{"as_of":"2026-08-12T03:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b33f45fac6e79cb8668da0e6bbf18ce873be8982b3c9b225931387620713c570","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":44,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T23:20:11.067426Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T16:59:58.189803Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-07-06T18:12:13.931421Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-08-11T23:20:11.067426Z","title":"Lumina-t2x: Transforming text into any modality, resolution, and duration via flow-based large diffusion transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.02632","last_updated":"2024-12-04T05:02:45Z","snapshot_observed_at":"2026-08-11T23:11:43.672371Z","submitted_at":"2024-12-03T18:01:45Z","title":"Scaling Image Tokenizers with Grouped Spherical Quantization","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T23:20:11.067426Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2412.02632"},"observation_digest":"sha256:5cf8417d60a4a3b14b32de09557edd6f8dd92ecf4c1c1785f04f8b791c6ffbc1","observation_id":"9b23476b-6142-4793-9401-469a30043998","resolution":{"observed_at":"2026-08-11T23:20:11.067426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-07-06T18:12:13.931421Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-08-11T22:51:11.670823Z","title":"Lumina-t2x: Transforming text into any modality, resolution, and duration via flow-based large diffusion trans- formers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-11T22:45:25.734749Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.670823Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:948b48461523e59eb1e916cae465eb43a826ec0144d742fedcaa9fc5ec785e8d","observation_id":"45b05fbf-8760-4267-bc57-45d5b7dfed17","resolution":{"observed_at":"2026-08-11T22:51:11.670823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-07-06T18:12:13.931421Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-08-11T22:23:15.450275Z","title":"Lumina-t2x: Transforming text into any modality, reso- lution, and duration via flow-based large diffusion transform- ers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03552","last_updated":"2024-12-04T18:50:08Z","snapshot_observed_at":"2026-08-11T22:13:53.263849Z","submitted_at":"2024-12-04T18:50:08Z","title":"Imagine360: Immersive 360 Video Generation from Perspective Anchor","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T22:23:15.450275Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2412.03552"},"observation_digest":"sha256:4fd97ad3ff20cdf512c1188994943794433388b9f7f510c6491efb07ec0ba739","observation_id":"abf81c51-b893-4d32-ac0d-024683d3f1ca","resolution":{"observed_at":"2026-08-11T22:23:15.450275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-07-06T18:12:13.931421Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":"2405.05945","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-07-04T16:59:58.189803Z","title":"Lumina-t2x: Transforming text into any modality, resolution, and duration via flow-based large diffusion transformers","venue":null,"work_id":"236b1566-5e13-464f-89a2-cae7ec249825","year":2024},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:270c932a55b4b62c92273c4ffc9523afe4d0c62f47dc635acd52cf6ff2f59be4","observation_id":"1a8be5e9-fde3-4620-85d7-e12ba2b9effc","resolution":{"observed_at":"2026-05-23T07:42:43.487031Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-07-06T18:12:13.931421Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-08-11T22:05:33.668005Z","title":"Lumina-t2x: Transforming text into any modality, resolu- tion, and duration via flow-based large diffusion transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-11T21:57:58.991459Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.668005Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:6c39eb47adea5c444d5491b609135b20d57c639f56253c36236e05f41aaf2688","observation_id":"6a0b6586-9b77-499a-b583-d36255a26bf2","resolution":{"observed_at":"2026-08-11T22:05:33.668005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-07-06T18:12:13.931421Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-08-11T20:55:01.928899Z","title":"Lumina-t2x: Transforming text into any modality, resolution, and du- ration via flow-based large diffusion transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05263","last_updated":"2025-03-08T01:36:55Z","snapshot_observed_at":"2026-08-11T20:47:21.008906Z","submitted_at":"2024-12-06T18:52:20Z","title":"Mind the Time: Temporally-Controlled Multi-Event Video Generation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T20:55:01.928899Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2412.05263"},"observation_digest":"sha256:3138826b2713739103e42ad2cf73ef9e6fb742ebbecf15ca9111932d60a098d1","observation_id":"b0514003-a314-4573-b676-3ebcc310c0e8","resolution":{"observed_at":"2026-08-11T20:55:01.928899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-07-06T18:12:13.931421Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-08-11T20:20:36.493002Z","title":"Lumina-t2x: Transforming text into any modality, resolution, and duration via flow-based large diffusion trans- formers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-11T20:14:50.602382Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T20:20:36.493002Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2412.05848"},"observation_digest":"sha256:85b2f7cefe18ff7aeaf2f5187d88a41ab7582442703cf968ed1883c44a27eb37","observation_id":"8b34c3ec-711c-49a9-bd46-a26009a8df44","resolution":{"observed_at":"2026-08-11T20:20:36.493002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-07-06T18:12:13.931421Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-08-11T16:56:01.614056Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09619","last_updated":"2024-12-12T18:59:53Z","snapshot_observed_at":"2026-08-11T22:13:17.092361Z","submitted_at":"2024-12-12T18:59:53Z","title":"SnapGen: Taming High-Resolution Text-to-Image Models for Mobile Devices with Efficient Architectures and Training","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T16:56:01.614056Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2412.09619"},"observation_digest":"sha256:baf80e2d3d7cbd50c1c74c84f4c482ca275a456479102ce05ceafc62fae73d06","observation_id":"f5969d1a-10eb-459c-8dac-467337f136ca","resolution":{"observed_at":"2026-08-11T16:56:01.614056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-07-06T18:12:13.931421Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-08-11T15:43:00.877098Z","title":"Lumina-t2x: Trans- forming text into any modality, resolution, and duration via flow-based large diffusion transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","snapshot_observed_at":"2026-08-12T01:15:28.071238Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T15:43:00.877098Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2412.10768"},"observation_digest":"sha256:af532ccb37b21cfbdb4fe1eccc0f51945d8a75475c5db8adfff3bb3aa9d786ca","observation_id":"b5e1b2c8-5007-4e4c-a5a6-da577476013d","resolution":{"observed_at":"2026-08-11T15:43:00.877098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-07-06T18:12:13.931421Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-08-11T15:40:19.798497Z","title":"Lumina-t2x: Transforming text into any modality, resolution, and duration via flow-based large diffusion transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-11T20:10:49.995786Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.798497Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:45eb79ad89b015c8762f3333bd9191e2cf4d8252aed41c22157f56d72a300fd0","observation_id":"60c5fffb-27ba-46fc-ba1a-9f59906940ed","resolution":{"observed_at":"2026-08-11T15:40:19.798497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-07-06T18:12:13.931421Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-08-11T14:20:49.289133Z","title":"Lumina-t2x: Transforming text into any modality, reso- lution, and duration via flow-based large diffusion transform- ers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12095","last_updated":"2024-12-17T18:45:55Z","snapshot_observed_at":"2026-08-11T19:47:52.307932Z","submitted_at":"2024-12-16T18:59:29Z","title":"Causal Diffusion Transformers for Generative Modeling","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T14:20:49.289133Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2412.12095"},"observation_digest":"sha256:5118e1052192f7fee0efc89586270c4e8206aba2de39a517898944916538b359","observation_id":"24708269-1164-4a1c-8351-c328662ed805","resolution":{"observed_at":"2026-08-11T14:20:49.289133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-07-06T18:12:13.931421Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-08-11T10:54:30.795049Z","title":"Lumina-t2x: Transforming text into any modality, reso- lution, and duration via flow-based large diffusion transform- ers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16112","last_updated":"2024-12-20T17:57:09Z","snapshot_observed_at":"2026-08-11T10:44:44.614197Z","submitted_at":"2024-12-20T17:57:09Z","title":"CLEAR: Conv-Like Linearization Revs Pre-Trained Diffusion Transformers Up","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T10:54:30.795049Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2412.16112"},"observation_digest":"sha256:03eaa980c88d4650196c338055273a46f037b471780eeabc767c70c7ea05a400","observation_id":"0d33ef00-2426-439d-9090-5595f082775d","resolution":{"observed_at":"2026-08-11T10:54:30.795049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-07-06T18:12:13.931421Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-08-11T01:04:35.030224Z","title":"Lumina-t2x: Trans- forming text into any modality, resolution, and duration via flow-based large diffusion transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.030224Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:46324a5f1bf3a13fa692c79f239fb753ca39ccf4a395c81c739976bbb88fa32e","observation_id":"c5a220a6-cc78-4066-bc0d-e24c36358e57","resolution":{"observed_at":"2026-08-11T01:04:35.030224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-07-06T18:12:13.931421Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-08-10T23:02:07.643640Z","title":"Lumina-t2x: Transforming text into any modality, reso- lution, and duration via flow-based large diffusion transform- ers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-10T22:52:06.844699Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.643640Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:aa9a692e2e39179d33e63ec953c0f4d48653818fc72e686bbcbc6ce84771169d","observation_id":"70ca07cd-d460-41aa-aafc-a56c2210b7c7","resolution":{"observed_at":"2026-08-10T23:02:07.643640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-07-06T18:12:13.931421Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-08-10T22:34:14.232420Z","title":"Lumina-t2x: Transforming text into any modality, reso- lution, and duration via flow-based large diffusion transform- ers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01423","last_updated":"2025-03-10T11:43:42Z","snapshot_observed_at":"2026-08-11T01:06:46.210110Z","submitted_at":"2025-01-02T18:59:40Z","title":"Reconstruction vs. Generation: Taming Optimization Dilemma in Latent Diffusion Models","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T22:34:14.232420Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2501.01423"},"observation_digest":"sha256:c556841cd7912d8f1abd465f0ca8764249767752a4efd9391ecf9ba17e7fe212","observation_id":"7f2264ac-3a17-4ecb-93cb-f017f9639c8d","resolution":{"observed_at":"2026-08-10T22:34:14.232420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-07-06T18:12:13.931421Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-08-10T22:25:25.600000Z","title":"Lumina-t2x: Transforming text into any modality, resolution, and duration via flow-based large diffusion transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01790","last_updated":"2025-03-18T10:47:27Z","snapshot_observed_at":"2026-08-11T03:10:45.092988Z","submitted_at":"2025-01-03T12:45:22Z","title":"Ingredients: Blending Custom Photos with Video Diffusion Transformers","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:25.600000Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2501.01790"},"observation_digest":"sha256:622c5da3d1b3157376494e64d2baa574cb2b023cc7400470485371fa1c2b35f4","observation_id":"01546f54-6fc4-4311-8884-8941a3753d23","resolution":{"observed_at":"2026-08-10T22:25:25.600000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-07-06T18:12:13.931421Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-08-10T15:31:35.500088Z","title":"Lumina-t2x: Transforming text into any modality, resolution, and duration via flow-based large diffusion transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13920","last_updated":"2025-01-23T18:58:33Z","snapshot_observed_at":"2026-08-11T01:43:21.457790Z","submitted_at":"2025-01-23T18:58:33Z","title":"IMAGINE-E: Image Generation Intelligence Evaluation of State-of-the-art Text-to-Image Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T15:31:35.500088Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2501.13920"},"observation_digest":"sha256:b1eb135fb4e723fc70bf2dc4cfb08f9c1e999ebc288c3f74273c8a6bc3e44aa1","observation_id":"86cbbaa3-b068-402a-ae93-7afc7168ddb0","resolution":{"observed_at":"2026-08-10T15:31:35.500088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-07-06T18:12:13.931421Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-08-10T10:56:30.925033Z","title":"Lumina-t2x: Transforming text into any modality, resolution, and duration via flow-based large diffusion transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16764","last_updated":"2025-01-28T07:38:59Z","snapshot_observed_at":"2026-08-11T00:40:41.296584Z","submitted_at":"2025-01-28T07:38:59Z","title":"DiffSplat: Repurposing Image Diffusion Models for Scalable Gaussian Splat Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T10:56:30.925033Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2501.16764"},"observation_digest":"sha256:fd88a8510e32d1759c96118bb6467bcdb1fbfc9c222e50bcf5a24b4d2f14e495","observation_id":"0e61a512-9c5d-48db-b995-acd0aeb50426","resolution":{"observed_at":"2026-08-10T10:56:30.925033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-07-06T18:12:13.931421Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-08-08T14:26:46.667065Z","title":"Lumina-t2x: Transforming text into any modality, resolution, and duration via flow-based large diffusion transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06782","last_updated":"2025-02-12T10:07:07Z","snapshot_observed_at":"2026-08-08T14:18:27.556352Z","submitted_at":"2025-02-10T18:58:11Z","title":"Lumina-Video: Efficient and Flexible Video Generation with Multi-scale Next-DiT","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T14:26:46.667065Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2502.06782"},"observation_digest":"sha256:07465276003542e878e1d3927fa7882a7caf665523064c9dbef2e1f37fcd0bbc","observation_id":"cf5811c7-1ecb-4db6-856d-72512fd18b65","resolution":{"observed_at":"2026-08-08T14:26:46.667065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-07-06T18:12:13.931421Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-08-08T12:32:46.422166Z","title":"Lumina-t2x: Transforming text into any modality, resolution, and duration via flow-based large diffusion transformers, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07508","last_updated":"2025-02-27T08:35:45Z","snapshot_observed_at":"2026-08-09T12:47:03.057456Z","submitted_at":"2025-02-11T12:22:35Z","title":"Enhance-A-Video: Better Generated Video for Free","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T12:32:46.422166Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2502.07508"},"observation_digest":"sha256:c655693f6a09c0f401535a59400e56ac44f59de11739507f8b97562aa4c94514","observation_id":"f0b70c9f-20b8-4842-9c61-371730ec43de","resolution":{"observed_at":"2026-08-08T12:32:46.422166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-07-06T18:12:13.931421Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-08-07T19:40:21.192239Z","title":"Lumina-t2x: Transforming text into any modality, resolution, and duration via flow-based large diffusion transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.192239Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:f6734649a7f2e7dd793e391795b48a7579a1d4a00ad8fe8af81f19e969692b6e","observation_id":"e6debad6-641c-428b-8ca2-12cf1f884dcf","resolution":{"observed_at":"2026-08-07T19:40:21.192239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-07-06T18:12:13.931421Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-08-07T12:48:50.794369Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-07T20:36:09.670028Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:50.794369Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:f146aa9cc436a7ea1822bf66b2cb9076fd4b02950d05d2f941536d970ceb8d3a","observation_id":"369b99fb-2f79-4006-ae23-413dac14c3a7","resolution":{"observed_at":"2026-08-07T12:48:50.794369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-07-06T18:12:13.931421Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-08-07T05:20:51.030846Z","title":"Lumina-t2x: Transforming text into any modality, reso- lution, and duration via flow-based large diffusion transform- ers.arXiv preprint arXiv:2405.05945, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-10T12:36:56.309400Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.030846Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:ecdc40f5d0596dfdeb42452bede999361cc7cc42b1fcd0d3b8c53990b4c28cfb","observation_id":"becaf3ad-2e97-42fc-9820-e757bec27070","resolution":{"observed_at":"2026-08-07T05:20:51.030846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-07-06T18:12:13.931421Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-08-06T23:36:10.416115Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17016","last_updated":"2025-06-20T14:13:52Z","snapshot_observed_at":"2026-08-08T16:17:24.703072Z","submitted_at":"2025-06-20T14:13:52Z","title":"The Hidden Cost of an Image: Quantifying the Energy Consumption of AI Image Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:36:10.416115Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2506.17016"},"observation_digest":"sha256:2ac6a90471e63786874c1fe78477bf3150eb22d6dfa19392c20332ac63a4ccfc","observation_id":"4e0b2401-591c-44d4-8424-d67df269a7a7","resolution":{"observed_at":"2026-08-06T23:36:10.416115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-07-06T18:12:13.931421Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-08-06T22:41:38.549537Z","title":"Lumina-t2x: Transforming text into any modality, reso- lution, and duration via flow-based large diffusion transform- ers.arXiv preprint arXiv:2405.05945, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20946","last_updated":"2025-06-26T02:25:16Z","snapshot_observed_at":"2026-08-11T02:56:47.578278Z","submitted_at":"2025-06-26T02:25:16Z","title":"Consistent Zero-shot 3D Texture Synthesis Using Geometry-aware Diffusion and Temporal Video Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:38.549537Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2506.20946"},"observation_digest":"sha256:c4772c4fa2b6719372af00394c15b40e327cc549a8fbd435a84bd172b1543958","observation_id":"68f82bf5-177a-43f2-bd05-a159abd0926b","resolution":{"observed_at":"2026-08-06T22:41:38.549537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-07-06T18:12:13.931421Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-08-06T20:26:37.854469Z","title":"Lumina-t2x: Transform- ing text into any modality, resolution, and duration via flow-based large diffusion transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02713","last_updated":"2025-07-04T14:45:23Z","snapshot_observed_at":"2026-08-10T07:52:08.420355Z","submitted_at":"2025-07-03T15:27:28Z","title":"UniMC: Taming Diffusion Transformer for Unified Keypoint-Guided Multi-Class Image Generation","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:37.854469Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2507.02713"},"observation_digest":"sha256:d38850810ef73fa79ddeaa9b524291b75b20100a4f43ceb03ec7a052483c039c","observation_id":"507a892c-920f-4d4f-8c5d-79a184db2557","resolution":{"observed_at":"2026-08-06T20:26:37.854469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-07-06T18:12:13.931421Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-08-06T15:42:23.696320Z","title":"Lumina-t2x: Transforming text into any modality, reso- lution, and duration via flow-based large diffusion transform- ers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15249","last_updated":"2025-07-21T05:15:45Z","snapshot_observed_at":"2026-08-08T19:24:05.470945Z","submitted_at":"2025-07-21T05:15:45Z","title":"FreeCus: Free Lunch Subject-driven Customization in Diffusion Transformers","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:23.696320Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2507.15249"},"observation_digest":"sha256:c722a4a3095498243367c1441bbe9d385334e71d38639f27271985ec0e8c8dc9","observation_id":"f36ad844-76c0-432f-88db-c24ea48c0fe3","resolution":{"observed_at":"2026-08-06T15:42:23.696320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-07-06T18:12:13.931421Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-08-06T15:06:47.862588Z","title":"Lumina-t2x: Transforming text into any modality, resolution, and du- ration via flow-based large diffusion transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.17135","last_updated":"2025-07-23T02:15:45Z","snapshot_observed_at":"2026-08-08T14:29:37.833505Z","submitted_at":"2025-07-23T02:15:45Z","title":"SADA: Stability-guided Adaptive Diffusion Acceleration","version":1},"reference_index":1971,"source":"pdf_text","source_observed_at":"2026-08-06T15:06:47.862588Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2507.17135"},"observation_digest":"sha256:4a4320e85a7c5650c8700526c9ea6f2c9ecd29251172061095ef555dbd3fa0af","observation_id":"f39e90c7-6473-421f-8a07-88b379c89963","resolution":{"observed_at":"2026-08-06T15:06:47.862588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-07-06T18:12:13.931421Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-08-05T10:19:54.338843Z","title":"Lumina-t2x: Transforming text into any modality, reso- lution, and duration via flow-based large diffusion transform- ers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04394","last_updated":"2025-09-04T17:05:59Z","snapshot_observed_at":"2026-08-10T04:42:03.007150Z","submitted_at":"2025-09-04T17:05:59Z","title":"Transition Models: Rethinking the Generative Learning Objective","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T10:19:54.338843Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2509.04394"},"observation_digest":"sha256:a7a44f54ae148fd7e5dc55d2649316cacd31867c3494ea30026fb94b362aa59a","observation_id":"5ea0a60b-59a7-460a-b24c-a29539916253","resolution":{"observed_at":"2026-08-05T10:19:54.338843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-07-06T18:12:13.931421Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-08-04T06:47:04.960072Z","title":"Lumina-t2x: Transforming text into any modality, resolution, and duration via flow-based large diffu- sion transformers.arXiv preprint arXiv:2405.05945, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-08T05:22:59.737639Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:04.960072Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:9364caccd31421978c63cd54f298a0f1f639164e7d26e62c762798ded43c7520","observation_id":"e22bf4ad-90c0-485e-9b86-15ba0e62355b","resolution":{"observed_at":"2026-08-04T06:47:04.960072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-07-06T18:12:13.931421Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":"2405.05945","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-07-04T16:59:58.189803Z","title":"Lumina-t2x: Transforming text into any modality, resolution, and duration via flow-based large diffusion transformers","venue":null,"work_id":"236b1566-5e13-464f-89a2-cae7ec249825","year":2024},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-11T14:08:36.801359Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:1853abef8b34a5dd34119a3283dd4570bd077e8c3f5feaccf040bd7d06120e06","observation_id":"9615c93f-3338-4e9e-9b36-a96ec39ad54c","resolution":{"observed_at":"2026-05-11T14:08:37.037281Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-07-06T18:12:13.931421Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-08-03T19:47:31.331517Z","title":"Lumina- t2x: Transforming text into any modality, resolution, and duration via flow-based large diffusion transformers.arXiv preprint arXiv:2405.05945, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:31.331517Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:1c9ed634e69bff1a6ecc74405cc5e716f2186e31b1d6c899c04c2a5f7d557348","observation_id":"0af520a0-f9d2-4d3e-adfc-e940073ddea5","resolution":{"observed_at":"2026-08-03T19:47:31.331517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-07-06T18:12:13.931421Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-08-03T13:24:44.583633Z","title":"Lumina-t2x: Transforming text into any modality, resolution, and duration via flow-based large diffusion transformers.arXiv preprint arXiv:2405.05945, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.24551","last_updated":"2026-06-18T22:13:10Z","snapshot_observed_at":"2026-08-07T22:25:01.573943Z","submitted_at":"2025-12-31T01:19:14Z","title":"PhyGDPO: Physics-Aware Groupwise Direct Preference Optimization for Physically Consistent Text-to-Video Generation","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T13:24:44.583633Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2512.24551"},"observation_digest":"sha256:a050457cde8ba66da53867d386c07877d7fe170261d588b1e45371577a029fc5","observation_id":"2e1d1b14-e900-4af9-9b4e-44852958871f","resolution":{"observed_at":"2026-08-03T13:24:44.583633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-07-06T18:12:13.931421Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":"2405.05945","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-07-04T16:59:58.189803Z","title":"Lumina-t2x: Transforming text into any modality, resolution, and duration via flow-based large diffusion transformers","venue":null,"work_id":"236b1566-5e13-464f-89a2-cae7ec249825","year":2024},"citing_paper":{"arxiv_id":"2601.03233","last_updated":"2026-01-06T18:24:41Z","snapshot_observed_at":"2026-07-06T22:40:51.136169Z","submitted_at":"2026-01-06T18:24:41Z","title":"LTX-2: Efficient Joint Audio-Visual Foundation Model","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-13T07:06:20.470686Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2601.03233"},"observation_digest":"sha256:1b07d6e61846bc27b86ce35a95cabd355f6f9eafffbbeffdde5a43488b2f2c85","observation_id":"3baab651-d424-4f57-8e34-64e567e52b9d","resolution":{"observed_at":"2026-05-13T07:06:20.602944Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-07-06T18:12:13.931421Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-08-02T18:25:53.388773Z","title":"Lumina-t2x: Transforming text into any modality, resolution, and duration via flow-based large diffusion transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-07T15:25:42.104111Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:53.388773Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:f50e8f261c066a06d5955b12382303cde64f9465f7bcee7d39c7c9c5caf78afa","observation_id":"a1c7b072-6116-4d0d-9a7a-7cef17bd31ae","resolution":{"observed_at":"2026-08-02T18:25:53.388773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-07-06T18:12:13.931421Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":"2405.05945","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-07-04T16:59:58.189803Z","title":"Lumina-t2x: Transforming text into any modality, resolution, and duration via flow-based large diffusion transformers","venue":null,"work_id":"236b1566-5e13-464f-89a2-cae7ec249825","year":2024},"citing_paper":{"arxiv_id":"2604.04924","last_updated":"2026-04-06T17:59:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-06T17:59:04Z","title":"Your Pre-trained Diffusion Model Secretly Knows Restoration","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T19:08:08.266895Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2604.04924"},"observation_digest":"sha256:f0abc4f18f251452926579ea63edb812275c2e7061c78d0fc583a1689be58269","observation_id":"8cedf145-7646-4f11-97d4-ed771cb4ced8","resolution":{"observed_at":"2026-05-10T23:25:54.311194Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-07-06T18:12:13.931421Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":"2405.05945","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-07-04T16:59:58.189803Z","title":"Lumina-t2x: Transforming text into any modality, resolution, and duration via flow-based large diffusion transformers","venue":null,"work_id":"236b1566-5e13-464f-89a2-cae7ec249825","year":2024},"citing_paper":{"arxiv_id":"2604.06129","last_updated":"2026-04-07T17:40:37Z","snapshot_observed_at":"2026-07-06T22:54:40.349479Z","submitted_at":"2026-04-07T17:40:37Z","title":"PoM: A Linear-Time Replacement for Attention with the Polynomial Mixer","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T19:20:52.810648Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2604.06129"},"observation_digest":"sha256:708d1287e33fee530666b899d8fd6e8c6fea483c8a46ffb152d85fc63af2f054","observation_id":"01e589f1-73b8-4d5b-a956-6b2e0ed37672","resolution":{"observed_at":"2026-05-10T23:05:49.276835Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-07-06T18:12:13.931421Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":"2405.05945","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-07-04T16:59:58.189803Z","title":"Lumina-t2x: Transforming text into any modality, resolution, and duration via flow-based large diffusion transformers","venue":null,"work_id":"236b1566-5e13-464f-89a2-cae7ec249825","year":2024},"citing_paper":{"arxiv_id":"2605.20708","last_updated":"2026-06-16T17:19:08Z","snapshot_observed_at":"2026-07-06T23:31:13.042581Z","submitted_at":"2026-05-20T05:07:15Z","title":"Rethinking Cross-Layer Information Routing in Diffusion Transformers","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-21T05:29:19.111071Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2605.20708"},"observation_digest":"sha256:ddebb8ae3bfe95be7beeb6e92ced2dba5be59eb625ce1ebb8021d1f04780628f","observation_id":"78f93a64-378d-4863-af34-f65f86ad570f","resolution":{"observed_at":"2026-05-21T05:29:39.351506Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-07-06T18:12:13.931421Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":"2405.05945","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-07-04T16:59:58.189803Z","title":"Lumina-t2x: Transforming text into any modality, resolution, and duration via flow-based large diffusion transformers","venue":null,"work_id":"236b1566-5e13-464f-89a2-cae7ec249825","year":2024},"citing_paper":{"arxiv_id":"2605.20708","last_updated":"2026-06-16T17:19:08Z","snapshot_observed_at":"2026-07-06T23:31:13.042581Z","submitted_at":"2026-05-20T05:07:15Z","title":"Rethinking Cross-Layer Information Routing in Diffusion Transformers","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T17:50:22.258541Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2605.20708"},"observation_digest":"sha256:5714d127b512ba0d537c6c2d93bd287d3fd1594e7da7591db7f624830dd7e179","observation_id":"3974ee18-589f-4e11-a768-666e71b0b1e5","resolution":{"observed_at":"2026-06-30T17:54:58.006086Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-07-06T18:12:13.931421Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":"2405.05945","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-07-04T16:59:58.189803Z","title":"Lumina-t2x: Transforming text into any modality, resolution, and duration via flow-based large diffusion transformers","venue":null,"work_id":"236b1566-5e13-464f-89a2-cae7ec249825","year":2024},"citing_paper":{"arxiv_id":"2605.21431","last_updated":"2026-06-17T15:23:12Z","snapshot_observed_at":"2026-07-06T23:31:51.443407Z","submitted_at":"2026-05-20T17:23:32Z","title":"iTryOn: Mastering Interactive Video Virtual Try-On with Spatial-Semantic Guidance","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-05-21T05:11:34.441784Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2605.21431"},"observation_digest":"sha256:5b2718fabf89b89c1e1547ee8af6bd69f0cc818526b2849b66e97628a25cc486","observation_id":"b484cbb6-46a1-4905-a953-82437073dd91","resolution":{"observed_at":"2026-05-21T05:13:58.480079Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-07-06T18:12:13.931421Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":"2405.05945","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-07-04T16:59:58.189803Z","title":"Lumina-t2x: Transforming text into any modality, resolution, and duration via flow-based large diffusion transformers","venue":null,"work_id":"236b1566-5e13-464f-89a2-cae7ec249825","year":2024},"citing_paper":{"arxiv_id":"2606.01399","last_updated":"2026-05-31T18:45:11Z","snapshot_observed_at":"2026-07-06T23:41:58.121923Z","submitted_at":"2026-05-31T18:45:11Z","title":"PAI-Studio: Cinematic Video Background Replacement with Camera-Aware Motion","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T17:14:23.336848Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2606.01399"},"observation_digest":"sha256:be394d46275ea6dadeee74f8da9583ae3bdf47a65727613a41ddfce8fc1bac53","observation_id":"99f43335-dc78-45c4-9a5f-c92e163eaf42","resolution":{"observed_at":"2026-07-01T21:16:14.711300Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-07-06T18:12:13.931421Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":"2405.05945","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-07-04T16:59:58.189803Z","title":"Lumina-t2x: Transforming text into any modality, resolution, and duration via flow-based large diffusion transformers","venue":null,"work_id":"236b1566-5e13-464f-89a2-cae7ec249825","year":2024},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:d73ad927a85491a9b987cb196c1989629c860a3912ea159b776c09608526384e","observation_id":"80f432bc-4c07-4351-a531-359f6798c77f","resolution":{"observed_at":"2026-07-02T03:06:29.553020Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-07-06T18:12:13.931421Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":"2405.05945","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-07-04T16:59:58.189803Z","title":"Lumina-t2x: Transforming text into any modality, resolution, and duration via flow-based large diffusion transformers","venue":null,"work_id":"236b1566-5e13-464f-89a2-cae7ec249825","year":2024},"citing_paper":{"arxiv_id":"2606.24888","last_updated":"2026-06-23T17:59:55Z","snapshot_observed_at":"2026-08-08T16:38:03.178919Z","submitted_at":"2026-06-23T17:59:55Z","title":"DiffusionBench: On Holistic Evaluation of Diffusion Transformers","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-06-26T00:06:11.951205Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2606.24888"},"observation_digest":"sha256:4aedae1f414fc0c6274c45c26d4986bfb81a881b75538b84fd009cb0b701e3a1","observation_id":"ebfe7e57-5f25-46fc-9c68-ec5c72bedbd4","resolution":{"observed_at":"2026-07-04T16:59:58.191470Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-07-06T18:12:13.931421Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":"2405.05945","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-07-04T16:59:58.189803Z","title":"Lumina-t2x: Transforming text into any modality, resolution, and duration via flow-based large diffusion transformers","venue":null,"work_id":"236b1566-5e13-464f-89a2-cae7ec249825","year":2024},"citing_paper":{"arxiv_id":"2606.30124","last_updated":"2026-06-29T10:59:10Z","snapshot_observed_at":"2026-08-02T12:26:27.389877Z","submitted_at":"2026-06-29T10:59:10Z","title":"SciIR: A Large-scale Training Dataset and Benchmark for Scientific Image Reasoning Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T06:48:22.594002Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2606.30124"},"observation_digest":"sha256:6ce2c52b861b597b6620876dd62c84687a266505a58b0f633eaa2e8de5dd4c62","observation_id":"e74f25ad-366e-4769-ad71-e43ae8dab661","resolution":{"observed_at":"2026-06-30T06:54:20.738061Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2405.05945/citation-record","integrity":"/paper/2405.05945/integrity","json":"/paper/2405.05945/citation-record.json","paper":"/paper/2405.05945"},"outbound":[],"paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T18:12:13.931421Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 44 inbound Pith citation observations for arXiv:2405.05945."}