{"as_of":"2026-08-07T22:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:85c230f3909c4f704ff579e3038b7b1c552082b3f411bc5ca7178005ddf1010e","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:26:02.330264Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.07999/citation-record","integrity":"/paper/2506.07999/integrity","json":"/paper/2506.07999/citation-record.json","paper":"/paper/2506.07999"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2205.11487","last_updated":"2022-05-23T17:42:53Z","snapshot_observed_at":"2026-07-06T13:12:59.688989Z","submitted_at":"2022-05-23T17:42:53Z","title":"Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.11487","snapshot_observed_at":"2026-08-07T05:26:02.141730Z","title":"Denton, Seyed Kamyar Seyed Ghasemipour, Burcu Karagol Ayan, Seyedeh Sara Mahdavi, Raphael Gontijo Lopes, Tim Salimans, Jonathan Ho, David J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-07T14:14:59.427680Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.141730Z"},"links":{"cited_paper":"/paper/2205.11487","citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:b32911fcacbc7088b4b4fdd8a6912b5010d59e176c0646b9e55b31c9fecddab5","observation_id":"544ef75f-082c-41c0-8402-9ca8daa351ab","resolution":{"observed_at":"2026-08-07T05:26:02.141730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:03.030454Z","title":"Semantic-conditional diffusion networks for image captioning*","venue":null,"work_id":"251626c2-fd8b-4a38-a7bc-366042252224","year":2023},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-07T14:14:59.427680Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.148374Z"},"links":{"citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:e05babf341e3b421cce63d30fa6d4cd44e41341dc96962eb42d1a34e4c579b0d","observation_id":"494bde0b-a381-4826-bc7e-74cc21da2b3b","resolution":{"observed_at":"2026-08-07T05:26:03.035305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:03.014788Z","title":"Metaxas, and S","venue":null,"work_id":"a28c7271-5c6a-4e12-8347-48bab1b0de75","year":2022},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-07T14:14:59.427680Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.154536Z"},"links":{"citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:660a4ac097a6233cfa6baabc2b4fc8377b4fb6189a4ac098e4d1e73c2dc28d18","observation_id":"7210748d-ffab-4ce4-84b6-868e679ba753","resolution":{"observed_at":"2026-08-07T05:26:03.019678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01827","last_updated":"2024-01-03T16:43:47Z","snapshot_observed_at":"2026-07-06T17:11:17.528395Z","submitted_at":"2024-01-03T16:43:47Z","title":"Moonshot: Towards Controllable Video Generation and Editing with Multimodal Conditions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01827","snapshot_observed_at":"2026-08-07T05:26:02.159306Z","title":"Moonshot: Towards controllable video generation and editing with multimodal conditions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-07T14:14:59.427680Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.159306Z"},"links":{"cited_paper":"/paper/2401.01827","citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:dc5eb3bcded287135010adaca62b9dd5af9f8749e6c2d74c7b74cb4680b054b0","observation_id":"4fa29346-b78e-407d-ba57-8d494f21b8e0","resolution":{"observed_at":"2026-08-07T05:26:02.159306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:02.998469Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":"48db9997-ebca-4ddc-b886-b6bff30242a1","year":2021},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-07T14:14:59.427680Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.164485Z"},"links":{"citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:df8ac2d28c63c8da4adcc2c766078dbf34375bb27898939e9c9ef36b27564542","observation_id":"1acfa949-3647-486a-8f7a-3dcc41e3ac57","resolution":{"observed_at":"2026-08-07T05:26:03.003472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-07T22:11:30.869700Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-07T05:26:02.169516Z","title":"Chameleon: Mixed-modal early-fusion foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-07T14:14:59.427680Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.169516Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:dfbba1696ccb0ee10250680db89ae2e048cd794399c8876bd076598b76507d8b","observation_id":"a9af8c98-d79e-47ad-a980-60bd0d5c3382","resolution":{"observed_at":"2026-08-07T05:26:02.169516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03575","snapshot_observed_at":"2026-08-07T05:26:02.174857Z","title":"Cosmos world foundation model platform for physical ai","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-07T14:14:59.427680Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.174857Z"},"links":{"cited_paper":"/paper/2501.03575","citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:e95984d0e475cb31576c5fb689c5f0cebfbf65cf9798d1811ca180e4623b6794","observation_id":"e296f37f-7262-4e36-9ab5-699e0e348ad8","resolution":{"observed_at":"2026-08-07T05:26:02.174857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:02.982928Z","title":"Blattmann, Dominik Lorenz, Patrick Esser, and Bj \\\"o rn Ommer","venue":null,"work_id":"7b7f2ff8-a831-4494-b54c-46c5276cabf4","year":2022},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-07T14:14:59.427680Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.179899Z"},"links":{"citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:b46be038bb1b30480e6dcde41dbb2d45295e77827ca81c95562626fb38338d55","observation_id":"861fa5a2-c893-4650-8695-d3812e7ed8e9","resolution":{"observed_at":"2026-08-07T05:26:02.987674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:02.967793Z","title":"Peebles and Saining Xie","venue":null,"work_id":"b2190a56-02e3-41a5-8cd3-23c602049922","year":2023},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-07T14:14:59.427680Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.184466Z"},"links":{"citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:2d595c4d5025dffda9220a3fdafcb1ba32c43732f8893082f7be116ad3626baf","observation_id":"40f1b01b-18b6-4358-a0fd-bcefc82a9227","resolution":{"observed_at":"2026-08-07T05:26:02.972644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03206","last_updated":"2024-03-05T18:45:39Z","snapshot_observed_at":"2026-07-06T17:40:01.975792Z","submitted_at":"2024-03-05T18:45:39Z","title":"Scaling Rectified Flow Transformers for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03206","snapshot_observed_at":"2026-08-07T05:26:02.189060Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-07T14:14:59.427680Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.189060Z"},"links":{"cited_paper":"/paper/2403.03206","citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:bc169b72f0f6b481d7a66efa97735ecc5ad2d65635906a428305a1309344f762","observation_id":"9b1e849c-805a-457e-bf94-fd03f743576b","resolution":{"observed_at":"2026-08-07T05:26:02.189060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:02.950596Z","title":"Announcing the flux pro finetuning api","venue":null,"work_id":"5ac5b4ee-8013-44dd-a124-c70381714bfc","year":2025},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-07T14:14:59.427680Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.195206Z"},"links":{"citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:0251770bb52880c75c7f7f0467ffa1c3581b3494607bb849da4230e26dabf726","observation_id":"68056b33-8d3e-40df-834f-f1d5b816e72a","resolution":{"observed_at":"2026-08-07T05:26:02.956433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11838","last_updated":"2024-11-01T14:45:36Z","snapshot_observed_at":"2026-07-06T18:32:23.999019Z","submitted_at":"2024-06-17T17:59:58Z","title":"Autoregressive Image Generation without Vector Quantization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11838","snapshot_observed_at":"2026-08-07T05:26:02.200117Z","title":"Autoregressive image generation without vector quantization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-07T14:14:59.427680Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.200117Z"},"links":{"cited_paper":"/paper/2406.11838","citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:259a74c9dda4e42494c62326bf80c2bdaf965cc97e3342a1b746ca8f3839b654","observation_id":"5f1e3e6b-773d-4c51-8945-3fe4e201cf36","resolution":{"observed_at":"2026-08-07T05:26:02.200117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:02.205671Z","title":"Acdit: Interpolating autoregressive conditional modeling and diffusion transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-07T14:14:59.427680Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.205671Z"},"links":{"citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:2f4eb0f38ea03e07814eb67404c9bff175c2ee64a4b519d67a11e860460c921f","observation_id":"c225a258-a4c0-40ad-ad33-589605391c9d","resolution":{"observed_at":"2026-08-07T05:26:02.205671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-08-07T05:26:02.210366Z","title":"Transfusion: Predict the next token and diffuse images with one multi-modal model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-07T14:14:59.427680Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.210366Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:86bf16d18482e586d6910fd3abeac5b7ed6497b2db7bd844e883a4c0bae3929f","observation_id":"6fbc3b17-ad2e-44d7-8d58-a644b733a2a1","resolution":{"observed_at":"2026-08-07T05:26:02.210366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-07T05:26:02.215293Z","title":"Show-o: One single transformer to unify multimodal understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-07T14:14:59.427680Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.215293Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:c4867bf7106d278bf02d9aec9fa12e6e0ffc34674500d238d92d0a03df5be0ef","observation_id":"efe7341d-83ae-420a-bc88-319e07ac5896","resolution":{"observed_at":"2026-08-07T05:26:02.215293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.11239","last_updated":"2020-12-16T21:15:05Z","snapshot_observed_at":"2026-07-06T09:30:47.469703Z","submitted_at":"2020-06-19T17:24:44Z","title":"Denoising Diffusion Probabilistic Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.11239","snapshot_observed_at":"2026-08-07T05:26:02.219967Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-07T14:14:59.427680Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.219967Z"},"links":{"cited_paper":"/paper/2006.11239","citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:473fc784238debfc32964685f73bc73b7d1a4e9b8d01bd5e9797755336dfbbac","observation_id":"a6927dc3-ef34-4fbc-beff-b841f147b555","resolution":{"observed_at":"2026-08-07T05:26:02.219967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:02.932902Z","title":"Neural discrete representation learning","venue":null,"work_id":"dd4a4550-5502-4f03-8d89-42e6d89a3829","year":2017},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-07T14:14:59.427680Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.224761Z"},"links":{"citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:e7387c28b7ba964536e4decae477bbf79873a42a0b0f72da40addb730a0df682","observation_id":"592032d5-4885-454e-9b6a-b31df77da8b3","resolution":{"observed_at":"2026-08-07T05:26:02.938173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15505","last_updated":"2023-10-12T07:55:05Z","snapshot_observed_at":"2026-07-06T16:24:17.829828Z","submitted_at":"2023-09-27T09:13:40Z","title":"Finite Scalar Quantization: VQ-VAE Made Simple","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15505","snapshot_observed_at":"2026-08-07T05:26:02.229503Z","title":"Minnen, Eirikur Agustsson, and Michael Tschannen","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-07T14:14:59.427680Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.229503Z"},"links":{"cited_paper":"/paper/2309.15505","citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:0c3b57f8d0527f710744b7099a725fca407f1c824b38129d9fb125ad5473d95c","observation_id":"52069c2e-0ba9-437b-8cac-ff9b27c1b071","resolution":{"observed_at":"2026-08-07T05:26:02.229503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:02.916726Z","title":"Minnen, Yong Cheng, Agrim Gupta, Xiuye Gu, Alexander G","venue":null,"work_id":"05176f95-aef7-42ec-8ad0-c9daef426363","year":2023},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-07T14:14:59.427680Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.235441Z"},"links":{"citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:aaeaaad2c14756e2296fb8071c651961d49ddc663acdda67a18746df998ec0ab","observation_id":"fbaad28b-6672-4741-97a4-0bfbedee047a","resolution":{"observed_at":"2026-08-07T05:26:02.921578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02116","last_updated":"2024-07-17T16:32:09Z","snapshot_observed_at":"2026-07-06T16:56:46.051958Z","submitted_at":"2023-12-04T18:48:02Z","title":"GIVT: Generative Infinite-Vocabulary Transformers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02116","snapshot_observed_at":"2026-08-07T05:26:02.240085Z","title":"Givt: Generative infinite-vocabulary transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-07T14:14:59.427680Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.240085Z"},"links":{"cited_paper":"/paper/2312.02116","citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:4072a2518f670e46b18b19fc84189a4a8a8a267c04d85890c77e828024ef8224","observation_id":"1d12df17-efb9-41c9-8cea-fa22c4d26da0","resolution":{"observed_at":"2026-08-07T05:26:02.240085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-02T19:18:33.010410Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-07T05:26:02.245217Z","title":"Zettlemoyer, and Lili Yu","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-07T14:14:59.427680Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.245217Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:db8e7e79573c1016b51936429b9cf49fb8dc715a381690ef981c7188fc817fe9","observation_id":"58e5e446-5684-49ed-a9fb-a57566674917","resolution":{"observed_at":"2026-08-07T05:26:02.245217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T05:26:02.250162Z","title":"Hartshorn, Aobo Yang, Archi Mitra, and Archie Sravankumar et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-07T14:14:59.427680Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.250162Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:ac837a730f59a085cef23db2bafa6db37c4841a7db5f1b424bccfb372f97efba","observation_id":"bd83759b-6a84-4ff7-9ff3-95f419ceca7e","resolution":{"observed_at":"2026-08-07T05:26:02.250162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.09672","last_updated":"2021-02-18T23:44:17Z","snapshot_observed_at":"2026-08-06T00:36:41.660457Z","submitted_at":"2021-02-18T23:44:17Z","title":"Improved Denoising Diffusion Probabilistic Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.09672","snapshot_observed_at":"2026-08-07T05:26:02.255039Z","title":"Improved denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-07T14:14:59.427680Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.255039Z"},"links":{"cited_paper":"/paper/2102.09672","citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:49f8343f4ab59bfbcaf9f129062f546dcac5e2ce27e0cde21e147eb4411c0ec3","observation_id":"f8e9cff5-7b83-49e2-8c18-1caf4883be3c","resolution":{"observed_at":"2026-08-07T05:26:02.255039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04996","last_updated":"2025-05-08T01:53:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T18:59:06Z","title":"Mixture-of-Transformers: A Sparse and Scalable Architecture for Multi-Modal Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04996","snapshot_observed_at":"2026-08-07T05:26:02.259935Z","title":"Zettlemoyer, and Xi Victoria Lin","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-07T14:14:59.427680Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.259935Z"},"links":{"cited_paper":"/paper/2411.04996","citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:de506a59365d35dd1c9f30f6275baef3902c2596c5962c169af7cf06e985ee97","observation_id":"4fba9174-df27-40ef-a29b-901eeec878d1","resolution":{"observed_at":"2026-08-07T05:26:02.259935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05496","last_updated":"2024-12-07T01:46:38Z","snapshot_observed_at":"2026-08-07T15:28:16.662668Z","submitted_at":"2024-12-07T01:46:38Z","title":"Flex Attention: A Programming Model for Generating Optimized Attention Kernels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05496","snapshot_observed_at":"2026-08-07T05:26:02.265059Z","title":"Flex attention: A programming model for generating optimized attention kernels","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-07T14:14:59.427680Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.265059Z"},"links":{"cited_paper":"/paper/2412.05496","citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:fa2a7fe702fbeeed04ada3d92f6a9d5b0d4395221f35fa63ecb0619e760d6be1","observation_id":"b1c20c57-3a1e-4fa7-ad98-4618190b6905","resolution":{"observed_at":"2026-08-07T05:26:02.265059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.00512","last_updated":"2022-06-07T09:17:35Z","snapshot_observed_at":"2026-07-06T12:33:23.843893Z","submitted_at":"2022-02-01T16:07:25Z","title":"Progressive Distillation for Fast Sampling of Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.00512","snapshot_observed_at":"2026-08-07T05:26:02.270330Z","title":"Progressive distillation for fast sampling of diffusion models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-07T14:14:59.427680Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.270330Z"},"links":{"cited_paper":"/paper/2202.00512","citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:49c0bcd14f913d33329a8c1163f6c7239af4ec668e79314df8cdf61a7c64fae3","observation_id":"4db2e591-13d1-4e93-93a7-dde297427fd4","resolution":{"observed_at":"2026-08-07T05:26:02.270330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:02.900174Z","title":"A style-based generator architecture for generative adversarial networks","venue":null,"work_id":"5115cf88-9784-4c6c-91ba-7eaa5be7a0a2","year":2019},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-07T14:14:59.427680Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.275413Z"},"links":{"citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:0a8f78e3c6a64c17f14c2820f13dc2dbf9368633f3eaf59a9afa0bf8cde663b5","observation_id":"62d869dd-57ac-48be-966f-c3e3d4421037","resolution":{"observed_at":"2026-08-07T05:26:02.905182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:02.280007Z","title":"Berg, and Li Fei-Fei","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-07T14:14:59.427680Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.280007Z"},"links":{"citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:fac34299d53a09cb2fae68b833543d9b5611d2845618b36a5693aab7df84df82","observation_id":"dec8887e-146a-497a-9fcb-531037e4a453","resolution":{"observed_at":"2026-08-07T05:26:02.280007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.08500","last_updated":"2018-01-12T14:05:44Z","snapshot_observed_at":"2026-07-06T05:48:30.254634Z","submitted_at":"2017-06-26T17:45:23Z","title":"GANs Trained by a Two Time-Scale Update Rule Converge to a Local Nash Equilibrium","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.08500","snapshot_observed_at":"2026-08-07T05:26:02.284927Z","title":"Gans trained by a two time-scale update rule converge to a nash equilibrium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-07T14:14:59.427680Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.284927Z"},"links":{"cited_paper":"/paper/1706.08500","citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:bf18f0c294fdb0e3d514c46c52afda592f6f00ae76dcf26459bdec6d4f9d32d2","observation_id":"e2b7d0af-685f-409a-9696-75ee733aa485","resolution":{"observed_at":"2026-08-07T05:26:02.284927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-07T05:26:02.290423Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-07T14:14:59.427680Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.290423Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:128c0cf9c4802faa99081f395fbc450b15357b0f84bb2b3c38f8daaf5c85d7a8","observation_id":"b359263d-7854-4482-bff0-19015f64197b","resolution":{"observed_at":"2026-08-07T05:26:02.290423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-07T05:26:02.295862Z","title":"Hierarchical text-conditional image generation with clip latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-07T14:14:59.427680Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.295862Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:e00d6c17fcffccd2789397b8ed6a4a624cdc64531f3746eb6c6dfa38fac6bf2f","observation_id":"87f949b3-56af-4d57-b1b8-c37f3b2ffbad","resolution":{"observed_at":"2026-08-07T05:26:02.295862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16280","last_updated":"2024-09-24T17:51:04Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:51:04Z","title":"MonoFormer: One Transformer for Both Diffusion and Autoregression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16280","snapshot_observed_at":"2026-08-07T05:26:02.300549Z","title":"Monoformer: One transformer for both diffusion and autoregression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-07T14:14:59.427680Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.300549Z"},"links":{"cited_paper":"/paper/2409.16280","citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:f0ed1a36e1c717351924490e272b32958b5c8cc798e66df8947d908808d79317","observation_id":"69d98c81-9564-48fe-8a07-aeefee81b03d","resolution":{"observed_at":"2026-08-07T05:26:02.300549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08635","last_updated":"2024-12-11T18:57:32Z","snapshot_observed_at":"2026-07-06T20:05:28.003434Z","submitted_at":"2024-12-11T18:57:32Z","title":"Multimodal Latent Language Modeling with Next-Token Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08635","snapshot_observed_at":"2026-08-07T05:26:02.305545Z","title":"Multimodal latent language modeling with next-token diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-07T14:14:59.427680Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.305545Z"},"links":{"cited_paper":"/paper/2412.08635","citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:898d398d32b18557552bd368c98be935513f70735f2b372a797857028c8f6c1f","observation_id":"c019fe1d-5e97-499b-8135-b37cb455203b","resolution":{"observed_at":"2026-08-07T05:26:02.305545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08916","last_updated":"2022-10-04T22:37:32Z","snapshot_observed_at":"2026-07-06T13:22:09.403770Z","submitted_at":"2022-06-17T17:53:47Z","title":"Unified-IO: A Unified Model for Vision, Language, and Multi-Modal Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08916","snapshot_observed_at":"2026-08-07T05:26:02.310361Z","title":"Unified-io: A unified model for vision, language, and multi-modal tasks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-07T14:14:59.427680Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.310361Z"},"links":{"cited_paper":"/paper/2206.08916","citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:f01b289b02cfa212e2c28fb2bd1ffd9680b16d04c6484e4b81dedcb092bb78b1","observation_id":"446505ae-d8ab-4536-8a30-77cdf3a0a24c","resolution":{"observed_at":"2026-08-07T05:26:02.310361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:02.879905Z","title":"Unified-io 2: Scaling autoregressive multimodal models with vision, language, audio, and action","venue":null,"work_id":"0f30a08f-22ba-43a2-b985-d4c5b84c7fed","year":2024},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-07T14:14:59.427680Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.315361Z"},"links":{"citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:198f6a4223699adffd25feec8724655b477ea6d1d3ce59741ccbcd6f2fd6c056","observation_id":"736137f4-926f-4033-9fb4-1590dd309969","resolution":{"observed_at":"2026-08-07T05:26:02.887324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:02.860422Z","title":"Addendum to gpt-4o system card: Native image generation, 2025","venue":null,"work_id":"ff1c26ce-ca08-4310-8cbd-de55f0833302","year":2025},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-07T14:14:59.427680Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.320633Z"},"links":{"citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:c509a74852bfbb7c33b607728a365554a79f06cdade713abde592fb036d18e72","observation_id":"d9adef13-b6d4-4578-a126-2b3c99bbc6c7","resolution":{"observed_at":"2026-08-07T05:26:02.867367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-07T05:26:02.325132Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-07T14:14:59.427680Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.325132Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:e837ad1a03e82ce68889a3531decbc333af9f9cf13786cfdd91874f289f69327","observation_id":"5a82c5ce-1d22-45c3-b8f0-cae910510371","resolution":{"observed_at":"2026-08-07T05:26:02.325132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10812","last_updated":"2024-10-14T17:59:42Z","snapshot_observed_at":"2026-08-07T19:45:45.522836Z","submitted_at":"2024-10-14T17:59:42Z","title":"HART: Efficient Visual Generation with Hybrid Autoregressive Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10812","snapshot_observed_at":"2026-08-07T05:26:02.330264Z","title":"Hart: Efficient visual generation with hybrid autoregressive transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-07T14:14:59.427680Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.330264Z"},"links":{"cited_paper":"/paper/2410.10812","citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:b2363201c14ee1b1061418a68d40f012ef5e690d7fc0489ba1d1ac810e0c4516","observation_id":"7afd44aa-38ce-4c14-996a-5b623d8e2a32","resolution":{"observed_at":"2026-08-07T05:26:02.330264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T14:14:59.427680Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":0,"verified_fuzzy":11},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 0 inbound Pith citation observations for arXiv:2506.07999."}