{"as_of":"2026-08-11T11:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9bcf82a16015a7acae05b1c8ec9f8adeaef68e44b4592171a4c3c1dd9cc1c194","coverage":[{"denominator":99,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":99,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T04:49:30.873360Z","state":"measured"},{"denominator":199,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":199,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":172,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T06:01:59.818823Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":340,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2206.10789","doi":"10.48550/arxiv.2206.10789","metadata_source":"pith","pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","venue":"cs.CV","work_id":"0a105815-ff2e-43ce-8566-966cdcae1af4","year":2022},"citing_paper":{"arxiv_id":"2208.01618","last_updated":"2022-08-02T17:50:36Z","snapshot_observed_at":"2026-08-02T23:40:32.342515Z","submitted_at":"2022-08-02T17:50:36Z","title":"An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-11T18:08:55.311069Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2208.01618"},"observation_digest":"sha256:39652dfeb84347b9ae87950134bf745e697d89711e22977d341fbd6192ba64ed","observation_id":"ed759494-4e47-4531-aed0-2fdbfb2b4bde","resolution":{"observed_at":"2026-05-12T04:49:31.747550Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2206.10789","doi":"10.48550/arxiv.2206.10789","metadata_source":"pith","pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","venue":"cs.CV","work_id":"0a105815-ff2e-43ce-8566-966cdcae1af4","year":2022},"citing_paper":{"arxiv_id":"2208.01626","last_updated":"2022-08-02T17:55:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-02T17:55:41Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-11T07:00:01.154743Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2208.01626"},"observation_digest":"sha256:1be49ef49fa0af668725e46805558a04aa5d7b09187fc1eeb71425ae08be719e","observation_id":"73f522ce-279b-4823-ac7c-cb65e3fada02","resolution":{"observed_at":"2026-05-12T04:49:31.747550Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2206.10789","doi":"10.48550/arxiv.2206.10789","metadata_source":"pith","pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","venue":"cs.CV","work_id":"0a105815-ff2e-43ce-8566-966cdcae1af4","year":2022},"citing_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-11T01:13:03.213358Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2209.14792"},"observation_digest":"sha256:5d43ec5041fad2fc1c9331dcb4960315d6c97aaf16f96495baf8f35d191f9f78","observation_id":"2c9909b1-76e8-4c41-809e-253f5f0f18e2","resolution":{"observed_at":"2026-05-12T04:49:31.747550Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2206.10789","doi":"10.48550/arxiv.2206.10789","metadata_source":"pith","pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","venue":"cs.CV","work_id":"0a105815-ff2e-43ce-8566-966cdcae1af4","year":2022},"citing_paper":{"arxiv_id":"2209.14988","last_updated":"2022-09-29T17:50:40Z","snapshot_observed_at":"2026-07-06T13:57:54.539656Z","submitted_at":"2022-09-29T17:50:40Z","title":"DreamFusion: Text-to-3D using 2D Diffusion","version":1},"reference_index":160,"source":"arxiv_source","source_observed_at":"2026-05-11T11:27:10.287358Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2209.14988"},"observation_digest":"sha256:a3245351e082ff89021f9bd0ef4cc2c312c5b905e10bb600dac8a88b57f043ad","observation_id":"bb7fbf59-e28f-48f8-a0b2-545cdeb66394","resolution":{"observed_at":"2026-05-12T04:49:31.747550Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2206.10789","doi":"10.48550/arxiv.2206.10789","metadata_source":"pith","pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","venue":"cs.CV","work_id":"0a105815-ff2e-43ce-8566-966cdcae1af4","year":2022},"citing_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-11T03:31:08.155347Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2210.02303"},"observation_digest":"sha256:8ba09cc507ae9e4acb525acaa2aa8c26b31a6b2d8eee423b7f9fac0c88b732d4","observation_id":"f9f0375e-9642-413a-bf1d-7ae6887d7bac","resolution":{"observed_at":"2026-05-12T04:49:31.747550Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2206.10789","doi":"10.48550/arxiv.2206.10789","metadata_source":"pith","pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","venue":"cs.CV","work_id":"0a105815-ff2e-43ce-8566-966cdcae1af4","year":2022},"citing_paper":{"arxiv_id":"2210.02399","last_updated":"2022-10-05T17:18:28Z","snapshot_observed_at":"2026-08-04T09:09:48.463217Z","submitted_at":"2022-10-05T17:18:28Z","title":"Phenaki: Variable Length Video Generation From Open Domain Textual Description","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-17T01:43:34.024375Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2210.02399"},"observation_digest":"sha256:d508ec94c917615051c4df345c6c4babdf90d1eabe5762851ef88fc350e17f3e","observation_id":"a6cd0a22-c329-476d-b79c-1222b7d9ed4e","resolution":{"observed_at":"2026-05-17T01:43:34.177769Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2206.10789","doi":"10.48550/arxiv.2206.10789","metadata_source":"pith","pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","venue":"cs.CV","work_id":"0a105815-ff2e-43ce-8566-966cdcae1af4","year":2022},"citing_paper":{"arxiv_id":"2210.08402","last_updated":"2022-10-16T00:08:18Z","snapshot_observed_at":"2026-07-29T21:51:47.064287Z","submitted_at":"2022-10-16T00:08:18Z","title":"LAION-5B: An open large-scale dataset for training next generation image-text models","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-13T14:22:16.968028Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2210.08402"},"observation_digest":"sha256:0ae01d83c3a8a909c3ebdc6d203e0bd26bdfbd4d9b07244d8cb432094bf646bb","observation_id":"55fb41e9-13c6-47fe-ab76-b0d73638b582","resolution":{"observed_at":"2026-05-13T14:22:17.446645Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2206.10789","doi":"10.48550/arxiv.2206.10789","metadata_source":"pith","pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","venue":"cs.CV","work_id":"0a105815-ff2e-43ce-8566-966cdcae1af4","year":2022},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:2beddcd90a237ddc2dad6e04c4a0652c8275ed240f79bce37e94adc75ec21cfb","observation_id":"6dd858a3-a606-40fd-bb39-a89b27ce06c4","resolution":{"observed_at":"2026-05-15T01:44:22.842165Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2206.10789","doi":"10.48550/arxiv.2206.10789","metadata_source":"pith","pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","venue":"cs.CV","work_id":"0a105815-ff2e-43ce-8566-966cdcae1af4","year":2022},"citing_paper":{"arxiv_id":"2211.09085","last_updated":"2022-11-16T18:06:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-16T18:06:33Z","title":"Galactica: A Large Language Model for Science","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-13T05:53:21.810346Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2211.09085"},"observation_digest":"sha256:3c959456816323911ebfa8592ba1a4691f7aeacd022f315001005cb05259fc37","observation_id":"de0d3ea7-bcce-4e3f-84fa-e765473df9c3","resolution":{"observed_at":"2026-05-13T05:53:21.931338Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2206.10789","doi":"10.48550/arxiv.2206.10789","metadata_source":"pith","pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","venue":"cs.CV","work_id":"0a105815-ff2e-43ce-8566-966cdcae1af4","year":2022},"citing_paper":{"arxiv_id":"2211.15089","last_updated":"2022-12-15T14:27:19Z","snapshot_observed_at":"2026-08-07T07:03:02.158312Z","submitted_at":"2022-11-28T06:08:54Z","title":"Continuous diffusion for categorical data","version":3},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-05-18T03:30:22.025578Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2211.15089"},"observation_digest":"sha256:5b0317fbe0205730e7be6840729d0d295dc8dbd1fffd1b07237c7c4caa2887c0","observation_id":"cc1dfb85-3770-42c6-84d3-7b0887b400a7","resolution":{"observed_at":"2026-05-18T03:30:22.339640Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2206.10789","doi":"10.48550/arxiv.2206.10789","metadata_source":"pith","pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","venue":"cs.CV","work_id":"0a105815-ff2e-43ce-8566-966cdcae1af4","year":2022},"citing_paper":{"arxiv_id":"2211.17192","last_updated":"2023-05-18T20:28:20Z","snapshot_observed_at":"2026-08-08T11:03:33.403601Z","submitted_at":"2022-11-30T17:33:28Z","title":"Fast Inference from Transformers via Speculative Decoding","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-05-17T22:52:00.101612Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2211.17192"},"observation_digest":"sha256:f37beb47d0bcd6f722ea972c7a6843150a1908f09a0c4303db54976996f73cb6","observation_id":"96609aa2-9528-42b2-8e77-8c3b6ba190bd","resolution":{"observed_at":"2026-05-17T22:52:00.223825Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2206.10789","doi":"10.48550/arxiv.2206.10789","metadata_source":"pith","pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","venue":"cs.CV","work_id":"0a105815-ff2e-43ce-8566-966cdcae1af4","year":2022},"citing_paper":{"arxiv_id":"2212.09748","last_updated":"2023-03-02T09:06:55Z","snapshot_observed_at":"2026-07-06T14:32:37.317828Z","submitted_at":"2022-12-19T18:59:58Z","title":"Scalable Diffusion Models with Transformers","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-12T06:04:05.434354Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2212.09748"},"observation_digest":"sha256:31cf8c0cabd6a990e34bc23fa5d38f7710a3b885e0785badcafcbec459df1b89","observation_id":"4a244c0c-9f35-4558-992c-af6ed4c78b8b","resolution":{"observed_at":"2026-05-12T06:04:05.810349Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2206.10789","doi":"10.48550/arxiv.2206.10789","metadata_source":"pith","pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","venue":"cs.CV","work_id":"0a105815-ff2e-43ce-8566-966cdcae1af4","year":2022},"citing_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-11T08:22:03.403362Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2304.08485"},"observation_digest":"sha256:9e96319d4562ef5eeea3f41bb19a8578c50c305294e3190b42598d424a0b291a","observation_id":"f0c655f1-1a4a-41ea-be5f-fe1eb4976b81","resolution":{"observed_at":"2026-05-12T04:49:31.747550Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2206.10789","doi":"10.48550/arxiv.2206.10789","metadata_source":"pith","pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","venue":"cs.CV","work_id":"0a105815-ff2e-43ce-8566-966cdcae1af4","year":2022},"citing_paper":{"arxiv_id":"2305.02463","last_updated":"2023-05-03T23:59:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-03T23:59:13Z","title":"Shap-E: Generating Conditional 3D Implicit Functions","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-16T15:32:06.563955Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2305.02463"},"observation_digest":"sha256:e18d0a72d1be685f038e4dc8f063fd5531bce615002b559de6f8b0b9a800d48e","observation_id":"c437b3ac-3c66-48fc-ba21-e2f2ffe49bd0","resolution":{"observed_at":"2026-05-16T15:32:06.692336Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2206.10789","doi":"10.48550/arxiv.2206.10789","metadata_source":"pith","pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","venue":"cs.CV","work_id":"0a105815-ff2e-43ce-8566-966cdcae1af4","year":2022},"citing_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T23:57:08.818348Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2308.06721"},"observation_digest":"sha256:35ed7ccff29e751b875fb1e9b45f24c57ff4b647c89f1b3b59ac0299aae319c7","observation_id":"57b34476-e85b-4cee-91df-5e3fd4d70b43","resolution":{"observed_at":"2026-05-12T04:49:31.747550Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2206.10789","doi":"10.48550/arxiv.2206.10789","metadata_source":"pith","pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","venue":"cs.CV","work_id":"0a105815-ff2e-43ce-8566-966cdcae1af4","year":2022},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:96f8285f20ede60c15688a46c3bc874f91e0c53edb0cef4269bda7f18b7b535c","observation_id":"55ba762c-7bae-4b10-bcc2-99ac10481875","resolution":{"observed_at":"2026-05-13T20:06:44.602357Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2206.10789","doi":"10.48550/arxiv.2206.10789","metadata_source":"pith","pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","venue":"cs.CV","work_id":"0a105815-ff2e-43ce-8566-966cdcae1af4","year":2022},"citing_paper":{"arxiv_id":"2310.06114","last_updated":"2024-09-26T17:14:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-09T19:42:22Z","title":"Learning Interactive Real-World Simulators","version":3},"reference_index":172,"source":"arxiv_source","source_observed_at":"2026-05-16T02:15:18.265190Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2310.06114"},"observation_digest":"sha256:b7b92334e5f81636312ca74c822b854a13b30335959545dc23a033f104133828","observation_id":"96a611e9-5731-4105-b9c7-142c9356f31a","resolution":{"observed_at":"2026-05-16T02:15:18.629848Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2206.10789","doi":"10.48550/arxiv.2206.10789","metadata_source":"pith","pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","venue":"cs.CV","work_id":"0a105815-ff2e-43ce-8566-966cdcae1af4","year":2022},"citing_paper":{"arxiv_id":"2310.19512","last_updated":"2023-10-30T13:12:40Z","snapshot_observed_at":"2026-08-10T20:17:19.785772Z","submitted_at":"2023-10-30T13:12:40Z","title":"VideoCrafter1: Open Diffusion Models for High-Quality Video Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-14T21:40:43.956642Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2310.19512"},"observation_digest":"sha256:621b50e14e8531c8b18bb17cc380dc8ad20c1ac6b85b8e35a575d7bc92677e84","observation_id":"a8853952-f1e1-4838-b391-1c392deb9ec6","resolution":{"observed_at":"2026-05-14T21:40:44.160267Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2206.10789","doi":"10.48550/arxiv.2206.10789","metadata_source":"pith","pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","venue":"cs.CV","work_id":"0a105815-ff2e-43ce-8566-966cdcae1af4","year":2022},"citing_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"reference_index":127,"source":"arxiv_source","source_observed_at":"2026-05-24T05:00:28.453838Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2312.11805"},"observation_digest":"sha256:48da4da93a9cd9b3d41bf94ad28503a04a91d4f9697c434e9810c9f11f08e75a","observation_id":"aacf55c7-ee86-4337-8e17-dfe53b47619e","resolution":{"observed_at":"2026-05-24T05:03:55.541087Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2206.10789","doi":"10.48550/arxiv.2206.10789","metadata_source":"pith","pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","venue":"cs.CV","work_id":"0a105815-ff2e-43ce-8566-966cdcae1af4","year":2022},"citing_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-07-30T23:45:07.963944Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-15T17:51:05.465548Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2312.14125"},"observation_digest":"sha256:6227449835facc25b75d21c8fc70e4f95d1263b80d7a91a751f9d870dc63a3f4","observation_id":"817bb176-c1ba-4fce-9048-b41dca849e31","resolution":{"observed_at":"2026-05-15T17:51:05.614606Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2206.10789","doi":"10.48550/arxiv.2206.10789","metadata_source":"pith","pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","venue":"cs.CV","work_id":"0a105815-ff2e-43ce-8566-966cdcae1af4","year":2022},"citing_paper":{"arxiv_id":"2402.08268","last_updated":"2025-02-03T21:47:31Z","snapshot_observed_at":"2026-08-11T03:45:32.889856Z","submitted_at":"2024-02-13T07:47:36Z","title":"World Model on Million-Length Video And Language With Blockwise RingAttention","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-16T06:36:57.165551Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2402.08268"},"observation_digest":"sha256:ffd298857ea9f4ebb70efa6c275f50aedb2b34af42f6d1f80fe78580cdfd5a0a","observation_id":"b8e9fb38-b93f-451d-9b04-9905280eb14c","resolution":{"observed_at":"2026-05-16T06:36:57.239048Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2206.10789","doi":"10.48550/arxiv.2206.10789","metadata_source":"pith","pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","venue":"cs.CV","work_id":"0a105815-ff2e-43ce-8566-966cdcae1af4","year":2022},"citing_paper":{"arxiv_id":"2403.03206","last_updated":"2024-03-05T18:45:39Z","snapshot_observed_at":"2026-07-06T17:40:01.975792Z","submitted_at":"2024-03-05T18:45:39Z","title":"Scaling Rectified Flow Transformers for High-Resolution Image Synthesis","version":1},"reference_index":194,"source":"arxiv_source","source_observed_at":"2026-05-12T08:27:53.446686Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2403.03206"},"observation_digest":"sha256:17ec4ac63356b8cf1a888f72b576690baff02c19cc3c06dae4b641d7784d8f36","observation_id":"0aa3e213-fc17-46af-bd23-d94834f8e3e8","resolution":{"observed_at":"2026-05-12T08:27:53.634088Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2206.10789","doi":"10.48550/arxiv.2206.10789","metadata_source":"pith","pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","venue":"cs.CV","work_id":"0a105815-ff2e-43ce-8566-966cdcae1af4","year":2022},"citing_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-09T16:24:26.560430Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-11T19:43:03.310237Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2403.05135"},"observation_digest":"sha256:d24131724a62252f3276dfeb90cb6bfb1659df675579787faadbe976bc976023","observation_id":"baa85def-08ce-4b23-a374-c1247054efca","resolution":{"observed_at":"2026-05-12T04:49:31.747550Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2206.10789","doi":"10.48550/arxiv.2206.10789","metadata_source":"pith","pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","venue":"cs.CV","work_id":"0a105815-ff2e-43ce-8566-966cdcae1af4","year":2022},"citing_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-11T22:09:16.622717Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2406.06525"},"observation_digest":"sha256:482c91aa6b2db2ce98d4d0bf434e668b4b9d2d647c6709466910bd19dcfed652","observation_id":"8b402d7a-4e61-42f6-92bc-b7801c4c48ec","resolution":{"observed_at":"2026-05-12T04:49:31.747550Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2206.10789","doi":"10.48550/arxiv.2206.10789","metadata_source":"pith","pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","venue":"cs.CV","work_id":"0a105815-ff2e-43ce-8566-966cdcae1af4","year":2022},"citing_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-08-11T01:34:46.484513Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:26.887069Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2408.11039"},"observation_digest":"sha256:1217fa70596792cf463a2599af78140770ff71d37a3d8f4145b7bab76f45de8b","observation_id":"70d2c301-4bec-4eac-b181-731fa5545c0e","resolution":{"observed_at":"2026-05-13T05:57:26.993448Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2206.10789","doi":"10.48550/arxiv.2206.10789","metadata_source":"pith","pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","venue":"cs.CV","work_id":"0a105815-ff2e-43ce-8566-966cdcae1af4","year":2022},"citing_paper":{"arxiv_id":"2408.14837","last_updated":"2025-04-24T03:03:57Z","snapshot_observed_at":"2026-07-06T19:06:23.640089Z","submitted_at":"2024-08-27T07:46:07Z","title":"Diffusion Models Are Real-Time Game Engines","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-16T12:04:44.162343Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2408.14837"},"observation_digest":"sha256:b7d0bd59e34c3ba2e5dffcf3fd5b8fe9b25d271ae8c3019723dbad8599191614","observation_id":"4c09ecad-160f-4d44-a2bc-0dbbd3b4c369","resolution":{"observed_at":"2026-05-16T12:04:44.225014Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2206.10789","doi":"10.48550/arxiv.2206.10789","metadata_source":"pith","pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","venue":"cs.CV","work_id":"0a105815-ff2e-43ce-8566-966cdcae1af4","year":2022},"citing_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-11T10:56:06.418360Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2409.18869"},"observation_digest":"sha256:204ab4e74e12ec5f887ea5e72699b887f77a727c4c6d1c36fe95da9d2575eb36","observation_id":"74c55ca5-f052-4dc5-a716-2cd715a152f6","resolution":{"observed_at":"2026-05-12T04:49:31.747550Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2206.10789","doi":"10.48550/arxiv.2206.10789","metadata_source":"pith","pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","venue":"cs.CV","work_id":"0a105815-ff2e-43ce-8566-966cdcae1af4","year":2022},"citing_paper":{"arxiv_id":"2412.04300","last_updated":"2025-06-04T03:29:18Z","snapshot_observed_at":"2026-08-08T07:13:29.035650Z","submitted_at":"2024-12-05T16:21:01Z","title":"T2I-FactualBench: Benchmarking the Factuality of Text-to-Image Models with Knowledge-Intensive Concepts","version":3},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-23T08:00:12.781392Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2412.04300"},"observation_digest":"sha256:8dd66062e1fde295f7a23118d31c7e3e72d6e132363037a0d1142c5402aaf440","observation_id":"9d8816d3-7bb2-4e7a-9683-94a1d219df76","resolution":{"observed_at":"2026-05-23T08:02:43.331108Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2206.10789","doi":"10.48550/arxiv.2206.10789","metadata_source":"pith","pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","venue":"cs.CV","work_id":"0a105815-ff2e-43ce-8566-966cdcae1af4","year":2022},"citing_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-17T15:07:39.718555Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2412.14169"},"observation_digest":"sha256:2b83ed16baba9fd368667dd8c77be8460bd09527a111ada1c2299065285bc784","observation_id":"a131a26e-66f1-48e2-a545-bc3cf6dc6b16","resolution":{"observed_at":"2026-05-17T15:07:39.829441Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-11T06:01:59.818823Z","title":"Scaling autoregres- sive models for content-rich text-to-image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16919","last_updated":"2025-08-09T03:33:36Z","snapshot_observed_at":"2026-08-11T05:56:34.417600Z","submitted_at":"2024-12-22T08:28:20Z","title":"TAR3D: Creating High-Quality 3D Assets via Next-Part Prediction","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T06:01:59.818823Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2412.16919"},"observation_digest":"sha256:e9a1d6c1de7d9c7505f854e6fc4a070319f796320ecb06ec00dbeceaa26d3d68","observation_id":"d400e8e4-4fa3-416e-b189-dd9dbd162a85","resolution":{"observed_at":"2026-08-11T06:01:59.818823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-11T04:39:36.759706Z","title":"Scaling autoregres- sive models for content-rich text-to-image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18653","last_updated":"2024-12-24T19:00:02Z","snapshot_observed_at":"2026-08-11T04:33:55.415799Z","submitted_at":"2024-12-24T19:00:02Z","title":"1.58-bit FLUX","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T04:39:36.759706Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2412.18653"},"observation_digest":"sha256:7022f0f864a9cc3374ae88adc7dab791af66a406b29383102e79b7be1b5d6994","observation_id":"06afcad5-ae64-4a94-af83-a593239ac90c","resolution":{"observed_at":"2026-08-11T04:39:36.759706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-11T00:18:36.849864Z","title":"Scaling autoregres- sive models for content-rich text-to-image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.19531","last_updated":"2024-12-27T08:53:37Z","snapshot_observed_at":"2026-08-11T01:08:20.491698Z","submitted_at":"2024-12-27T08:53:37Z","title":"Is Your Text-to-Image Model Robust to Caption Noise?","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T00:18:36.849864Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2412.19531"},"observation_digest":"sha256:6f0c9f6b4bcd063ea8ecf212c1862a5fa2d7398f9f16178285c1edd117f629a9","observation_id":"ada49843-71c3-412e-853f-228e19ea5ce6","resolution":{"observed_at":"2026-08-11T00:18:36.849864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-11T00:13:43.677898Z","title":"Scaling autoregres- sive models for content-rich text-to-image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.19637","last_updated":"2025-06-21T13:41:27Z","snapshot_observed_at":"2026-08-11T00:00:26.549650Z","submitted_at":"2024-12-27T13:31:55Z","title":"ReNeg: Learning Negative Embedding with Reward Guidance","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T00:13:43.677898Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2412.19637"},"observation_digest":"sha256:9dc8d99ddbd3fd4535853e2b4df29eab57dfd93d8293a52e0ad316b3a2faec51","observation_id":"b81c66ec-e33c-4b39-9591-18074c91767b","resolution":{"observed_at":"2026-08-11T00:13:43.677898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-10T23:14:40.708574Z","title":"Scaling autoregres- sive models for content-rich text-to-image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.20800","last_updated":"2024-12-30T08:47:25Z","snapshot_observed_at":"2026-08-10T23:08:24.510594Z","submitted_at":"2024-12-30T08:47:25Z","title":"VMix: Improving Text-to-Image Diffusion Model with Cross-Attention Mixing Control","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T23:14:40.708574Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2412.20800"},"observation_digest":"sha256:e1ce31a8c41099b995af4cff4d28b84cfdc9da24c57abc9c02106bbb1b8240f6","observation_id":"5037f6f1-1b70-42ef-8380-5381a1c8bd05","resolution":{"observed_at":"2026-08-10T23:14:40.708574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-10T23:05:13.746565Z","title":"Scaling autoregressive models for content-rich text-to-image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.00116","last_updated":"2024-12-30T19:30:40Z","snapshot_observed_at":"2026-08-10T22:57:01.150963Z","submitted_at":"2024-12-30T19:30:40Z","title":"Text-to-Image GAN with Pretrained Representations","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:13.746565Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2501.00116"},"observation_digest":"sha256:b72c1b633ab808e0e27621ba9313092d25a9d3dbd0f46bee82b6f642c6b6a27d","observation_id":"5f838876-fc7a-4165-a8d3-daadcbbee38b","resolution":{"observed_at":"2026-08-10T23:05:13.746565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-10T22:44:30.541656Z","title":"Scaling autoregres- sive models for content-rich text-to-image generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.541656Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:a0f178d7c8ef5568469d59acdfa15b4221f1c938cac3dfdf9ffff45823d48536","observation_id":"52e35fa3-3958-4a53-9135-94994b442840","resolution":{"observed_at":"2026-08-10T22:44:30.541656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-10T22:43:31.714764Z","title":"Y.; Luong, T.; Baid, G.; Wang, Z.; Vasudevan, V.; Ku, A.; Yang, Y.; Ayan, B","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.00941","last_updated":"2025-01-01T19:49:38Z","snapshot_observed_at":"2026-08-10T22:36:41.416884Z","submitted_at":"2025-01-01T19:49:38Z","title":"A Novel Diffusion Model for Pairwise Geoscience Data Generation with Unbalanced Training Dataset","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-10T22:43:31.714764Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2501.00941"},"observation_digest":"sha256:c09ee8983743f3918d0b83708b1bb8588ca5ac436f321894b88fda40ae3ade08","observation_id":"98c4c712-4d37-4459-8c0e-81c7d8caeaeb","resolution":{"observed_at":"2026-08-10T22:43:31.714764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-10T23:48:02.416943Z","title":"Scaling autoregres- sive models for content-rich text-to-image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.01973","last_updated":"2025-01-09T07:26:05Z","snapshot_observed_at":"2026-08-10T23:40:36.197059Z","submitted_at":"2024-12-28T02:28:19Z","title":"INFELM: In-depth Fairness Evaluation of Large Text-To-Image Models","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:02.416943Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2501.01973"},"observation_digest":"sha256:bfa4ff3e5b47fcfdd61bd629bcb34b81b247195b7eedbbad310ef7fc8b29f9ea","observation_id":"3b5862f0-521a-48bb-9464-57df2ad73499","resolution":{"observed_at":"2026-08-10T23:48:02.416943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-10T21:42:07.106704Z","title":"Scaling autoregressive models for content- rich text-to-image generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.04304","last_updated":"2025-02-12T10:49:40Z","snapshot_observed_at":"2026-08-10T21:34:15.467528Z","submitted_at":"2025-01-08T06:30:31Z","title":"DGQ: Distribution-Aware Group Quantization for Text-to-Image Diffusion Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:07.106704Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2501.04304"},"observation_digest":"sha256:8bfcfa1bd9d8f4e8ba7e0d61163439adc869232bc887d5dadebac64972077ae8","observation_id":"6e3fefee-ef75-4a8a-aefa-a8f2b5e92e24","resolution":{"observed_at":"2026-08-10T21:42:07.106704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-10T21:29:20.140153Z","title":"Scaling autoregressive models for content-rich text-to-image generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.04699","last_updated":"2025-01-08T18:59:35Z","snapshot_observed_at":"2026-08-10T21:57:36.732361Z","submitted_at":"2025-01-08T18:59:35Z","title":"EditAR: Unified Conditional Generation with Autoregressive Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-10T21:29:20.140153Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2501.04699"},"observation_digest":"sha256:121a328fee277be78eafd53861a9fc9428fa96ce02bd3dd9c6ebf112ec193b82","observation_id":"231f247a-8df4-488a-a358-63b542d6eb62","resolution":{"observed_at":"2026-08-10T21:29:20.140153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-10T22:04:24.330890Z","title":"Scaling autoregressive models for content- rich text-to-image generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.06218","last_updated":"2025-01-06T14:23:07Z","snapshot_observed_at":"2026-08-11T06:39:35.330519Z","submitted_at":"2025-01-06T14:23:07Z","title":"Dissecting Bit-Level Scaling Laws in Quantizing Vision Generative Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T22:04:24.330890Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2501.06218"},"observation_digest":"sha256:0f066872985f4b91513eef0657a11e08b24c1e2bf737821fde24ec5d1a258236","observation_id":"ec1ca818-d779-4d23-80bd-47d78f7af62e","resolution":{"observed_at":"2026-08-10T22:04:24.330890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-10T21:04:57.554821Z","title":"Scaling autoregressive models for content-rich text-to-image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.06481","last_updated":"2025-01-11T08:16:30Z","snapshot_observed_at":"2026-08-10T20:57:09.235828Z","submitted_at":"2025-01-11T08:16:30Z","title":"Focus-N-Fix: Region-Aware Fine-Tuning for Text-to-Image Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T21:04:57.554821Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2501.06481"},"observation_digest":"sha256:102fb26d1690ce80a6537e45ba417b04b108b5e6ec31be3176f8eebb5179e98f","observation_id":"0c78d1d8-d5ca-49c4-acda-5720336a061a","resolution":{"observed_at":"2026-08-10T21:04:57.554821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-10T20:16:58.637567Z","title":"Scaling autoregres- sive models for content-rich text-to-image generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.08994","last_updated":"2025-01-15T18:20:37Z","snapshot_observed_at":"2026-08-11T02:55:15.016588Z","submitted_at":"2025-01-15T18:20:37Z","title":"RepVideo: Rethinking Cross-Layer Representation for Video Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T20:16:58.637567Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2501.08994"},"observation_digest":"sha256:d8a718187ce489dd8c1ecaf1ee7a849112d6093f64634ab711dff4d0d4052f91","observation_id":"8d406714-7fd8-407b-ba3f-d9a77ed1373d","resolution":{"observed_at":"2026-08-10T20:16:58.637567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-10T19:48:08.234771Z","title":"Scaling autoregressive models for content-rich text-to-image generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.09755","last_updated":"2025-01-16T18:59:04Z","snapshot_observed_at":"2026-08-10T19:39:02.178593Z","submitted_at":"2025-01-16T18:59:04Z","title":"Learnings from Scaling Visual Tokenizers for Reconstruction and Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T19:48:08.234771Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2501.09755"},"observation_digest":"sha256:8eb824c7645d195b8573f255f2db504bba527a8aeb7870678aa16e902cd9bf9f","observation_id":"6737044d-731d-4629-8795-d114f4c6a526","resolution":{"observed_at":"2026-08-10T19:48:08.234771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-10T16:12:00.043560Z","title":"Scaling autoregressive models for content-rich text-to-image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.13452","last_updated":"2025-02-27T06:55:41Z","snapshot_observed_at":"2026-08-10T20:06:28.437472Z","submitted_at":"2025-01-23T08:06:11Z","title":"EchoVideo: Identity-Preserving Human Video Generation by Multimodal Feature Fusion","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T16:12:00.043560Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2501.13452"},"observation_digest":"sha256:8a6d5dc8a06ad526e25259ddc031452f7cbe1b2d929d258f6ef74da83c4cfe7c","observation_id":"ba7fd32d-d8a2-40a2-b46b-84d79d47ff3d","resolution":{"observed_at":"2026-08-10T16:12:00.043560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-09T22:56:36.227366Z","title":"Y., Luong, T., Baid, G., Wang, Z., Vasudevan, V., Ku, A., Yang, Y., Ayan, B","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-10T02:35:35.003821Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.227366Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:a828247c89319d13a96a02f6b6e10729a2f6e6c130fd7259ee2d2333e9d7edd5","observation_id":"10880191-3d47-4747-ab61-163f8a62be6b","resolution":{"observed_at":"2026-08-09T22:56:36.227366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-09T21:47:59.592777Z","title":"Y ., Luong, T., Baid, G., Wang, Z., Va- sudevan, V ., Ku, A., Yang, Y ., Ayan, B","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18993","last_updated":"2025-01-31T09:53:47Z","snapshot_observed_at":"2026-08-09T21:40:28.450978Z","submitted_at":"2025-01-31T09:53:47Z","title":"Visual Autoregressive Modeling for Image Super-Resolution","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T21:47:59.592777Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2501.18993"},"observation_digest":"sha256:6e50d99d4b3e0c71119af08bd5fd62e88ba7e244fb7f2439b23266ed9ec85a2d","observation_id":"37fbd40b-1879-4e8a-8833-4db61cd71d61","resolution":{"observed_at":"2026-08-09T21:47:59.592777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-09T19:05:52.999296Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00433","last_updated":"2025-02-01T13:46:02Z","snapshot_observed_at":"2026-08-10T20:31:18.708788Z","submitted_at":"2025-02-01T13:46:02Z","title":"CAT Pruning: Cluster-Aware Token Pruning For Text-to-Image Diffusion Models","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-09T19:05:52.999296Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2502.00433"},"observation_digest":"sha256:32084193c93cc8fe15e66a7df506e32d6f460b90c678f36c40a4802f9352620e","observation_id":"2b410c8c-d285-4b2b-b65a-cc13d2ce4079","resolution":{"observed_at":"2026-08-09T19:05:52.999296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-09T17:34:10.212570Z","title":"Scaling autoregres- sive models for content-rich text-to-image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01690","last_updated":"2025-02-02T16:55:42Z","snapshot_observed_at":"2026-08-10T05:20:12.605634Z","submitted_at":"2025-02-02T16:55:42Z","title":"HuViDPO:Enhancing Video Generation through Direct Preference Optimization for Human-Centric Alignment","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-09T17:34:10.212570Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2502.01690"},"observation_digest":"sha256:5e33142b271b7566ce5e371f8482a97fbdb11167bde4111491bd73ce3d7f9661","observation_id":"433754fd-2c16-4c97-8c20-c822fb0e8dbc","resolution":{"observed_at":"2026-08-09T17:34:10.212570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-09T04:11:42.108293Z","title":"Yu, J., Xu, Y ., Koh, J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.03686","last_updated":"2025-05-23T22:41:09Z","snapshot_observed_at":"2026-08-10T20:59:26.902411Z","submitted_at":"2025-02-06T00:24:39Z","title":"Variational Control for Guidance in Diffusion Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-09T04:11:42.108293Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2502.03686"},"observation_digest":"sha256:26de600724a50f17d19c0e3320ae23ed7695425a1a2ce9bd883ab9474dd686f3","observation_id":"58144a33-5b5d-476b-a589-da6a641d948e","resolution":{"observed_at":"2026-08-09T04:11:42.108293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-08T23:56:18.756524Z","title":"CoRR abs/2206.10789 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04412","last_updated":"2025-02-06T12:17:35Z","snapshot_observed_at":"2026-08-10T17:56:07.595086Z","submitted_at":"2025-02-06T12:17:35Z","title":"Decoder-Only LLMs are Better Controllers for Diffusion Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T23:56:18.756524Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2502.04412"},"observation_digest":"sha256:ce9c85dc5c6cf7543ae8dd05836184961564748886c86b24f84ea488bbb1e105","observation_id":"93633c06-e13d-4cc0-b4a6-81db2175d86c","resolution":{"observed_at":"2026-08-08T23:56:18.756524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-08T15:24:46.475345Z","title":"Y ., Luong, T., Baid, G., Wang, Z., Va- sudevan, V ., Ku, A., Yang, Y ., Ayan, B","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06474","last_updated":"2025-02-10T13:52:52Z","snapshot_observed_at":"2026-08-10T10:35:02.905372Z","submitted_at":"2025-02-10T13:52:52Z","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T15:24:46.475345Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2502.06474"},"observation_digest":"sha256:c365aed31312dfd35cb71961fad5b2f4a406aafab9ed423d2a0cf65c1ec19816","observation_id":"eee958a3-ce80-4dc1-aa91-877675b86481","resolution":{"observed_at":"2026-08-08T15:24:46.475345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-07T21:17:55.978646Z","title":"Y ., Zhang, H., Pang, R., Qin, J., Ku, A., Xu, Y ., Baldridge, J., and Wu, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09509","last_updated":"2025-08-04T10:44:54Z","snapshot_observed_at":"2026-08-09T00:33:22.873294Z","submitted_at":"2025-02-13T17:21:51Z","title":"EQ-VAE: Equivariance Regularized Latent Space for Improved Generative Image Modeling","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T21:17:55.978646Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2502.09509"},"observation_digest":"sha256:8da634dcf98c08378ce71e5bf8939813dbdb0cfdc57a12aee5dc200840e60a05","observation_id":"9a02b24a-7b41-4465-a473-9e6fcfb9b7c4","resolution":{"observed_at":"2026-08-07T21:17:55.978646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-07T20:00:34.088913Z","title":"Scaling autoregres- sive models for content-rich text-to-image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.09963","last_updated":"2025-02-14T07:41:47Z","snapshot_observed_at":"2026-08-09T16:37:34.149959Z","submitted_at":"2025-02-14T07:41:47Z","title":"Generating on Generated: An Approach Towards Self-Evolving Diffusion Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T20:00:34.088913Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2502.09963"},"observation_digest":"sha256:2bb8b781b0d931480ed6d2745291e4a903512c6149884a28f2d3dae72a6c618f","observation_id":"841c55ce-4a5c-40b1-9b5e-61b6c7470d7b","resolution":{"observed_at":"2026-08-07T20:00:34.088913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-07T19:40:21.443079Z","title":"Scaling autore- gressive models for content-rich text-to-image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.443079Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:8a295144f0a9f53e65e0c5161eab3bb9e7c6f1cf3c7920a4d8c8d79c1510754d","observation_id":"5edf496e-fb40-4a8e-91f7-514112de257b","resolution":{"observed_at":"2026-08-07T19:40:21.443079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2206.10789","doi":"10.48550/arxiv.2206.10789","metadata_source":"pith","pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","venue":"cs.CV","work_id":"0a105815-ff2e-43ce-8566-966cdcae1af4","year":2022},"citing_paper":{"arxiv_id":"2503.05236","last_updated":"2026-02-25T13:17:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-07T08:36:05Z","title":"Unified Reward Model for Multimodal Understanding and Generation","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-14T00:44:30.558048Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2503.05236"},"observation_digest":"sha256:fe60f94c024a78d6fa56624e2e8d77d2e99c8ec482142467d038d4f1e4516fce","observation_id":"8420c32b-5fe0-4f3c-b92a-0c0b3959ff58","resolution":{"observed_at":"2026-05-14T00:44:30.783001Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2206.10789","doi":"10.48550/arxiv.2206.10789","metadata_source":"pith","pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","venue":"cs.CV","work_id":"0a105815-ff2e-43ce-8566-966cdcae1af4","year":2022},"citing_paper":{"arxiv_id":"2503.07703","last_updated":"2025-03-10T17:58:33Z","snapshot_observed_at":"2026-07-06T20:50:09.622181Z","submitted_at":"2025-03-10T17:58:33Z","title":"Seedream 2.0: A Native Chinese-English Bilingual Image Generation Foundation Model","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-17T08:27:36.242416Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2503.07703"},"observation_digest":"sha256:3493465147013a65971ec383cb3cfbda324fec66094ee3c137b9961ac654f96a","observation_id":"2c46995d-b210-4425-8d3d-3a86648220c0","resolution":{"observed_at":"2026-05-17T08:27:36.364653Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2206.10789","doi":"10.48550/arxiv.2206.10789","metadata_source":"pith","pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","venue":"cs.CV","work_id":"0a105815-ff2e-43ce-8566-966cdcae1af4","year":2022},"citing_paper":{"arxiv_id":"2503.12575","last_updated":"2026-04-05T16:16:05Z","snapshot_observed_at":"2026-07-06T20:53:31.919637Z","submitted_at":"2025-03-16T17:06:00Z","title":"BalancedDPO: Adaptive Multi-Metric Alignment","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-22T23:37:55.154902Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2503.12575"},"observation_digest":"sha256:e867f2075fc9878f6af6e0e4fe3721baa28b360c12e737aa846b457fbe659a89","observation_id":"9b6dde2a-03da-44fb-b40a-dcc78074431f","resolution":{"observed_at":"2026-05-22T23:42:16.581410Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2206.10789","doi":"10.48550/arxiv.2206.10789","metadata_source":"pith","pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","venue":"cs.CV","work_id":"0a105815-ff2e-43ce-8566-966cdcae1af4","year":2022},"citing_paper":{"arxiv_id":"2505.14202","last_updated":"2026-04-06T02:54:59Z","snapshot_observed_at":"2026-07-30T11:23:54.758846Z","submitted_at":"2025-05-20T11:01:36Z","title":"MSDformer: Multi-scale Discrete Transformer For Time Series Generation","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-22T13:44:08.891339Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2505.14202"},"observation_digest":"sha256:ca3b03d2d052bd15636730d70cd6f35437ee8393dd6e3c94146d41defff00956","observation_id":"cc27188b-03e6-4d7d-8ea5-b7d05dbd53ec","resolution":{"observed_at":"2026-05-22T13:44:52.871888Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-07T15:12:02.518907Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.15973","last_updated":"2025-05-21T19:44:58Z","snapshot_observed_at":"2026-08-09T22:34:17.522518Z","submitted_at":"2025-05-21T19:44:58Z","title":"An Exploratory Study on Multi-modal Generative AI in AR Storytelling","version":1},"reference_index":112,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:02.518907Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2505.15973"},"observation_digest":"sha256:5aecf1ed4100548dd3070b1131388686ca77365624dae3451002860b64b187b2","observation_id":"dd326d28-e7c6-48f9-b32f-770ebd37379c","resolution":{"observed_at":"2026-08-07T15:12:02.518907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-07T14:55:31.570990Z","title":"Scaling autoregressive models for content-rich text-to-image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:31.570990Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:ff47fc7c39aca49d1a2f1842254c5335ef7c8f1f6d8bd436d0565028e679b064","observation_id":"78e39d37-354c-4b90-8b8a-310c159b4d0f","resolution":{"observed_at":"2026-08-07T14:55:31.570990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-07T14:29:21.180996Z","title":"Scaling autoregressive models for content-rich text-to-image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18730","last_updated":"2025-05-24T14:56:09Z","snapshot_observed_at":"2026-08-07T17:06:29.055596Z","submitted_at":"2025-05-24T14:56:09Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:21.180996Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2505.18730"},"observation_digest":"sha256:60fcf456ae6530fe8f1bf61155d4366eaf6d08391787ea6e00f5c5c99fc2bcc3","observation_id":"ac01512f-127b-4625-9706-5d0f8abe1555","resolution":{"observed_at":"2026-08-07T14:29:21.180996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-07T14:18:55.721329Z","title":"Scaling autoregressive models for content-rich text-to-image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19422","last_updated":"2026-07-09T01:17:11Z","snapshot_observed_at":"2026-08-07T14:12:06.053516Z","submitted_at":"2025-05-26T02:22:41Z","title":"LlamaSeg: Image Segmentation via Autoregressive Mask Generation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:55.721329Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2505.19422"},"observation_digest":"sha256:0c2cc628b6a97d01c18b2d41680f4cb33a955141e7e16c9cfb73054b2156a22e","observation_id":"a7d720ca-b63c-439a-8d53-88cc3e268380","resolution":{"observed_at":"2026-08-07T14:18:55.721329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-07T13:24:39.862109Z","title":"Scaling autoregres- sive models for content-rich text-to-image generation.arXiv preprint arXiv:2206.10789, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21960","last_updated":"2025-05-28T04:23:22Z","snapshot_observed_at":"2026-08-10T02:18:23.890883Z","submitted_at":"2025-05-28T04:23:22Z","title":"One-Way Ticket:Time-Independent Unified Encoder for Distilling Text-to-Image Diffusion Models","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T13:24:39.862109Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2505.21960"},"observation_digest":"sha256:f9d6838880a75374e3551f6f99f8f4b403e94a67d78c11902dcb98a581a2fd0d","observation_id":"81b0344d-10a9-4bc5-b6e1-085584823e6b","resolution":{"observed_at":"2026-08-07T13:24:39.862109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-07T11:26:58.701288Z","title":"Y ., Luong, T., Baid, G., Wang, Z., Va- sudevan, V ., Ku, A., Yang, Y ., Ayan, B","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02698","last_updated":"2025-06-06T03:14:26Z","snapshot_observed_at":"2026-08-09T04:25:20.294383Z","submitted_at":"2025-06-03T09:47:22Z","title":"Smoothed Preference Optimization via ReNoise Inversion for Aligning Diffusion Models with Varied Human Preferences","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:58.701288Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2506.02698"},"observation_digest":"sha256:5fce679e4c56a4047b4c549fa111cbb6832f6067d49c72756e52eef2d51ff294","observation_id":"6444d429-66b4-4131-8379-fd37e72ace47","resolution":{"observed_at":"2026-08-07T11:26:58.701288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-07T11:15:27.931555Z","title":"Scaling autoregressive models for content-rich text-to-image generation.arXiv preprint arXiv:2206.10789, 2(3):5, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-10T16:29:24.659168Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:27.931555Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:62e03d0a2a6f0ebdb634e03f206ce8ae645b13857b9527bf04e65fa515e0eb6e","observation_id":"aa682b6b-9d61-4183-9d58-2f8001db09e3","resolution":{"observed_at":"2026-08-07T11:15:27.931555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2206.10789","doi":"10.48550/arxiv.2206.10789","metadata_source":"pith","pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","venue":"cs.CV","work_id":"0a105815-ff2e-43ce-8566-966cdcae1af4","year":2022},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:3bfed5cc617ca79fc7b67942fa8a25c8e2eec622df1241c86d59b00ca05aadf5","observation_id":"fbe66dd3-b9f1-4061-9032-6aedf59e49c6","resolution":{"observed_at":"2026-05-25T08:15:33.614999Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-07T11:05:22.407403Z","title":"Scaling autoregressive models for content-rich text-to-image generation.arXiv preprint arXiv:2206.10789, 2(3):5, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-07T10:55:55.701025Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.407403Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:92a2f02f8c9b095ce5f79f2db9adf308efebf4b1be44be1a9ab8c58b4d947034","observation_id":"b7f27687-3010-43f3-bdbe-4f0cc2ef0e23","resolution":{"observed_at":"2026-08-07T11:05:22.407403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-07T05:25:44.500274Z","title":"Scaling autoregressive models for content-rich text-to-image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07977","last_updated":"2025-06-26T15:47:09Z","snapshot_observed_at":"2026-08-09T14:38:22.529752Z","submitted_at":"2025-06-09T17:50:21Z","title":"OneIG-Bench: Omni-dimensional Nuanced Evaluation for Image Generation","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:44.500274Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2506.07977"},"observation_digest":"sha256:8dd025dc7137e8e7a6a0a49d111eb6de4317999fbfc37fc7c2eb72db74e670de","observation_id":"25a8ef6f-7c96-4537-acab-f6ba0e316079","resolution":{"observed_at":"2026-08-07T05:25:44.500274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-07T05:27:16.277893Z","title":"Scaling autoregres- sive models for content-rich text-to-image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-10T00:01:32.894604Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.277893Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:16a42529714fa84ea996b677ebb2d2303f41fb611b837a8a690306f81d18ba5e","observation_id":"65d4e749-b8d0-4fda-93f8-6157a89cb6a3","resolution":{"observed_at":"2026-08-07T05:27:16.277893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-07T04:17:51.824999Z","title":"Scaling autoregres- sive models for content-rich text-to-image generation.arXiv preprint arXiv:2206.10789, 2(3):5, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10962","last_updated":"2025-06-12T17:57:44Z","snapshot_observed_at":"2026-08-08T11:44:13.586975Z","submitted_at":"2025-06-12T17:57:44Z","title":"SpectralAR: Spectral Autoregressive Visual Generation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T04:17:51.824999Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2506.10962"},"observation_digest":"sha256:c507c491bb33f70e42f640e533851f108fe41a428246ccacdda89e25936b7283","observation_id":"3980dc5b-eeb1-416d-93a5-624f7010b676","resolution":{"observed_at":"2026-08-07T04:17:51.824999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-07T14:51:35.831619Z","title":"Scaling autoregressive models for content-rich text-to-image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12035","last_updated":"2025-05-22T23:26:56Z","snapshot_observed_at":"2026-08-09T21:48:13.011884Z","submitted_at":"2025-05-22T23:26:56Z","title":"MARch\\'e: Fast Masked Autoregressive Image Generation with Cache-Aware Attention","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:35.831619Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2506.12035"},"observation_digest":"sha256:1de225da15b7f1566cb13783ea41c07beb04aaa2fadd828a6da4d1adfbcf6c69","observation_id":"da2819f2-d93e-4d5c-be32-2e15503fb3be","resolution":{"observed_at":"2026-08-07T14:51:35.831619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-07T14:52:17.476303Z","title":"Scaling autoregressive models for content- rich text-to-image generation.arXiv preprint arXiv:2206.10789, 2(3):5,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12036","last_updated":"2025-07-01T05:46:31Z","snapshot_observed_at":"2026-08-11T00:15:29.337206Z","submitted_at":"2025-05-23T00:01:52Z","title":"A Minimalist Method for Fine-tuning Text-to-Image Diffusion Models","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:17.476303Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2506.12036"},"observation_digest":"sha256:d5a275ee98ad28e7afefb11a20be5fac0016f5c60f21f5dcacb1b9b7b808f756","observation_id":"49f672d8-3b0d-4384-9cab-82399c4fea80","resolution":{"observed_at":"2026-08-07T14:52:17.476303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-07T00:31:08.113817Z","title":"Scaling autoregressive mod- els for content-rich text-to-image generation.arXiv preprint arXiv:2206.10789, 2(3):5, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.14015","last_updated":"2025-06-16T21:26:45Z","snapshot_observed_at":"2026-08-11T06:20:16.984935Z","submitted_at":"2025-06-16T21:26:45Z","title":"Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.113817Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2506.14015"},"observation_digest":"sha256:29107529160bccc2335c306e3ca298d29c5cde1977be2dca80931ec96fe3ac7b","observation_id":"e979a7b2-90d9-4ec4-8946-4ae5a8d52129","resolution":{"observed_at":"2026-08-07T00:31:08.113817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2206.10789","doi":"10.48550/arxiv.2206.10789","metadata_source":"pith","pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","venue":"cs.CV","work_id":"0a105815-ff2e-43ce-8566-966cdcae1af4","year":2022},"citing_paper":{"arxiv_id":"2506.15742","last_updated":"2025-06-24T05:31:03Z","snapshot_observed_at":"2026-08-10T10:43:25.582099Z","submitted_at":"2025-06-17T20:18:23Z","title":"FLUX.1 Kontext: Flow Matching for In-Context Image Generation and Editing in Latent Space","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-10T16:36:02.016696Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2506.15742"},"observation_digest":"sha256:dc228446ed48591b66e877bc6b89e72c965ab8fdfbe4fab48898a852c214dcb3","observation_id":"9e9d6904-a56d-425e-8ee8-95ff170090b6","resolution":{"observed_at":"2026-05-12T04:49:31.747550Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-06T23:28:08.742835Z","title":"Scaling autoregressive models for content-rich text-to-image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-06T23:20:59.622434Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:08.742835Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:fa5ee08ff8365ff9210e50ebb59587250951215797069da8891b56b439c3035c","observation_id":"78361dec-7c30-48e3-bd4c-a52ff3363c04","resolution":{"observed_at":"2026-08-06T23:28:08.742835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2206.10789","doi":"10.48550/arxiv.2206.10789","metadata_source":"pith","pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","venue":"cs.CV","work_id":"0a105815-ff2e-43ce-8566-966cdcae1af4","year":2022},"citing_paper":{"arxiv_id":"2506.18438","last_updated":"2026-06-11T05:10:10Z","snapshot_observed_at":"2026-08-06T23:13:38.884229Z","submitted_at":"2025-06-23T09:19:38Z","title":"CPAM: Context-Preserving Adaptive Manipulation for Zero-Shot Real Image Editing","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-19T07:39:02.539294Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2506.18438"},"observation_digest":"sha256:f8a55c9c810f67d59625e51de2514e603fe63881917e225bad1fe512b8e75a05","observation_id":"cc175dbd-a9e3-4cb2-b9fc-a48af257ccf8","resolution":{"observed_at":"2026-05-19T07:42:09.177386Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-06T21:49:45.318496Z","title":"Scaling autoregres- sive models for content-rich text-to-image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23347","last_updated":"2025-07-07T16:20:58Z","snapshot_observed_at":"2026-08-08T19:09:33.549872Z","submitted_at":"2025-06-29T17:43:04Z","title":"CycleVAR: Repurposing Autoregressive Model for Unsupervised One-Step Image Translation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:45.318496Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2506.23347"},"observation_digest":"sha256:a340357ed151d16d100d2febf2b2c5e9c207ade96221914ec2e5946b904ff4c9","observation_id":"29cadb39-d80a-4d47-92ca-1aec93da7c87","resolution":{"observed_at":"2026-08-06T21:49:45.318496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-06T21:46:30.140725Z","title":"Scaling autoregressive models for content-rich text-to-image generation, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23589","last_updated":"2025-06-30T07:51:58Z","snapshot_observed_at":"2026-08-08T08:02:50.830843Z","submitted_at":"2025-06-30T07:51:58Z","title":"Transition Matching: Scalable and Flexible Generative Modeling","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T21:46:30.140725Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2506.23589"},"observation_digest":"sha256:6c2d9600115a82bf9999f8654c21017fc52d5930c5958ac5f0ce0ba534ba1919","observation_id":"2753b0f3-2511-4949-9bd2-e5eb3bcba558","resolution":{"observed_at":"2026-08-06T21:46:30.140725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-06T21:07:32.534698Z","title":"Scaling autoregres- sive models for content-rich text-to-image generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.01309","last_updated":"2025-07-02T02:53:43Z","snapshot_observed_at":"2026-08-10T06:10:52.913884Z","submitted_at":"2025-07-02T02:53:43Z","title":"SD-Acc: Accelerating Stable Diffusion through Phase-aware Sampling and Hardware Co-Optimizations","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:32.534698Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2507.01309"},"observation_digest":"sha256:15ab0212abfed71c2f2a1179baeeb4ca479cdfc8e6ef0faf37aa95f9723a023a","observation_id":"b7568541-b979-4092-a208-5c609a598400","resolution":{"observed_at":"2026-08-06T21:07:32.534698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-06T20:38:58.143921Z","title":"Scaling autoregres- sive models for content-rich text-to-image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:58.143921Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:e043cfe2deb6fed3d1cb1610a9e268b6cebfcba589308c1511306b0f95b6838d","observation_id":"efce1fec-01bf-4eb8-b361-4439f5f9c537","resolution":{"observed_at":"2026-08-06T20:38:58.143921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-06T20:30:26.552436Z","title":"Scaling autoregres- sive models for content-rich text-to-image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02687","last_updated":"2025-07-03T14:58:08Z","snapshot_observed_at":"2026-08-09T14:50:16.738180Z","submitted_at":"2025-07-03T14:58:08Z","title":"APT: Adaptive Personalized Training for Diffusion Models with Limited Data","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T20:30:26.552436Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2507.02687"},"observation_digest":"sha256:2e5410122b3e2e463bd0e1a64ab213aa2cd644c068040c9172d37323daa5153e","observation_id":"64a470f1-3ccf-455e-8aaa-69b0484e7651","resolution":{"observed_at":"2026-08-06T20:30:26.552436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-06T19:18:49.550557Z","title":"Scaling autoregressive mod- els for content-rich text-to-image generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.06033","last_updated":"2025-07-08T14:35:02Z","snapshot_observed_at":"2026-08-08T00:52:55.228538Z","submitted_at":"2025-07-08T14:35:02Z","title":"TextPixs: Glyph-Conditioned Diffusion with Character-Aware Attention and OCR-Guided Supervision","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T19:18:49.550557Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2507.06033"},"observation_digest":"sha256:0bac166ae686ef03b8322dc170ec109d83d8359b4bd057a6d395da7b9aa4b93d","observation_id":"39d586ed-687b-4e0b-aa4d-78c1e53c3648","resolution":{"observed_at":"2026-08-06T19:18:49.550557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-06T18:54:11.615639Z","title":"Scaling autoregressive models for content-rich text-to-image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07104","last_updated":"2025-07-11T03:43:50Z","snapshot_observed_at":"2026-08-08T17:01:07.284698Z","submitted_at":"2025-07-09T17:59:04Z","title":"Vision-Language-Vision Auto-Encoder: Scalable Knowledge Distillation from Diffusion Models","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T18:54:11.615639Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2507.07104"},"observation_digest":"sha256:67edb5de0f35705de416b3d915e736d833be50e57ff92074be0624ce749e8701","observation_id":"74bafdb0-3aeb-4e06-bed6-c32db1b6805f","resolution":{"observed_at":"2026-08-06T18:54:11.615639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-06T19:06:40.558141Z","title":"Scaling autoregressive models for content-rich text-to-image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07137","last_updated":"2025-07-09T00:51:09Z","snapshot_observed_at":"2026-08-11T01:38:59.773962Z","submitted_at":"2025-07-09T00:51:09Z","title":"Automating Evaluation of Diffusion Model Unlearning with (Vision-) Language Model World Knowledge","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:40.558141Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2507.07137"},"observation_digest":"sha256:b74f18e0cdc65f10f9a809c4dbe9d437b3739a7d8bbf57d6ff88d31a17d15bbe","observation_id":"dba5b899-6ab5-4acc-996d-fa96cf81ad29","resolution":{"observed_at":"2026-08-06T19:06:40.558141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-06T10:17:00.900106Z","title":"Scaling autoregres- sive models for content-rich text-to-image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.00314","last_updated":"2025-08-01T04:47:48Z","snapshot_observed_at":"2026-08-11T08:40:13.301680Z","submitted_at":"2025-08-01T04:47:48Z","title":"Hybrid Scandium Aluminum Nitride/Silicon Nitride Integrated Photonic Circuits","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:00.900106Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2508.00314"},"observation_digest":"sha256:2fd921acd94982e07245a80ada8be5231fe6b8c964145c3586658b23b3010a00","observation_id":"41877635-a953-4336-a07f-49dc001d2e7c","resolution":{"observed_at":"2026-08-06T10:17:00.900106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-06T10:18:02.963300Z","title":"Scaling autoregres- sive models for content-rich text-to-image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.00319","last_updated":"2025-08-01T05:02:26Z","snapshot_observed_at":"2026-08-09T18:26:52.267540Z","submitted_at":"2025-08-01T05:02:26Z","title":"Steering Guidance for Personalized Text-to-Image Diffusion Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T10:18:02.963300Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2508.00319"},"observation_digest":"sha256:434c38d42783435e20b8abc94c575d6a17a47761767c26769f070848aa048baf","observation_id":"03bc6434-d9c6-47eb-bd98-575a24fee16c","resolution":{"observed_at":"2026-08-06T10:18:02.963300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-06T05:59:15.646747Z","title":"Scaling autoregres- sive models for content-rich text-to-image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-11T06:17:27.300223Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.646747Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:279c209ffd3a27fcb8bac9d4f95582af8c555451d81c286fc9172e3fb1bc62b9","observation_id":"75f515f5-2b13-4031-b42c-f47808b2960d","resolution":{"observed_at":"2026-08-06T05:59:15.646747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-06T00:04:32.821331Z","title":"Scaling autoregressive models for content- rich text-to-image generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.04472","last_updated":"2025-08-06T14:19:32Z","snapshot_observed_at":"2026-08-09T06:08:47.407244Z","submitted_at":"2025-08-06T14:19:32Z","title":"Zero-Residual Concept Erasure via Progressive Alignment in Text-to-Image Model","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T00:04:32.821331Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2508.04472"},"observation_digest":"sha256:78621be4dc55b9d2b1899d9a23fb8d98d6b085b5310ee90cddb20e3dbac37fe1","observation_id":"2c517ff5-5419-457a-a318-b2c96d8ae3b0","resolution":{"observed_at":"2026-08-06T00:04:32.821331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2206.10789","doi":"10.48550/arxiv.2206.10789","metadata_source":"pith","pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","venue":"cs.CV","work_id":"0a105815-ff2e-43ce-8566-966cdcae1af4","year":2022},"citing_paper":{"arxiv_id":"2508.05691","last_updated":"2026-05-05T09:40:32Z","snapshot_observed_at":"2026-08-11T06:58:57.056068Z","submitted_at":"2025-08-06T12:17:38Z","title":"SPRINT: Robust Model Attribution of Generated Images via Secret Pixel Reconstruction","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-19T00:42:01.640233Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2508.05691"},"observation_digest":"sha256:3261d30a7d1fb3bd52f3ae7f24a792d233e29fbe44022fb023620372ed6e99ee","observation_id":"73bcffa3-7f25-404f-b2be-affd62948699","resolution":{"observed_at":"2026-05-19T00:42:54.495610Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-05T21:18:53.874431Z","title":"Scaling autoregres- sive models for content-rich text-to-image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.09045","last_updated":"2025-08-12T16:07:27Z","snapshot_observed_at":"2026-08-09T14:50:14.474368Z","submitted_at":"2025-08-12T16:07:27Z","title":"Per-Query Visual Concept Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:53.874431Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2508.09045"},"observation_digest":"sha256:b245088253ad5467152f494ce6bdd3978710b080cc13649fbfe881c0dd8034a9","observation_id":"18cde8cf-8778-47db-b12c-1cf1955b78c1","resolution":{"observed_at":"2026-08-05T21:18:53.874431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-05T20:49:53.234073Z","title":"Scaling autoregressive models for content-rich text-to-image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.09858","last_updated":"2025-08-13T14:50:19Z","snapshot_observed_at":"2026-08-10T07:55:10.749018Z","submitted_at":"2025-08-13T14:50:19Z","title":"HumanGenesis: Agent-Based Geometric and Generative Modeling for Synthetic Human Dynamics","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T20:49:53.234073Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2508.09858"},"observation_digest":"sha256:774aec80735b36b86353aff12eae829da69ca6f203f14b6f49549f532fc8df8e","observation_id":"dd892bda-310d-41cd-bce9-12f7aee75dd0","resolution":{"observed_at":"2026-08-05T20:49:53.234073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-05T18:40:37.210646Z","title":"Y.; Luong, T.; Baid, G.; Wang, Z.; Vasudevan, V.; Ku, A.; Yang, Y.; Ayan, B","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.14405","last_updated":"2025-08-20T04:03:54Z","snapshot_observed_at":"2026-08-11T00:12:07.953100Z","submitted_at":"2025-08-20T04:03:54Z","title":"CTA-Flux: Integrating Chinese Cultural Semantics into High-Quality English Text-to-Image Communities","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-05T18:40:37.210646Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2508.14405"},"observation_digest":"sha256:93c7aa1515e124a62d9ff29b69a9262158f6f1e10b9e8003078dd2011bcb8c5d","observation_id":"a6acb6ac-e0eb-4ca5-9beb-5f7d217b9e78","resolution":{"observed_at":"2026-08-05T18:40:37.210646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-05T12:59:28.474779Z","title":"Scaling autoregressive mod- els for content-rich text-to-image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.01107","last_updated":"2025-09-01T04:00:22Z","snapshot_observed_at":"2026-08-10T05:47:18.278957Z","submitted_at":"2025-09-01T04:00:22Z","title":"FICGen: Frequency-Inspired Contextual Disentanglement for Layout-driven Degraded Image Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:28.474779Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2509.01107"},"observation_digest":"sha256:dc7bb472dbde808f5e8bafea1b00ecd48b650112ff46bbdd5796d24620ac4e2c","observation_id":"08260805-81a1-48e1-a37a-25de76424aa9","resolution":{"observed_at":"2026-08-05T12:59:28.474779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-04T19:59:32.102328Z","title":"Menacing appearance","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-08T03:23:34.403562Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.102328Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:b7bd33f0c75e459d6585e9b1ba18c4d0278ec0727601790266f70600e339530e","observation_id":"d2e44fef-7cac-4680-9705-e9a6e449ee52","resolution":{"observed_at":"2026-08-04T19:59:32.102328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-04T18:48:03.872017Z","title":"Scaling autoregressive models for content-rich text-to-image generation.arXiv preprint arXiv:2206.10789, 2(3):5, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.872017Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:796b492ead4232d27ba3834a02c3b451404e1d7192e277e4fb85847dc1bb7a69","observation_id":"d6030455-2072-4d5c-8360-fa3b2aee2280","resolution":{"observed_at":"2026-08-04T18:48:03.872017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-04T17:40:28.525639Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.10704","last_updated":"2025-09-12T21:45:16Z","snapshot_observed_at":"2026-08-08T02:47:28.384116Z","submitted_at":"2025-09-12T21:45:16Z","title":"Maestro: Self-Improving Text-to-Image Generation via Agent Orchestration","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-04T17:40:28.525639Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2509.10704"},"observation_digest":"sha256:31420149b14d99ba4e79d6ff3b4d03d3c228fb129e540d526af48dcf88d14033","observation_id":"9a5a0829-9c42-4048-9b53-2d9376339568","resolution":{"observed_at":"2026-08-04T17:40:28.525639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-04T11:08:01.939270Z","title":"Scaling autoregressive models for content-rich text-to-image generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.06928","last_updated":"2026-05-27T05:34:49Z","snapshot_observed_at":"2026-08-09T16:33:37.475163Z","submitted_at":"2025-10-08T12:08:21Z","title":"IAR2: Improving Autoregressive Visual Generation with Semantic-Detail Associated Token Prediction","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T11:08:01.939270Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2510.06928"},"observation_digest":"sha256:4de1b0510852c1865f5a92433a40a166d8a1e4673dc208ed56a83192752deac3","observation_id":"1c0875f4-5e9b-44e3-b2cb-6dfe9f159174","resolution":{"observed_at":"2026-08-04T11:08:01.939270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-03T20:15:31.231928Z","title":"Scaling autoregres- sive models for content-rich text-to-image generation.arXiv preprint arXiv:2206.10789, 2(3):5, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.20651","last_updated":"2026-07-21T00:23:00Z","snapshot_observed_at":"2026-08-04T02:39:13.955398Z","submitted_at":"2025-11-25T18:59:55Z","title":"RubricRL: Simple Generalizable Rewards for Text-to-Image Generation","version":4},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-03T20:15:31.231928Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2511.20651"},"observation_digest":"sha256:20f4fb9c36ccbc706d90ca21883c60f640930cd5c98ee0cd320ca8171179d3e1","observation_id":"dfcec9ce-0fc9-4f58-ad60-e2efb6c7d603","resolution":{"observed_at":"2026-08-03T20:15:31.231928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-03T17:49:11.421158Z","title":"Scaling autoregressive models for content-rich text-to-image generation.arXiv preprint arXiv:2206.10789,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.08180","last_updated":"2026-06-09T07:26:39Z","snapshot_observed_at":"2026-08-09T15:37:32.095500Z","submitted_at":"2025-12-09T02:22:23Z","title":"GeoLoom: High-quality Geometric Diagram Generation from Textual Input","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T17:49:11.421158Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2512.08180"},"observation_digest":"sha256:a4c9ee32761d08f47a7c81d2db62436ebf0f33d82c823f6aa79157110bd3779e","observation_id":"8cbaf14d-58a5-4971-b0b9-a58207b66585","resolution":{"observed_at":"2026-08-03T17:49:11.421158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2206.10789/citation-record","integrity":"/paper/2206.10789/integrity","json":"/paper/2206.10789/citation-record.json","paper":"/paper/2206.10789"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Introducing pathways: A next-generation ai architecture","venue":null,"work_id":"6a44fc3b-2ced-4e68-bc47-c63f283c84b4","year":2021},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:62d58e43aa8dc414853a32ef473c5dbc80681459d16de6d86d1f6857298b377e","observation_id":"bc14b55e-31fb-492b-b253-d76c946e8db3","resolution":{"observed_at":"2026-05-12T04:49:31.644567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":"cafdc74f-7fef-4b7a-a8a5-90ff5e1734b8","year":2021},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:8a49ab8a5131cea36b9c1835d1d28ed7503790f627d37057ab7dc4f79c084ce7","observation_id":"c98725d8-a553-4cc4-85d5-465ec6b806ba","resolution":{"observed_at":"2026-05-12T04:49:31.587287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cogview: Mastering text-to-image generation via transformers","venue":null,"work_id":"a2fa38fb-6d9f-4029-ba37-e2b157530dde","year":2021},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:d389042a91e0dd5fada2cf4a3eee19f2d56d38ec8694bf01727ee471638cb014","observation_id":"3c2b7fd0-e299-4b4c-b971-f21e8358ef59","resolution":{"observed_at":"2026-05-12T04:49:31.591715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attention is all you need","venue":null,"work_id":"ac9d72e5-eb60-417e-963d-25671207074e","year":2017},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:ddc8c3d833050b08379b814563b89532ffe3043dff3dc08f2d66e57889079367","observation_id":"3bcc3d32-7601-4dec-9514-e5552e66bfc6","resolution":{"observed_at":"2026-05-12T04:49:31.596999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.02200","last_updated":"2017-04-22T01:23:06Z","snapshot_observed_at":"2026-08-04T22:37:25.412529Z","submitted_at":"2016-09-07T21:41:32Z","title":"Discrete Variational Autoencoders","version":2},"cited_work":{"arxiv_id":"1609.02200","doi":null,"metadata_source":"pith","pith_arxiv_id":"1609.02200","snapshot_observed_at":"2026-07-10T17:07:25.637389Z","title":"Discrete Variational Autoencoders","venue":"stat.ML","work_id":"6dd92474-cf3a-4e7e-b5a6-6b52d48d57f2","year":2016},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"cited_paper":"/paper/1609.02200","citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:7a16db6b7bb87a94cecc5f5331e9a19d6e4a7edace7b30cf426876246cdf15ca","observation_id":"936e10fd-d240-4a20-b291-8099e71d41df","resolution":{"observed_at":"2026-05-12T04:49:31.033281Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Neural discrete representation learning","venue":null,"work_id":"a8236ca8-bb6a-4c0c-a77b-299d27dda39b","year":2017},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:55956a93fee2001a005ae750ec837de1d1a9a08b5ec26503b64add0de62cb71f","observation_id":"1149fe5e-a39d-400b-86e7-44e55f73db09","resolution":{"observed_at":"2026-05-12T04:49:31.609894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improving language understanding by generative pre-training","venue":null,"work_id":"35052a77-eee3-4ee2-9c8a-f5d88499c113","year":2018},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:6587679281bb0967689530ea5cec3baef53d9af622572a55ed093ebb439f3d20","observation_id":"828bd678-9ec1-45f1-b097-7da471cd18b5","resolution":{"observed_at":"2026-05-12T04:49:31.618358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Conceptual 12M: Pushing web-scale image-text pre-training to recognize long-tail visual concepts","venue":null,"work_id":"65c0d05a-5bb4-4c2f-9cfd-ee392408cafa","year":2021},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:c2ca7cc176dde29fa9af7aa98a00ded9669a30902d050aa4004fe360e08bfe13","observation_id":"4d4d2ce9-baf4-4c3a-9bd3-b4dbe0aabd2e","resolution":{"observed_at":"2026-05-12T04:49:31.622593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":"0891e7fd-32ee-4093-93a8-ba0e8fd498fe","year":2021},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:731794f778199b730053b335a96628a3d89d94ef394c4e540000bc88412f1e42","observation_id":"1f394c72-f280-492d-813a-35c6bf0e1ae0","resolution":{"observed_at":"2026-05-12T04:49:31.629644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.13131","last_updated":"2022-03-24T15:44:50Z","snapshot_observed_at":"2026-08-06T19:08:21.390272Z","submitted_at":"2022-03-24T15:44:50Z","title":"Make-A-Scene: Scene-Based Text-to-Image Generation with Human Priors","version":1},"cited_work":{"arxiv_id":"2203.13131","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.13131","snapshot_observed_at":"2026-06-29T23:04:01.962523Z","title":"Make-a-Scene","venue":null,"work_id":"2c99d6c4-d1c6-4714-95e0-006639b9ac5c","year":2022},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"cited_paper":"/paper/2203.13131","citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:45755d58653011ce1cb033c4ca3db93215b9caf584c8afb497a5db45755cd3e8","observation_id":"69afec39-e1a1-4aad-8f38-061e7d1ca95f","resolution":{"observed_at":"2026-05-12T04:49:31.051437Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10741","last_updated":"2022-03-08T18:18:49Z","snapshot_observed_at":"2026-08-07T12:21:17.790675Z","submitted_at":"2021-12-20T18:42:55Z","title":"GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models","version":3},"cited_work":{"arxiv_id":"2112.10741","doi":"10.48550/arxiv.2112.10741","metadata_source":"pith","pith_arxiv_id":"2112.10741","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models","venue":"cs.CV","work_id":"34430d19-7919-48ce-88a5-17b3bfe2192e","year":2021},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"cited_paper":"/paper/2112.10741","citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:67dfc98aa4e07ba8f715504251a23bcc98eebf63b15009ad00ec6ac5adb57dd0","observation_id":"af9d287a-d262-45be-812f-29ab0cc11cc6","resolution":{"observed_at":"2026-05-12T04:49:31.059778Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-21T20:52:26.23702+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T20:52:26.23702+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":"2204.06125","doi":"10.48550/arxiv.2204.06125","metadata_source":"pith","pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","venue":"cs.CV","work_id":"0c6a768b-70b8-4242-bb0e-459f1008c9fc","year":2022},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:4d3cf152ec2f534e3c0158436f03fc6cb6d543a87a70eb6dc48f3141f2757113","observation_id":"45786d5f-b4f9-4f79-b8fa-2cef30ee3539","resolution":{"observed_at":"2026-05-12T04:49:31.067347Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:50:02.412412+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:50:02.412412+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11487","last_updated":"2022-05-23T17:42:53Z","snapshot_observed_at":"2026-07-06T13:12:59.688989Z","submitted_at":"2022-05-23T17:42:53Z","title":"Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding","version":1},"cited_work":{"arxiv_id":"2205.11487","doi":"10.48550/arxiv.2205.11487","metadata_source":"pith","pith_arxiv_id":"2205.11487","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding","venue":"cs.CV","work_id":"af16442b-a46f-469d-8818-c37b53a504c7","year":2022},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"cited_paper":"/paper/2205.11487","citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:f9bedae81331320ecb03a2fb47f0a7d594897d3206662775cf39c8159232e298","observation_id":"7e9dd7e4-914e-435a-95a3-1c5ab55d28f1","resolution":{"observed_at":"2026-05-12T07:38:54.138183Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:50:02.677+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:50:02.677+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:53.783404Z","title":"Denoising diffusion probabilistic models.Advances in Neural Information Processing Systems, 33:6840–6851","venue":null,"work_id":"b707e044-45b2-45ad-a843-aed07db67eff","year":2020},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:6171e06f7a306d1644744798f8233e67a9d1be992923648f0322db6aaa5499cb","observation_id":"3bd4ea1e-c251-4b61-9239-40ac06581b8c","resolution":{"observed_at":"2026-05-12T04:49:31.655922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffusion models beat gans on image synthesis","venue":null,"work_id":"d4814ac4-8ce4-4f81-a498-d84072157b37","year":2021},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:cd6ceba7ea4e6873ab101caad502385b8bd668d86b6f1a76c6768a6e35978025","observation_id":"498d97f3-828e-43d4-b139-db3d53c746a5","resolution":{"observed_at":"2026-05-12T04:49:31.663780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"a654f2d5-4159-4790-86bc-8cd564165af1","year":2014},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:e8c736718a73c375b03658394d47dfbabb6d073498a335f5d17526c707eab34f","observation_id":"f80132c1-4209-4e97-b47c-e624b046e93c","resolution":{"observed_at":"2026-05-12T04:49:31.669823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language models are few-shot learners","venue":null,"work_id":"c370ca66-c708-49bc-8d20-e30ccadd794c","year":1901},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:ea731e17851b5333b6f0be311e4c636537dbfa69a3ffd61a9b6d3b8dc5199eae","observation_id":"cd5cbc39-ffc3-4855-82bd-4e725b357203","resolution":{"observed_at":"2026-05-12T04:49:31.673381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.08239","last_updated":"2022-02-10T16:30:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-20T15:44:37Z","title":"LaMDA: Language Models for Dialog Applications","version":3},"cited_work":{"arxiv_id":"2201.08239","doi":"10.48550/arxiv.2201.08239","metadata_source":"pith","pith_arxiv_id":"2201.08239","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LaMDA: Language Models for Dialog Applications","venue":"cs.CL","work_id":"1b66d0a5-f6ae-4332-8025-c662dc64b238","year":2022},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"cited_paper":"/paper/2201.08239","citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:becc71bb727c3e47a17fff1d944fbf5ee79adeca399ac489ad1974f7d75560de","observation_id":"1ff6f802-2b3d-47f3-b04c-411acc00d009","resolution":{"observed_at":"2026-05-12T04:49:31.087810Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.06905","last_updated":"2022-08-01T21:07:58Z","snapshot_observed_at":"2026-07-06T12:18:14.988251Z","submitted_at":"2021-12-13T18:58:19Z","title":"GLaM: Efficient Scaling of Language Models with Mixture-of-Experts","version":2},"cited_work":{"arxiv_id":"2112.06905","doi":"10.48550/arxiv.2112.06905","metadata_source":"arxiv_reference","pith_arxiv_id":"2112.06905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2112.06905 , year =","venue":"arXiv (Cornell University)","work_id":"34546f42-6cd7-499f-8af0-57d965de5408","year":2022},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"cited_paper":"/paper/2112.06905","citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:ea5701338947c05fde2fe2a187d4d6d52eed34ce02828eb9131fc519e7fc1d41","observation_id":"545b5eed-f442-4098-ae5f-386a3b60a53f","resolution":{"observed_at":"2026-05-12T04:49:31.100632Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04627","last_updated":"2022-06-05T01:57:58Z","snapshot_observed_at":"2026-07-06T11:56:10.689708Z","submitted_at":"2021-10-09T18:36:00Z","title":"Vector-quantized Image Modeling with Improved VQGAN","version":3},"cited_work":{"arxiv_id":"2110.04627","doi":null,"metadata_source":"pith","pith_arxiv_id":"2110.04627","snapshot_observed_at":"2026-07-04T09:49:44.490632Z","title":"Vector-quantized Image Modeling with Improved VQGAN","venue":"cs.CV","work_id":"8ba56539-4766-42a4-868c-f9bef1281034","year":2021},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"cited_paper":"/paper/2110.04627","citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:efb54eec3f251690f0e22cd4a8cca322fedb21bf06adac827ae111687c5cc708","observation_id":"50324ecb-9037-446b-ab62-313e7939e255","resolution":{"observed_at":"2026-05-16T18:40:37.571629Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transformer transducer: A streamable speech recognition model with transformer encoders and rnn-t loss","venue":null,"work_id":"153a7d79-69b1-43b3-bdfd-86335a5085f2","year":2020},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:169386048a3323b1288f03bb362c2cffb097cd3fd0db909b9510ba46bca82107","observation_id":"05a7cb37-7bfd-4930-9c01-21472b2178b6","resolution":{"observed_at":"2026-05-12T04:49:31.694164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-08T15:18:32.322111Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":"2005.08100","doi":"10.48550/arxiv.2005.08100","metadata_source":"pith","pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"C., Parmar, N., Zhang, Y., Yu, J","venue":"eess.AS","work_id":"ea82ef7a-cc1e-489b-8704-4732b4801696","year":2020},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:8b5fc5ee3769ce44d8b4688a9c33cac299c49165b516a80216cbe6806478b306","observation_id":"04016ebf-6b02-4846-90c0-323f59c02367","resolution":{"observed_at":"2026-05-12T04:49:31.123367Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-10T15:38:39.405362+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T15:38:39.405362+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.09977","last_updated":"2020-02-27T07:36:47Z","snapshot_observed_at":"2026-08-04T13:03:06.820772Z","submitted_at":"2020-01-27T18:53:15Z","title":"Towards a Human-like Open-Domain Chatbot","version":3},"cited_work":{"arxiv_id":"2001.09977","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2001.09977","snapshot_observed_at":"2026-07-04T10:09:45.437752Z","title":"Adiwardana, M.-T","venue":null,"work_id":"ba5130eb-69cb-4786-944d-f724b5f7876c","year":2001},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"cited_paper":"/paper/2001.09977","citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:ae3a8e26d1b85bf427770922112546219d2b3b788ae81607c1ee80564aec4030","observation_id":"bd23425f-c046-4e9b-84e8-d2ff0a2b1a2f","resolution":{"observed_at":"2026-05-12T04:49:31.138132Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-08-10T15:05:25.558818Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"cited_work":{"arxiv_id":"2205.01917","doi":"10.48550/arxiv.2205.01917","metadata_source":"pith","pith_arxiv_id":"2205.01917","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","venue":"cs.CV","work_id":"5dd5bf10-d548-40ff-9b6c-6735129b27ee","year":2022},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"cited_paper":"/paper/2205.01917","citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:e45ea8a85062d28c2c20b5992050a44cc17d71f25c57dc3b120f9d49edac5d6a","observation_id":"8131ddf4-a86e-403d-bc15-313b37c409a2","resolution":{"observed_at":"2026-05-15T10:53:08.606863Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T13:22:43.398968+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T13:22:43.398968+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":"f47edd20-e81c-410d-ba16-fdecc63b4065","year":2021},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:106f93be998868b62bf3f9d77c9c812eb31c76011b8b2c13902ec980d636bc82","observation_id":"143e13db-4f46-4d62-b1ab-0f08c017fa60","resolution":{"observed_at":"2026-05-12T04:49:31.721279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Megatron-lm: Training multi-billion parameter language models using model parallelism","venue":null,"work_id":"6dc163d1-d970-4fb3-9587-d5a203ab3150","year":2019},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:91c6ed2b54644326373e92087211416d112e256a8fc7275744ddfd5485061e85","observation_id":"fa79bcbc-fab3-422d-932a-f0ae2ed8c317","resolution":{"observed_at":"2026-05-12T04:49:31.724620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.04663","last_updated":"2021-12-23T21:29:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-05-10T20:54:58Z","title":"GSPMD: General and Scalable Parallelization for ML Computation Graphs","version":2},"cited_work":{"arxiv_id":"2105.04663","doi":"10.48550/arxiv.2105.04663","metadata_source":"pith","pith_arxiv_id":"2105.04663","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GSPMD: General and Scalable Parallelization for ML Computation Graphs","venue":"cs.DC","work_id":"0ab74606-fb17-4ead-898b-8086ae8cb3af","year":2021},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"cited_paper":"/paper/2105.04663","citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:916350ace77f840200eee01ea4521d5c44245b095adc4397eb9fbeedab1d6cee","observation_id":"7e74ebce-cb32-4e25-bce1-eac787778fe4","resolution":{"observed_at":"2026-05-18T12:36:36.562059Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Connecting vision and language with localized narratives","venue":null,"work_id":"d1a8b6d4-efa3-43b9-8bd0-c9abf1f852fa","year":2020},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:20d783ee597dc29759ddb7531f48ab6ad16903e28fa24e8fd783837f10c76afb","observation_id":"00235bea-dff7-4c0f-946a-797dc8a4f904","resolution":{"observed_at":"2026-05-12T04:49:31.732805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generative pretraining from pixels","venue":null,"work_id":"9db54818-721a-4e91-a99c-2adda05e3b77","year":2020},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:4efbb5d3a4cce04a249c5e57e91c86984d3ae08f4e030a9d75f305aa8736d75a","observation_id":"3dbc4469-1055-4b02-962b-f97599fe5eea","resolution":{"observed_at":"2026-05-12T04:49:31.741041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.08718","last_updated":"2018-12-21T02:42:59Z","snapshot_observed_at":"2026-07-06T06:57:33.984469Z","submitted_at":"2018-08-27T07:48:21Z","title":"Wide Activation for Efficient and Accurate Image Super-Resolution","version":2},"cited_work":{"arxiv_id":"1808.08718","doi":null,"metadata_source":"pith","pith_arxiv_id":"1808.08718","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wide Activation for Efficient and Accurate Image Super-Resolution","venue":"cs.CV","work_id":"b15b8396-4a30-4428-9a21-2808eea0d61d","year":2018},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"cited_paper":"/paper/1808.08718","citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:ccccd600ce0326828042a60b073fb2b65fe33224a6cb36e569a66b4cf702ee1a","observation_id":"137f2d6e-6044-4aec-9c16-0989e9b915ad","resolution":{"observed_at":"2026-05-12T04:49:31.176535Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1508.07909","last_updated":"2016-06-10T14:45:08Z","snapshot_observed_at":"2026-07-06T04:28:16.222296Z","submitted_at":"2015-08-31T16:37:31Z","title":"Neural Machine Translation of Rare Words with Subword Units","version":5},"cited_work":{"arxiv_id":"1508.07909","doi":"10.48550/arxiv.1508.07909","metadata_source":"pith","pith_arxiv_id":"1508.07909","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Neural Machine Translation of Rare Words with Subword Units","venue":"cs.CL","work_id":"b540b77d-96cd-4550-9c11-d02686beb7b1","year":2015},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"cited_paper":"/paper/1508.07909","citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:7575b6ade5dfb9c98b64454c7719d05c86d8c43046d0e45a8049f515e8ed6526","observation_id":"1bb5d6e5-2884-46d7-b5a7-f2085104e115","resolution":{"observed_at":"2026-05-12T15:15:20.428834Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.06226","last_updated":"2018-08-19T16:49:06Z","snapshot_observed_at":"2026-07-06T06:56:20.935388Z","submitted_at":"2018-08-19T16:49:06Z","title":"SentencePiece: A simple and language independent subword tokenizer and detokenizer for Neural Text Processing","version":1},"cited_work":{"arxiv_id":"1808.06226","doi":"10.18653/v1/d18-2012","metadata_source":"doi_reference","pith_arxiv_id":"1808.06226","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Sentencepiece: A simple and language independent subword tokenizer and detokenizer for neural text processing","venue":"cs.CL","work_id":"81a6320b-c2e1-4d74-a03e-9e1ff6bbed8d","year":2018},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"cited_paper":"/paper/1808.06226","citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:4d99c86c991aa9cd88d7b36ffbb968e7d51f4c1e2d99f7427f101ea044f6f041","observation_id":"877876c2-074e-40cf-8d92-1a77a40abf1a","resolution":{"observed_at":"2026-05-12T20:09:07.599904Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-11T12:19:12.876508+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T12:19:12.876508+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-09T19:46:04.857927Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":"1904.10509","doi":"10.48550/arxiv.1904.10509","metadata_source":"pith","pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Generating Long Sequences with Sparse Transformers","venue":"cs.LG","work_id":"c5b81688-45ee-4a9a-b095-e6290f45cb6c","year":2019},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:a3af0b4aa909d72f33bb9928e76678f2e40d55f484ad1304ae51afb7ced600be","observation_id":"7eca41e1-ceb2-4e39-aacf-7fd5677feeee","resolution":{"observed_at":"2026-05-12T04:49:31.204641Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:59.71041+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:59.71041+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.10683","last_updated":"2023-09-19T15:14:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-23T17:37:36Z","title":"Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer","version":4},"cited_work":{"arxiv_id":"1910.10683","doi":"10.18653/v1/2020.acl-main.259","metadata_source":"pith","pith_arxiv_id":"1910.10683","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer","venue":"cs.LG","work_id":"50e3b368-0243-4726-8186-233869802ad1","year":2019},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"cited_paper":"/paper/1910.10683","citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:fbb445b5b06ac3d4731cacfde4b211634b418459809cc8c2150c4a056ee4e417","observation_id":"c6204cef-b5c7-47c8-8159-84e249a78260","resolution":{"observed_at":"2026-05-12T05:37:56.023799Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":"1810.04805","doi":"10.1111/jofi.12885","metadata_source":"pith","pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","venue":"cs.CL","work_id":"ed240a10-5b19-406c-baa5-30803f465785","year":2018},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:6b3e700c49eea8cdae725a503d05266df0e87da2e62f3974070b00db5f412c86","observation_id":"c703b258-e8b4-4ce4-9322-f091c0240866","resolution":{"observed_at":"2026-05-12T04:49:31.222092Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Classiﬁer-free diffusion guidance","venue":null,"work_id":"19b7a18e-8539-4d3f-a3d1-4ef123215811","year":2021},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:bde01c93d02e30ed027a593d42cee636177ad3ecf342fb5b91417ec4d94a5825","observation_id":"4a03492d-8135-4a75-97d4-7b2f4a20d2f3","resolution":{"observed_at":"2026-05-12T04:49:31.373070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Classiﬁer free guidance for autoregressive transformers","venue":null,"work_id":"c333b4e8-cb3f-49f0-aa33-20732aefa597","year":2021},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:73e12e5736e891b2dd485818c2496beb8e1f382a00165a78c73b6c638ce2c22d","observation_id":"ef326a36-0001-43ef-ba0a-901466d2783a","resolution":{"observed_at":"2026-05-12T04:49:31.377792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1902.08295","last_updated":"2019-02-21T22:55:09Z","snapshot_observed_at":"2026-08-10T10:14:10.480197Z","submitted_at":"2019-02-21T22:55:09Z","title":"Lingvo: a Modular and Scalable Framework for Sequence-to-Sequence Modeling","version":1},"cited_work":{"arxiv_id":"1902.08295","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1902.08295","snapshot_observed_at":"2026-07-04T23:25:00.242485Z","title":"Lingvo: a modular and scalable framework for sequence-to-sequence modeling","venue":null,"work_id":"ac45b2db-594c-42ad-a1ad-c2905ced21e2","year":1902},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"cited_paper":"/paper/1902.08295","citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:1c7589b627041de4d6d4791e38624537561a1103e84ac5fbc4bb252ade2589ae","observation_id":"c569a808-39c0-4161-b83a-8a148736d3bc","resolution":{"observed_at":"2026-07-04T23:25:00.242485Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Le, Yonghui Wu, and Zhifeng Chen","venue":null,"work_id":"f3f34bde-4931-4b86-bba8-dd05ef3ca1b4","year":2018},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:f41eb29556e4419a42b20332577c2d73f7cde46ce4032a4d27377547eac301a5","observation_id":"06281e1a-070e-4deb-9e6a-c4ff25376b5f","resolution":{"observed_at":"2026-05-12T04:49:31.389060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efﬁcient large-scale language model training on gpu clusters using megatron-lm","venue":null,"work_id":"86906188-dda6-43f3-9b8c-1f7430ffabf1","year":2021},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:bd597e5b217ddd6f77bfb1836891677794a45cdf0ce1b6f71d5684dde3bb76c3","observation_id":"7491df29-2d76-43ea-adc5-8af51716372e","resolution":{"observed_at":"2026-05-12T04:49:31.399425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T10:53:40.629998Z","title":"Adafactor: Adaptive learning rates with sublinear memory cost","venue":null,"work_id":"719ca16a-868c-4e49-b5a2-402b74680850","year":2018},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:b0439659be3157f2c9fae0971a6791b4c41d50fa179ec3dfed0a81b81133c93c","observation_id":"378d248c-f965-4e02-9190-6f8e9a51d07c","resolution":{"observed_at":"2026-05-12T04:49:31.410042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":"2111.02114","doi":"10.48550/arxiv.2111.02114","metadata_source":"pith","pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","venue":"cs.CV","work_id":"fbf16034-512e-4dd9-a0bd-7ddd23f532a6","year":2021},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:ed689eb913f6a2824033aa4084b369f7e654c111aa8144dca6bfa6797f35d726","observation_id":"cfa0a83a-5a53-407f-8f97-9ff47245f3a5","resolution":{"observed_at":"2026-05-12T10:21:01.130308Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:40.426779+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:40.426779+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling vision trans- formers","venue":null,"work_id":"e218ec87-0b48-49a3-a010-a039c3e67e27","year":2021},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:64e667ae69d7da59d7b439ddcad259dfb476ecf35c49c09336aded43c92df330","observation_id":"ce2162a6-d9f8-435a-a5a5-e14e7aae0bdc","resolution":{"observed_at":"2026-05-12T04:49:31.420494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-06T05:59:00.316195Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":"2108.10904","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-07-04T19:10:05.334285Z","title":"arXiv preprint arXiv:2108.10904 , year=","venue":null,"work_id":"d5ac0780-1f7e-430f-84e4-c505e2b1edfb","year":2021},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:7d39cdea980e3d53cdb3ddef55557eaf9c4db67328ff4f3455afd5ff9f00ff87","observation_id":"eed7dac8-d443-494c-8abe-df58544933c5","resolution":{"observed_at":"2026-05-12T04:49:31.252855Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Text-to-image generation grounded by ﬁne-grained user attention","venue":null,"work_id":"62e19b90-a4eb-4601-ab47-85b764a22908","year":2021},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:b67b2cd95eeadb51dc12c699178780b0a453cfe359f8d4253df30ea94e0378a0","observation_id":"98aa7198-2109-4a10-a9ee-40b344173f80","resolution":{"observed_at":"2026-05-12T04:49:31.432097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cross-modal contrastive learning for text-to-image generation","venue":null,"work_id":"980ac4a7-9126-4504-bc38-accbfff9e5f9","year":2021},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:57bf4795304d656e958e4c0a130ff6bce2e31031e43f1295015f8cc11bc967fd","observation_id":"04ec64ab-5066-4e41-948b-ff1fbc4be3f9","resolution":{"observed_at":"2026-05-12T04:49:31.436158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Benchmark for compositional text-to-image synthesis","venue":null,"work_id":"8c49c42f-28b9-4709-b555-171dfee935e4","year":2021},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:6bc11211484b8e6cb70f153ce9d3b18d1cb08e66c89f8168fa654203db087975","observation_id":"fc56d227-404f-4e5a-8a2d-519b26719380","resolution":{"observed_at":"2026-05-12T04:49:31.443984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.14822","last_updated":"2022-03-03T10:49:30Z","snapshot_observed_at":"2026-07-06T12:13:17.374586Z","submitted_at":"2021-11-29T18:59:46Z","title":"Vector Quantized Diffusion Model for Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2111.14822","doi":"10.48550/arxiv.2111.14822","metadata_source":"arxiv_reference","pith_arxiv_id":"2111.14822","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vector quantized diffusion model for text-to-image synthesis","venue":"arXiv (Cornell University)","work_id":"74abb574-5815-4cf3-8ccb-c2cacd465abd","year":2022},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"cited_paper":"/paper/2111.14822","citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:3355a697fcc709892886577c0799329318acbc2540087ab4de16418b6a4dd09b","observation_id":"3ee3cc0d-44c2-4742-a9a1-e5ad6544a394","resolution":{"observed_at":"2026-05-12T04:49:31.260695Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":"e84551e1-d24c-487f-be4e-1c8180aba99a","year":2021},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:2999fe4cf98f190088f3b4adda5ff60df9553e431f90a295ea8997cd5cf53837","observation_id":"fbca2ccf-b9b8-4b30-ad1a-daa809c88995","resolution":{"observed_at":"2026-05-12T04:49:31.455566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Accelerating large-scale inference with anisotropic vector quantization","venue":null,"work_id":"0baf1fd2-b2aa-4525-bb67-4e727c718c98","year":2020},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:5d1da986e387cd5cac6fa318fff18e10dbdef06826d3344a5062a1f3ddae616d","observation_id":"60cbf6a9-7dbf-48fc-b45c-5f356ef8902a","resolution":{"observed_at":"2026-05-12T04:49:31.464476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium","venue":null,"work_id":"467420fe-e893-4a77-8c1a-00dc82c7e35c","year":2017},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:9efd0dec5a94632836c3f1933ea4afc1f16191895e341d087c5262f96ef11bfe","observation_id":"26047782-7f48-444a-91d8-9ae4f4f01ab2","resolution":{"observed_at":"2026-05-12T04:49:31.468484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Re- thinking the inception architecture for computer vision","venue":null,"work_id":"968fe6f0-e76d-42fc-b25f-77bcff4bed49","year":2016},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:3d4de3729a27c7528d583724f28ce6c26c23f914001f782ffe721bfacc28451f","observation_id":"0b012cc9-0104-45f7-8d46-91263668a923","resolution":{"observed_at":"2026-05-12T04:49:31.472063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"AttnGAN: Fine-grained text to image generation with attentional generative adversarial networks","venue":null,"work_id":"4900b213-8950-4bc7-9dc0-6a9c50856bd6","year":2018},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:2e2afdabec6aca85257931c626a24c31fc6c2c26e125a2cba8b4f7c25f6bec2d","observation_id":"f2a79930-87ac-4367-809a-7b1bd23eeae0","resolution":{"observed_at":"2026-05-12T04:49:31.475897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dall-eval: Probing the reasoning skills and social biases of text-to-image generative transformers","venue":null,"work_id":"6745560b-7f2f-4e93-bacd-9bf2fc940a3b","year":2022},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:eab1e9ceb8f018de21183405ff96f66ba27f7edc20b921869a8d57b65cf9e3e9","observation_id":"078c06e0-abb8-4316-ba83-53463e646c7c","resolution":{"observed_at":"2026-05-12T04:49:31.486349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unifying vision-and-language tasks via text generation","venue":null,"work_id":"e778b7cf-0f96-4770-a132-81e78a909c7a","year":2021},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:bbf973b7296b4ae0108f3065f9d01a915ee22a6bcc9315d10aaede5bd49c8897","observation_id":"e5cbe754-66c4-4f35-89f7-a4540b90dd5a","resolution":{"observed_at":"2026-05-12T04:49:31.493587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":"ba4fb831-3962-42ee-b4d0-a34485495fba","year":2002},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:bf6191ec66c7f8b46562474cbd780e4ff3381147f3b26d7ac42b3e7275267c1a","observation_id":"5e496484-b211-485f-95ad-f4e8ddbabeaf","resolution":{"observed_at":"2026-05-12T04:49:31.500028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lawrence Zitnick, and Devi Parikh","venue":null,"work_id":"d831e612-e384-42b9-8678-2a169ba0e614","year":2015},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:0896568e3eed0fdef79593ffb25a3d06085347cc735feaebec3ec6757550fa06","observation_id":"79ed99c4-235c-474b-a436-0873eea9d43f","resolution":{"observed_at":"2026-05-12T04:49:31.506731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Meteor universal: Language speciﬁc translation evalua- tion for any target language","venue":null,"work_id":"6b9f5dc4-2485-4d69-a80c-c928f3dcbcc5","year":2014},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:1fbffef3c4ab2881835043522ef3e2a19de06858750662642a89f0117f494bf0","observation_id":"07f1d6e4-64ba-43b3-a97b-de8d625015d8","resolution":{"observed_at":"2026-05-12T04:49:31.511991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SPICE: Semantic Propositional Image Caption Evaluation","venue":null,"work_id":"f1746bec-041f-4680-9ff2-c47ffeb264d6","year":2016},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:e82e5e1b36c80978b51e5b9ff1173fbb6a23fa8c808a28c65eb02028df896059","observation_id":"c0d00522-1d6c-43b4-94f4-317f116f5fc4","resolution":{"observed_at":"2026-05-12T04:49:31.517421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cogview2: Faster and better text-to- image generation via hierarchical transformers","venue":null,"work_id":"fa672a67-d897-411e-93ac-b454d0ef2143","year":2022},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:38a209a14bff4870040032cefd04aac31121529c57051272be89e33e1b7c9364","observation_id":"8c4d1e65-12d7-4008-90f3-000fd769abec","resolution":{"observed_at":"2026-05-12T04:49:31.522321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"mindall-e on conceptual captions","venue":null,"work_id":"43bc37e6-cdbb-431b-aaff-8104786240c3","year":2021},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:33905837fc7bf63ba82943b9535e2749f33db7980c72c161898349e65b12cc38","observation_id":"1f94c185-79d8-4e82-89a2-f87dce69d1de","resolution":{"observed_at":"2026-05-12T04:49:31.528124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.11278","last_updated":"2020-09-23T17:45:17Z","snapshot_observed_at":"2026-08-11T01:30:50.341570Z","submitted_at":"2020-09-23T17:45:17Z","title":"X-LXMERT: Paint, Caption and Answer Questions with Multi-Modal Transformers","version":1},"cited_work":{"arxiv_id":"2009.11278","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2009.11278","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"X-lxmert: Paint, caption and answer questions with multi-modal transformers","venue":null,"work_id":"5cb48769-0796-443c-a40d-3dfdff4483d7","year":2009},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"cited_paper":"/paper/2009.11278","citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:49e771453dc9fe72bb7de1a47901f1edd882ba1f4f11ba5f5b4ee636570d86a2","observation_id":"351e33f4-d5a6-4193-abe4-e73fce1c3d8c","resolution":{"observed_at":"2026-05-12T04:49:31.268347Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep visual-semantic alignments for generating image descriptions","venue":null,"work_id":"f1df749e-8a35-4ebf-8ab9-5dff9b4756d3","year":2017},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:34651d7f3fec1433462a294218f7ca2f2f9256efa4634b6cd9a7ebf82f088d31","observation_id":"7ed17d4d-3339-43f6-ae5d-3d57d8f1d3c1","resolution":{"observed_at":"2026-05-12T04:49:31.538923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How to marry a star: Probabilistic constraints for meaning in context","venue":null,"work_id":"f60ac1bc-9aa0-45cf-8615-ff13093a8988","year":2021},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:0dee735d7b786f6baaf39316947239fdc777560742bcc0f48cf59ae0e7061596","observation_id":"d3e075f2-626c-4030-9056-4b39d39ed05c","resolution":{"observed_at":"2026-05-12T04:49:31.543969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wordseye: an automatic text-to-scene conversion system","venue":null,"work_id":"757c127e-7e93-4d42-988d-3527edcc1e16","year":2001},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:a42e0567d7720b71be51dd4231c5ed990e0be82378a734f56041d1648d1d2691","observation_id":"a6ba989b-45a6-4104-9702-77c2e931570d","resolution":{"observed_at":"2026-05-12T04:49:31.550200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generative adversarial text to image synthesis","venue":null,"work_id":"869aca4e-1ba6-436b-b95a-3ac935ae2b61","year":2016},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:10583dc75db743a292adec8d8014cc74ca98e09b64406d8f177fbdeed2763dcc","observation_id":"c9072070-eca4-4f6f-aa20-30a2a823162a","resolution":{"observed_at":"2026-05-12T04:49:31.555183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"StackGAN: Text to photo-realistic image synthesis with stacked generative adversarial networks","venue":null,"work_id":"8b0c9538-c558-446e-991d-b4476d57ed59","year":2017},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:ebec3f6607a461da186bbc6948a1248e45ae97c5132922a27cac797f833c9edb","observation_id":"ae0499a9-51b6-4d2b-9bd9-348702e53c03","resolution":{"observed_at":"2026-05-12T04:49:31.558785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9e19ca9b-783e-4c2d-8167-f8e0f857fa01","year":2018},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:04b5e2e14cd1dde8954b2128eae1efa11a21d2265058c15e1d22f382f606b994","observation_id":"9ae4e39e-54bb-4ad9-b3c4-0a53f401a474","resolution":{"observed_at":"2026-05-12T04:49:31.562208Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning what and where to draw","venue":null,"work_id":"17917676-ffed-4ed2-92bb-57f116d03374","year":2016},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:ae7db5343621f4a4c12b6adaab0290d20bd7f2070e992da5af3eedc6940444b7","observation_id":"39b3f9d0-f299-4dab-9248-614c265f483d","resolution":{"observed_at":"2026-05-12T04:49:31.566854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Inferring semantic layout for hierarchical text-to-image synthesis","venue":null,"work_id":"c8ce29c9-bdba-4776-8f07-084b1de08225","year":2018},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:6051f6e4999f0c9bd94ab986af40b55eefba6244adce0c8eafff5c3bf35d8bea","observation_id":"b9b2a0fe-b2b5-45ae-ae9e-9c6aa5c53710","resolution":{"observed_at":"2026-05-12T04:49:31.573248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generating multiple objects at spatially distinct locations","venue":null,"work_id":"7b92e274-15f5-43e2-948b-ad746e1a6555","year":2019},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:dd20a5de653674c53589de3dcec62c587463e94c625fcda99a8b72dd98063a23","observation_id":"a4d6adf4-3f47-42ce-9abd-f740df48e97a","resolution":{"observed_at":"2026-05-12T04:49:31.578256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dall·e mini, 7 2021","venue":null,"work_id":"d36331ab-ea42-4765-a36a-9ad91bd9f3c0","year":2021},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:358bfc14bf76e825ff0c044271faa04c1c178b0d2a4e926bcfc3b88884c3bb6f","observation_id":"9d15a21e-3156-468b-9f7a-5e0bf16ca814","resolution":{"observed_at":"2026-05-12T04:49:31.605957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.04200","last_updated":"2022-02-08T23:54:06Z","snapshot_observed_at":"2026-08-06T14:19:25.667074Z","submitted_at":"2022-02-08T23:54:06Z","title":"MaskGIT: Masked Generative Image Transformer","version":1},"cited_work":{"arxiv_id":"2202.04200","doi":"10.48550/arxiv.2202.04200","metadata_source":"arxiv_reference","pith_arxiv_id":"2202.04200","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"year =","venue":"arXiv (Cornell University)","work_id":"0774ab0b-06e3-4394-95c4-7968f428a143","year":2022},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"cited_paper":"/paper/2202.04200","citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:8d06040adcbec28dee6e9fd6e14bbf6a9c2e5cbefe9fb4aaeb6b743b830d3c0c","observation_id":"6e2c1129-6f29-4c6b-a1fd-d6d781f258ce","resolution":{"observed_at":"2026-05-12T04:49:31.287350Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02311","last_updated":"2022-10-05T06:02:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-05T16:11:45Z","title":"PaLM: Scaling Language Modeling with Pathways","version":5},"cited_work":{"arxiv_id":"2204.02311","doi":"10.48550/arxiv.2204.02311","metadata_source":"pith","pith_arxiv_id":"2204.02311","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaLM: Scaling Language Modeling with Pathways","venue":"cs.CL","work_id":"a94f3ef7-2c49-4445-93fe-6ec16aafd966","year":2022},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"cited_paper":"/paper/2204.02311","citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:ffcb9927d6d834302a7a7270662909f380020bd56a6d919254e63e56d5d5d57d","observation_id":"16e94e7e-e41e-4bb5-b982-80daf11a579a","resolution":{"observed_at":"2026-05-12T04:49:31.295609Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:25:21.411055+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:25:21.411055+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":"2203.15556","doi":"10.1098/rsta.2024.0522","metadata_source":"pith","pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training Compute-Optimal Large Language Models","venue":"cs.CL","work_id":"b2faf28d-86b7-429c-bc42-469458efc246","year":2022},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:c24ede0a515afdd62ded713e82d0bd5aacbfd4eb42f614e401e7e07c28141219","observation_id":"7de39fc6-bd99-4eab-bd79-7b2d76bb6058","resolution":{"observed_at":"2026-05-12T04:49:31.020705Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"048f4af6-54a5-41e6-ad73-9b28c324cf6a","year":2021},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:f980d4d96ff6bdcda5b6027c8bcef050d05d23aa036902a4c0f983cae731ea27","observation_id":"9ecbe2e2-4e51-4c53-97e9-f8eb645105a6","resolution":{"observed_at":"2026-05-12T04:49:31.650795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cascaded diffusion models for high ﬁdelity image generation","venue":null,"work_id":"fdeede10-a3a8-4cba-92a0-1b0f6d0642b9","year":2022},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:f12cbd7dcada11f1dcd1dcab2d6b63b501212ab1b074d928a859feaa01da85e9","observation_id":"7091d1df-f145-487e-8621-5e347984e964","resolution":{"observed_at":"2026-05-12T04:49:31.680855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Analyzing and improving the image quality of stylegan","venue":null,"work_id":"290e623f-9523-4654-a55c-7c50959e01e7","year":2020},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:2cbb8161c152a6f88b595460a4bea17a4a8439edc04623ebdb3be017aab5ef2f","observation_id":"b40d0471-b9e2-4fc3-b81c-212509fccde7","resolution":{"observed_at":"2026-05-12T04:49:31.687216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Perceptual losses for real-time style transfer and super-resolution","venue":null,"work_id":"6ae7ceed-2d29-4e12-aa02-059b4383efc6","year":2016},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:df81282e39c355109f82f00bc7bc8104cdfa4c97ee091da57d184bcc71c54322","observation_id":"216471d8-8cf4-4447-b34d-025fec080f40","resolution":{"observed_at":"2026-05-12T04:49:31.690922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T18:04:01.023758Z","title":"The unrea- sonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":"e0592bb2-6c0c-48b9-9c2d-1ca4cacf289b","year":2018},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:6462340d950a20917b6317b84fe47a941d8fb841dbc5a4501b33e09069e5290e","observation_id":"d9e7c3d2-254f-405d-a860-71a6adc8f0cb","resolution":{"observed_at":"2026-05-12T04:49:31.699162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Anonymous paper under review","venue":null,"work_id":"55eca372-e561-4e1d-bf2f-289258f96840","year":2022},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:8f3428e5676f4787755a65a9febc7fb27cb7505e78c9dc82027b679cf2e58906","observation_id":"b4c8d938-ab4b-495e-9712-209263673dce","resolution":{"observed_at":"2026-05-12T04:49:31.710989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07258","last_updated":"2022-07-12T23:45:14Z","snapshot_observed_at":"2026-08-02T09:20:40.804790Z","submitted_at":"2021-08-16T17:50:08Z","title":"On the Opportunities and Risks of Foundation Models","version":3},"cited_work":{"arxiv_id":"2108.07258","doi":"10.1016/j.specom.2008.12.003","metadata_source":"pith","pith_arxiv_id":"2108.07258","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"On the Opportunities and Risks of Foundation Models","venue":"cs.LG","work_id":"a18039e9-928d-47c9-a836-32656a71bf71","year":2021},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"cited_paper":"/paper/2108.07258","citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:09e5661f8b82e3cb4bdce8c8ee332af0ff770113f3b0c76433e160085b1846c2","observation_id":"2887472c-5a7a-4148-bf10-86834a88fc41","resolution":{"observed_at":"2026-05-12T04:49:31.301985Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:22:59.787075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:22:59.787075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards accountability for machine learning datasets: Practices from software engineering and infrastructure","venue":null,"work_id":"d80fbc18-812a-4dec-afe6-88effac7ed2f","year":2021},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:bc1f38a8a7c3cb6531aa01ab1d69e428af6f8d629fc9123c3758f51fa98a902f","observation_id":"35898be5-69dd-47eb-a369-e889fd4a237d","resolution":{"observed_at":"2026-05-12T04:49:31.727890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the genealogy of machine learning datasets: A critical history of ImageNet","venue":null,"work_id":"4e8c2a26-5462-45f3-8e7d-5ea55fc7179f","year":2021},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:3e8c04aeda2c8768cd95462d9643f4689939fabf671573812e464dbb5d1207d1","observation_id":"64c75d76-5a9f-4bc0-9221-e5e6c40dc688","resolution":{"observed_at":"2026-05-12T04:49:31.331152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Model cards for model reporting","venue":null,"work_id":"a61780f8-3c6d-47c6-95d2-bc5116009264","year":2019},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:6f4abc091c9895598e20fc8ea078f33748221a1620acac243d782293824ed40a","observation_id":"ad9abd1a-ccbb-45ef-a8dd-0c96a1bec59d","resolution":{"observed_at":"2026-05-12T04:49:31.338893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Datasheets for datasets","venue":null,"work_id":"4fd6f1fa-d468-4dc5-ba9b-2d983f04604c","year":2021},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:95d57233b67532ce79b31c881a65bb05137a58eeb4b0c2ae35da1711d6deee4d","observation_id":"fec16499-e3c3-408d-bdf4-0b2f3611aa81","resolution":{"observed_at":"2026-05-12T04:49:31.342826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Data Cards: Purposeful and transparent dataset documentation for responsible AI","venue":null,"work_id":"95c5d612-137b-4717-ac7b-3affd46c8d20","year":2022},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:b67d8ffb76e0d65be2ff0d49d76c92265df9175836815b83b28f8632216a6a8b","observation_id":"7f7eef7f-8a5b-44c4-83d9-854365b75b25","resolution":{"observed_at":"2026-05-12T04:49:31.348931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tell, draw, and repeat: Generating and modifying images based on continual linguistic instruction","venue":null,"work_id":"c6019bc2-0711-4aea-8b72-11c8f9e8f2eb","year":2019},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:fa21cc7f7657d5866a48545bc13b7d4dde96d22736b1b399e9e132dab784c06a","observation_id":"91f1b8c1-bc63-41a7-bbfd-06145b98c72f","resolution":{"observed_at":"2026-05-12T04:49:31.353081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chatpainter: Improving text to image generation using dialogue","venue":null,"work_id":"b7cd140d-fe65-451f-bd19-b35a7822d224","year":2018},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:fbbe4165861095917f213b5653fa2604c98c43ee90a3ddf2ba66304054fe04dd","observation_id":"f8b78fcd-5d49-4a78-a0ea-2406892275e1","resolution":{"observed_at":"2026-05-12T04:49:31.360345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Disability studies as a source of critical inquiry for the ﬁeld of assistive technology","venue":null,"work_id":"39722dbb-6cc6-40a9-971a-561a9c66ce80","year":2010},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:1017c7cd08273c18cb931bcce6c3870e9c49c304b1fab9311744a85a16c9168a","observation_id":"529981f9-fae5-4074-a160-7e05d9dcc656","resolution":{"observed_at":"2026-05-12T04:49:31.383296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Who (or What) Is an AI Artist? Leonardo, 55(2):130–134, 04 2022","venue":null,"work_id":"01a5092a-c468-4669-99bc-c26e5481e05e","year":2022},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:1a138b0ab59567ac4761259b7b290eec893e5112455bb761a54d186991f53789","observation_id":"193ebf13-2669-4203-aecc-cb975069b782","resolution":{"observed_at":"2026-05-12T04:49:31.416655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Biases in generative art: A causal look from the lens of art history","venue":null,"work_id":"bf55bf22-fc2b-4c34-b744-1aedb606a2f5","year":2021},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:799617d195756651a88e6dbe9529543804d11da2efa1dcfbe4d814255021e6fe","observation_id":"15cc6739-3416-4b8a-bec5-ea085005e266","resolution":{"observed_at":"2026-05-12T04:49:31.427582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.08144","last_updated":"2016-10-08T19:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-26T19:59:55Z","title":"Google's Neural Machine Translation System: Bridging the Gap between Human and Machine Translation","version":2},"cited_work":{"arxiv_id":"1609.08144","doi":"10.18653/v1/2021.eacl-main.163","metadata_source":"pith","pith_arxiv_id":"1609.08144","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Google's Neural Machine Translation System: Bridging the Gap between Human and Machine Translation","venue":"cs.CL","work_id":"e294e5a1-5dd2-44a0-b348-adbd62fe1916","year":2016},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"cited_paper":"/paper/1609.08144","citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:f297b7f1b0772ffd938f20bbb08539a77360cf61f2fa0b113b021aa7697bb510","observation_id":"602d13d7-e314-413f-a54f-159907a83a75","resolution":{"observed_at":"2026-05-12T15:21:29.028955Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Data-driven sentence simpliﬁ- cation: Survey and benchmark","venue":null,"work_id":"3d5686a0-f9cb-4514-92f7-92ba9b27a4f8","year":2020},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:0ab0cc9f5505cf204dba5c9e65f6223edbc9049411a7b900ce7f8ea3c480a9c5","observation_id":"6eb280d6-dc86-4fa3-a8ba-65c2ed3f8b33","resolution":{"observed_at":"2026-05-12T04:49:31.533990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Paraphrase generation: A survey of the state of the art","venue":null,"work_id":"9a57f816-3db0-4cde-87f1-4a290fe91cc7","year":2021},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:d5101789684efb9c9ebb8aef9ea61e7d192c3a0c6f3d57e568139d998fd0c6d5","observation_id":"35589fa7-491a-40fc-9ccb-971b4dfcbdf2","resolution":{"observed_at":"2026-05-12T04:49:31.633229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"No classiﬁcation without representation: Assessing geodiversity issues in open data sets for the developing world","venue":null,"work_id":"4b3964c8-07a3-453d-a4be-4ef8e41cba43","year":2017},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:5adc9f9540c57eedfd9a1a5367a2cd66e105aa6aa52929a815f1e7137bc430f8","observation_id":"d25f3bfd-87b3-4e96-9db8-6fb1efbef896","resolution":{"observed_at":"2026-05-12T04:49:31.639303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Does object recognition work for everyone? In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops, pages 52–59","venue":null,"work_id":"6ad4b2e9-c1ac-483c-b634-dc256d5de751","year":2019},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:5be3301e79669218907c58d1a125e454107f8ec38c31545c904c85df56772259","observation_id":"2cdab732-07e4-4742-adcd-fc368d58528a","resolution":{"observed_at":"2026-05-12T04:49:31.717350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Distortion agnostic deep watermarking","venue":null,"work_id":"bffd9582-a6f3-4746-917b-1b2304af37cc","year":2020},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:e07d55bbab969d718ffe25a61c6099de4d6368f29ef4a1b39b790c1203c88f46","observation_id":"ba0c2444-b47e-45f3-8891-1a7d1449bd61","resolution":{"observed_at":"2026-05-12T04:49:31.447494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.01963","last_updated":"2021-10-05T11:47:27Z","snapshot_observed_at":"2026-07-06T11:54:31.182477Z","submitted_at":"2021-10-05T11:47:27Z","title":"Multimodal datasets: misogyny, pornography, and malignant stereotypes","version":1},"cited_work":{"arxiv_id":"2110.01963","doi":"10.48550/arxiv.2110.01963","metadata_source":"pith","pith_arxiv_id":"2110.01963","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal datasets: misogyny, pornography, and malignant stereotypes","venue":"cs.CY","work_id":"fa09cccc-4dae-4631-ad3d-0b4c145a5b44","year":2021},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"cited_paper":"/paper/2110.01963","citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:c95f8a7d16a2a402322ae3e4b742983d5c0f4204689d4f69e59642f677e706f2","observation_id":"204ebc01-8786-4186-960d-4bb4f74cd790","resolution":{"observed_at":"2026-05-12T04:49:31.324161Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T13:22:32.162969+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T13:22:32.162969+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation"},"reference_resolution":{"displayed":99,"state_counts":{"malformed_identifier":0,"metadata_mismatch":7,"parse_uncertain":0,"unresolved":1,"verified_exact":22,"verified_fuzzy":69},"total_outbound_references":99},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 99 of 99 outbound references and 100 inbound Pith citation observations for arXiv:2206.10789."}