{"as_of":"2026-08-23T09:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:758e216eb414054c0d6f021e60bdbf4f15ace48c02838c8aa6390e8c8e1e9e5e","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-13T22:26:09.216328Z","state":"measured"},{"denominator":122,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":122,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":99,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":99,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T10:10:03.609971Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1135,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2102.12092","doi":"10.48550/arxiv.2102.12092","metadata_source":"pith","pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zero-Shot Text-to-Image Generation","venue":"cs.CV","work_id":"b687fcea-fa95-4504-9ab2-8a627cae0000","year":2021},"citing_paper":{"arxiv_id":"2104.10157","last_updated":"2021-09-14T21:20:06Z","snapshot_observed_at":"2026-08-17T06:54:13.493934Z","submitted_at":"2021-04-20T17:58:03Z","title":"VideoGPT: Video Generation using VQ-VAE and Transformers","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-13T17:24:33.725187Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2104.10157"},"observation_digest":"sha256:017f0e816db347429a100b53857a1090c0c6341f2f10765b763d067938e63d27","observation_id":"922875b4-03ed-4001-85f0-2954776afd30","resolution":{"observed_at":"2026-05-13T22:26:09.277502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2102.12092","doi":"10.48550/arxiv.2102.12092","metadata_source":"pith","pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zero-Shot Text-to-Image Generation","venue":"cs.CV","work_id":"b687fcea-fa95-4504-9ab2-8a627cae0000","year":2021},"citing_paper":{"arxiv_id":"2105.04663","last_updated":"2021-12-23T21:29:57Z","snapshot_observed_at":"2026-08-19T16:35:52.969358Z","submitted_at":"2021-05-10T20:54:58Z","title":"GSPMD: General and Scalable Parallelization for ML Computation Graphs","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-18T12:36:36.359390Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2105.04663"},"observation_digest":"sha256:4a4a46802f2ba20ded2c4d62e03b1cc384e5dce2579a02ca71443b6ae04351e9","observation_id":"9a92a76e-459a-4ec7-a60e-feb0554eee79","resolution":{"observed_at":"2026-05-18T12:36:36.406424Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2102.12092","doi":"10.48550/arxiv.2102.12092","metadata_source":"pith","pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zero-Shot Text-to-Image Generation","venue":"cs.CV","work_id":"b687fcea-fa95-4504-9ab2-8a627cae0000","year":2021},"citing_paper":{"arxiv_id":"2105.05233","last_updated":"2021-06-01T17:49:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-05-11T17:50:24Z","title":"Diffusion Models Beat GANs on Image Synthesis","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-13T11:16:28.445702Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2105.05233"},"observation_digest":"sha256:663ed432af8f4e5b538ca8e73f41cbed207bc7486d147e6ba0db97e11d07426f","observation_id":"24bf7e54-9ff9-49f8-bb5e-7a3172ac862f","resolution":{"observed_at":"2026-05-13T22:26:09.277502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2102.12092","doi":"10.48550/arxiv.2102.12092","metadata_source":"pith","pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zero-Shot Text-to-Image Generation","venue":"cs.CV","work_id":"b687fcea-fa95-4504-9ab2-8a627cae0000","year":2021},"citing_paper":{"arxiv_id":"2106.01345","last_updated":"2021-06-24T17:09:59Z","snapshot_observed_at":"2026-08-19T12:22:46.459617Z","submitted_at":"2021-06-02T17:53:39Z","title":"Decision Transformer: Reinforcement Learning via Sequence Modeling","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-18T15:11:11.056013Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2106.01345"},"observation_digest":"sha256:d17ee98ee7733010954b5d38c079f2186d7748a3aa245f7ea2f74f3e1890888f","observation_id":"1ff36d7d-5011-4444-b1d1-a6a74d398e23","resolution":{"observed_at":"2026-05-18T15:11:11.267437Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2102.12092","doi":"10.48550/arxiv.2102.12092","metadata_source":"pith","pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zero-Shot Text-to-Image Generation","venue":"cs.CV","work_id":"b687fcea-fa95-4504-9ab2-8a627cae0000","year":2021},"citing_paper":{"arxiv_id":"2106.08254","last_updated":"2022-09-03T14:11:33Z","snapshot_observed_at":"2026-08-17T05:59:48.347864Z","submitted_at":"2021-06-15T16:02:37Z","title":"BEiT: BERT Pre-Training of Image Transformers","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-13T11:50:11.476015Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2106.08254"},"observation_digest":"sha256:6a51307b40946ab922ddf194bbe690415486c494860641bcbf122a4b2816ff0e","observation_id":"6376ebb9-6f71-4d83-b400-512f9cc54ad4","resolution":{"observed_at":"2026-05-13T22:26:09.277502Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2102.12092","doi":"10.48550/arxiv.2102.12092","metadata_source":"pith","pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zero-Shot Text-to-Image Generation","venue":"cs.CV","work_id":"b687fcea-fa95-4504-9ab2-8a627cae0000","year":2021},"citing_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T10:21:01.062199Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2111.02114"},"observation_digest":"sha256:49a55216a724d49a3fe9f5f6cd79200f5bede7e848b55f744075c8052d84d897","observation_id":"fc5583c4-dda5-4f4f-8bf0-a20117cfbb40","resolution":{"observed_at":"2026-05-13T22:26:09.277502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2102.12092","doi":"10.48550/arxiv.2102.12092","metadata_source":"pith","pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zero-Shot Text-to-Image Generation","venue":"cs.CV","work_id":"b687fcea-fa95-4504-9ab2-8a627cae0000","year":2021},"citing_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T09:38:09.427509Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2111.11432"},"observation_digest":"sha256:a7a3d5b268f4b03d54fe8590920557cfa716cc80a4e57c07b59527aa028d100c","observation_id":"f8fccb61-5695-4904-b2a8-14516ad85837","resolution":{"observed_at":"2026-05-16T09:38:09.553108Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2102.12092","doi":"10.48550/arxiv.2102.12092","metadata_source":"pith","pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zero-Shot Text-to-Image Generation","venue":"cs.CV","work_id":"b687fcea-fa95-4504-9ab2-8a627cae0000","year":2021},"citing_paper":{"arxiv_id":"2112.10741","last_updated":"2022-03-08T18:18:49Z","snapshot_observed_at":"2026-08-07T12:21:17.790675Z","submitted_at":"2021-12-20T18:42:55Z","title":"GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-11T05:56:10.970591Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2112.10741"},"observation_digest":"sha256:79c39d5c0451cc41f5e2362bc00c85842981254713ccf5f6a6bc97ed8507e36a","observation_id":"0c6c1574-9604-4b75-82f7-5e11371a4792","resolution":{"observed_at":"2026-05-13T22:26:09.277502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2102.12092","doi":"10.48550/arxiv.2102.12092","metadata_source":"pith","pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zero-Shot Text-to-Image Generation","venue":"cs.CV","work_id":"b687fcea-fa95-4504-9ab2-8a627cae0000","year":2021},"citing_paper":{"arxiv_id":"2112.10752","last_updated":"2022-04-13T11:38:44Z","snapshot_observed_at":"2026-07-06T12:20:47.369918Z","submitted_at":"2021-12-20T18:55:25Z","title":"High-Resolution Image Synthesis with Latent Diffusion Models","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-11T22:02:09.899347Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2112.10752"},"observation_digest":"sha256:737aa4aeb75d879fbce9892228f71b5b7f31a213194ac0a62a452b395c168da2","observation_id":"2fa11952-b0a5-4e13-8ed9-47c9871090b1","resolution":{"observed_at":"2026-05-13T22:26:09.277502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2102.12092","doi":"10.48550/arxiv.2102.12092","metadata_source":"pith","pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zero-Shot Text-to-Image Generation","venue":"cs.CV","work_id":"b687fcea-fa95-4504-9ab2-8a627cae0000","year":2021},"citing_paper":{"arxiv_id":"2201.10005","last_updated":"2022-01-24T23:36:20Z","snapshot_observed_at":"2026-07-06T12:30:51.934079Z","submitted_at":"2022-01-24T23:36:20Z","title":"Text and Code Embeddings by Contrastive Pre-Training","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T19:24:11.907204Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2201.10005"},"observation_digest":"sha256:703f33b376649d81c8749540fcdba5ee71e356f16520509d1a573b073f9d4fb7","observation_id":"0b517447-822b-4ca2-8206-da8b21c1210e","resolution":{"observed_at":"2026-05-15T19:24:12.045243Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2102.12092","doi":"10.48550/arxiv.2102.12092","metadata_source":"pith","pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zero-Shot Text-to-Image Generation","venue":"cs.CV","work_id":"b687fcea-fa95-4504-9ab2-8a627cae0000","year":2021},"citing_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-08-15T12:50:58.405488Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T16:55:57.612364Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2204.06125"},"observation_digest":"sha256:0ea90b9b3b2ab8fc8021bf1bababe3fe7cfe58f5990ea4cacaf285a07d3d6fbe","observation_id":"af0016f7-f774-4f90-8bf2-504571599d19","resolution":{"observed_at":"2026-05-13T22:26:09.277502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2102.12092","doi":"10.48550/arxiv.2102.12092","metadata_source":"pith","pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zero-Shot Text-to-Image Generation","venue":"cs.CV","work_id":"b687fcea-fa95-4504-9ab2-8a627cae0000","year":2021},"citing_paper":{"arxiv_id":"2205.15868","last_updated":"2022-05-29T19:02:15Z","snapshot_observed_at":"2026-08-12T19:21:15.526321Z","submitted_at":"2022-05-29T19:02:15Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-11T12:24:30.071822Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2205.15868"},"observation_digest":"sha256:8c1674a1bfe26dcc2b880bdda6fe72441bae455c2038b7a3c8fc9f5d093a87e2","observation_id":"50945b12-ede7-4cb7-9194-8b2853bd734c","resolution":{"observed_at":"2026-05-13T22:26:09.277502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2102.12092","doi":"10.48550/arxiv.2102.12092","metadata_source":"pith","pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zero-Shot Text-to-Image Generation","venue":"cs.CV","work_id":"b687fcea-fa95-4504-9ab2-8a627cae0000","year":2021},"citing_paper":{"arxiv_id":"2208.07339","last_updated":"2022-11-10T18:14:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-15T17:08:50Z","title":"LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-05-13T13:35:35.972596Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2208.07339"},"observation_digest":"sha256:ea796e545fb697f83b0058b8f641843c95c352fba15eb8a91eb34bff9d86d60c","observation_id":"cf2d3381-bdfe-46ea-9459-2cda4f9010ab","resolution":{"observed_at":"2026-05-13T22:26:09.277502Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2102.12092","doi":"10.48550/arxiv.2102.12092","metadata_source":"pith","pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zero-Shot Text-to-Image Generation","venue":"cs.CV","work_id":"b687fcea-fa95-4504-9ab2-8a627cae0000","year":2021},"citing_paper":{"arxiv_id":"2208.14649","last_updated":"2026-04-22T00:33:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-31T06:18:10Z","title":"DetailCLIP: Injecting Image Details into CLIP's Feature Space","version":7},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-24T11:08:20.298043Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2208.14649"},"observation_digest":"sha256:57e5e8b56ad742797707d35c40348a694ac508fe40bc905057a8dfedfd292a32","observation_id":"f1a8f245-3849-4479-9117-cc958aba711f","resolution":{"observed_at":"2026-05-24T11:09:22.462818Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2102.12092","doi":"10.48550/arxiv.2102.12092","metadata_source":"pith","pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zero-Shot Text-to-Image Generation","venue":"cs.CV","work_id":"b687fcea-fa95-4504-9ab2-8a627cae0000","year":2021},"citing_paper":{"arxiv_id":"2210.08402","last_updated":"2022-10-16T00:08:18Z","snapshot_observed_at":"2026-08-13T17:36:16.794649Z","submitted_at":"2022-10-16T00:08:18Z","title":"LAION-5B: An open large-scale dataset for training next generation image-text models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-13T14:22:16.968028Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2210.08402"},"observation_digest":"sha256:68603b4ba012df32b386d97b40994de320dc05a5f4982468557851e0161d8988","observation_id":"75ed9063-47eb-4890-a334-3c92310e7798","resolution":{"observed_at":"2026-05-13T22:26:09.277502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2102.12092","doi":"10.48550/arxiv.2102.12092","metadata_source":"pith","pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zero-Shot Text-to-Image Generation","venue":"cs.CV","work_id":"b687fcea-fa95-4504-9ab2-8a627cae0000","year":2021},"citing_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-08-20T09:51:02.717471Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-13T01:54:21.943160Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2303.15389"},"observation_digest":"sha256:ed88ad43e6f7d8fd2c720a5cc7394623bc1e55d66627362573fff3a5c8647164","observation_id":"8197d098-652e-44a6-945c-8404abe851bb","resolution":{"observed_at":"2026-05-13T22:26:09.277502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2102.12092","doi":"10.48550/arxiv.2102.12092","metadata_source":"pith","pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zero-Shot Text-to-Image Generation","venue":"cs.CV","work_id":"b687fcea-fa95-4504-9ab2-8a627cae0000","year":2021},"citing_paper":{"arxiv_id":"2305.02463","last_updated":"2023-05-03T23:59:13Z","snapshot_observed_at":"2026-08-12T18:09:04.196531Z","submitted_at":"2023-05-03T23:59:13Z","title":"Shap-E: Generating Conditional 3D Implicit Functions","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-16T15:32:06.563955Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2305.02463"},"observation_digest":"sha256:b9dada297ad1d67f10d8f2c6c20e1cde7b892c47b03d5e32be402bdbcc678336","observation_id":"0c4fad37-f6a9-4397-a4cb-ccecf1f5976f","resolution":{"observed_at":"2026-05-16T15:32:06.848362Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2102.12092","doi":"10.48550/arxiv.2102.12092","metadata_source":"pith","pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zero-Shot Text-to-Image Generation","venue":"cs.CV","work_id":"b687fcea-fa95-4504-9ab2-8a627cae0000","year":2021},"citing_paper":{"arxiv_id":"2305.13301","last_updated":"2024-01-04T19:11:25Z","snapshot_observed_at":"2026-08-09T16:20:23.732146Z","submitted_at":"2023-05-22T17:57:41Z","title":"Training Diffusion Models with Reinforcement Learning","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-11T20:16:30.840184Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2305.13301"},"observation_digest":"sha256:2f280e9115d98ceaddff548d02697cece1d49511f014a5f955e49be485443f17","observation_id":"fe3a44d7-3951-461e-9de8-f7a6c19d8c3d","resolution":{"observed_at":"2026-05-13T22:26:09.277502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2102.12092","doi":"10.48550/arxiv.2102.12092","metadata_source":"pith","pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zero-Shot Text-to-Image Generation","venue":"cs.CV","work_id":"b687fcea-fa95-4504-9ab2-8a627cae0000","year":2021},"citing_paper":{"arxiv_id":"2306.09341","last_updated":"2023-09-25T08:19:23Z","snapshot_observed_at":"2026-08-14T02:46:25.655503Z","submitted_at":"2023-06-15T17:59:31Z","title":"Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-11T08:30:48.564596Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2306.09341"},"observation_digest":"sha256:8034890b10abc1f0f1ed0bfc423c6cde3e6bde317475eae59f50f8148d608e13","observation_id":"ee2c7628-5660-476a-8c15-f2afeeaa2e90","resolution":{"observed_at":"2026-05-13T22:26:09.277502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2102.12092","doi":"10.48550/arxiv.2102.12092","metadata_source":"pith","pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zero-Shot Text-to-Image Generation","venue":"cs.CV","work_id":"b687fcea-fa95-4504-9ab2-8a627cae0000","year":2021},"citing_paper":{"arxiv_id":"2309.16671","last_updated":"2025-11-23T00:34:43Z","snapshot_observed_at":"2026-08-17T12:17:37.741844Z","submitted_at":"2023-09-28T17:59:56Z","title":"Demystifying CLIP Data","version":6},"reference_index":104,"source":"arxiv_source","source_observed_at":"2026-05-16T09:20:20.143143Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2309.16671"},"observation_digest":"sha256:4f0cc3b85c93fd4b7d28b08b223f45f298cfcd2075a1f7b359fdc19d8b53cd95","observation_id":"602a8fc1-fbec-47e9-a7e9-4f73de834801","resolution":{"observed_at":"2026-05-16T09:20:20.364390Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2102.12092","doi":"10.48550/arxiv.2102.12092","metadata_source":"pith","pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zero-Shot Text-to-Image Generation","venue":"cs.CV","work_id":"b687fcea-fa95-4504-9ab2-8a627cae0000","year":2021},"citing_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-08-14T12:12:01.418974Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-15T17:51:05.465548Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2312.14125"},"observation_digest":"sha256:e913d779a47218daebea008830f727f82c8f23ec219267e854d71bd63998da99","observation_id":"99106562-d136-4f96-a72f-81dee26e93d4","resolution":{"observed_at":"2026-05-15T17:51:05.555998Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2102.12092","doi":"10.48550/arxiv.2102.12092","metadata_source":"pith","pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zero-Shot Text-to-Image Generation","venue":"cs.CV","work_id":"b687fcea-fa95-4504-9ab2-8a627cae0000","year":2021},"citing_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-11T10:03:27.919346Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2405.09818"},"observation_digest":"sha256:68cabab2cae454592ecf3bd261decd4ca916e9b94a504950a7757ee414902afe","observation_id":"ac7a1ce9-c5f0-45e5-ad1c-5cd9199600bd","resolution":{"observed_at":"2026-05-13T22:26:09.277502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2102.12092","doi":"10.48550/arxiv.2102.12092","metadata_source":"pith","pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zero-Shot Text-to-Image Generation","venue":"cs.CV","work_id":"b687fcea-fa95-4504-9ab2-8a627cae0000","year":2021},"citing_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-11T10:56:06.418360Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2409.18869"},"observation_digest":"sha256:b7fcb97bd8b1a28730d19db2e6988dfbeb063c905f142b6943d96e29587e8818","observation_id":"ab3c2451-2941-4bb4-8ee9-44176c5e732c","resolution":{"observed_at":"2026-05-13T22:26:09.277502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2102.12092","doi":"10.48550/arxiv.2102.12092","metadata_source":"pith","pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zero-Shot Text-to-Image Generation","venue":"cs.CV","work_id":"b687fcea-fa95-4504-9ab2-8a627cae0000","year":2021},"citing_paper":{"arxiv_id":"2411.04996","last_updated":"2025-05-08T01:53:55Z","snapshot_observed_at":"2026-08-14T02:18:08.215462Z","submitted_at":"2024-11-07T18:59:06Z","title":"Mixture-of-Transformers: A Sparse and Scalable Architecture for Multi-Modal Foundation Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-18T02:48:44.900467Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2411.04996"},"observation_digest":"sha256:992fb5d9fb414121997065a74880488a44cb85a4ea564e442defce0596be219b","observation_id":"eb22f116-67b5-428a-b15e-c5974a7b51ce","resolution":{"observed_at":"2026-05-18T02:48:45.127956Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-12T20:20:21.407122Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.09823","last_updated":"2024-11-14T22:15:48Z","snapshot_observed_at":"2026-08-20T03:17:44.169390Z","submitted_at":"2024-11-14T22:15:48Z","title":"Architect: Generating Vivid and Interactive 3D Scenes with Hierarchical 2D Inpainting","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T20:20:21.407122Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2411.09823"},"observation_digest":"sha256:b71281aadf18e688fcebff41aaac3073567b719795a9f03c0d8a706f7333f78d","observation_id":"ac0a63f5-98b5-498d-9094-df06117b7f24","resolution":{"observed_at":"2026-08-12T20:20:21.407122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-12T19:55:33.894665Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-19T03:35:32.872128Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.894665Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:3ad51205aeaf9b2b226c739b92103e6baaaf17dd8f429e8b273fc68cd9783af6","observation_id":"17adc1ba-cee6-4d7b-b41b-35329ce75b32","resolution":{"observed_at":"2026-08-12T19:55:33.894665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-12T18:56:48.035436Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.11162","last_updated":"2024-11-17T19:45:26Z","snapshot_observed_at":"2026-08-19T03:24:02.756209Z","submitted_at":"2024-11-17T19:45:26Z","title":"RPN 2: On Interdependence Function Learning Towards Unifying and Advancing CNN, RNN, GNN, and Transformer","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T18:56:48.035436Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2411.11162"},"observation_digest":"sha256:1ea70bbd52fca1c79f427b6ee397303b0a7beb0d1efc1f9792facda17ffb72a8","observation_id":"3329b436-f4f8-4f60-9acb-f93b10840fb2","resolution":{"observed_at":"2026-08-12T18:56:48.035436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-11T23:36:24.751632Z","title":"Zero-shot text-to-image generation, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-19T22:51:25.169366Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T23:36:24.751632Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2412.02368"},"observation_digest":"sha256:f5cc8602d7c9fd74d407b44a5c9a92ed712c9d224aa42b87c344d4c694b7442f","observation_id":"93aa862c-c758-4532-8ab0-5fb96977256b","resolution":{"observed_at":"2026-08-11T23:36:24.751632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-11T23:23:08.472627Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.02576","last_updated":"2024-12-03T17:02:49Z","snapshot_observed_at":"2026-08-19T16:35:53.539530Z","submitted_at":"2024-12-03T17:02:49Z","title":"The Efficacy of Transfer-based No-box Attacks on Image Watermarking: A Pragmatic Analysis","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T23:23:08.472627Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2412.02576"},"observation_digest":"sha256:a43563d79a5404067f340154c1cc51ed78b077651d381fbbdb17829af73631e2","observation_id":"964dda29-066a-416f-b379-c232fca7c0d1","resolution":{"observed_at":"2026-08-11T23:23:08.472627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-11T23:17:44.703124Z","title":"Zero-shot text-to-image generation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.02621","last_updated":"2024-12-03T17:50:19Z","snapshot_observed_at":"2026-08-17T11:06:59.813810Z","submitted_at":"2024-12-03T17:50:19Z","title":"Medical Multimodal Foundation Models in Clinical Diagnosis and Treatment: Applications, Challenges, and Future Directions","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T23:17:44.703124Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2412.02621"},"observation_digest":"sha256:d67ea473250a675baf226c215786d94e308094f12bd5b44949efa6d3dd28a82b","observation_id":"17fbc4f0-8c30-4718-8741-9644ab4c5291","resolution":{"observed_at":"2026-08-11T23:17:44.703124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-11T23:15:26.627187Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.02693","last_updated":"2024-12-03T18:59:28Z","snapshot_observed_at":"2026-08-18T03:12:42.798193Z","submitted_at":"2024-12-03T18:59:28Z","title":"Diffusion-based Visual Anagram as Multi-task Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T23:15:26.627187Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2412.02693"},"observation_digest":"sha256:8b0d2f1e7402503a4e4e1cee1993253f9b21a3936747b958bf69b02fc18e7d26","observation_id":"20d8dc6f-8bda-4245-951d-cea58b5dd8ec","resolution":{"observed_at":"2026-08-11T23:15:26.627187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-11T14:52:42.167477Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.11574","last_updated":"2024-12-16T09:01:32Z","snapshot_observed_at":"2026-08-16T10:19:28.474489Z","submitted_at":"2024-12-16T09:01:32Z","title":"PyPotteryLens: An Open-Source Deep Learning Framework for Automated Digitisation of Archaeological Pottery Documentation","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-11T14:52:42.167477Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2412.11574"},"observation_digest":"sha256:0aeec5f51c4c93b3833fdf7c8ea142fdb6d8fc58975cf0bcd10131cef8fefe06","observation_id":"8cd8fda4-7f6b-40fe-9be2-0c73a644c492","resolution":{"observed_at":"2026-08-11T14:52:42.167477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-11T14:43:41.822155Z","title":"In IEEE/CVF Confer- ence on Computer Vision and Pattern Recognition, CVPR 2023, Vancouver, BC, Canada, June 17-24, 2023, pages 6967–6977","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11694","last_updated":"2025-03-04T01:47:20Z","snapshot_observed_at":"2026-08-23T05:50:02.537684Z","submitted_at":"2024-12-16T12:12:45Z","title":"From Specific-MLLMs to Omni-MLLMs: A Survey on MLLMs Aligned with Multi-modalities","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T14:43:41.822155Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2412.11694"},"observation_digest":"sha256:573a4ab6a788a7fd0064741ad77fd65109437c774dcf3359e99ae6336fb64278","observation_id":"8172c3f8-a721-4b5e-8508-f550d531a49e","resolution":{"observed_at":"2026-08-11T14:43:41.822155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-11T12:58:45.076231Z","title":"Zero-shot text-to-image generation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.13635","last_updated":"2024-12-18T09:09:39Z","snapshot_observed_at":"2026-08-18T20:25:53.507370Z","submitted_at":"2024-12-18T09:09:39Z","title":"Self-control: A Better Conditional Mechanism for Masked Autoregressive Model","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T12:58:45.076231Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2412.13635"},"observation_digest":"sha256:bcddfbac063406136df7169c13265537b4d01e58cc5d488ba128f4a90c0400ca","observation_id":"f9f04929-f78b-4068-af89-a9a8d4f6dbc6","resolution":{"observed_at":"2026-08-11T12:58:45.076231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-11T12:13:43.931325Z","title":"Namhyuk Ahn, Junsoo Lee, Chunggi Lee, Kunhee Kim, Daesik Kim, Seung-Hun Nam, and Kibeom Hong","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14496","last_updated":"2025-04-12T15:23:37Z","snapshot_observed_at":"2026-08-20T00:37:32.259826Z","submitted_at":"2024-12-19T03:42:58Z","title":"WikiStyle+: A Multimodal Approach to Content-Style Representation Disentanglement for Artistic Image Stylization","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T12:13:43.931325Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2412.14496"},"observation_digest":"sha256:249eb79ba96e13bc5ae22dafd4149b8b0e4e3b0c072bea02e52bb645bf5e203d","observation_id":"7721fd55-6403-4212-aa69-c8188b473bcf","resolution":{"observed_at":"2026-08-11T12:13:43.931325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-11T16:10:24.504494Z","title":"Zero-shot text-to-image generation.arXiv preprint arXiv:2102.12092,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16188","last_updated":"2024-12-13T17:55:39Z","snapshot_observed_at":"2026-08-19T19:52:10.253275Z","submitted_at":"2024-12-13T17:55:39Z","title":"A Decade of Deep Learning: A Survey on The Magnificent Seven","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:24.504494Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2412.16188"},"observation_digest":"sha256:a6c9ce59429bac01b50f2aad0b68819d1b584b738609788e65fa1a157b8f7574","observation_id":"6b601167-6764-4032-90e2-5fff56158bb9","resolution":{"observed_at":"2026-08-11T16:10:24.504494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-11T10:40:07.960038Z","title":"Zero-Shot Text-to-Image Generation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.16389","last_updated":"2024-12-20T22:53:29Z","snapshot_observed_at":"2026-08-17T02:01:49.648778Z","submitted_at":"2024-12-20T22:53:29Z","title":"Ethics and Technical Aspects of Generative AI Models in Digital Content Creation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T10:40:07.960038Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2412.16389"},"observation_digest":"sha256:9379dd865e1de2c06b55c51869bbae276c140e64a28f76b5d598fa71e96ce9e8","observation_id":"260a4a83-c0b8-4713-b467-35dcc480bf21","resolution":{"observed_at":"2026-08-11T10:40:07.960038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-11T10:32:15.760853Z","title":"Zero-shot text-to- image generation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.16531","last_updated":"2024-12-21T08:18:43Z","snapshot_observed_at":"2026-08-15T09:04:40.247166Z","submitted_at":"2024-12-21T08:18:43Z","title":"From Creation to Curriculum: Examining the role of generative AI in Arts Universities","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:15.760853Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2412.16531"},"observation_digest":"sha256:2534806a93aee7033569930145c916041a4c447d92c14a21a7dfbca703d495a9","observation_id":"63760278-8bc4-4dce-9351-2347e91a5e8a","resolution":{"observed_at":"2026-08-11T10:32:15.760853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-11T05:51:35.200769Z","title":"Zero-shot text-to-image generation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.17077","last_updated":"2024-12-22T15:59:07Z","snapshot_observed_at":"2026-08-17T15:32:35.046640Z","submitted_at":"2024-12-22T15:59:07Z","title":"SubstationAI: Multimodal Large Model-Based Approaches for Analyzing Substation Equipment Faults","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T05:51:35.200769Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2412.17077"},"observation_digest":"sha256:ea661802e17c1cd5a7a5af4ab65930ed81f29d00fd53d94a83f67217e1745f73","observation_id":"4aa705af-f3c3-46ee-b47e-9865cf5c54f4","resolution":{"observed_at":"2026-08-11T05:51:35.200769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-10T23:01:43.140233Z","title":", author Pavlov, M","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.00226","last_updated":"2025-07-16T04:59:12Z","snapshot_observed_at":"2026-08-17T14:15:25.181840Z","submitted_at":"2024-12-31T02:23:10Z","title":"Generative Emergent Communication: Large Language Model is a Collective World Model","version":2},"reference_index":105,"source":"arxiv_source","source_observed_at":"2026-08-10T23:01:43.140233Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2501.00226"},"observation_digest":"sha256:3162b03ba0bc001b1e5eb3feec7c5783fc04d219de5e3db495fd62e77fce9e5c","observation_id":"9578345e-a5e4-4d21-93de-e1410f1aeee4","resolution":{"observed_at":"2026-08-10T23:01:43.140233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-10T21:29:20.056049Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.04699","last_updated":"2025-01-08T18:59:35Z","snapshot_observed_at":"2026-08-15T21:39:35.554722Z","submitted_at":"2025-01-08T18:59:35Z","title":"EditAR: Unified Conditional Generation with Autoregressive Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T21:29:20.056049Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2501.04699"},"observation_digest":"sha256:e7fc5f0273399e254881c7c3449fab4d0be7780c8fdbbcfee833abbecce69a57","observation_id":"da25f774-4068-44b7-85fe-17d7c4aed2de","resolution":{"observed_at":"2026-08-10T21:29:20.056049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-10T21:16:56.168596Z","title":"Ramesh, M","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.05435","last_updated":"2025-04-05T23:53:49Z","snapshot_observed_at":"2026-08-15T15:14:46.312554Z","submitted_at":"2025-01-09T18:48:35Z","title":"Neuro-Symbolic AI in 2024: A Systematic Review","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T21:16:56.168596Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2501.05435"},"observation_digest":"sha256:1531d66eba27d15336845aa7483ed7574c48dcea46478a5faea8fd3654e9ab36","observation_id":"1520218f-b7bf-49df-9035-d0f403fdc499","resolution":{"observed_at":"2026-08-10T21:16:56.168596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-10T21:11:06.855735Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.06081","last_updated":"2025-01-10T16:15:25Z","snapshot_observed_at":"2026-08-20T18:33:26.330775Z","submitted_at":"2025-01-10T16:15:25Z","title":"Averaged Adam accelerates stochastic optimization in the training of deep neural network approximations for partial differential equation and optimal control problems","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:06.855735Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2501.06081"},"observation_digest":"sha256:08b8e50107d324848c21ca57dc5ffd2b3edf0bb933c247c48860386b994fc0c8","observation_id":"ac003d5a-6afe-44cf-9274-1b809f553eb2","resolution":{"observed_at":"2026-08-10T21:11:06.855735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-10T20:37:40.418097Z","title":"Zero-shot text-to-image generation, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.07834","last_updated":"2025-02-23T06:20:37Z","snapshot_observed_at":"2026-08-14T08:41:57.728063Z","submitted_at":"2025-01-14T04:35:37Z","title":"Flow: Modularized Agentic Workflow Automation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T20:37:40.418097Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2501.07834"},"observation_digest":"sha256:644569bb72e594ea10b76cebdc65c0c2959b8f0dcb546668f39e45e723c6b9ac","observation_id":"4987f367-fc3d-46bb-b7ad-78b5f5449137","resolution":{"observed_at":"2026-08-10T20:37:40.418097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-10T20:16:33.462899Z","title":"Ren, B., Liu, M., Ding, R., and Liu, H","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.08982","last_updated":"2026-07-20T09:21:17Z","snapshot_observed_at":"2026-08-18T14:13:44.931260Z","submitted_at":"2025-01-15T17:59:32Z","title":"CityLoc: 6DoF Pose Distributional Localization for Text Descriptions in Large-Scale Scenes with Gaussian Representation","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T20:16:33.462899Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2501.08982"},"observation_digest":"sha256:16122de347139696d3ad0d79d22802b6210f2f51edbe43e05bfe1c903de5f43e","observation_id":"df07b8d1-83e3-4e44-b311-ef02de45d24d","resolution":{"observed_at":"2026-08-10T20:16:33.462899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-10T17:16:47.533348Z","title":"Ramesh, Mikhail Pavlov, Gabriel Goh, Scott Gray, Chelsea V oss, Alec Radford, Mark Chen, and Ilya Sutskever","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.533348Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:1b567a4539af4f73ac27fcf3e8eee306c279976470ef279f1970333f32bafbab","observation_id":"0fd74360-c00e-47ac-959d-3f07d4277060","resolution":{"observed_at":"2026-08-10T17:16:47.533348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-10T12:25:31.481974Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.16557","last_updated":"2025-01-27T22:57:39Z","snapshot_observed_at":"2026-08-16T05:38:07.148650Z","submitted_at":"2025-01-27T22:57:39Z","title":"CARING-AI: Towards Authoring Context-aware Augmented Reality INstruction through Generative Artificial Intelligence","version":1},"reference_index":108,"source":"pdf_text","source_observed_at":"2026-08-10T12:25:31.481974Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2501.16557"},"observation_digest":"sha256:819c85d7844a22981ebd4e201f13b73bc62abe585589a1a5043797d9401a550f","observation_id":"55c90488-9a5d-4b72-9d27-26e744e4f188","resolution":{"observed_at":"2026-08-10T12:25:31.481974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-09T17:09:26.859300Z","title":"Preprint, arXiv:2102.12092","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00965","last_updated":"2025-05-25T17:39:32Z","snapshot_observed_at":"2026-08-18T22:00:04.433424Z","submitted_at":"2025-02-03T00:04:50Z","title":"CLIP-UP: A Simple and Efficient Mixture-of-Experts CLIP Training Recipe with Sparse Upcycling","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-09T17:09:26.859300Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2502.00965"},"observation_digest":"sha256:9a628f6505483cdcf9c64bdcb161e26aed5b81d4f00ecf96b7d625f9c8c25fd8","observation_id":"03148481-167a-4e91-b3ed-651a88b27d76","resolution":{"observed_at":"2026-08-09T17:09:26.859300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-09T15:09:40.047361Z","title":"Aditya Ramesh, Prafulla Dhariwal, Alex Nichol, Casey Chu, and Mark Chen","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01507","last_updated":"2025-02-03T16:40:47Z","snapshot_observed_at":"2026-08-18T05:03:09.237922Z","submitted_at":"2025-02-03T16:40:47Z","title":"End-to-end Training for Text-to-Image Synthesis using Dual-Text Embeddings","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-09T15:09:40.047361Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2502.01507"},"observation_digest":"sha256:65123520ec9817a93992b37de78a04cf289f4b6de209867cbc08f5a59db4c417","observation_id":"9e2e35ea-cd90-488c-9099-f03f4104af40","resolution":{"observed_at":"2026-08-09T15:09:40.047361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-08T17:31:07.823377Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06897","last_updated":"2025-02-09T14:03:37Z","snapshot_observed_at":"2026-08-15T07:44:42.719465Z","submitted_at":"2025-02-09T14:03:37Z","title":"PyPotteryInk: One-Step Diffusion Model for Sketch to Publication-ready Archaeological Drawings","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-08T17:31:07.823377Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2502.06897"},"observation_digest":"sha256:63d3065c8a29cd2933ab2749a2246dbd666bc530afbb71b6d76c9f4c0741cda5","observation_id":"a399d453-841b-4776-900f-7c8000d4f6a6","resolution":{"observed_at":"2026-08-08T17:31:07.823377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-16T10:10:03.609971Z","title":"Zero -shot text -to-image generation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.18912","last_updated":"2025-04-26T12:58:17Z","snapshot_observed_at":"2026-08-19T16:35:03.214209Z","submitted_at":"2025-04-26T12:58:17Z","title":"Inferring Questions from Programming Screenshots","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T10:10:03.609971Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2504.18912"},"observation_digest":"sha256:31f4422d085b77c3f4694ea2b44343d71a0ee4967926f18a73d5a5d88e920757","observation_id":"10fb234d-9106-4e0f-ae3f-286d9e497118","resolution":{"observed_at":"2026-08-16T10:10:03.609971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-16T05:52:01.062217Z","title":"Zero-shot text-to-image generation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.19595","last_updated":"2025-04-29T09:01:26Z","snapshot_observed_at":"2026-08-20T05:37:31.109467Z","submitted_at":"2025-04-28T08:58:34Z","title":"WILD: a new in-the-Wild Image Linkage Dataset for synthetic image attribution","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:01.062217Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2504.19595"},"observation_digest":"sha256:29eec7295a2572077a479f210d39f02a669d8f527cbbe19dbe1817493812045e","observation_id":"f9dd7d2b-87b7-44c1-8759-a7eb4f4bf67b","resolution":{"observed_at":"2026-08-16T05:52:01.062217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-15T23:50:44.033955Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.03859","last_updated":"2025-05-06T15:00:59Z","snapshot_observed_at":"2026-08-17T20:05:07.179393Z","submitted_at":"2025-05-06T15:00:59Z","title":"Deepfakes on Demand: the rise of accessible non-consensual deepfake image generators","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T23:50:44.033955Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2505.03859"},"observation_digest":"sha256:e6cd3fc32e5f820b18ad514825bd5e49c8891d95e6c61b1f334ad3ab6ce5260f","observation_id":"cf02a480-416b-4182-96db-3a4fe7b04987","resolution":{"observed_at":"2026-08-15T23:50:44.033955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-15T22:21:29.620026Z","title":"Ramesh , author M","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.07442","last_updated":"2025-05-12T11:07:24Z","snapshot_observed_at":"2026-08-21T16:19:58.614511Z","submitted_at":"2025-05-12T11:07:24Z","title":"DiffCrysGen: A Score-Based Diffusion Model for Design of Diverse Inorganic Crystalline Materials","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T22:21:29.620026Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2505.07442"},"observation_digest":"sha256:1e9a1f941acf5bdf5db4a5f503cbc95fba1f230a7a7fceed5049511a4111dfb9","observation_id":"8ef2e3cb-62d4-4fd5-86fb-79808f7ebba0","resolution":{"observed_at":"2026-08-15T22:21:29.620026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-15T22:37:17.594094Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.08803","last_updated":"2025-05-10T22:42:29Z","snapshot_observed_at":"2026-08-20T21:11:39.954641Z","submitted_at":"2025-05-10T22:42:29Z","title":"Multi-modal Synthetic Data Training and Model Collapse: Insights from VLMs and Diffusion Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T22:37:17.594094Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2505.08803"},"observation_digest":"sha256:db79c34e7a0ce4e25c07d1b2c1639920f59292ea8a850252fe2302fe27a66eb1","observation_id":"473dd928-3fa7-4119-8bc4-08fb9121c5f9","resolution":{"observed_at":"2026-08-15T22:37:17.594094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-15T21:06:44.430532Z","title":"Aditya Ramesh, Prafulla Dhariwal, Alex Nichol, Casey Chu, and Mark Chen","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.10743","last_updated":"2025-05-15T23:08:52Z","snapshot_observed_at":"2026-08-20T07:47:55.377864Z","submitted_at":"2025-05-15T23:08:52Z","title":"IMAGE-ALCHEMY: Advancing subject fidelity in personalised text-to-image generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T21:06:44.430532Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2505.10743"},"observation_digest":"sha256:a1bf40e48cb0e5a604675c89e15cf91cae5f2123be628ebb6eedde6392abb510","observation_id":"4aa9d947-798c-4e0f-a7b6-5bbff39e8e10","resolution":{"observed_at":"2026-08-15T21:06:44.430532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-07T15:08:16.889616Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16365","last_updated":"2025-05-22T08:21:27Z","snapshot_observed_at":"2026-08-22T16:53:56.800925Z","submitted_at":"2025-05-22T08:21:27Z","title":"A collaborative constrained graph diffusion model for the generation of realistic synthetic molecules","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:16.889616Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2505.16365"},"observation_digest":"sha256:a665fdbafb22ff1e5779d8b591a702001bdd8756e72612c2964fee17e54f7dfa","observation_id":"9e5ad02f-13c7-4bc8-a277-3c4eb8f58e2a","resolution":{"observed_at":"2026-08-07T15:08:16.889616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-07T14:52:59.194602Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.17280","last_updated":"2025-05-22T20:56:38Z","snapshot_observed_at":"2026-08-12T14:35:11.501437Z","submitted_at":"2025-05-22T20:56:38Z","title":"Mitigate One, Skew Another? Tackling Intersectional Biases in Text-to-Image Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T14:52:59.194602Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2505.17280"},"observation_digest":"sha256:8e9fea3ce930cc3a44a0234384d01000f9fffb55d337dae95bfb9397cb0c5358","observation_id":"e27c383d-4ec4-44e8-8645-9ec6af9eb9ca","resolution":{"observed_at":"2026-08-07T14:52:59.194602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-07T14:06:52.551359Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-18T20:10:07.636309Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:52.551359Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:61aad63c6fe03688387cf589d4aedef61399f415837b743a70fe9884307a0f00","observation_id":"8b5878c5-cde4-430d-8d15-44266ed48e53","resolution":{"observed_at":"2026-08-07T14:06:52.551359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-07T14:00:56.738485Z","title":"Ramesh, M","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20290","last_updated":"2025-06-03T22:50:28Z","snapshot_observed_at":"2026-08-13T14:30:25.903303Z","submitted_at":"2025-05-26T17:59:17Z","title":"EgoZero: Robot Learning from Smart Glasses","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:56.738485Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2505.20290"},"observation_digest":"sha256:78ffa13141e4f8e9ac9ea30f36b9627013ce5f0e37455d5b25dc439f03c21f2a","observation_id":"2d44ce61-8d6b-448f-b308-199e9a634726","resolution":{"observed_at":"2026-08-07T14:00:56.738485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-07T13:20:48.749797Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-12T19:41:41.227014Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:48.749797Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:ea708a86b96a00f735ddef339cf1709893571d3b9862506135076df89bce3565","observation_id":"821a4347-7511-40bb-aac1-0a49b15ef796","resolution":{"observed_at":"2026-08-07T13:20:48.749797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-07T12:52:42.565243Z","title":"Zero-shot text-to-image generation, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23331","last_updated":"2025-06-28T18:55:07Z","snapshot_observed_at":"2026-08-19T19:46:21.791232Z","submitted_at":"2025-05-29T10:45:38Z","title":"Fine-Tuning Next-Scale Visual Autoregressive Models with Group Relative Policy Optimization","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T12:52:42.565243Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2505.23331"},"observation_digest":"sha256:4ece23de6e6c0d00b1f307c0c02053b9814d9c4a7dd3a47821643b71921f510b","observation_id":"0b42df90-d4f4-4cfd-8661-84c51b32b6e1","resolution":{"observed_at":"2026-08-07T12:52:42.565243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-07T11:54:56.809361Z","title":"Rombach, R., Blattmann, A., Lorenz, D., Esser, P., and Ommer, B","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01182","last_updated":"2025-07-08T20:18:16Z","snapshot_observed_at":"2026-08-19T01:50:51.321167Z","submitted_at":"2025-06-01T21:33:36Z","title":"Humanoid World Models: Open World Foundation Models for Humanoid Robotics","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:56.809361Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2506.01182"},"observation_digest":"sha256:46a971657def3d881fb78c3945b2969fd0fc6fbfca1ae2ec898aa2d690636faa","observation_id":"442a0f88-0949-4fb7-a7d1-8147c8ff6807","resolution":{"observed_at":"2026-08-07T11:54:56.809361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-07T10:41:39.779709Z","title":"José Ribeiro- Gomes, Tianhui Cai, Zoltán A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04606","last_updated":"2025-06-05T03:49:01Z","snapshot_observed_at":"2026-08-19T19:47:08.289957Z","submitted_at":"2025-06-05T03:49:01Z","title":"SmartAvatar: Text- and Image-Guided Human Avatar Generation with VLM AI Agents","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:39.779709Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2506.04606"},"observation_digest":"sha256:52572fbd46b22cd6a71b40c211ebd828de3c2a5b4980045d6c865acf9fca8f25","observation_id":"96cc0822-947f-497b-bf70-8c2d52e32e5b","resolution":{"observed_at":"2026-08-07T10:41:39.779709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2102.12092","doi":"10.48550/arxiv.2102.12092","metadata_source":"pith","pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zero-Shot Text-to-Image Generation","venue":"cs.CV","work_id":"b687fcea-fa95-4504-9ab2-8a627cae0000","year":2021},"citing_paper":{"arxiv_id":"2506.20911","last_updated":"2026-05-06T17:42:17Z","snapshot_observed_at":"2026-07-06T21:47:49.078141Z","submitted_at":"2025-06-26T00:33:43Z","title":"FaSTA$^*$: Fast-Slow Toolpath Agent with Subroutine Mining for Efficient Multi-turn Image Editing","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-19T08:17:08.223736Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2506.20911"},"observation_digest":"sha256:02d3de3d8172ebd55314759d9c14db6be6891022c57b0336184ce429c304f32a","observation_id":"53568e40-68f5-4841-8ef7-5761d669e7ca","resolution":{"observed_at":"2026-05-19T08:17:10.821005Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-06T21:48:13.474408Z","title":"Zero-shot text-to-image generation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.23350","last_updated":"2025-06-29T17:54:00Z","snapshot_observed_at":"2026-08-19T16:33:34.192321Z","submitted_at":"2025-06-29T17:54:00Z","title":"On the Resilience of Underwater Semantic Wireless Communications","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:48:13.474408Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2506.23350"},"observation_digest":"sha256:958473b4d6f7d13da8d13da4c57be19bc527b2b130cdf97ef4ca9f49b01689e8","observation_id":"d57aa31a-e186-49bc-b3a0-8185039cb1fb","resolution":{"observed_at":"2026-08-06T21:48:13.474408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-06T21:46:28.684612Z","title":"Zero-shot text-to-image generation, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.23589","last_updated":"2025-06-30T07:51:58Z","snapshot_observed_at":"2026-08-11T16:25:47.851476Z","submitted_at":"2025-06-30T07:51:58Z","title":"Transition Matching: Scalable and Flexible Generative Modeling","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T21:46:28.684612Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2506.23589"},"observation_digest":"sha256:edeedfe481ebbcda7941283d4f3963987412e53e00bd6a820675ae289a658078","observation_id":"0f6f9a7e-7e96-4126-97e6-bad372c2e798","resolution":{"observed_at":"2026-08-06T21:46:28.684612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-06T19:44:19.898429Z","title":"Ramesh, M","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.04765","last_updated":"2025-07-07T08:43:46Z","snapshot_observed_at":"2026-08-16T23:44:48.848582Z","submitted_at":"2025-07-07T08:43:46Z","title":"GraphBrep: Learning B-Rep in Graph Structure for Efficient CAD Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:19.898429Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2507.04765"},"observation_digest":"sha256:31a2a8bfb26e9f9413eb10585f393636ce7ea2cd479b94572e5e832efc8da345","observation_id":"3af5aa16-df5c-464d-9d02-6001571e1da0","resolution":{"observed_at":"2026-08-06T19:44:19.898429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-06T19:50:21.587329Z","title":"Rombach, R., Blattmann, A., Lorenz, D., Esser, P., and Ommer, B","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05300","last_updated":"2025-07-07T01:18:40Z","snapshot_observed_at":"2026-08-17T01:20:08.939356Z","submitted_at":"2025-07-07T01:18:40Z","title":"Structured Captions Improve Prompt Adherence in Text-to-Image Models (Re-LAION-Caption 19M)","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:21.587329Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2507.05300"},"observation_digest":"sha256:fcd8e13d2cc81cebd4ef21b75673a60a4cf8e96c3d51a5a8b5a0e27632b2432e","observation_id":"3b8c973b-ba5c-4166-9c49-159b4e9bd0fa","resolution":{"observed_at":"2026-08-06T19:50:21.587329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-06T17:00:19.177529Z","title":"Ramesh, M","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.11974","last_updated":"2025-07-16T07:16:51Z","snapshot_observed_at":"2026-08-13T19:56:46.614750Z","submitted_at":"2025-07-16T07:16:51Z","title":"A Review of Generative AI in Aquaculture: Foundations, Applications, and Future Directions for Smart and Sustainable Farming","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T17:00:19.177529Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2507.11974"},"observation_digest":"sha256:3136ffcbcfbaa573d280ac0fec95630f2e9af494c56630b676030fa404516db8","observation_id":"d182779b-7dae-4d12-baf7-e4400ab244e8","resolution":{"observed_at":"2026-08-06T17:00:19.177529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-06T14:34:10.580858Z","title":"Zero-shot text-to-image generation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.21157","last_updated":"2025-07-24T22:05:52Z","snapshot_observed_at":"2026-08-14T02:53:48.252152Z","submitted_at":"2025-07-24T22:05:52Z","title":"Unmasking Synthetic Realities in Generative AI: A Comprehensive Review of Adversarially Robust Deepfake Detection Systems","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T14:34:10.580858Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2507.21157"},"observation_digest":"sha256:08ec1272064ed6db1303c523e33205b204ea52e06f24356c1782cb6b261dd3e0","observation_id":"eb1f0315-49bf-4810-b4ff-4195a773b720","resolution":{"observed_at":"2026-08-06T14:34:10.580858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-06T10:37:51.194375Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.23585","last_updated":"2025-07-31T14:18:28Z","snapshot_observed_at":"2026-08-19T16:35:05.536750Z","submitted_at":"2025-07-31T14:18:28Z","title":"Agency Among Agents: Designing with Hypertextual Friction in the Algorithmic Web","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T10:37:51.194375Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2507.23585"},"observation_digest":"sha256:16c1dbb54c94970c9d1c1ddaf93bc1f2bc756b6192f9e257f5de37957bd12f0e","observation_id":"d420a61d-75c9-40f8-8e2d-9502a5ccbcb4","resolution":{"observed_at":"2026-08-06T10:37:51.194375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-05T22:52:02.653418Z","title":"Ramesh, M","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.06291","last_updated":"2025-08-08T13:11:54Z","snapshot_observed_at":"2026-08-20T12:50:59.514579Z","submitted_at":"2025-08-08T13:11:54Z","title":"Real-Time 3D Vision-Language Embedding Mapping","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T22:52:02.653418Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2508.06291"},"observation_digest":"sha256:641ec82eaffd14b792d2753d6d35cbe2c5ac1506cfbb680673b542ec4d0e2cd5","observation_id":"725a87a1-2138-4c38-93a8-61406a50411f","resolution":{"observed_at":"2026-08-05T22:52:02.653418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-05T14:49:31.867345Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.20881","last_updated":"2025-08-28T15:11:49Z","snapshot_observed_at":"2026-08-09T19:14:23.746651Z","submitted_at":"2025-08-28T15:11:49Z","title":"Understanding and evaluating computer vision models through the lens of counterfactuals","version":1},"reference_index":210,"source":"pdf_text","source_observed_at":"2026-08-05T14:49:31.867345Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2508.20881"},"observation_digest":"sha256:58a499cb6975f17adbc6c17ad9922732c726a8f531a8b2075ae68bd1a63cf2db","observation_id":"44de9bf5-2e6d-4854-934b-3df4e357d917","resolution":{"observed_at":"2026-08-05T14:49:31.867345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-05T05:01:36.921533Z","title":"Zero-Shot Text-to-Image Generation.ArXiv, 2102.12092, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-15T05:55:38.630847Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.921533Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:4d752dc8fc23561261f3421838bfc0e29861f34918bf880d800392e1e21b814e","observation_id":"87d9060f-42ac-4c74-b9f8-de95ef1ef747","resolution":{"observed_at":"2026-08-05T05:01:36.921533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-04T21:25:27.114736Z","title":"Zero-Shot Text-to-Image Generation.ArXiv, 2102.12092, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-15T13:12:57.491333Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:27.114736Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:ababaf7ae75cb3a14ebdb926cd159b2c00253b0d7f632707ea593d7cb9e1f7b3","observation_id":"e4bfc21b-1c53-4578-98e0-b9f4ab7a1ca6","resolution":{"observed_at":"2026-08-04T21:25:27.114736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-04T17:56:30.917048Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10359","last_updated":"2025-09-12T15:47:50Z","snapshot_observed_at":"2026-08-18T07:28:53.855753Z","submitted_at":"2025-09-12T15:47:50Z","title":"Immunizing Images from Text to Image Editing via Adversarial Cross-Attention","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T17:56:30.917048Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2509.10359"},"observation_digest":"sha256:72ce6041d83461b8f8998c82b4f7125821bc4631d85c20228993013bf50b1139","observation_id":"314eb7db-ce21-4ede-8aab-e3a66df32586","resolution":{"observed_at":"2026-08-04T17:56:30.917048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-03T23:48:03.476241Z","title":"Zero-shot text-to-image generation.arXiv preprint arXiv:2102.12092, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.04260","last_updated":"2026-06-11T13:00:51Z","snapshot_observed_at":"2026-08-21T09:38:03.126566Z","submitted_at":"2025-11-06T10:51:11Z","title":"Proto-LeakNet: Towards Signal-Leak Aware Attribution in Synthetic Human Face Imagery","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T23:48:03.476241Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2511.04260"},"observation_digest":"sha256:e0bfb9e4cdf09785bf74b1c39ece3ba2b95a86e55e871e4d304823867a6146d2","observation_id":"e343fc6e-b8ed-4bc9-a304-3693b1a679ee","resolution":{"observed_at":"2026-08-03T23:48:03.476241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-03T19:59:09.485773Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.11815","last_updated":"2026-05-23T23:07:49Z","snapshot_observed_at":"2026-08-19T22:26:13.592238Z","submitted_at":"2025-11-26T18:59:43Z","title":"Video Deepfake Abuse: How Company Choices Predictably Shape Misuse Patterns","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-03T19:59:09.485773Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2512.11815"},"observation_digest":"sha256:4b7753286628f10f133ac5140f4304b236c5121fb638fbde05c0d9f57ae898a2","observation_id":"5bcfd51e-592b-4b97-859f-b9a5ce9e62df","resolution":{"observed_at":"2026-08-03T19:59:09.485773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-03T11:14:51.746511Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.07152","last_updated":"2026-01-12T02:49:09Z","snapshot_observed_at":"2026-08-13T21:46:54.981431Z","submitted_at":"2026-01-12T02:49:09Z","title":"Agents of Diffusion: Enhancing Diffusion Language Models with Multi-Agent Reinforcement Learning for Structured Data Generation (Extended Version)","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T11:14:51.746511Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2601.07152"},"observation_digest":"sha256:767d2a8f79ca52da20260deb25f978980fad4f8f1ade0dab0692a1f3761f16a3","observation_id":"15ec77e4-7ecd-46b3-81c4-aee1efdfc83c","resolution":{"observed_at":"2026-08-03T11:14:51.746511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-03T10:46:23.990908Z","title":"Ramesh, M","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.09117","last_updated":"2026-06-23T22:21:32Z","snapshot_observed_at":"2026-08-16T04:52:40.090548Z","submitted_at":"2026-01-14T03:33:14Z","title":"A Marketplace for AI-Generated Adult Content and Deepfakes","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T10:46:23.990908Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2601.09117"},"observation_digest":"sha256:e80310e183b2667217459c0998711cadb32a5cb44af1ec51c1e8ce98eaf14e5a","observation_id":"f810abbb-7911-41d7-9dbf-037cce92ce3e","resolution":{"observed_at":"2026-08-03T10:46:23.990908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-03T01:02:56.438442Z","title":"31 Dilip Roy","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10751","last_updated":"2026-07-08T15:02:57Z","snapshot_observed_at":"2026-08-18T02:30:56.532941Z","submitted_at":"2026-02-11T11:30:48Z","title":"Predicting integers from continuous parameters","version":3},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-03T01:02:56.438442Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2602.10751"},"observation_digest":"sha256:e0db9810a6a327171c567416c8e10314622520fa6ea07a295f0182d160839d92","observation_id":"8c43d029-a5dd-4144-8e51-8b80d202809b","resolution":{"observed_at":"2026-08-03T01:02:56.438442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2102.12092","doi":"10.48550/arxiv.2102.12092","metadata_source":"pith","pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zero-Shot Text-to-Image Generation","venue":"cs.CV","work_id":"b687fcea-fa95-4504-9ab2-8a627cae0000","year":2021},"citing_paper":{"arxiv_id":"2604.02482","last_updated":"2026-05-14T04:48:34Z","snapshot_observed_at":"2026-08-15T00:28:52.326014Z","submitted_at":"2026-04-02T19:30:24Z","title":"SEDGE: Structural Extrapolated Data Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-13T21:04:58.515329Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2604.02482"},"observation_digest":"sha256:d78f250f79d0b17f5c81381c7193e2d9b6094e81b1f5d050967d6c070ae24498","observation_id":"5121d0bd-7af6-438b-a861-bc4cea874533","resolution":{"observed_at":"2026-05-13T22:26:09.277502Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2102.12092","doi":"10.48550/arxiv.2102.12092","metadata_source":"pith","pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zero-Shot Text-to-Image Generation","venue":"cs.CV","work_id":"b687fcea-fa95-4504-9ab2-8a627cae0000","year":2021},"citing_paper":{"arxiv_id":"2604.02482","last_updated":"2026-05-14T04:48:34Z","snapshot_observed_at":"2026-08-15T00:28:52.326014Z","submitted_at":"2026-04-02T19:30:24Z","title":"SEDGE: Structural Extrapolated Data Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-15T07:34:02.199098Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2604.02482"},"observation_digest":"sha256:cba3cef50bc9afcc1e97fe3808ed6aeb2640af258425463db46d328ff3020910","observation_id":"3704c1c8-779a-4ae3-b6e6-6e9d4745b083","resolution":{"observed_at":"2026-05-15T07:35:13.748025Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2102.12092","doi":"10.48550/arxiv.2102.12092","metadata_source":"pith","pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zero-Shot Text-to-Image Generation","venue":"cs.CV","work_id":"b687fcea-fa95-4504-9ab2-8a627cae0000","year":2021},"citing_paper":{"arxiv_id":"2604.10927","last_updated":"2026-04-13T02:54:07Z","snapshot_observed_at":"2026-08-14T06:37:14.823390Z","submitted_at":"2026-04-13T02:54:07Z","title":"LiveGesture Streamable Co-Speech Gesture Generation Model","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T16:46:58.944000Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2604.10927"},"observation_digest":"sha256:16a0e73b1ef6fc8f8ccc7093287ca953892f26c8fc9ec1f71a784f7bef0c839b","observation_id":"0b63dda0-e888-42a1-bb2d-d8a9b7ac3d47","resolution":{"observed_at":"2026-05-13T22:26:09.277502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2102.12092","doi":"10.48550/arxiv.2102.12092","metadata_source":"pith","pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zero-Shot Text-to-Image Generation","venue":"cs.CV","work_id":"b687fcea-fa95-4504-9ab2-8a627cae0000","year":2021},"citing_paper":{"arxiv_id":"2604.19532","last_updated":"2026-06-01T10:50:11Z","snapshot_observed_at":"2026-08-11T02:38:09.579133Z","submitted_at":"2026-04-21T14:53:10Z","title":"BEAT: Tokenizing and Generating Symbolic Music by Uniform Temporal Steps","version":1},"reference_index":105,"source":"arxiv_source","source_observed_at":"2026-05-10T01:18:04.842423Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2604.19532"},"observation_digest":"sha256:4b063aca10ed34578b4a0008907bc66070e28303d65b1d2f83c096114d009f8c","observation_id":"dfaf15d9-4d7d-471a-ade1-5346e3df31cf","resolution":{"observed_at":"2026-05-13T22:26:09.277502Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2102.12092","doi":"10.48550/arxiv.2102.12092","metadata_source":"pith","pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zero-Shot Text-to-Image Generation","venue":"cs.CV","work_id":"b687fcea-fa95-4504-9ab2-8a627cae0000","year":2021},"citing_paper":{"arxiv_id":"2604.21036","last_updated":"2026-04-22T19:30:35Z","snapshot_observed_at":"2026-08-10T23:43:24.667506Z","submitted_at":"2026-04-22T19:30:35Z","title":"Who Defines Fairness? Target-Based Prompting for Demographic Representation in Generative Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-09T23:48:37.948835Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2604.21036"},"observation_digest":"sha256:118a96c08eea51b6c6c20962122b997e20cdbf821fc2bad0fbb07819a6a681ee","observation_id":"1f03e6ba-9d84-4376-b053-ae6af8f7a3da","resolution":{"observed_at":"2026-05-13T22:26:09.277502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2102.12092","doi":"10.48550/arxiv.2102.12092","metadata_source":"pith","pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zero-Shot Text-to-Image Generation","venue":"cs.CV","work_id":"b687fcea-fa95-4504-9ab2-8a627cae0000","year":2021},"citing_paper":{"arxiv_id":"2605.07565","last_updated":"2026-06-23T14:34:02Z","snapshot_observed_at":"2026-08-15T03:49:17.156992Z","submitted_at":"2026-05-08T10:37:10Z","title":"Ensemble Distributionally Robust Bayesian Optimisation with Continuous Context","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-05-11T03:18:03.316334Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2605.07565"},"observation_digest":"sha256:7fc9064bc14aa5c2c40ddb223ff3be73252db6e768bc35372708b37e7fe467ad","observation_id":"665251b0-9cd5-4a3d-b647-43904baff60d","resolution":{"observed_at":"2026-05-13T22:26:09.277502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2102.12092","doi":"10.48550/arxiv.2102.12092","metadata_source":"pith","pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zero-Shot Text-to-Image Generation","venue":"cs.CV","work_id":"b687fcea-fa95-4504-9ab2-8a627cae0000","year":2021},"citing_paper":{"arxiv_id":"2605.08871","last_updated":"2026-05-09T10:46:59Z","snapshot_observed_at":"2026-08-11T12:27:08.580370Z","submitted_at":"2026-05-09T10:46:59Z","title":"Rennala MVR: Improved Time Complexity for Parallel Stochastic Optimization via Momentum-Based Variance Reduction","version":1},"reference_index":139,"source":"arxiv_source","source_observed_at":"2026-05-12T01:51:20.003552Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2605.08871"},"observation_digest":"sha256:8328d4a5a86e61b9a875aa03d1f7a3432477571a5e6eb95a1a645052685bc6d5","observation_id":"2e941981-ca77-4278-8fa3-6ee225249b8a","resolution":{"observed_at":"2026-05-13T22:26:09.277502Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2102.12092","doi":"10.48550/arxiv.2102.12092","metadata_source":"pith","pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zero-Shot Text-to-Image Generation","venue":"cs.CV","work_id":"b687fcea-fa95-4504-9ab2-8a627cae0000","year":2021},"citing_paper":{"arxiv_id":"2605.18174","last_updated":"2026-05-18T10:18:02Z","snapshot_observed_at":"2026-08-15T08:55:48.785673Z","submitted_at":"2026-05-18T10:18:02Z","title":"Ringmaster LMO: Asynchronous Linear Minimization Oracle Momentum Method","version":1},"reference_index":141,"source":"arxiv_source","source_observed_at":"2026-05-20T13:08:52.912250Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2605.18174"},"observation_digest":"sha256:912a7e77c18bf033362d84ac60fff911343f73b833016bee72da0c275772b9ec","observation_id":"4e4c30e0-4369-4246-9cf2-60372997b09c","resolution":{"observed_at":"2026-05-20T13:13:18.606479Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2102.12092","doi":"10.48550/arxiv.2102.12092","metadata_source":"pith","pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zero-Shot Text-to-Image Generation","venue":"cs.CV","work_id":"b687fcea-fa95-4504-9ab2-8a627cae0000","year":2021},"citing_paper":{"arxiv_id":"2605.20866","last_updated":"2026-05-20T08:01:45Z","snapshot_observed_at":"2026-08-13T16:04:20.229116Z","submitted_at":"2026-05-20T08:01:45Z","title":"LOSCAR-SGD: Local SGD with Communication-Computation Overlap and Delay-Corrected Sparse Model Averaging","version":1},"reference_index":143,"source":"arxiv_source","source_observed_at":"2026-05-21T05:49:28.713982Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2605.20866"},"observation_digest":"sha256:5e0d8ff68ecd0f9d2b611ea4dd2c79c5b7c934a15c64353b764004c55df19848","observation_id":"a9ff73b0-5904-411b-b95f-fb25d770662b","resolution":{"observed_at":"2026-05-21T05:49:40.701655Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2102.12092","doi":"10.48550/arxiv.2102.12092","metadata_source":"pith","pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zero-Shot Text-to-Image Generation","venue":"cs.CV","work_id":"b687fcea-fa95-4504-9ab2-8a627cae0000","year":2021},"citing_paper":{"arxiv_id":"2606.02305","last_updated":"2026-06-01T14:25:36Z","snapshot_observed_at":"2026-07-06T23:42:44.661608Z","submitted_at":"2026-06-01T14:25:36Z","title":"Mapping Whisper Representations to Human ECoG Responses with Interpretable Time-Resolved Neural Encoding","version":1},"reference_index":126,"source":"arxiv_source","source_observed_at":"2026-06-28T11:39:30.563754Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2606.02305"},"observation_digest":"sha256:813b6ad0591ef4d2b66a94905cb8a140cfc198069a4c971a7deed5c2d83401dc","observation_id":"4a67e0d1-f702-4661-b4a4-534b003071a8","resolution":{"observed_at":"2026-06-28T11:42:04.067501Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2102.12092","doi":"10.48550/arxiv.2102.12092","metadata_source":"pith","pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zero-Shot Text-to-Image Generation","venue":"cs.CV","work_id":"b687fcea-fa95-4504-9ab2-8a627cae0000","year":2021},"citing_paper":{"arxiv_id":"2606.08841","last_updated":"2026-06-07T21:11:47Z","snapshot_observed_at":"2026-08-12T13:59:25.112926Z","submitted_at":"2026-06-07T21:11:47Z","title":"ZIPP:Zero-shot Image Personalization from Personas","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-27T18:11:22.987938Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2606.08841"},"observation_digest":"sha256:fa4102e669446eaa96a859b2a329e089f62329a2a85da734f9354b272692fd19","observation_id":"9815f686-64c6-466f-98ee-b7ab1cd1aef1","resolution":{"observed_at":"2026-07-02T23:27:27.959436Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2102.12092","doi":"10.48550/arxiv.2102.12092","metadata_source":"pith","pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zero-Shot Text-to-Image Generation","venue":"cs.CV","work_id":"b687fcea-fa95-4504-9ab2-8a627cae0000","year":2021},"citing_paper":{"arxiv_id":"2606.24021","last_updated":"2026-06-22T23:54:40Z","snapshot_observed_at":"2026-08-15T10:04:06.642287Z","submitted_at":"2026-06-22T23:54:40Z","title":"Token-to-Token Alignment of Text Embeddings for Semantic Blending","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-26T08:34:23.842302Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2606.24021"},"observation_digest":"sha256:4df0a2bebeee93d018f204a4a5bed37ef641afd1af158d02d1c0aa6bbb6f150c","observation_id":"97f61ca5-656d-4284-ac76-acc56feb58a1","resolution":{"observed_at":"2026-07-04T10:39:46.128417Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-07-31T01:59:33.072872Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.25078","last_updated":"2026-07-27T21:13:29Z","snapshot_observed_at":"2026-08-15T11:30:20.610798Z","submitted_at":"2026-07-27T21:13:29Z","title":"Diff-ID: Identity Consistent Facial Image Generation and Morphing via Diffusion Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-31T01:59:33.072872Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2607.25078"},"observation_digest":"sha256:c4aa74a4db24dfb35816926b1a70d1b5c8e6ac2824f697f282d7d51f87c093dd","observation_id":"27a6e446-bfce-4024-9767-aaef24929011","resolution":{"observed_at":"2026-07-31T01:59:33.072872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-04T03:02:38.885153Z","title":"arXiv preprint arXiv:2102.12092 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.00626","last_updated":"2026-08-01T12:32:31Z","snapshot_observed_at":"2026-08-16T19:43:42.807666Z","submitted_at":"2026-08-01T12:32:31Z","title":"Where Does Generative Difficulty Reside? An Empirical Study of Target Representations","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T03:02:38.885153Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2608.00626"},"observation_digest":"sha256:381722ff6ac68f69d999fa69582442d10924c199dbc51adbfda2dfbe072e30dc","observation_id":"2aa3f75a-318e-4705-8695-8ff9a6a55f00","resolution":{"observed_at":"2026-08-04T03:02:38.885153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-15T15:04:48.399633Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.02820","last_updated":"2026-08-03T19:32:13Z","snapshot_observed_at":"2026-08-19T08:36:38.187414Z","submitted_at":"2026-08-03T19:32:13Z","title":"Evading Chain-of-Thought Monitoring Through Model Poisoning","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-15T15:04:48.399633Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2608.02820"},"observation_digest":"sha256:35be3c6e50ecf8b4f37c5ae14dd8fe9e2df709659538f991983bc4a6afae75e7","observation_id":"38d58b6f-a98b-4312-8b90-82f00a215da5","resolution":{"observed_at":"2026-08-15T15:04:48.399633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-06T21:05:45.963044Z","title":"2102.12092 , archivePrefix=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04607","last_updated":"2026-08-05T09:14:22Z","snapshot_observed_at":"2026-08-19T08:22:55.066034Z","submitted_at":"2026-08-05T09:14:22Z","title":"On MUON optimization: From non-convergence to an error analysis with Polar Express and the Newton-Schulz polynomial from implementations","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T21:05:45.963044Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2608.04607"},"observation_digest":"sha256:5bc1fcc64f63160686b2e77dbaf0d358cb6b72bd568a93096f0ae6da608a1e3e","observation_id":"63e6af98-2245-4982-b6a8-789ff45f2788","resolution":{"observed_at":"2026-08-06T21:05:45.963044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-16T00:22:07.528089Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-19T06:06:19.330018Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.528089Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:3a990787b1c83c7fd7223b38c2dadcc631e64fa366c3f5336de4c820c131aaee","observation_id":"fdb59593-1e7d-4656-a9c5-00a9e0f28889","resolution":{"observed_at":"2026-08-16T00:22:07.528089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2102.12092/citation-record","integrity":"/paper/2102.12092/integrity","json":"/paper/2102.12092/citation-record.json","paper":"/paper/2102.12092"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bowman et al","venue":null,"work_id":"52301570-311d-400c-a35e-e91c2dafc161","year":2015},"citing_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-13T22:26:09.216328Z"},"links":{"citing_paper":"/paper/2102.12092"},"observation_digest":"sha256:6d66891089483b9e09ba2cdec59d84ded400bc94071bc7786ea387f7a3400c50","observation_id":"2df1834a-007e-409f-bd4b-1adefed903bc","resolution":{"observed_at":"2026-05-13T22:26:09.229996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Using a linear annealing schedule for this typically led to divergence","venue":null,"work_id":"a760669a-0fff-48d1-8242-87dac551d654","year":null},"citing_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-13T22:26:09.216328Z"},"links":{"citing_paper":"/paper/2102.12092"},"observation_digest":"sha256:aeaad6ba56f8ac0be63fc3e832aa428f782fb30f46d4bee306a14bf41cfe80d0","observation_id":"d09cce28-e648-4d67-9024-ad2ddfda28bd","resolution":{"observed_at":"2026-05-13T22:26:09.232693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"row, column, row, row","venue":null,"work_id":"0336e6b0-451d-47dc-8d97-1a46d4107b72","year":2017},"citing_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T22:26:09.216328Z"},"links":{"citing_paper":"/paper/2102.12092"},"observation_digest":"sha256:cc13abe12d2af8e4c501c832ad2a3cb5556ea0596ef608f3b7e32d7ddd580e8a","observation_id":"6baae6b4-2780-45f8-bd98-8069e679c6ef","resolution":{"observed_at":"2026-05-13T22:26:09.235067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Our model uses 128 gradient scales, one for each of its resblocks","venue":null,"work_id":"acbee4e8-41fd-48e1-b387-4b6685b9e6e2","year":null},"citing_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T22:26:09.216328Z"},"links":{"citing_paper":"/paper/2102.12092"},"observation_digest":"sha256:5339a17c6d73722ab825c8ce4f59491e5a50f6dd992ab205fb551d0f391d738c","observation_id":"40a3e61c-9bf8-4631-832b-f784773a0f72","resolution":{"observed_at":"2026-05-13T22:26:09.237344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In particular, store all gains, biases, embeddings, and unembeddings in 32-bit precision, with 32-bit gradients (including for remote communication) and 32-bit Adam moments","venue":null,"work_id":"2cbd3bc9-f9b0-4459-902d-4ad616b9d452","year":null},"citing_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-13T22:26:09.216328Z"},"links":{"citing_paper":"/paper/2102.12092"},"observation_digest":"sha256:46256341669e019283a0691ec2d3cf29755f29b37d1ecaf2cd229bd533a493e5","observation_id":"9be93f41-86d9-4ecc-a7bc-2a89864e11f6","resolution":{"observed_at":"2026-05-13T22:26:09.239872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"For data-parallel training, we need to divide the gradients by the total number of data-parallel workers M","venue":null,"work_id":"200d057c-93e1-43a6-ae84-26bbc280f715","year":2019},"citing_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-13T22:26:09.216328Z"},"links":{"citing_paper":"/paper/2102.12092"},"observation_digest":"sha256:daec7bb89dc391b3177bfb80f3793b3c23641a43dcf823dc8349d4e3e3a38fc3","observation_id":"569541e8-230d-48bb-b3c3-6ea27e66e3cf","resolution":{"observed_at":"2026-05-13T22:26:09.242339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"fffc14f3-12de-44c9-af1d-5e5b27fda70f","year":null},"citing_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T22:26:09.216328Z"},"links":{"citing_paper":"/paper/2102.12092"},"observation_digest":"sha256:b8199b7416f65da4a420619e26978e7288e077f06c178817f7c209774aabd158","observation_id":"4f56d470-0934-4020-b7af-94124e1964d4","resolution":{"observed_at":"2026-05-13T22:26:09.244289Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Otherwise, we do nothing and proceed with backpropagation; a single nonﬁnite value in the gradient means that the entire update will be skipped, which happens about 5% of the time","venue":null,"work_id":"af52f662-a070-48a9-9f3e-857f78311259","year":null},"citing_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-13T22:26:09.216328Z"},"links":{"citing_paper":"/paper/2102.12092"},"observation_digest":"sha256:cc3ecfb2f00408774be26493513ff86d78903a15d42b1766131d375d6a7eae86","observation_id":"c86db7c2-cf22-410c-b415-2e040fd168dd","resolution":{"observed_at":"2026-05-13T22:26:09.246687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Both the P and Q matrices are stored in 1-6-9 format and have their values scaled by predetermined constants, as discussed in Section D","venue":null,"work_id":"e9603ab7-8e0d-4b5d-b959-b5b875002a41","year":null},"citing_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-13T22:26:09.216328Z"},"links":{"citing_paper":"/paper/2102.12092"},"observation_digest":"sha256:336883040cfcf578a1d2ec4000c4081fc5246b9d6e57260c3df745c6d995fcea","observation_id":"942081b7-73bb-453b-a472-14e0deb0af10","resolution":{"observed_at":"2026-05-13T22:26:09.248947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"This all-reduce is carried out in the 1-6-9 format, using a custom kernel","venue":null,"work_id":"09ab3052-4039-4d21-ae87-b6cc8b998ddd","year":null},"citing_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-13T22:26:09.216328Z"},"links":{"citing_paper":"/paper/2102.12092"},"observation_digest":"sha256:00d308fcc5dd151fc9e9ffd26493a1bae572f6fd7de67e1361da8f839558d22b","observation_id":"6523559e-ee65-49c8-be55-e09f6b198f63","resolution":{"observed_at":"2026-05-13T22:26:09.251233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"We use a custom Householder orthogonalization kernel rather than Gram-Schmidt, as we found the latter to be numerically unstable","venue":null,"work_id":"e5c547c7-5077-4c51-85a3-600185f2bfa5","year":null},"citing_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-13T22:26:09.216328Z"},"links":{"citing_paper":"/paper/2102.12092"},"observation_digest":"sha256:211897116c3d0dc822c0559f3deb94cb284baf4579d15f3eb3999b795a7a50d5","observation_id":"0cab1972-128e-4201-8802-57967dc05e48","resolution":{"observed_at":"2026-05-13T22:26:09.253396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zero-Shot Text-to-Image Generation","venue":null,"work_id":"bb1adccb-b811-44d6-bc99-f7b5fa116da9","year":null},"citing_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-13T22:26:09.216328Z"},"links":{"citing_paper":"/paper/2102.12092"},"observation_digest":"sha256:6f6d92d0314bd69b3fdd11d6f2d3fd902f5c2ae9f07479dc0867a971bbfa1e45","observation_id":"8d255c1e-9a26-4b49-90b7-5b9eb6706e3d","resolution":{"observed_at":"2026-05-13T22:26:09.255503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"As in step (4), we clamp all inﬁnities in the results of the all-reduce to the maximum value of the 1-6-9 format, retaining the sign","venue":null,"work_id":"81435c8a-0dfd-4ee9-8f6e-1943637285d7","year":null},"citing_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-13T22:26:09.216328Z"},"links":{"citing_paper":"/paper/2102.12092"},"observation_digest":"sha256:6cfec4eb2f08ab07c7bb1dff800b62f26b357ddbaa10f6a0cc9c7f82f9cfb0d8","observation_id":"2d31d7c1-283f-4ac2-bcf7-1054270d789e","resolution":{"observed_at":"2026-05-13T22:26:09.257566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Section D explains why we use 32-bit precision for these parameters and their gradients","venue":null,"work_id":"3a1c3f87-597e-4dd0-aa5b-3be860d41e49","year":null},"citing_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-13T22:26:09.216328Z"},"links":{"citing_paper":"/paper/2102.12092"},"observation_digest":"sha256:524de30028059ce32e8a555086b37ed1fa8d80d0b245aed7fa9eac406cd78711","observation_id":"9e9adb57-3835-4f46-a71a-4bb2b3c7c1c4","resolution":{"observed_at":"2026-05-13T22:26:09.259641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"fcb427ae-e793-4cd2-8fa9-2765eecd3143","year":null},"citing_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-13T22:26:09.216328Z"},"links":{"citing_paper":"/paper/2102.12092"},"observation_digest":"sha256:688f97e44a7cfaac7bb91ef48706768044f035b612197b2137569d14f05f7f22","observation_id":"3dcdd7e8-116b-40b3-8be8-99177b3618f8","resolution":{"observed_at":"2026-05-13T22:26:09.261650Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"643d1b03-3737-45d8-a56b-724bce94f3f5","year":null},"citing_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-13T22:26:09.216328Z"},"links":{"citing_paper":"/paper/2102.12092"},"observation_digest":"sha256:4d79d746770718b32671fda90eb0608ea1ebd3390f376596f309180ce60cfca6","observation_id":"53a9d960-1f4b-46c3-96fa-8ae917e062e5","resolution":{"observed_at":"2026-05-13T22:26:09.263358Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Like backpropagation, the parameter updates proceed resblock-by-resblock","venue":null,"work_id":"80e8b7d1-503c-4b4f-915e-6902de8df500","year":null},"citing_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-13T22:26:09.216328Z"},"links":{"citing_paper":"/paper/2102.12092"},"observation_digest":"sha256:23fa8984c5b837e224d5d0b65b095e7d84dd18855fa4736fbaa196972b9c2eb9","observation_id":"f830d2ff-c5b8-4e9a-a2df-53711d65742e","resolution":{"observed_at":"2026-05-13T22:26:09.265186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"local” gradient averaged over the GPUs on the machine using reduce-scatter, and the “remote","venue":null,"work_id":"0162beef-5b1b-49a3-82e1-3274934f6c39","year":null},"citing_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T22:26:09.216328Z"},"links":{"citing_paper":"/paper/2102.12092"},"observation_digest":"sha256:ec1715bcafac09360dbdc922868e242c9d3627c079f3985e015abdd7aead8f47","observation_id":"7b04f537-34aa-4a62-9b74-9c063f1b8bd2","resolution":{"observed_at":"2026-05-13T22:26:09.267155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"We also note the following important optimizations","venue":null,"work_id":"dfee052d-1c88-4a00-8b15-8c01d3b313ae","year":null},"citing_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-13T22:26:09.216328Z"},"links":{"citing_paper":"/paper/2102.12092"},"observation_digest":"sha256:cbc12ef1b803cf5dfab9fbfd67ad92b3954d6d44208a95abe673efbd1444109b","observation_id":"74d2a88f-8c2e-427c-9a5c-b3fb07ededef","resolution":{"observed_at":"2026-05-13T22:26:09.268990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"For example, while we are running step (2) for resblock i, we can proceed to steps (3)–(8) for all resblocks j > i","venue":null,"work_id":"fb821bdd-72c4-4703-ad36-1af5dc1f1a50","year":null},"citing_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-13T22:26:09.216328Z"},"links":{"citing_paper":"/paper/2102.12092"},"observation_digest":"sha256:69030c48cf014830cd4de345bfcb536a77e26b2eff9573772ae495e96fb54bfa","observation_id":"445b2588-da2f-44f1-b389-dae00d81d4c0","resolution":{"observed_at":"2026-05-13T22:26:09.270883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"For example, we only prefetch the parameters from the preceding resblock when the reduce-scatter operations have ﬁnished for the current one","venue":null,"work_id":"d68ef671-dcc7-40e0-9457-7b08c9d18a36","year":null},"citing_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-13T22:26:09.216328Z"},"links":{"citing_paper":"/paper/2102.12092"},"observation_digest":"sha256:d3ac4fa94d4f178856a1c098b88dadc3c02d6e5aebcf06ef96f8f492eeae8c4f","observation_id":"9d4cc561-c45b-4429-baee-51056c1452a7","resolution":{"observed_at":"2026-05-13T22:26:09.273093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The former inﬂuences the bandwidth analysis, which we present in Section E.1","venue":null,"work_id":"3fe8ae60-7aa5-460c-9e22-0337bbce5a28","year":null},"citing_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-13T22:26:09.216328Z"},"links":{"citing_paper":"/paper/2102.12092"},"observation_digest":"sha256:2a163b78eb61b83669aab1f287fe712903b36f474f84c8e0b807aaeb8b6983f2","observation_id":"471f39fe-40ce-4329-be52-d6c76ec1911a","resolution":{"observed_at":"2026-05-13T22:26:09.275041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"the exact same cat on the top as a sketch on the bottom","venue":null,"work_id":"92c4f152-35cc-4667-a9bf-5bead8ddcf7e","year":null},"citing_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-13T22:26:09.216328Z"},"links":{"citing_paper":"/paper/2102.12092"},"observation_digest":"sha256:2f5169cbf2116baf826a2553049a795107e348d3d46418ffbecb2a5d2468ddc0","observation_id":"ab2b269c-1f6b-43f2-8c18-65a67d7b8d09","resolution":{"observed_at":"2026-05-13T22:26:09.276897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":3,"verified_exact":0,"verified_fuzzy":20},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 99 inbound Pith citation observations for arXiv:2102.12092."}