{"as_of":"2026-08-11T15:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:de26f04d2d05929a3827ab59b846b346400152a6424a96cb3860a159aba9d6c7","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T23:05:13.761523Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.00116/citation-record","integrity":"/paper/2501.00116/integrity","json":"/paper/2501.00116/citation-record.json","paper":"/paper/2501.00116"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-10T23:05:13.610089Z","title":"ediffi: Text-to-image diffusion models with an ensemble of expert denoisers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.00116","last_updated":"2024-12-30T19:30:40Z","snapshot_observed_at":"2026-08-11T14:47:30.980598Z","submitted_at":"2024-12-30T19:30:40Z","title":"Text-to-Image GAN with Pretrained Representations","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:13.610089Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2501.00116"},"observation_digest":"sha256:956d95361793fd820fbe1c448919a3caff984ffa52964c9019dd92edc4caf287","observation_id":"193a1ede-4da1-4ea5-852f-9ba0e14348e4","resolution":{"observed_at":"2026-08-10T23:05:13.610089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:14.227686Z","title":"Cogview: Mastering text-to-image generation via transformers","venue":null,"work_id":"500905ab-ce75-4df4-a2ac-4cdde311c072","year":2021},"citing_paper":{"arxiv_id":"2501.00116","last_updated":"2024-12-30T19:30:40Z","snapshot_observed_at":"2026-08-11T14:47:30.980598Z","submitted_at":"2024-12-30T19:30:40Z","title":"Text-to-Image GAN with Pretrained Representations","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:13.627896Z"},"links":{"citing_paper":"/paper/2501.00116"},"observation_digest":"sha256:ebe7b47dfd031696878e33676eb593c0ce23366f0a33602208c3cb518bf5cd2f","observation_id":"5d456aaf-d281-4b77-8e77-dc55a52f9dde","resolution":{"observed_at":"2026-08-10T23:05:14.231518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:14.216375Z","title":"Cogview2: Faster and better text-to-image generation via hierarchical transformers","venue":null,"work_id":"0e04b13f-d33d-4d28-a48c-291d931ffe80","year":2022},"citing_paper":{"arxiv_id":"2501.00116","last_updated":"2024-12-30T19:30:40Z","snapshot_observed_at":"2026-08-11T14:47:30.980598Z","submitted_at":"2024-12-30T19:30:40Z","title":"Text-to-Image GAN with Pretrained Representations","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:13.631822Z"},"links":{"citing_paper":"/paper/2501.00116"},"observation_digest":"sha256:d32c14da7cb52bbf68d295e45ce2bf48d25d065549cbf7e8b858d516c8617e2d","observation_id":"755e8e8f-cfd6-43d0-ae4e-52259e0daed7","resolution":{"observed_at":"2026-08-10T23:05:14.220351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:14.204564Z","title":"Vector quantized diffusion model for text- to-image synthesis","venue":null,"work_id":"db09a959-d4af-4898-93b4-60eb71cccad9","year":2022},"citing_paper":{"arxiv_id":"2501.00116","last_updated":"2024-12-30T19:30:40Z","snapshot_observed_at":"2026-08-11T14:47:30.980598Z","submitted_at":"2024-12-30T19:30:40Z","title":"Text-to-Image GAN with Pretrained Representations","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:13.636234Z"},"links":{"citing_paper":"/paper/2501.00116"},"observation_digest":"sha256:eabc201a54b43d0a85d6b283926f5da3b7e6c68d23514ffd4f6ca45199ca58a7","observation_id":"138f4b5e-0e82-4c8d-b456-2ead615cdb8c","resolution":{"observed_at":"2026-08-10T23:05:14.208426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.09741","last_updated":"2022-07-11T04:21:37Z","snapshot_observed_at":"2026-08-11T14:46:55.089040Z","submitted_at":"2022-02-20T06:35:18Z","title":"Visual Attention Network","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.09741","snapshot_observed_at":"2026-08-10T23:05:13.640094Z","title":"Visual at- tention network","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.00116","last_updated":"2024-12-30T19:30:40Z","snapshot_observed_at":"2026-08-11T14:47:30.980598Z","submitted_at":"2024-12-30T19:30:40Z","title":"Text-to-Image GAN with Pretrained Representations","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:13.640094Z"},"links":{"cited_paper":"/paper/2202.09741","citing_paper":"/paper/2501.00116"},"observation_digest":"sha256:9592beee326c35f29f1fc45b244c6f20e308e7427a2f1868dabc08c5d60d48f3","observation_id":"4283bf23-1304-4954-b8cb-f501e2c38a85","resolution":{"observed_at":"2026-08-10T23:05:13.640094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:14.192111Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium","venue":null,"work_id":"f170616a-dade-4a09-a8c6-620e6996f1fe","year":2017},"citing_paper":{"arxiv_id":"2501.00116","last_updated":"2024-12-30T19:30:40Z","snapshot_observed_at":"2026-08-11T14:47:30.980598Z","submitted_at":"2024-12-30T19:30:40Z","title":"Text-to-Image GAN with Pretrained Representations","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:13.644122Z"},"links":{"citing_paper":"/paper/2501.00116"},"observation_digest":"sha256:0ced62c14bd13b45932ca32c0dc8e61a135521eb549060eaf674bf15d3298cdc","observation_id":"4180485e-df93-4ffe-95ec-5bc67eb88185","resolution":{"observed_at":"2026-08-10T23:05:14.196159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:14.169493Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":"ae4408ac-55d2-4985-9b8b-c79081f7320a","year":2015},"citing_paper":{"arxiv_id":"2501.00116","last_updated":"2024-12-30T19:30:40Z","snapshot_observed_at":"2026-08-11T14:47:30.980598Z","submitted_at":"2024-12-30T19:30:40Z","title":"Text-to-Image GAN with Pretrained Representations","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:13.651592Z"},"links":{"citing_paper":"/paper/2501.00116"},"observation_digest":"sha256:f60c4ac712000ce2ed876001bf6328a4f222bf14d0b2b75e6ab15be46b6f8711","observation_id":"6adcb0ee-6916-48db-90d3-cf0f25990719","resolution":{"observed_at":"2026-08-10T23:05:14.173495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:14.132400Z","title":"Text to image generation with semantic-spatial aware gan","venue":null,"work_id":"0aec3b64-a123-45e0-8987-8d4dfcffa303","year":2022},"citing_paper":{"arxiv_id":"2501.00116","last_updated":"2024-12-30T19:30:40Z","snapshot_observed_at":"2026-08-11T14:47:30.980598Z","submitted_at":"2024-12-30T19:30:40Z","title":"Text-to-Image GAN with Pretrained Representations","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:13.662824Z"},"links":{"citing_paper":"/paper/2501.00116"},"observation_digest":"sha256:a9078897bdb95a609b5a7ad9ab1b253310e6f165b87e1d0ba87f16ed2a4e9ee4","observation_id":"670a81fb-25be-42cc-8d42-26de063cc77d","resolution":{"observed_at":"2026-08-10T23:05:14.136493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:14.120569Z","title":"Microsoft coco: Com- mon objects in context","venue":null,"work_id":"a35b24b9-fd30-45fa-a628-3f08d3eceb77","year":2014},"citing_paper":{"arxiv_id":"2501.00116","last_updated":"2024-12-30T19:30:40Z","snapshot_observed_at":"2026-08-11T14:47:30.980598Z","submitted_at":"2024-12-30T19:30:40Z","title":"Text-to-Image GAN with Pretrained Representations","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:13.666686Z"},"links":{"citing_paper":"/paper/2501.00116"},"observation_digest":"sha256:9c34b0f648a58f745cb122030cf229fb8214f7af80dedf29ae00c81c562e2618","observation_id":"7a72d765-df33-4f19-89df-a7b5cf3df2cd","resolution":{"observed_at":"2026-08-10T23:05:14.124794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:14.108197Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":"313b6747-00f9-4837-be5a-6c3488c07da6","year":2021},"citing_paper":{"arxiv_id":"2501.00116","last_updated":"2024-12-30T19:30:40Z","snapshot_observed_at":"2026-08-11T14:47:30.980598Z","submitted_at":"2024-12-30T19:30:40Z","title":"Text-to-Image GAN with Pretrained Representations","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:13.670293Z"},"links":{"citing_paper":"/paper/2501.00116"},"observation_digest":"sha256:1c9b3e109be20e73848d9117d20e463eeb7164089be055c9a7ff532369b22c1f","observation_id":"cf9bca88-e215-4835-a196-c08c76a927df","resolution":{"observed_at":"2026-08-10T23:05:14.112384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10741","last_updated":"2022-03-08T18:18:49Z","snapshot_observed_at":"2026-08-07T12:21:17.790675Z","submitted_at":"2021-12-20T18:42:55Z","title":"GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10741","snapshot_observed_at":"2026-08-10T23:05:13.673889Z","title":"Glide: Towards photore- alistic image generation and editing with text-guided dif- fusion models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.00116","last_updated":"2024-12-30T19:30:40Z","snapshot_observed_at":"2026-08-11T14:47:30.980598Z","submitted_at":"2024-12-30T19:30:40Z","title":"Text-to-Image GAN with Pretrained Representations","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:13.673889Z"},"links":{"cited_paper":"/paper/2112.10741","citing_paper":"/paper/2501.00116"},"observation_digest":"sha256:cb385cb6045ac364f1db2b255dd38026b822a3b2857c25cb7e8608b9cb0bc8c5","observation_id":"61086c16-2f01-442f-9a8c-bbd9a29ba7bd","resolution":{"observed_at":"2026-08-10T23:05:13.673889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06434","last_updated":"2016-01-07T23:09:39Z","snapshot_observed_at":"2026-08-04T04:34:27.861448Z","submitted_at":"2015-11-19T22:50:32Z","title":"Unsupervised Representation Learning with Deep Convolutional Generative Adversarial Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06434","snapshot_observed_at":"2026-08-10T23:05:13.678035Z","title":"Unsupervised representation learning with deep convolutional generative adversarial networks","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.00116","last_updated":"2024-12-30T19:30:40Z","snapshot_observed_at":"2026-08-11T14:47:30.980598Z","submitted_at":"2024-12-30T19:30:40Z","title":"Text-to-Image GAN with Pretrained Representations","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:13.678035Z"},"links":{"cited_paper":"/paper/1511.06434","citing_paper":"/paper/2501.00116"},"observation_digest":"sha256:0a0d8be548e7bfe4e79279ee8e8798b73e7ea1ad72ba20b0e5c6a5bc576f50c1","observation_id":"9e1c88b9-2b97-4bad-8f00-6f950dfc9e17","resolution":{"observed_at":"2026-08-10T23:05:13.678035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:14.095876Z","title":"Learning transferable visual models from nat- ural language supervision","venue":null,"work_id":"4146af21-de25-4a52-b2d7-815a0d53a7b6","year":2021},"citing_paper":{"arxiv_id":"2501.00116","last_updated":"2024-12-30T19:30:40Z","snapshot_observed_at":"2026-08-11T14:47:30.980598Z","submitted_at":"2024-12-30T19:30:40Z","title":"Text-to-Image GAN with Pretrained Representations","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:13.682140Z"},"links":{"citing_paper":"/paper/2501.00116"},"observation_digest":"sha256:8451b8f2a2045198f1c5836fc6958925b66892c45076e78cff5ec67a989c2779","observation_id":"2e24ac50-ca07-4e22-aecc-ab214da02315","resolution":{"observed_at":"2026-08-10T23:05:14.100268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:14.083128Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":"dbe2a901-7510-4db3-bc1a-e3362026e948","year":2021},"citing_paper":{"arxiv_id":"2501.00116","last_updated":"2024-12-30T19:30:40Z","snapshot_observed_at":"2026-08-11T14:47:30.980598Z","submitted_at":"2024-12-30T19:30:40Z","title":"Text-to-Image GAN with Pretrained Representations","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:13.685918Z"},"links":{"citing_paper":"/paper/2501.00116"},"observation_digest":"sha256:925f9c580b87bb46f44ca893bad8cb8bbe8fbca92cef432620dea474575be8b7","observation_id":"07aee608-a9a4-4b0d-9dd6-9e0b8915fe49","resolution":{"observed_at":"2026-08-10T23:05:14.087816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-10T23:05:13.689736Z","title":"Hierarchical text-conditional image generation with clip latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.00116","last_updated":"2024-12-30T19:30:40Z","snapshot_observed_at":"2026-08-11T14:47:30.980598Z","submitted_at":"2024-12-30T19:30:40Z","title":"Text-to-Image GAN with Pretrained Representations","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:13.689736Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2501.00116"},"observation_digest":"sha256:2f83ad881465cd0869b9c0d98507976969b7b8315bdc465e1f83f2a864cc383a","observation_id":"abec9f14-4cd9-454d-b2a2-5f9d0feb1c69","resolution":{"observed_at":"2026-08-10T23:05:13.689736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:14.064025Z","title":"Dae- gan: Dynamic aspect-aware gan for text-to-image synthe- sis","venue":null,"work_id":"e73f68f8-070f-4fff-bd8a-2e7e4d5b608a","year":2021},"citing_paper":{"arxiv_id":"2501.00116","last_updated":"2024-12-30T19:30:40Z","snapshot_observed_at":"2026-08-11T14:47:30.980598Z","submitted_at":"2024-12-30T19:30:40Z","title":"Text-to-Image GAN with Pretrained Representations","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:13.697288Z"},"links":{"citing_paper":"/paper/2501.00116"},"observation_digest":"sha256:8e8bd54cc8c079a923db146e9aedb7860072f84b2de84a07850ed1d58263649e","observation_id":"5167e705-b356-46b3-a7f5-6a4a06addcb7","resolution":{"observed_at":"2026-08-10T23:05:14.068233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:14.051935Z","title":"Improved techniques for training gans","venue":null,"work_id":"97bf8c03-875a-4aad-9211-0a59b0f5d442","year":2016},"citing_paper":{"arxiv_id":"2501.00116","last_updated":"2024-12-30T19:30:40Z","snapshot_observed_at":"2026-08-11T14:47:30.980598Z","submitted_at":"2024-12-30T19:30:40Z","title":"Text-to-Image GAN with Pretrained Representations","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:13.700860Z"},"links":{"citing_paper":"/paper/2501.00116"},"observation_digest":"sha256:b1c4098c2216e56397132f20c47fa19bfb9c99a07b835ec9ee954e83fa7f2586","observation_id":"02136172-77c0-451e-a7f9-00e0e35df7be","resolution":{"observed_at":"2026-08-10T23:05:14.056004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:14.039499Z","title":"Projected gans converge faster","venue":null,"work_id":"6d6b4b1e-7902-4cad-94be-a9cf64ca0a24","year":2021},"citing_paper":{"arxiv_id":"2501.00116","last_updated":"2024-12-30T19:30:40Z","snapshot_observed_at":"2026-08-11T14:47:30.980598Z","submitted_at":"2024-12-30T19:30:40Z","title":"Text-to-Image GAN with Pretrained Representations","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:13.704587Z"},"links":{"citing_paper":"/paper/2501.00116"},"observation_digest":"sha256:fbecd6d4f4917e77721df7177887ad6c6b555f200846bc48f4b6e0a234a30bf0","observation_id":"1091660b-ad27-49df-beed-6b7fb52e5371","resolution":{"observed_at":"2026-08-10T23:05:14.043885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.09515","last_updated":"2023-01-23T16:05:45Z","snapshot_observed_at":"2026-08-11T10:25:54.988412Z","submitted_at":"2023-01-23T16:05:45Z","title":"StyleGAN-T: Unlocking the Power of GANs for Fast Large-Scale Text-to-Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.09515","snapshot_observed_at":"2026-08-10T23:05:13.708303Z","title":"Stylegan-t: Unlocking the power of gans for fast large-scale text-to-image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00116","last_updated":"2024-12-30T19:30:40Z","snapshot_observed_at":"2026-08-11T14:47:30.980598Z","submitted_at":"2024-12-30T19:30:40Z","title":"Text-to-Image GAN with Pretrained Representations","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:13.708303Z"},"links":{"cited_paper":"/paper/2301.09515","citing_paper":"/paper/2501.00116"},"observation_digest":"sha256:d1b6c8ac9039ab0bbf65e097fdff1b1c557a460f7482662678c39e2ddfc44311","observation_id":"b0ea2a9a-1d93-4b69-a8ff-c681fcd12386","resolution":{"observed_at":"2026-08-10T23:05:13.708303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:14.027509Z","title":"A u-net based discriminator for generative adversarial networks","venue":null,"work_id":"88afed18-df7b-49f9-84e3-cd50bbabcfb0","year":2020},"citing_paper":{"arxiv_id":"2501.00116","last_updated":"2024-12-30T19:30:40Z","snapshot_observed_at":"2026-08-11T14:47:30.980598Z","submitted_at":"2024-12-30T19:30:40Z","title":"Text-to-Image GAN with Pretrained Representations","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:13.712162Z"},"links":{"citing_paper":"/paper/2501.00116"},"observation_digest":"sha256:c2378fa4a1e36d6eae5713114cce5d8fd2001d2413961099e0d527467aad7847","observation_id":"814d71cb-2a3d-4482-8c26-652d81d3dce6","resolution":{"observed_at":"2026-08-10T23:05:14.031529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:14.000902Z","title":"Rethinking the inception architecture for computer vision","venue":null,"work_id":"f3c150a9-4c09-42fe-8876-de5b80615832","year":2016},"citing_paper":{"arxiv_id":"2501.00116","last_updated":"2024-12-30T19:30:40Z","snapshot_observed_at":"2026-08-11T14:47:30.980598Z","submitted_at":"2024-12-30T19:30:40Z","title":"Text-to-Image GAN with Pretrained Representations","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:13.719714Z"},"links":{"citing_paper":"/paper/2501.00116"},"observation_digest":"sha256:965f507e8e6216455c9b28aea958d1936f6ecea5ec690f01baa4059fd7297f08","observation_id":"f97a4185-e806-4422-87a1-9ff52377bc3d","resolution":{"observed_at":"2026-08-10T23:05:14.006449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2008.05865","last_updated":"2022-10-15T03:51:50Z","snapshot_observed_at":"2026-07-06T09:46:54.764203Z","submitted_at":"2020-08-13T12:51:17Z","title":"DF-GAN: A Simple and Effective Baseline for Text-to-Image Synthesis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.05865","snapshot_observed_at":"2026-08-10T23:05:13.723351Z","title":"Df-gan: Deep fusion generative adversarial networks for text-to- image synthesis","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.00116","last_updated":"2024-12-30T19:30:40Z","snapshot_observed_at":"2026-08-11T14:47:30.980598Z","submitted_at":"2024-12-30T19:30:40Z","title":"Text-to-Image GAN with Pretrained Representations","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:13.723351Z"},"links":{"cited_paper":"/paper/2008.05865","citing_paper":"/paper/2501.00116"},"observation_digest":"sha256:92b87fd972f4785d58fdd41ed92ae3cfef47ca0a725f14df9a13a16f0ad4e19b","observation_id":"6dcf9b75-964c-4cd8-8e0f-6bb1b6e8e465","resolution":{"observed_at":"2026-08-10T23:05:13.723351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:13.988563Z","title":"Df-gan: A sim- ple and effective baseline for text-to-image synthesis","venue":null,"work_id":"df79f0d0-87ce-42bb-988b-98fe984625a8","year":2022},"citing_paper":{"arxiv_id":"2501.00116","last_updated":"2024-12-30T19:30:40Z","snapshot_observed_at":"2026-08-11T14:47:30.980598Z","submitted_at":"2024-12-30T19:30:40Z","title":"Text-to-Image GAN with Pretrained Representations","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:13.727550Z"},"links":{"citing_paper":"/paper/2501.00116"},"observation_digest":"sha256:29cf94555656b346101b8890c415b9d6b0b81e5f0da2beb48faa5242f355a4ac","observation_id":"24a7397c-6fb6-4913-b5f0-31f89178565a","resolution":{"observed_at":"2026-08-10T23:05:13.993022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:13.976322Z","title":"Galip: Generative adversarial clips for text-to-image synthesis","venue":null,"work_id":"571a5542-1e12-4a13-b4d0-8695d941a331","year":2023},"citing_paper":{"arxiv_id":"2501.00116","last_updated":"2024-12-30T19:30:40Z","snapshot_observed_at":"2026-08-11T14:47:30.980598Z","submitted_at":"2024-12-30T19:30:40Z","title":"Text-to-Image GAN with Pretrained Representations","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:13.731048Z"},"links":{"citing_paper":"/paper/2501.00116"},"observation_digest":"sha256:399880710cd4a95bf2aa7f0d5a340457d7d214e0c91e0caad49b4cac6c4f5412","observation_id":"110197b5-837f-4f0e-b834-28330ad1f918","resolution":{"observed_at":"2026-08-10T23:05:13.980588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:13.735073Z","title":"The caltech- ucsd birds-200-2011 dataset","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2501.00116","last_updated":"2024-12-30T19:30:40Z","snapshot_observed_at":"2026-08-11T14:47:30.980598Z","submitted_at":"2024-12-30T19:30:40Z","title":"Text-to-Image GAN with Pretrained Representations","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:13.735073Z"},"links":{"citing_paper":"/paper/2501.00116"},"observation_digest":"sha256:551909c91db72d315e789167259e78ec5a56aeca4c56877a9b086503193527c0","observation_id":"4d09ad61-9cd6-4287-b466-1b90c5c44dea","resolution":{"observed_at":"2026-08-10T23:05:13.735073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-10T23:05:13.746565Z","title":"Scaling autoregressive models for content-rich text-to-image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.00116","last_updated":"2024-12-30T19:30:40Z","snapshot_observed_at":"2026-08-11T14:47:30.980598Z","submitted_at":"2024-12-30T19:30:40Z","title":"Text-to-Image GAN with Pretrained Representations","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:13.746565Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2501.00116"},"observation_digest":"sha256:c13e44bc13d4a230e6488a62617f5834096b0b99c16f431a4e893c706b8dbe79","observation_id":"5f838876-fc7a-4165-a8d3-daadcbbee38b","resolution":{"observed_at":"2026-08-10T23:05:13.746565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:13.943360Z","title":"Stackgan: Text to photo-realistic image synthesis with stacked generative adversarial net- works","venue":null,"work_id":"4c844d92-b0cf-4e30-b398-f17176510419","year":2017},"citing_paper":{"arxiv_id":"2501.00116","last_updated":"2024-12-30T19:30:40Z","snapshot_observed_at":"2026-08-11T14:47:30.980598Z","submitted_at":"2024-12-30T19:30:40Z","title":"Text-to-Image GAN with Pretrained Representations","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:13.750457Z"},"links":{"citing_paper":"/paper/2501.00116"},"observation_digest":"sha256:3bc9bc15b808ad7a79ee31b5d832a0e959bac7660bf475925ff01c6f78f461b5","observation_id":"bcf619f7-0b44-44b7-acf6-ff1b5dfe99ef","resolution":{"observed_at":"2026-08-10T23:05:13.947543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:13.931392Z","title":"Cross-modal contrastive learning for text-to-image generation","venue":null,"work_id":"b5cf581b-9089-4a2f-92df-2d3e50f8e789","year":2021},"citing_paper":{"arxiv_id":"2501.00116","last_updated":"2024-12-30T19:30:40Z","snapshot_observed_at":"2026-08-11T14:47:30.980598Z","submitted_at":"2024-12-30T19:30:40Z","title":"Text-to-Image GAN with Pretrained Representations","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:13.754269Z"},"links":{"citing_paper":"/paper/2501.00116"},"observation_digest":"sha256:27cffdf5bf3d852c527630caa06f355cc31b3a9f90e05df9fd39a5b09f1446cc","observation_id":"128167e9-246d-4cd2-83e9-605abd4a87a8","resolution":{"observed_at":"2026-08-10T23:05:13.935491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:13.919479Z","title":"Towards language-free training for text-to-image generation","venue":null,"work_id":"a4a827f4-b938-4ace-b06a-1e53a0c29a5f","year":2022},"citing_paper":{"arxiv_id":"2501.00116","last_updated":"2024-12-30T19:30:40Z","snapshot_observed_at":"2026-08-11T14:47:30.980598Z","submitted_at":"2024-12-30T19:30:40Z","title":"Text-to-Image GAN with Pretrained Representations","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:13.758050Z"},"links":{"citing_paper":"/paper/2501.00116"},"observation_digest":"sha256:30fbdb9b586fef82a53350ce27c763f9b4f1e88ab5607b66265977721b3f896f","observation_id":"9d200783-fe63-4da7-aa6e-a234037c3619","resolution":{"observed_at":"2026-08-10T23:05:13.923514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:13.907209Z","title":"Dm-gan: Dynamic memory generative adversar- ial networks for text-to-image synthesis","venue":null,"work_id":"a6ccd28e-3097-460e-898b-81c20f540f27","year":2019},"citing_paper":{"arxiv_id":"2501.00116","last_updated":"2024-12-30T19:30:40Z","snapshot_observed_at":"2026-08-11T14:47:30.980598Z","submitted_at":"2024-12-30T19:30:40Z","title":"Text-to-Image GAN with Pretrained Representations","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:13.761523Z"},"links":{"citing_paper":"/paper/2501.00116"},"observation_digest":"sha256:e3e2af310cc5538cdcaf1f122f578e984e2fc8786622d48e7d333a6b94f18e46","observation_id":"41e3ad65-0747-4ae3-bfac-2a1f012fa4cf","resolution":{"observed_at":"2026-08-10T23:05:13.911501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:13.955539Z","title":"Attngan: Fine-grained text to image gener- ation with attentional generative adversarial networks","venue":null,"work_id":"828e7266-ab7c-423b-b070-8fd0871d21cc","year":2018},"citing_paper":{"arxiv_id":"2501.00116","last_updated":"2024-12-30T19:30:40Z","snapshot_observed_at":"2026-08-11T14:47:30.980598Z","submitted_at":"2024-12-30T19:30:40Z","title":"Text-to-Image GAN with Pretrained Representations","version":1},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:13.738750Z"},"links":{"citing_paper":"/paper/2501.00116"},"observation_digest":"sha256:388880064cda992f317186669cd156a6b15467d656392868bf8a18d6be7d03b2","observation_id":"5a8bd889-0829-4eb2-b797-577fe4322d3f","resolution":{"observed_at":"2026-08-10T23:05:13.960113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:14.144736Z","title":"Ensembling off-the-shelf models for gan training","venue":null,"work_id":"0eb469ce-c62a-4764-bb62-d6d36edb5274","year":2022},"citing_paper":{"arxiv_id":"2501.00116","last_updated":"2024-12-30T19:30:40Z","snapshot_observed_at":"2026-08-11T14:47:30.980598Z","submitted_at":"2024-12-30T19:30:40Z","title":"Text-to-Image GAN with Pretrained Representations","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:13.659075Z"},"links":{"citing_paper":"/paper/2501.00116"},"observation_digest":"sha256:06cdf1b77707883726ab160c140795c42c501d249f4c073a589f2f5f639313cb","observation_id":"bd425ebe-73ba-4dea-8fc3-f7c2b51c572c","resolution":{"observed_at":"2026-08-10T23:05:14.149185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:14.158050Z","title":"Kingma and Max Welling","venue":null,"work_id":"7b690423-9c76-4d0e-a0cf-311f3e3e04a3","year":2014},"citing_paper":{"arxiv_id":"2501.00116","last_updated":"2024-12-30T19:30:40Z","snapshot_observed_at":"2026-08-11T14:47:30.980598Z","submitted_at":"2024-12-30T19:30:40Z","title":"Text-to-Image GAN with Pretrained Representations","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:13.655501Z"},"links":{"citing_paper":"/paper/2501.00116"},"observation_digest":"sha256:e8cb6716ed9526249874699f8e51f218d202cdd55b6543d5ba611b6b105ab49e","observation_id":"3eba33bc-3ad8-428b-b139-53a5b3281c0e","resolution":{"observed_at":"2026-08-10T23:05:14.161963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:13.693658Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.00116","last_updated":"2024-12-30T19:30:40Z","snapshot_observed_at":"2026-08-11T14:47:30.980598Z","submitted_at":"2024-12-30T19:30:40Z","title":"Text-to-Image GAN with Pretrained Representations","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:13.693658Z"},"links":{"citing_paper":"/paper/2501.00116"},"observation_digest":"sha256:402911f05e9e36fda760bf04a5f36a6f62fb3c5854a302785ea29662dc149f5e","observation_id":"2e2f5d08-944c-4fda-878c-c240ffd4adc6","resolution":{"observed_at":"2026-08-10T23:05:13.693658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:14.180658Z","title":"Scaling up gans for text-to-image syn- thesis","venue":null,"work_id":"ef552b7b-2356-4b00-9c98-ce4987cd3fda","year":2023},"citing_paper":{"arxiv_id":"2501.00116","last_updated":"2024-12-30T19:30:40Z","snapshot_observed_at":"2026-08-11T14:47:30.980598Z","submitted_at":"2024-12-30T19:30:40Z","title":"Text-to-Image GAN with Pretrained Representations","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:13.647903Z"},"links":{"citing_paper":"/paper/2501.00116"},"observation_digest":"sha256:d8559907edd836d73c1d79a5d67036651e3f8647e085318b61c58bbd2d4133be","observation_id":"4527565c-84a1-4de4-b384-a9269c9702ca","resolution":{"observed_at":"2026-08-10T23:05:14.184632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.10482","last_updated":"2022-04-22T03:49:47Z","snapshot_observed_at":"2026-08-08T13:00:59.809206Z","submitted_at":"2022-04-22T03:49:47Z","title":"Recurrent Affine Transformation for Text-to-image Synthesis","version":1},"cited_work":{"arxiv_id":"2204.10482","doi":null,"metadata_source":"pith","pith_arxiv_id":"2204.10482","snapshot_observed_at":"2026-08-10T23:05:13.805575Z","title":"Recurrent Affine Transformation for Text-to-image Synthesis","venue":"cs.CV","work_id":"e65e54e3-af0b-4cb2-93fa-2a8ec29616a8","year":2022},"citing_paper":{"arxiv_id":"2501.00116","last_updated":"2024-12-30T19:30:40Z","snapshot_observed_at":"2026-08-11T14:47:30.980598Z","submitted_at":"2024-12-30T19:30:40Z","title":"Text-to-Image GAN with Pretrained Representations","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:13.742488Z"},"links":{"cited_paper":"/paper/2204.10482","citing_paper":"/paper/2501.00116"},"observation_digest":"sha256:1f870d1bfff1def1dfc9c88409964e76f0472e646f5053b0a249aec966b3c02e","observation_id":"0070fa8d-8bef-4c3f-af4b-52811b3ef965","resolution":{"observed_at":"2026-08-10T23:05:13.812195Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:14.015411Z","title":"Very deep convolutional networks for large-scale image recognition","venue":null,"work_id":"adb96427-8a8d-4d05-adc6-172b73665e18","year":2015},"citing_paper":{"arxiv_id":"2501.00116","last_updated":"2024-12-30T19:30:40Z","snapshot_observed_at":"2026-08-11T14:47:30.980598Z","submitted_at":"2024-12-30T19:30:40Z","title":"Text-to-Image GAN with Pretrained Representations","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:13.716024Z"},"links":{"citing_paper":"/paper/2501.00116"},"observation_digest":"sha256:f0b85dfc492b6f7bfe4cd668a7e095f191b97b2abdfe0456565c5bcb66fe9f93","observation_id":"0056adfe-e962-4abe-8ef7-ad7578c15ae1","resolution":{"observed_at":"2026-08-10T23:05:14.019723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-10T23:05:13.618967Z","title":"Muse: Text-to-image generation via masked generative transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00116","last_updated":"2024-12-30T19:30:40Z","snapshot_observed_at":"2026-08-11T14:47:30.980598Z","submitted_at":"2024-12-30T19:30:40Z","title":"Text-to-Image GAN with Pretrained Representations","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:13.618967Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2501.00116"},"observation_digest":"sha256:19308214a6f36e1fb54437ab0d725b67b973783e60b027ff6120d01010cd04c0","observation_id":"c4d75ffb-116f-45f4-8bfa-3b25bbf55808","resolution":{"observed_at":"2026-08-10T23:05:13.618967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:14.249943Z","title":"Emerging properties in self-supervised vi- sion transformers","venue":null,"work_id":"3d3dea72-128a-406c-af2e-9a32501ef67a","year":2021},"citing_paper":{"arxiv_id":"2501.00116","last_updated":"2024-12-30T19:30:40Z","snapshot_observed_at":"2026-08-11T14:47:30.980598Z","submitted_at":"2024-12-30T19:30:40Z","title":"Text-to-Image GAN with Pretrained Representations","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:13.614939Z"},"links":{"citing_paper":"/paper/2501.00116"},"observation_digest":"sha256:a5ce6d901cfe916226712c9e226e62ba1e8566030c57e23c7f8902a6903f2c22","observation_id":"f9e7bacb-afcb-4f1c-8332-407e25eaf35a","resolution":{"observed_at":"2026-08-10T23:05:14.254006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:14.238724Z","title":"Conceptual 12m: Pushing web-scale image-text pre-training to recognize long-tail visual concepts","venue":null,"work_id":"9b12fa0a-ad80-4b48-a6b8-aaf0e4603a50","year":2021},"citing_paper":{"arxiv_id":"2501.00116","last_updated":"2024-12-30T19:30:40Z","snapshot_observed_at":"2026-08-11T14:47:30.980598Z","submitted_at":"2024-12-30T19:30:40Z","title":"Text-to-Image GAN with Pretrained Representations","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:13.623757Z"},"links":{"citing_paper":"/paper/2501.00116"},"observation_digest":"sha256:f7184d416a3ec3cf4a9f927c9ec3cc39409404a039a631c16c72271a58db5174","observation_id":"e88b32fd-2844-4386-a6c3-8a9a7621ba4c","resolution":{"observed_at":"2026-08-10T23:05:14.242531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.00116","last_updated":"2024-12-30T19:30:40Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T14:47:30.980598Z","submitted_at":"2024-12-30T19:30:40Z","title":"Text-to-Image GAN with Pretrained Representations"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":1,"verified_fuzzy":28},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2501.00116."}