{"as_of":"2026-08-18T14:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:24947e5ee6c7fa3a0c45e87d8ea91c92bc158e5f426aee97df8cee39ec7dbcca","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T15:09:40.133207Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.01507/citation-record","integrity":"/paper/2502.01507/integrity","json":"/paper/2502.01507/citation-record.json","paper":"/paper/2502.01507"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1810.01365","last_updated":"2019-05-02T07:20:50Z","snapshot_observed_at":"2026-08-14T18:20:27.927813Z","submitted_at":"2018-10-02T16:50:28Z","title":"On Self Modulation for Generative Adversarial Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.01365","snapshot_observed_at":"2026-08-09T15:09:39.990669Z","title":"Jun Cheng, Fuxiang Wu, Yanling Tian, Lei Wang, and Dapeng Tao","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01507","last_updated":"2025-02-03T16:40:47Z","snapshot_observed_at":"2026-08-18T05:03:09.237922Z","submitted_at":"2025-02-03T16:40:47Z","title":"End-to-end Training for Text-to-Image Synthesis using Dual-Text Embeddings","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-09T15:09:39.990669Z"},"links":{"cited_paper":"/paper/1810.01365","citing_paper":"/paper/2502.01507"},"observation_digest":"sha256:7d384670d01e8febae89a375f33e6baf71717569d204c41565de73fb0dc2478b","observation_id":"f3215e4f-506e-4fc5-8f3c-05c1bc892410","resolution":{"observed_at":"2026-08-09T15:09:39.990669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09841","last_updated":"2021-06-23T16:07:21Z","snapshot_observed_at":"2026-08-16T18:57:41.827625Z","submitted_at":"2020-12-17T18:57:28Z","title":"Taming Transformers for High-Resolution Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.09841","snapshot_observed_at":"2026-08-09T15:09:40.008399Z","title":"13 Oran Gafni, Adam Polyak, Oron Ashual, Shelly Sheynin, Devi Parikh, and Yaniv Taigman","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2502.01507","last_updated":"2025-02-03T16:40:47Z","snapshot_observed_at":"2026-08-18T05:03:09.237922Z","submitted_at":"2025-02-03T16:40:47Z","title":"End-to-end Training for Text-to-Image Synthesis using Dual-Text Embeddings","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-09T15:09:40.008399Z"},"links":{"cited_paper":"/paper/2012.09841","citing_paper":"/paper/2502.01507"},"observation_digest":"sha256:f2db366e6a4763002a5bec4f50ec1e1dbdfda9da1889fb0464c690b76911b531","observation_id":"c8a1d4cf-c7cb-417c-9ffb-036654322eac","resolution":{"observed_at":"2026-08-09T15:09:40.008399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:09:41.020598Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":"a76755dc-6123-405b-9dd4-5bd963fba723","year":2015},"citing_paper":{"arxiv_id":"2502.01507","last_updated":"2025-02-03T16:40:47Z","snapshot_observed_at":"2026-08-18T05:03:09.237922Z","submitted_at":"2025-02-03T16:40:47Z","title":"End-to-end Training for Text-to-Image Synthesis using Dual-Text Embeddings","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-09T15:09:40.013198Z"},"links":{"citing_paper":"/paper/2502.01507"},"observation_digest":"sha256:e929e773a2a502f29d565727a3da332be13cf25c03977563617895eb8cb419cb","observation_id":"4a7c5f4d-5c57-4048-93dc-05b7f04dc878","resolution":{"observed_at":"2026-08-09T15:09:41.024593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:09:41.007644Z","title":null,"venue":null,"work_id":"f953a94d-3675-4d5a-aaad-fb38c96fa403","year":2020},"citing_paper":{"arxiv_id":"2502.01507","last_updated":"2025-02-03T16:40:47Z","snapshot_observed_at":"2026-08-18T05:03:09.237922Z","submitted_at":"2025-02-03T16:40:47Z","title":"End-to-end Training for Text-to-Image Synthesis using Dual-Text Embeddings","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-09T15:09:40.025480Z"},"links":{"citing_paper":"/paper/2502.01507"},"observation_digest":"sha256:d637686d55df110ad402d53c0f535bcd2dfb8def5d3bb90d9af7ca8605d65702","observation_id":"2e47f44b-ddd7-4da9-96b7-be14f2dd00b2","resolution":{"observed_at":"2026-08-09T15:09:41.011812Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.09672","last_updated":"2021-02-18T23:44:17Z","snapshot_observed_at":"2026-08-17T08:18:36.930250Z","submitted_at":"2021-02-18T23:44:17Z","title":"Improved Denoising Diffusion Probabilistic Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.09672","snapshot_observed_at":"2026-08-09T15:09:40.036150Z","title":"Maria-Elena Nilsback and Andrew Zisserman","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01507","last_updated":"2025-02-03T16:40:47Z","snapshot_observed_at":"2026-08-18T05:03:09.237922Z","submitted_at":"2025-02-03T16:40:47Z","title":"End-to-end Training for Text-to-Image Synthesis using Dual-Text Embeddings","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-09T15:09:40.036150Z"},"links":{"cited_paper":"/paper/2102.09672","citing_paper":"/paper/2502.01507"},"observation_digest":"sha256:7adc68320b0ca1910c0d7afe549768838192d8979793b891cb1acad06aa81474","observation_id":"fa88d0c9-2cf5-448b-abe1-22a5be1f69e9","resolution":{"observed_at":"2026-08-09T15:09:40.036150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-09T15:09:40.041613Z","title":"Aditya Ramesh, Mikhail Pavlov, Gabriel Goh, Scott Gray, Chelsea Voss, Alec Radford, Mark Chen, and Ilya Sutskever","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01507","last_updated":"2025-02-03T16:40:47Z","snapshot_observed_at":"2026-08-18T05:03:09.237922Z","submitted_at":"2025-02-03T16:40:47Z","title":"End-to-end Training for Text-to-Image Synthesis using Dual-Text Embeddings","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-09T15:09:40.041613Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2502.01507"},"observation_digest":"sha256:ec12994589f25e60ec4f2982deb7d51b5098c7203a014a022cf05ba800d2afe7","observation_id":"8055126c-7d78-451d-b5a6-0e94e67a1838","resolution":{"observed_at":"2026-08-09T15:09:40.041613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-09T15:09:40.047361Z","title":"Aditya Ramesh, Prafulla Dhariwal, Alex Nichol, Casey Chu, and Mark Chen","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01507","last_updated":"2025-02-03T16:40:47Z","snapshot_observed_at":"2026-08-18T05:03:09.237922Z","submitted_at":"2025-02-03T16:40:47Z","title":"End-to-end Training for Text-to-Image Synthesis using Dual-Text Embeddings","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-09T15:09:40.047361Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2502.01507"},"observation_digest":"sha256:65123520ec9817a93992b37de78a04cf289f4b6de209867cbc08f5a59db4c417","observation_id":"9e2e35ea-cd90-488c-9099-f03f4104af40","resolution":{"observed_at":"2026-08-09T15:09:40.047361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-08-15T12:50:58.405488Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-09T15:09:40.053774Z","title":"Ali Razavi, Aaron van den Oord, and Oriol Vinyals","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01507","last_updated":"2025-02-03T16:40:47Z","snapshot_observed_at":"2026-08-18T05:03:09.237922Z","submitted_at":"2025-02-03T16:40:47Z","title":"End-to-end Training for Text-to-Image Synthesis using Dual-Text Embeddings","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-09T15:09:40.053774Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2502.01507"},"observation_digest":"sha256:b945df063b5b2c16aa8f6e588fefb14f1058339af455ee5e5a23038794164642","observation_id":"46db79fc-cf05-461a-bad3-675e83439521","resolution":{"observed_at":"2026-08-09T15:09:40.053774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11487","last_updated":"2022-05-23T17:42:53Z","snapshot_observed_at":"2026-08-17T05:51:02.087480Z","submitted_at":"2022-05-23T17:42:53Z","title":"Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.11487","snapshot_observed_at":"2026-08-09T15:09:40.060578Z","title":"Tim Salimans, Ian Goodfellow, Wojciech Zaremba, Vicki Cheung, Alec Radford, and Xi Chen","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01507","last_updated":"2025-02-03T16:40:47Z","snapshot_observed_at":"2026-08-18T05:03:09.237922Z","submitted_at":"2025-02-03T16:40:47Z","title":"End-to-end Training for Text-to-Image Synthesis using Dual-Text Embeddings","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-09T15:09:40.060578Z"},"links":{"cited_paper":"/paper/2205.11487","citing_paper":"/paper/2502.01507"},"observation_digest":"sha256:52c20115f0040205eb8bca883a2f91c80f707c66c53fa0323d86bfd4fab5bbf9","observation_id":"68f6f8c4-9123-4e5e-8a14-5023ddf4ba3d","resolution":{"observed_at":"2026-08-09T15:09:40.060578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2020.30267","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:09:40.649925Z","title":"Hongchen Tan, Xiuping Liu, Baocai Yin, and Xin Li","venue":null,"work_id":"7c7a773d-9624-4e90-ac11-e9cd7f679b1e","year":2020},"citing_paper":{"arxiv_id":"2502.01507","last_updated":"2025-02-03T16:40:47Z","snapshot_observed_at":"2026-08-18T05:03:09.237922Z","submitted_at":"2025-02-03T16:40:47Z","title":"End-to-end Training for Text-to-Image Synthesis using Dual-Text Embeddings","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-09T15:09:40.070944Z"},"links":{"citing_paper":"/paper/2502.01507"},"observation_digest":"sha256:1847faa5f253ed1fcad73717ce7891d31878bef30d46fb708a67ed351082b188","observation_id":"8f344a35-0309-444e-be54-25cd62c70348","resolution":{"observed_at":"2026-08-09T15:09:40.660278Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2020.92772","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:09:40.463508Z","title":"Ming Tao, Hao Tang, Fei Wu, Xiao-Yuan Jing, Bing-Kun Bao, and Changsheng Xu","venue":null,"work_id":"cde1f203-a41a-4537-84ff-7ab6609a7ea3","year":2020},"citing_paper":{"arxiv_id":"2502.01507","last_updated":"2025-02-03T16:40:47Z","snapshot_observed_at":"2026-08-18T05:03:09.237922Z","submitted_at":"2025-02-03T16:40:47Z","title":"End-to-end Training for Text-to-Image Synthesis using Dual-Text Embeddings","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-09T15:09:40.075955Z"},"links":{"citing_paper":"/paper/2502.01507"},"observation_digest":"sha256:49d466ca07544533ef55e14cbdd95edc4d7ab93c1fe4d8e4edeee0ab4f033077","observation_id":"5ae53ed8-16f6-448b-83c1-584f3eefff29","resolution":{"observed_at":"2026-08-09T15:09:40.470829Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2018.28562","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:09:40.296168Z","title":"Stackgan++: Realistic image synthesis with stacked generative adversarial networks.IEEE Transactions on Pattern Analysis and Machine Intelligence, PP, 10 2017a","venue":null,"work_id":"f9f1f2f9-bb1b-4b7c-ad92-470eeaf3cca1","year":null},"citing_paper":{"arxiv_id":"2502.01507","last_updated":"2025-02-03T16:40:47Z","snapshot_observed_at":"2026-08-18T05:03:09.237922Z","submitted_at":"2025-02-03T16:40:47Z","title":"End-to-end Training for Text-to-Image Synthesis using Dual-Text Embeddings","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-09T15:09:40.095194Z"},"links":{"citing_paper":"/paper/2502.01507"},"observation_digest":"sha256:a4fcb4e62d495d8133120bffa0d6e0defb8e0a8ec40fd3cfcfa8466d9a62b1a3","observation_id":"5f97429b-964d-4103-925f-ff79a3d192a7","resolution":{"observed_at":"2026-08-09T15:09:40.303796Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.02709","last_updated":"2020-11-21T23:59:25Z","snapshot_observed_at":"2026-08-16T19:07:58.262003Z","submitted_at":"2020-11-05T08:57:15Z","title":"DTGAN: Dual Attention Generative Adversarial Networks for Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":"2011.02709","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.02709","snapshot_observed_at":"2026-08-09T15:09:40.192609Z","title":"DTGAN: Dual Attention Generative Adversarial Networks for Text-to-Image Generation","venue":"cs.CV","work_id":"df5b100e-63f0-4f6d-b4b9-bcd02897af21","year":2020},"citing_paper":{"arxiv_id":"2502.01507","last_updated":"2025-02-03T16:40:47Z","snapshot_observed_at":"2026-08-18T05:03:09.237922Z","submitted_at":"2025-02-03T16:40:47Z","title":"End-to-end Training for Text-to-Image Synthesis using Dual-Text Embeddings","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T15:09:40.104617Z"},"links":{"cited_paper":"/paper/2011.02709","citing_paper":"/paper/2502.01507"},"observation_digest":"sha256:765e6f1d7577f7920be9123b0ef46783b9323e96387749b9dc8cfdaf202c30be","observation_id":"0388d8c0-82c0-4f68-b0af-c69aeca4e5b9","resolution":{"observed_at":"2026-08-09T15:09:40.199618Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:09:40.952192Z","title":null,"venue":null,"work_id":"1729dc35-fb7c-48fb-bf06-0d7947bb358a","year":2022},"citing_paper":{"arxiv_id":"2502.01507","last_updated":"2025-02-03T16:40:47Z","snapshot_observed_at":"2026-08-18T05:03:09.237922Z","submitted_at":"2025-02-03T16:40:47Z","title":"End-to-end Training for Text-to-Image Synthesis using Dual-Text Embeddings","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-09T15:09:40.114240Z"},"links":{"citing_paper":"/paper/2502.01507"},"observation_digest":"sha256:97bd43d2cab023f4a1d5b08afacc8766cc51c2ab9a2cfe170d11457aa0f4ba47","observation_id":"72174d50-2523-42e0-b648-b3f25a7799e9","resolution":{"observed_at":"2026-08-09T15:09:40.956566Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:09:40.938561Z","title":null,"venue":null,"work_id":"fc9ef8fb-473c-45a3-9862-87008469986c","year":1997},"citing_paper":{"arxiv_id":"2502.01507","last_updated":"2025-02-03T16:40:47Z","snapshot_observed_at":"2026-08-18T05:03:09.237922Z","submitted_at":"2025-02-03T16:40:47Z","title":"End-to-end Training for Text-to-Image Synthesis using Dual-Text Embeddings","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-09T15:09:40.119309Z"},"links":{"citing_paper":"/paper/2502.01507"},"observation_digest":"sha256:d1f59a377fc8a9296cd0d875d6d21144946d6c2c8323b079a8eb660df68d5a5a","observation_id":"016d377a-26ce-42c5-bb42-e930c41d6303","resolution":{"observed_at":"2026-08-09T15:09:40.942812Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:09:40.925719Z","title":"(2017) in both the generator and discriminator text encoders, and we have reported the results in Table","venue":null,"work_id":"03c1caec-7c81-488f-940e-f13cb2b0efdb","year":2017},"citing_paper":{"arxiv_id":"2502.01507","last_updated":"2025-02-03T16:40:47Z","snapshot_observed_at":"2026-08-18T05:03:09.237922Z","submitted_at":"2025-02-03T16:40:47Z","title":"End-to-end Training for Text-to-Image Synthesis using Dual-Text Embeddings","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-09T15:09:40.123539Z"},"links":{"citing_paper":"/paper/2502.01507"},"observation_digest":"sha256:f56c876da4df83559ed42e812735cbac2ab5c76871a0a49acc621d28b3f4375f","observation_id":"24bbd123-69ac-4daa-ae47-bceeaa9c6edc","resolution":{"observed_at":"2026-08-09T15:09:40.929814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:09:40.912107Z","title":"DTE-GAN architecture consists of a dual text embedding setup (Section C.1), a single-stage Generator (Section C.2) and a Discriminator (Section C.3)","venue":null,"work_id":"0059595f-5d27-48e0-b9f1-9c9fd21f1fdc","year":1997},"citing_paper":{"arxiv_id":"2502.01507","last_updated":"2025-02-03T16:40:47Z","snapshot_observed_at":"2026-08-18T05:03:09.237922Z","submitted_at":"2025-02-03T16:40:47Z","title":"End-to-end Training for Text-to-Image Synthesis using Dual-Text Embeddings","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-09T15:09:40.128871Z"},"links":{"citing_paper":"/paper/2502.01507"},"observation_digest":"sha256:068a3b997ff3770f4f1228100f2963ce83cd4b17bd5eacebdc3c47443c34e1b6","observation_id":"0c176c39-e431-42cf-a881-811d811fcbb8","resolution":{"observed_at":"2026-08-09T15:09:40.916217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:09:40.896777Z","title":null,"venue":null,"work_id":"7aecb7a2-9859-4db2-8756-54a3c322bd8d","year":2019},"citing_paper":{"arxiv_id":"2502.01507","last_updated":"2025-02-03T16:40:47Z","snapshot_observed_at":"2026-08-18T05:03:09.237922Z","submitted_at":"2025-02-03T16:40:47Z","title":"End-to-end Training for Text-to-Image Synthesis using Dual-Text Embeddings","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-09T15:09:40.133207Z"},"links":{"citing_paper":"/paper/2502.01507"},"observation_digest":"sha256:9d46cf6d3b3fcbc45d269407d5365854340cd72556f90539ebc3f739bab58722","observation_id":"7813a44a-2f30-46b4-ae49-753246fa49e1","resolution":{"observed_at":"2026-08-09T15:09:40.901812Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:09:40.966936Z","title":null,"venue":null,"work_id":"14a80687-1f1e-483b-80ca-2ac71101f21d","year":2010},"citing_paper":{"arxiv_id":"2502.01507","last_updated":"2025-02-03T16:40:47Z","snapshot_observed_at":"2026-08-18T05:03:09.237922Z","submitted_at":"2025-02-03T16:40:47Z","title":"End-to-end Training for Text-to-Image Synthesis using Dual-Text Embeddings","version":1},"reference_index":200,"source":"pdf_text","source_observed_at":"2026-08-09T15:09:40.085888Z"},"links":{"citing_paper":"/paper/2502.01507"},"observation_digest":"sha256:cd9746bac8dab651999a13add9f85e6d64c1bb102980bd0a45a2cc7da90f6f42","observation_id":"d6ce2c94-f544-4b88-9642-aaefcdef79e8","resolution":{"observed_at":"2026-08-09T15:09:40.971967Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:09:40.065823Z","title":"Jascha Sohl-Dickstein, Eric Weiss, Niru Maheswaranathan, and Surya Ganguli","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01507","last_updated":"2025-02-03T16:40:47Z","snapshot_observed_at":"2026-08-18T05:03:09.237922Z","submitted_at":"2025-02-03T16:40:47Z","title":"End-to-end Training for Text-to-Image Synthesis using Dual-Text Embeddings","version":1},"reference_index":1997,"source":"pdf_text","source_observed_at":"2026-08-09T15:09:40.065823Z"},"links":{"citing_paper":"/paper/2502.01507"},"observation_digest":"sha256:f632de1b5ded112ea8b9306a75458d45ccc676cf433d2750868e808506ce4432","observation_id":"5a78daf9-2ed3-4f5c-becb-054bb803caf8","resolution":{"observed_at":"2026-08-09T15:09:40.065823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-17T19:26:44.032537Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-09T15:09:40.018768Z","title":"Alex Krizhevsky","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01507","last_updated":"2025-02-03T16:40:47Z","snapshot_observed_at":"2026-08-18T05:03:09.237922Z","submitted_at":"2025-02-03T16:40:47Z","title":"End-to-end Training for Text-to-Image Synthesis using Dual-Text Embeddings","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-09T15:09:40.018768Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2502.01507"},"observation_digest":"sha256:f2621408217eb0d2988d289ae73623239d8b6fbeaee3b3359e3c16d8b5c9873d","observation_id":"f248ba16-c3a5-47f1-81dc-5ef761925251","resolution":{"observed_at":"2026-08-09T15:09:40.018768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:09:40.981587Z","title":null,"venue":null,"work_id":"bb177be8-da28-4a5c-8992-a7cd1d3fecff","year":2017},"citing_paper":{"arxiv_id":"2502.01507","last_updated":"2025-02-03T16:40:47Z","snapshot_observed_at":"2026-08-18T05:03:09.237922Z","submitted_at":"2025-02-03T16:40:47Z","title":"End-to-end Training for Text-to-Image Synthesis using Dual-Text Embeddings","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-09T15:09:40.081152Z"},"links":{"citing_paper":"/paper/2502.01507"},"observation_digest":"sha256:8f9bd83b4ce98b1ada42ffea09adf6227ff4ae813213ea80c030328e6b7f2de3","observation_id":"8e454184-18d3-4f51-b140-d03d0c906f42","resolution":{"observed_at":"2026-08-09T15:09:40.985254Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.13792","last_updated":"2022-03-24T04:14:56Z","snapshot_observed_at":"2026-08-16T17:39:01.190207Z","submitted_at":"2021-11-27T01:54:45Z","title":"LAFITE: Towards Language-Free Training for Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.13792","snapshot_observed_at":"2026-08-09T15:09:40.109640Z","title":"Lafite: Towards language-free training for text-to-image generation.arXiv preprint arXiv:2111.13792,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01507","last_updated":"2025-02-03T16:40:47Z","snapshot_observed_at":"2026-08-18T05:03:09.237922Z","submitted_at":"2025-02-03T16:40:47Z","title":"End-to-end Training for Text-to-Image Synthesis using Dual-Text Embeddings","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-09T15:09:40.109640Z"},"links":{"cited_paper":"/paper/2111.13792","citing_paper":"/paper/2502.01507"},"observation_digest":"sha256:727f373e937f92b4513f840cfddd3f3d17d0e5239a09690a454f18e9ac805812","observation_id":"429c2cb4-ef7b-479d-bf4b-5d3d4a18532a","resolution":{"observed_at":"2026-08-09T15:09:40.109640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:09:39.985250Z","title":"Ting Chen, Mario Lučić, Neil Houlsby, and Sylvain Gelly","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.01507","last_updated":"2025-02-03T16:40:47Z","snapshot_observed_at":"2026-08-18T05:03:09.237922Z","submitted_at":"2025-02-03T16:40:47Z","title":"End-to-end Training for Text-to-Image Synthesis using Dual-Text Embeddings","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-09T15:09:39.985250Z"},"links":{"citing_paper":"/paper/2502.01507"},"observation_digest":"sha256:f70e1c722fd051e2141fe78053711d0598a7373fa1471f98d03b4cb83db7e685","observation_id":"0fdaf98d-cd19-4f03-a75d-af131a256f1b","resolution":{"observed_at":"2026-08-09T15:09:39.985250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:09:40.792597Z","title":"Ayushman Dash, John Cristian Borges Gamboa, Sheraz Ahmed, Marcus Liwicki, and Muhammad Zeshan Afzal","venue":null,"work_id":"293bb443-dd0d-4a07-b61d-786b5e20dbc2","year":2020},"citing_paper":{"arxiv_id":"2502.01507","last_updated":"2025-02-03T16:40:47Z","snapshot_observed_at":"2026-08-18T05:03:09.237922Z","submitted_at":"2025-02-03T16:40:47Z","title":"End-to-end Training for Text-to-Image Synthesis using Dual-Text Embeddings","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-09T15:09:39.995772Z"},"links":{"citing_paper":"/paper/2502.01507"},"observation_digest":"sha256:27fd37724bad1c1a0fa5b91501515a65e269d10519a311b2ba9104d3f62b20a5","observation_id":"6cf6328c-c1e6-4189-bd6f-27cf470bee94","resolution":{"observed_at":"2026-08-09T15:09:40.797703Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:09:40.994271Z","title":"Lawrence Zitnick","venue":null,"work_id":"93c13f40-c7c7-48fe-93b4-1d7fdac9b73b","year":2014},"citing_paper":{"arxiv_id":"2502.01507","last_updated":"2025-02-03T16:40:47Z","snapshot_observed_at":"2026-08-18T05:03:09.237922Z","submitted_at":"2025-02-03T16:40:47Z","title":"End-to-end Training for Text-to-Image Synthesis using Dual-Text Embeddings","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-09T15:09:40.030996Z"},"links":{"citing_paper":"/paper/2502.01507"},"observation_digest":"sha256:0f95969414006ee5f356d2638aed82cc2e5e404028d036ad6d17a1693bedfa04","observation_id":"bb41dd06-7491-4981-8c0e-9c88b216d72d","resolution":{"observed_at":"2026-08-09T15:09:40.998624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:09:40.090251Z","title":"17 Guojun Yin, Bin Liu, Lu Sheng, Nenghai Yu, Xiaogang Wang, and Jing Shao","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01507","last_updated":"2025-02-03T16:40:47Z","snapshot_observed_at":"2026-08-18T05:03:09.237922Z","submitted_at":"2025-02-03T16:40:47Z","title":"End-to-end Training for Text-to-Image Synthesis using Dual-Text Embeddings","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-09T15:09:40.090251Z"},"links":{"citing_paper":"/paper/2502.01507"},"observation_digest":"sha256:2150cb789a707584e8e623aba36425bf0fe183d783abe31332f157f62eb4c044","observation_id":"7ddc4aff-d043-4aed-aff6-496dc141da1a","resolution":{"observed_at":"2026-08-09T15:09:40.090251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.01507","last_updated":"2025-02-03T16:40:47Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T05:03:09.237922Z","submitted_at":"2025-02-03T16:40:47Z","title":"End-to-end Training for Text-to-Image Synthesis using Dual-Text Embeddings"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":18,"verified_exact":1,"verified_fuzzy":4},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:2502.01507."}