{"as_of":"2026-08-14T19:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:42a1a9af847b92330fd8337432874e76aa59a7f055d61dd7d83995df46b664ab","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T19:04:58.940286Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.07196/citation-record","integrity":"/paper/2412.07196/integrity","json":"/paper/2412.07196/citation-record.json","paper":"/paper/2412.07196"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:04:59.889672Z","title":"In: Proceedings of the 27th International Conference on Neural Information Processing Systems (NIPS’14), pp","venue":null,"work_id":"8550b060-0e96-4e3c-bbfe-daaef6d879f7","year":2014},"citing_paper":{"arxiv_id":"2412.07196","last_updated":"2024-12-15T22:56:40Z","snapshot_observed_at":"2026-08-14T10:31:11.967110Z","submitted_at":"2024-12-10T05:09:52Z","title":"Fine-grained Text to Image Synthesis","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T19:04:58.674682Z"},"links":{"citing_paper":"/paper/2412.07196"},"observation_digest":"sha256:d65ee51ab9ae0d842fd112b31ce5a5cbe358c6d5fc4f1d36fee85e734bacf147","observation_id":"bdb77c0f-b1a6-4b75-a549-1f5e8fa0ecf5","resolution":{"observed_at":"2026-08-11T19:04:59.894958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:04:59.848393Z","title":"In: Balcan, M.F., Weinberger, K.Q","venue":null,"work_id":"8fb5c703-1336-45fd-bce5-40becbcb3557","year":2016},"citing_paper":{"arxiv_id":"2412.07196","last_updated":"2024-12-15T22:56:40Z","snapshot_observed_at":"2026-08-14T10:31:11.967110Z","submitted_at":"2024-12-10T05:09:52Z","title":"Fine-grained Text to Image Synthesis","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T19:04:58.685182Z"},"links":{"citing_paper":"/paper/2412.07196"},"observation_digest":"sha256:af7b0c0f4d670e8f0a20c35fadf028f5dbc2a05d423d990be3ca5e5d49b90423","observation_id":"4caa7884-3c6f-4679-b032-d9feea4c73da","resolution":{"observed_at":"2026-08-11T19:04:59.859491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:04:59.823467Z","title":"In: 2018 24th International Conference on Pattern Recognition (ICPR), pp","venue":null,"work_id":"3894a505-d898-4949-ba46-ede1575889c1","year":2018},"citing_paper":{"arxiv_id":"2412.07196","last_updated":"2024-12-15T22:56:40Z","snapshot_observed_at":"2026-08-14T10:31:11.967110Z","submitted_at":"2024-12-10T05:09:52Z","title":"Fine-grained Text to Image Synthesis","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T19:04:58.692145Z"},"links":{"citing_paper":"/paper/2412.07196"},"observation_digest":"sha256:898bbdf4dc4a9a7f9a1afd5aa08b5eaad439e453505696231aab8197f4681530","observation_id":"af2fe3a0-ae1a-4d03-b9c7-38fa88df2bf9","resolution":{"observed_at":"2026-08-11T19:04:59.830488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:04:59.793025Z","title":"In: 2018 IEEE/CVF Conference on Computer Vision and Pattern Recog- nition (CVPR), pp","venue":null,"work_id":"aa1e9742-613e-4cdf-9b4f-900649a22c30","year":2018},"citing_paper":{"arxiv_id":"2412.07196","last_updated":"2024-12-15T22:56:40Z","snapshot_observed_at":"2026-08-14T10:31:11.967110Z","submitted_at":"2024-12-10T05:09:52Z","title":"Fine-grained Text to Image Synthesis","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T19:04:58.704384Z"},"links":{"citing_paper":"/paper/2412.07196"},"observation_digest":"sha256:ffa7e08de87493057504d64dc9b123f27225701038f0ed0111bac9981ee82a08","observation_id":"0f624f25-b041-4519-bb31-7e159d348f2c","resolution":{"observed_at":"2026-08-11T19:04:59.801108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:04:59.768858Z","title":"In: 2022 IEEE/CVF Conference on Com- puter Vision and Pattern Recognition (CVPR), pp","venue":null,"work_id":"d6231e14-91ac-4373-8c46-34da883af25c","year":2022},"citing_paper":{"arxiv_id":"2412.07196","last_updated":"2024-12-15T22:56:40Z","snapshot_observed_at":"2026-08-14T10:31:11.967110Z","submitted_at":"2024-12-10T05:09:52Z","title":"Fine-grained Text to Image Synthesis","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T19:04:58.712584Z"},"links":{"citing_paper":"/paper/2412.07196"},"observation_digest":"sha256:095726773f52fb77d165794475ddd5519decd1e58dfaebca443c9abc3a496939","observation_id":"08493df5-0f96-47bb-8482-c5610c444922","resolution":{"observed_at":"2026-08-11T19:04:59.775304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:04:59.734640Z","title":"In: 2020 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp","venue":null,"work_id":"0fb1abfe-2a8a-4801-b0fa-0c15007aab11","year":2020},"citing_paper":{"arxiv_id":"2412.07196","last_updated":"2024-12-15T22:56:40Z","snapshot_observed_at":"2026-08-14T10:31:11.967110Z","submitted_at":"2024-12-10T05:09:52Z","title":"Fine-grained Text to Image Synthesis","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T19:04:58.725059Z"},"links":{"citing_paper":"/paper/2412.07196"},"observation_digest":"sha256:68fc51495bef431fce625da14a3a8559f094ff90588abb3ffe96b29ffc416c4b","observation_id":"140c0a6e-ce9c-4a65-9963-2f414c44b862","resolution":{"observed_at":"2026-08-11T19:04:59.747480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:04:59.702215Z","title":"In: IEEE Transactions on Multimedia, vol","venue":null,"work_id":"59102d14-a3ba-4a0c-8d0b-9dd1cf7f2d79","year":2024},"citing_paper":{"arxiv_id":"2412.07196","last_updated":"2024-12-15T22:56:40Z","snapshot_observed_at":"2026-08-14T10:31:11.967110Z","submitted_at":"2024-12-10T05:09:52Z","title":"Fine-grained Text to Image Synthesis","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T19:04:58.732823Z"},"links":{"citing_paper":"/paper/2412.07196"},"observation_digest":"sha256:9e3c94902f3b4282b8fb95afbe685bd22213e183fc475e622455d0e01af36457","observation_id":"b1d21dfb-a4f7-4976-83bc-f175e996b8ca","resolution":{"observed_at":"2026-08-11T19:04:59.711503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:04:59.671832Z","title":"In: Proceedings of the 38th International Conference on Machine Learning, Proceedings of Machine Learning Research, vol","venue":null,"work_id":"cfc8bd06-f1ca-432e-850c-a6d080d4730f","year":2021},"citing_paper":{"arxiv_id":"2412.07196","last_updated":"2024-12-15T22:56:40Z","snapshot_observed_at":"2026-08-14T10:31:11.967110Z","submitted_at":"2024-12-10T05:09:52Z","title":"Fine-grained Text to Image Synthesis","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T19:04:58.744963Z"},"links":{"citing_paper":"/paper/2412.07196"},"observation_digest":"sha256:43345aefe92380fcec393d1aea52b3a5d6e0b3dfd63d6a31fb90d49997a26b8a","observation_id":"a806e7e4-4406-4ff0-aa10-c71cf50976db","resolution":{"observed_at":"2026-08-11T19:04:59.680787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:04:59.637942Z","title":"In: Advances in Neural Infor- mation Processing Systems, vol","venue":null,"work_id":"33b13e0a-8dd6-4a68-acac-e4469d53d753","year":2021},"citing_paper":{"arxiv_id":"2412.07196","last_updated":"2024-12-15T22:56:40Z","snapshot_observed_at":"2026-08-14T10:31:11.967110Z","submitted_at":"2024-12-10T05:09:52Z","title":"Fine-grained Text to Image Synthesis","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T19:04:58.754228Z"},"links":{"citing_paper":"/paper/2412.07196"},"observation_digest":"sha256:aa6cdf553a93df3fd00c65c92a3f94e06943925947482c991958adeb2384a80f","observation_id":"9e3f3c37-7411-48b2-9225-1c548ab34c79","resolution":{"observed_at":"2026-08-11T19:04:59.647340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:04:59.600606Z","title":"In: Proceedings of the 31st International Conference on Neural Information Processing Systems (NIPS’17), pp","venue":null,"work_id":"ec74de8d-bebe-4bfd-a094-25ba8e9d5ed3","year":2017},"citing_paper":{"arxiv_id":"2412.07196","last_updated":"2024-12-15T22:56:40Z","snapshot_observed_at":"2026-08-14T10:31:11.967110Z","submitted_at":"2024-12-10T05:09:52Z","title":"Fine-grained Text to Image Synthesis","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T19:04:58.760940Z"},"links":{"citing_paper":"/paper/2412.07196"},"observation_digest":"sha256:7f20859acf8d835fd5fbbd94c970ddd538afab3b57fddd4c0798434f6a86fd42","observation_id":"56add82d-6cc5-4810-8144-4623da1edb50","resolution":{"observed_at":"2026-08-11T19:04:59.611177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-08-14T02:29:38.306439Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-11T19:04:58.770353Z","title":"arXiv preprint arXiv:2206.10789, vol","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.07196","last_updated":"2024-12-15T22:56:40Z","snapshot_observed_at":"2026-08-14T10:31:11.967110Z","submitted_at":"2024-12-10T05:09:52Z","title":"Fine-grained Text to Image Synthesis","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T19:04:58.770353Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2412.07196"},"observation_digest":"sha256:14cb109c726bd4beca8fde28b07b41a70b3dede9d46043604553b92ea8161220","observation_id":"aa0330cb-5b89-4b5e-93e6-921f43c7f671","resolution":{"observed_at":"2026-08-11T19:04:58.770353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04627","last_updated":"2022-06-05T01:57:58Z","snapshot_observed_at":"2026-08-13T12:11:58.325060Z","submitted_at":"2021-10-09T18:36:00Z","title":"Vector-quantized Image Modeling with Improved VQGAN","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04627","snapshot_observed_at":"2026-08-11T19:04:58.780105Z","title":"arXiv preprint arXiv:2110.04627 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.07196","last_updated":"2024-12-15T22:56:40Z","snapshot_observed_at":"2026-08-14T10:31:11.967110Z","submitted_at":"2024-12-10T05:09:52Z","title":"Fine-grained Text to Image Synthesis","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T19:04:58.780105Z"},"links":{"cited_paper":"/paper/2110.04627","citing_paper":"/paper/2412.07196"},"observation_digest":"sha256:310c96c94f75632b76f12ad3f4c0de1189fa0ceb85bb952b261088bb0f667acf","observation_id":"226a2121-afe4-4076-a974-ba76f1c9a3ce","resolution":{"observed_at":"2026-08-11T19:04:58.780105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10741","last_updated":"2022-03-08T18:18:49Z","snapshot_observed_at":"2026-08-07T12:21:17.790675Z","submitted_at":"2021-12-20T18:42:55Z","title":"GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10741","snapshot_observed_at":"2026-08-11T19:04:58.786459Z","title":"arXiv preprint arXiv:2112.10741 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.07196","last_updated":"2024-12-15T22:56:40Z","snapshot_observed_at":"2026-08-14T10:31:11.967110Z","submitted_at":"2024-12-10T05:09:52Z","title":"Fine-grained Text to Image Synthesis","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T19:04:58.786459Z"},"links":{"cited_paper":"/paper/2112.10741","citing_paper":"/paper/2412.07196"},"observation_digest":"sha256:eebe8b868dbc029c5130d73104a4097338e29ccee0bb2e7b512a12d7697f67b8","observation_id":"8d37af45-1489-4a00-8b32-f8869d9a92d7","resolution":{"observed_at":"2026-08-11T19:04:58.786459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:04:59.579137Z","title":"In: 2022 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp","venue":null,"work_id":"09bc232a-0338-45fe-b253-e449f80c1c07","year":2022},"citing_paper":{"arxiv_id":"2412.07196","last_updated":"2024-12-15T22:56:40Z","snapshot_observed_at":"2026-08-14T10:31:11.967110Z","submitted_at":"2024-12-10T05:09:52Z","title":"Fine-grained Text to Image Synthesis","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T19:04:58.793768Z"},"links":{"citing_paper":"/paper/2412.07196"},"observation_digest":"sha256:b7f8ffd3c91ff5c9cca3e8322495a156f2e81b176adb43d15d72086bca82bb3d","observation_id":"00810e65-0c45-415a-846c-ccddade50c08","resolution":{"observed_at":"2026-08-11T19:04:59.585012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-11T19:04:58.799155Z","title":"arXiv preprint arXiv:2204.06125, vol","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.07196","last_updated":"2024-12-15T22:56:40Z","snapshot_observed_at":"2026-08-14T10:31:11.967110Z","submitted_at":"2024-12-10T05:09:52Z","title":"Fine-grained Text to Image Synthesis","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T19:04:58.799155Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2412.07196"},"observation_digest":"sha256:e8590be4cdf601dc1d142e458853f05b73d5264af5d2a6e8271bc0cf15fdaf54","observation_id":"c4bb6c9c-9d67-4838-9740-ae1d824e7f0f","resolution":{"observed_at":"2026-08-11T19:04:58.799155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:04:59.559905Z","title":"In: Proceedings of the 36th International Con- ference on Neural Information Processing Systems (NIPS ’22), Article 2643, pp","venue":null,"work_id":"44b3f4fe-76b5-48f5-931f-56747dc1a503","year":2024},"citing_paper":{"arxiv_id":"2412.07196","last_updated":"2024-12-15T22:56:40Z","snapshot_observed_at":"2026-08-14T10:31:11.967110Z","submitted_at":"2024-12-10T05:09:52Z","title":"Fine-grained Text to Image Synthesis","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T19:04:58.807550Z"},"links":{"citing_paper":"/paper/2412.07196"},"observation_digest":"sha256:904088439641ef81413d973f44f50d29e719b9d9c4e65cee9c92de2d135e6e33","observation_id":"5e87086d-a323-4de9-845a-ffd8c1795638","resolution":{"observed_at":"2026-08-11T19:04:59.566485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:04:59.537226Z","title":"In: 2020 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp","venue":null,"work_id":"697d8487-e333-49fa-80bb-6ea381198d79","year":2020},"citing_paper":{"arxiv_id":"2412.07196","last_updated":"2024-12-15T22:56:40Z","snapshot_observed_at":"2026-08-14T10:31:11.967110Z","submitted_at":"2024-12-10T05:09:52Z","title":"Fine-grained Text to Image Synthesis","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T19:04:58.813300Z"},"links":{"citing_paper":"/paper/2412.07196"},"observation_digest":"sha256:de65dadf6013f6b63306465df0f7d131c094163835ee4f6fb6ad8502e7e14d20","observation_id":"7b314ef6-922e-49e8-b0d0-e9f74a0ee556","resolution":{"observed_at":"2026-08-11T19:04:59.543823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:04:59.511158Z","title":"Ouyang, Y","venue":null,"work_id":"041df6e2-de8e-49b7-93e5-02c7cff42471","year":2022},"citing_paper":{"arxiv_id":"2412.07196","last_updated":"2024-12-15T22:56:40Z","snapshot_observed_at":"2026-08-14T10:31:11.967110Z","submitted_at":"2024-12-10T05:09:52Z","title":"Fine-grained Text to Image Synthesis","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T19:04:58.819066Z"},"links":{"citing_paper":"/paper/2412.07196"},"observation_digest":"sha256:f57000ab80806a40542fb8c15c14da3fb76edbf4215fdb8ebd8a57a75e3f5fe8","observation_id":"15b8d157-145a-482d-8cd7-4a909497f3c0","resolution":{"observed_at":"2026-08-11T19:04:59.520506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:04:59.490458Z","title":"In: Proceedings of the 30th International Conference on Neural Information Processing Systems (NIPS’16), pp","venue":null,"work_id":"4b7bf145-7be5-4e16-88fe-1080d87e56c4","year":2016},"citing_paper":{"arxiv_id":"2412.07196","last_updated":"2024-12-15T22:56:40Z","snapshot_observed_at":"2026-08-14T10:31:11.967110Z","submitted_at":"2024-12-10T05:09:52Z","title":"Fine-grained Text to Image Synthesis","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T19:04:58.827700Z"},"links":{"citing_paper":"/paper/2412.07196"},"observation_digest":"sha256:beec0903de2b9c7a8d90dd66727f02b871a3d8ed5e436e2c96d8a86883138015","observation_id":"15241b36-066c-4e4b-a63e-dbd829eb1d5f","resolution":{"observed_at":"2026-08-11T19:04:59.496753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:04:59.465051Z","title":"In: Proceedings of the 30th International Conference on Neural Information Processing Systems (NIPS’16), pp","venue":null,"work_id":"c861244b-8fc6-462c-88f9-72c90c2bf1a8","year":2016},"citing_paper":{"arxiv_id":"2412.07196","last_updated":"2024-12-15T22:56:40Z","snapshot_observed_at":"2026-08-14T10:31:11.967110Z","submitted_at":"2024-12-10T05:09:52Z","title":"Fine-grained Text to Image Synthesis","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T19:04:58.838594Z"},"links":{"citing_paper":"/paper/2412.07196"},"observation_digest":"sha256:e9faef6ef34b867ce1e24955f8142e358244cfe7f8b9f9bae3a274a935ce9c47","observation_id":"57dbf110-f594-4dd5-8fa9-7e136e8bd2b9","resolution":{"observed_at":"2026-08-11T19:04:59.476452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:04:59.433998Z","title":"In: Proceedings of the 30th International Conference on Neural Information Processing Systems (NIPS’16), pp","venue":null,"work_id":"953e9936-29a8-457a-a19b-dfd906eb1174","year":2016},"citing_paper":{"arxiv_id":"2412.07196","last_updated":"2024-12-15T22:56:40Z","snapshot_observed_at":"2026-08-14T10:31:11.967110Z","submitted_at":"2024-12-10T05:09:52Z","title":"Fine-grained Text to Image Synthesis","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T19:04:58.846163Z"},"links":{"citing_paper":"/paper/2412.07196"},"observation_digest":"sha256:2d63a0af442cdf07af74e84335af884a95f1c20df119c09bf2c1979e5c60e3ef","observation_id":"2b49b64d-b7cb-4dd8-9d76-2cd1ceac5076","resolution":{"observed_at":"2026-08-11T19:04:59.442900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:04:59.403689Z","title":"In: Proceedings of the 34th International Conference on Machine Learning (ICML’17), vol","venue":null,"work_id":"7e9ed38f-6c01-49f7-9bc1-7944e55eb25b","year":2017},"citing_paper":{"arxiv_id":"2412.07196","last_updated":"2024-12-15T22:56:40Z","snapshot_observed_at":"2026-08-14T10:31:11.967110Z","submitted_at":"2024-12-10T05:09:52Z","title":"Fine-grained Text to Image Synthesis","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T19:04:58.855018Z"},"links":{"citing_paper":"/paper/2412.07196"},"observation_digest":"sha256:8a862c5cd8bccb37f64108783b6e680ae47db6dae5ff927156bfc33752a1da06","observation_id":"53bb5b66-5e49-4fe1-bb38-abde030f94fb","resolution":{"observed_at":"2026-08-11T19:04:59.411027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.02423","last_updated":"2021-11-28T01:54:15Z","snapshot_observed_at":"2026-08-14T13:29:51.854161Z","submitted_at":"2021-07-06T06:43:31Z","title":"Improving Text-to-Image Synthesis Using Contrastive Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.02423","snapshot_observed_at":"2026-08-11T19:04:58.862832Z","title":"arXiv preprint arXiv:2107.02423 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.07196","last_updated":"2024-12-15T22:56:40Z","snapshot_observed_at":"2026-08-14T10:31:11.967110Z","submitted_at":"2024-12-10T05:09:52Z","title":"Fine-grained Text to Image Synthesis","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T19:04:58.862832Z"},"links":{"cited_paper":"/paper/2107.02423","citing_paper":"/paper/2412.07196"},"observation_digest":"sha256:6b3479baa1e1a9a5912e866d7868ce9a9ba89276fb8f55d9cbbf83b174c6e72b","observation_id":"cf334610-1b50-487a-be8e-e4cab50ec7d9","resolution":{"observed_at":"2026-08-11T19:04:58.862832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1703.06412","last_updated":"2017-03-26T11:29:21Z","snapshot_observed_at":"2026-07-06T05:34:16.039296Z","submitted_at":"2017-03-19T10:07:58Z","title":"TAC-GAN - Text Conditioned Auxiliary Classifier Generative Adversarial Network","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.06412","snapshot_observed_at":"2026-08-11T19:04:58.872447Z","title":"arXiv preprint arXiv:1703.06412 (2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.07196","last_updated":"2024-12-15T22:56:40Z","snapshot_observed_at":"2026-08-14T10:31:11.967110Z","submitted_at":"2024-12-10T05:09:52Z","title":"Fine-grained Text to Image Synthesis","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T19:04:58.872447Z"},"links":{"cited_paper":"/paper/1703.06412","citing_paper":"/paper/2412.07196"},"observation_digest":"sha256:0a19ef3dc24e9ab1b07b7cc442c38bfbc86fefafa40fb7a3ec946967e4874898","observation_id":"7b3798e2-8c1b-47f4-8b83-e3b30b83c7d3","resolution":{"observed_at":"2026-08-11T19:04:58.872447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:04:59.375248Z","title":"Ouyang, Y","venue":null,"work_id":"ab46b5ab-b30b-4ba2-9ceb-65be88bd446f","year":2020},"citing_paper":{"arxiv_id":"2412.07196","last_updated":"2024-12-15T22:56:40Z","snapshot_observed_at":"2026-08-14T10:31:11.967110Z","submitted_at":"2024-12-10T05:09:52Z","title":"Fine-grained Text to Image Synthesis","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T19:04:58.879403Z"},"links":{"citing_paper":"/paper/2412.07196"},"observation_digest":"sha256:dfd810d26f8eaf78dc68b22273653be0fb61f530ee52f248469bfb94557bf694","observation_id":"462261bc-9111-4af4-9578-718857a2e681","resolution":{"observed_at":"2026-08-11T19:04:59.385370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:04:59.338459Z","title":"Ouyang, Y","venue":null,"work_id":"2511002d-4509-46b8-a00d-d6e2a454654d","year":2024},"citing_paper":{"arxiv_id":"2412.07196","last_updated":"2024-12-15T22:56:40Z","snapshot_observed_at":"2026-08-14T10:31:11.967110Z","submitted_at":"2024-12-10T05:09:52Z","title":"Fine-grained Text to Image Synthesis","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T19:04:58.897357Z"},"links":{"citing_paper":"/paper/2412.07196"},"observation_digest":"sha256:0b625615b89258b951d517354388d18110767954fb3453b7123acb571b2ced23","observation_id":"6264bd38-0308-400b-bd1e-7605ceb477b4","resolution":{"observed_at":"2026-08-11T19:04:59.347565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:04:59.318114Z","title":"In: 2021 IEEE/CVF Conference on Com- puter Vision and Pattern Recognition (CVPR), pp","venue":null,"work_id":"f12c9767-1dbe-4f80-891f-f30349adc41f","year":2021},"citing_paper":{"arxiv_id":"2412.07196","last_updated":"2024-12-15T22:56:40Z","snapshot_observed_at":"2026-08-14T10:31:11.967110Z","submitted_at":"2024-12-10T05:09:52Z","title":"Fine-grained Text to Image Synthesis","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T19:04:58.910174Z"},"links":{"citing_paper":"/paper/2412.07196"},"observation_digest":"sha256:1a2c6ca723ff9b472713dd4cd90d4d08e5c6b20081eaecd675d8d00f1a050f1f","observation_id":"6bdcbf75-f35c-4679-b37b-6f13a9815229","resolution":{"observed_at":"2026-08-11T19:04:59.325073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:04:59.290947Z","title":"In: 2019 IEEE/CVF Conference on Computer Vision 16 X","venue":null,"work_id":"0fd12c11-d853-4b99-a290-55848e1fce62","year":2019},"citing_paper":{"arxiv_id":"2412.07196","last_updated":"2024-12-15T22:56:40Z","snapshot_observed_at":"2026-08-14T10:31:11.967110Z","submitted_at":"2024-12-10T05:09:52Z","title":"Fine-grained Text to Image Synthesis","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T19:04:58.915596Z"},"links":{"citing_paper":"/paper/2412.07196"},"observation_digest":"sha256:f90e5a2fb72d38523fb549b289fe8834b69abb9dee97a5fae2dc0ad35be4893b","observation_id":"05f292db-693a-4bf0-ba99-ed4b41ec7d34","resolution":{"observed_at":"2026-08-11T19:04:59.298876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:04:59.244421Z","title":"In: Advances in Neural Information Pro- cessing Systems 29: Annual Conference on Neural Information Processing Systems 2016, pp","venue":null,"work_id":"406038a3-d30e-472c-b177-7ee5fcc34efa","year":2016},"citing_paper":{"arxiv_id":"2412.07196","last_updated":"2024-12-15T22:56:40Z","snapshot_observed_at":"2026-08-14T10:31:11.967110Z","submitted_at":"2024-12-10T05:09:52Z","title":"Fine-grained Text to Image Synthesis","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T19:04:58.926311Z"},"links":{"citing_paper":"/paper/2412.07196"},"observation_digest":"sha256:2636786964216d1dea5b4775d264044947f2b4edd709eb92215175ee06574085","observation_id":"063bb8f7-8907-40c8-ba0c-427cb58e0877","resolution":{"observed_at":"2026-08-11T19:04:59.254463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:04:59.213363Z","title":"Journal of Multivariate Analysis, vol","venue":null,"work_id":"fb762fde-09f8-43ef-acba-0aeb26d4aa36","year":1982},"citing_paper":{"arxiv_id":"2412.07196","last_updated":"2024-12-15T22:56:40Z","snapshot_observed_at":"2026-08-14T10:31:11.967110Z","submitted_at":"2024-12-10T05:09:52Z","title":"Fine-grained Text to Image Synthesis","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T19:04:58.932688Z"},"links":{"citing_paper":"/paper/2412.07196"},"observation_digest":"sha256:63e1e2993c425c8212799d1532a7dc0aee80cd3382a086d5c9e249400799fc89","observation_id":"933fabe0-83b9-4929-a5e2-05a71b88832b","resolution":{"observed_at":"2026-08-11T19:04:59.223463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.01973","last_updated":"2018-06-21T14:54:33Z","snapshot_observed_at":"2026-08-07T19:33:19.839652Z","submitted_at":"2018-01-06T05:44:29Z","title":"A Note on the Inception Score","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.01973","snapshot_observed_at":"2026-08-11T19:04:58.940286Z","title":"arXiv preprint arXiv:1801.01973","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.07196","last_updated":"2024-12-15T22:56:40Z","snapshot_observed_at":"2026-08-14T10:31:11.967110Z","submitted_at":"2024-12-10T05:09:52Z","title":"Fine-grained Text to Image Synthesis","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T19:04:58.940286Z"},"links":{"cited_paper":"/paper/1801.01973","citing_paper":"/paper/2412.07196"},"observation_digest":"sha256:776b78477a8bfbd94696d44af6495d9455d36c1009029c9a63bede5ce9fbfc0a","observation_id":"75ec20c3-1031-4258-8987-6fc56d50579a","resolution":{"observed_at":"2026-08-11T19:04:58.940286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.07196","last_updated":"2024-12-15T22:56:40Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T10:31:11.967110Z","submitted_at":"2024-12-10T05:09:52Z","title":"Fine-grained Text to Image Synthesis"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":0,"verified_fuzzy":24},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2412.07196."}