{"as_of":"2026-08-07T05:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a809fb5fb84f3172fa3bcbb7b4e70a2feb6e858e64d18ac5fc57cd0c3f5a3abd","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":24,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:07:11.354540Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-10T06:15:00.866473Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2012.09841","last_updated":"2021-06-23T16:07:21Z","snapshot_observed_at":"2026-08-07T00:06:20.341178Z","submitted_at":"2020-12-17T18:57:28Z","title":"Taming Transformers for High-Resolution Image Synthesis","version":3},"cited_work":{"arxiv_id":"2012.09841","doi":"10.48550/arxiv.2012.09841","metadata_source":"arxiv_reference","pith_arxiv_id":"2012.09841","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Esser, R","venue":null,"work_id":"b467cc9a-4a7a-4b7e-a4e5-d966dc3be597","year":2012},"citing_paper":{"arxiv_id":"2112.10752","last_updated":"2022-04-13T11:38:44Z","snapshot_observed_at":"2026-07-06T12:20:47.369918Z","submitted_at":"2021-12-20T18:55:25Z","title":"High-Resolution Image Synthesis with Latent Diffusion Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-11T22:02:09.899347Z"},"links":{"cited_paper":"/paper/2012.09841","citing_paper":"/paper/2112.10752"},"observation_digest":"sha256:67fecd097c3e68b53ccd4e3a4c111c7c944d278e77e86ef0fdb4bfff739f1b2a","observation_id":"c9e1fa55-7d71-401f-b199-a0f536a99d2c","resolution":{"observed_at":"2026-05-11T22:02:10.049564Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09841","last_updated":"2021-06-23T16:07:21Z","snapshot_observed_at":"2026-08-07T00:06:20.341178Z","submitted_at":"2020-12-17T18:57:28Z","title":"Taming Transformers for High-Resolution Image Synthesis","version":3},"cited_work":{"arxiv_id":"2012.09841","doi":"10.48550/arxiv.2012.09841","metadata_source":"arxiv_reference","pith_arxiv_id":"2012.09841","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Esser, R","venue":null,"work_id":"b467cc9a-4a7a-4b7e-a4e5-d966dc3be597","year":2012},"citing_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T16:55:57.612364Z"},"links":{"cited_paper":"/paper/2012.09841","citing_paper":"/paper/2204.06125"},"observation_digest":"sha256:f6ef7e3efec3df32610595895016dc338c6a591c688ea2ea3581cc76723191e4","observation_id":"8688c964-81cb-44ee-bc32-acf0cc50e4bf","resolution":{"observed_at":"2026-05-10T16:55:57.706155Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09841","last_updated":"2021-06-23T16:07:21Z","snapshot_observed_at":"2026-08-07T00:06:20.341178Z","submitted_at":"2020-12-17T18:57:28Z","title":"Taming Transformers for High-Resolution Image Synthesis","version":3},"cited_work":{"arxiv_id":"2012.09841","doi":"10.48550/arxiv.2012.09841","metadata_source":"arxiv_reference","pith_arxiv_id":"2012.09841","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Esser, R","venue":null,"work_id":"b467cc9a-4a7a-4b7e-a4e5-d966dc3be597","year":2012},"citing_paper":{"arxiv_id":"2205.15868","last_updated":"2022-05-29T19:02:15Z","snapshot_observed_at":"2026-07-06T13:15:58.303738Z","submitted_at":"2022-05-29T19:02:15Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-11T12:24:30.071822Z"},"links":{"cited_paper":"/paper/2012.09841","citing_paper":"/paper/2205.15868"},"observation_digest":"sha256:5e22200e96af934bb71a391af99a737cbca171bc7d847fe017268b39e679a3de","observation_id":"627d82d3-d55d-4f65-beb1-a76d206ff8b7","resolution":{"observed_at":"2026-05-11T12:24:30.169637Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09841","last_updated":"2021-06-23T16:07:21Z","snapshot_observed_at":"2026-08-07T00:06:20.341178Z","submitted_at":"2020-12-17T18:57:28Z","title":"Taming Transformers for High-Resolution Image Synthesis","version":3},"cited_work":{"arxiv_id":"2012.09841","doi":"10.48550/arxiv.2012.09841","metadata_source":"arxiv_reference","pith_arxiv_id":"2012.09841","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Esser, R","venue":null,"work_id":"b467cc9a-4a7a-4b7e-a4e5-d966dc3be597","year":2012},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2012.09841","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:1efb1c63a0fa95e58bae163622fe284aa7de414ae79e3c4faf2d56bc29afa724","observation_id":"d992ae0f-c056-43e8-8e4b-a13887ea7fe6","resolution":{"observed_at":"2026-05-10T22:58:52.084829Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09841","last_updated":"2021-06-23T16:07:21Z","snapshot_observed_at":"2026-08-07T00:06:20.341178Z","submitted_at":"2020-12-17T18:57:28Z","title":"Taming Transformers for High-Resolution Image Synthesis","version":3},"cited_work":{"arxiv_id":"2012.09841","doi":"10.48550/arxiv.2012.09841","metadata_source":"arxiv_reference","pith_arxiv_id":"2012.09841","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Esser, R","venue":null,"work_id":"b467cc9a-4a7a-4b7e-a4e5-d966dc3be597","year":2012},"citing_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-11T10:56:06.418360Z"},"links":{"cited_paper":"/paper/2012.09841","citing_paper":"/paper/2409.18869"},"observation_digest":"sha256:f3e8365c1c7d50aefd9f68d5ee3930eccb021ba84166b02576145fa39dda36e3","observation_id":"e8f7e586-273a-4e01-97e8-6a4102a7f999","resolution":{"observed_at":"2026-05-11T10:56:07.899835Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09841","last_updated":"2021-06-23T16:07:21Z","snapshot_observed_at":"2026-08-07T00:06:20.341178Z","submitted_at":"2020-12-17T18:57:28Z","title":"Taming Transformers for High-Resolution Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.09841","snapshot_observed_at":"2026-08-07T04:07:11.354540Z","title":"Esser, R","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.11753","last_updated":"2025-06-13T13:09:11Z","snapshot_observed_at":"2026-08-07T04:01:50.924410Z","submitted_at":"2025-06-13T13:09:11Z","title":"Exploring the Effectiveness of Deep Features from Domain-Specific Foundation Models in Retinal Image Synthesis","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:11.354540Z"},"links":{"cited_paper":"/paper/2012.09841","citing_paper":"/paper/2506.11753"},"observation_digest":"sha256:6223b5572cbb8bdb4a80bddb595f0d9d83dae5669dffa8e85a4f6a0079e03a8f","observation_id":"72e589fa-862b-4016-b3a5-4f6c6c8f6cea","resolution":{"observed_at":"2026-08-07T04:07:11.354540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09841","last_updated":"2021-06-23T16:07:21Z","snapshot_observed_at":"2026-08-07T00:06:20.341178Z","submitted_at":"2020-12-17T18:57:28Z","title":"Taming Transformers for High-Resolution Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.09841","snapshot_observed_at":"2026-08-06T21:46:28.121890Z","title":"Taming transformers for high-resolution image synthesis, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.23589","last_updated":"2025-06-30T07:51:58Z","snapshot_observed_at":"2026-08-06T21:34:46.635732Z","submitted_at":"2025-06-30T07:51:58Z","title":"Transition Matching: Scalable and Flexible Generative Modeling","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T21:46:28.121890Z"},"links":{"cited_paper":"/paper/2012.09841","citing_paper":"/paper/2506.23589"},"observation_digest":"sha256:8a7098393c18639033244c34172933aa39becc47f215038acae6ccde8ace03cb","observation_id":"39f2225e-a259-4729-818e-3aae54b1f9ce","resolution":{"observed_at":"2026-08-06T21:46:28.121890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09841","last_updated":"2021-06-23T16:07:21Z","snapshot_observed_at":"2026-08-07T00:06:20.341178Z","submitted_at":"2020-12-17T18:57:28Z","title":"Taming Transformers for High-Resolution Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.09841","snapshot_observed_at":"2026-08-06T17:58:36.667446Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.14185","last_updated":"2025-07-13T02:58:48Z","snapshot_observed_at":"2026-08-06T17:52:57.895389Z","submitted_at":"2025-07-13T02:58:48Z","title":"Latent Sensor Fusion: Multimedia Learning of Physiological Signals for Resource-Constrained Devices","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:36.667446Z"},"links":{"cited_paper":"/paper/2012.09841","citing_paper":"/paper/2507.14185"},"observation_digest":"sha256:821b1b3666837af45e6697c168dcf3645d731a0fbdaac567005e92c2920bf5ee","observation_id":"fda2a2e6-294f-44e9-9362-250e07a6b7ec","resolution":{"observed_at":"2026-08-06T17:58:36.667446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09841","last_updated":"2021-06-23T16:07:21Z","snapshot_observed_at":"2026-08-07T00:06:20.341178Z","submitted_at":"2020-12-17T18:57:28Z","title":"Taming Transformers for High-Resolution Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.09841","snapshot_observed_at":"2026-08-06T10:47:00.547306Z","title":"Tam- ing transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2508.03735","last_updated":"2025-07-31T11:24:40Z","snapshot_observed_at":"2026-08-06T10:46:57.177175Z","submitted_at":"2025-07-31T11:24:40Z","title":"StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T10:47:00.547306Z"},"links":{"cited_paper":"/paper/2012.09841","citing_paper":"/paper/2508.03735"},"observation_digest":"sha256:463b1161eb3242bbf3769a7e2ce9dd2025a2db91b9b0fd047bf74d39e930a691","observation_id":"25999249-f595-49b7-89a0-68e4bd432bcb","resolution":{"observed_at":"2026-08-06T10:47:00.547306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09841","last_updated":"2021-06-23T16:07:21Z","snapshot_observed_at":"2026-08-07T00:06:20.341178Z","submitted_at":"2020-12-17T18:57:28Z","title":"Taming Transformers for High-Resolution Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.09841","snapshot_observed_at":"2026-08-05T15:41:16.150346Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.19626","last_updated":"2025-08-27T07:04:58Z","snapshot_observed_at":"2026-08-06T14:04:57.627845Z","submitted_at":"2025-08-27T07:04:58Z","title":"Controllable Skin Synthesis via Lesion-Focused Vector Autoregression Model","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T15:41:16.150346Z"},"links":{"cited_paper":"/paper/2012.09841","citing_paper":"/paper/2508.19626"},"observation_digest":"sha256:3664616781d6970787d2b4e5a068b8dcefa01f0f68670864a8d561c4f7cb2ab5","observation_id":"898cb73b-271a-4ba7-830e-301c5af7812a","resolution":{"observed_at":"2026-08-05T15:41:16.150346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09841","last_updated":"2021-06-23T16:07:21Z","snapshot_observed_at":"2026-08-07T00:06:20.341178Z","submitted_at":"2020-12-17T18:57:28Z","title":"Taming Transformers for High-Resolution Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.09841","snapshot_observed_at":"2026-08-05T11:29:03.656854Z","title":"Esser, R","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.02771","last_updated":"2025-09-02T19:20:06Z","snapshot_observed_at":"2026-08-05T11:29:00.334912Z","submitted_at":"2025-09-02T19:20:06Z","title":"Analysis of Speaker Verification Performance Trade-offs with Neural Audio Codec Transmission","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T11:29:03.656854Z"},"links":{"cited_paper":"/paper/2012.09841","citing_paper":"/paper/2509.02771"},"observation_digest":"sha256:7070061b1d502f2d95aee71c72b4c92628dd1d87c35be27f2ca1b88bc08f8e60","observation_id":"64746141-28d3-40d5-b6fa-56f1b65a1650","resolution":{"observed_at":"2026-08-05T11:29:03.656854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09841","last_updated":"2021-06-23T16:07:21Z","snapshot_observed_at":"2026-08-07T00:06:20.341178Z","submitted_at":"2020-12-17T18:57:28Z","title":"Taming Transformers for High-Resolution Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.09841","snapshot_observed_at":"2026-08-04T07:22:12.652710Z","title":"Taming transformers for high-resolution image synthesis, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.27497","last_updated":"2026-07-18T14:25:55Z","snapshot_observed_at":"2026-08-06T07:07:19.926806Z","submitted_at":"2025-10-31T14:19:50Z","title":"InertialAR: Autoregressive 3D Molecule Generation with Inertial Frames","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:12.652710Z"},"links":{"cited_paper":"/paper/2012.09841","citing_paper":"/paper/2510.27497"},"observation_digest":"sha256:c9d8ea0e5e6e5611012849dee1cacb3aaaebd441d7bc137927cf0f0bbdcf3b05","observation_id":"a5b1424c-630d-4465-8998-9f1c458fb51b","resolution":{"observed_at":"2026-08-04T07:22:12.652710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09841","last_updated":"2021-06-23T16:07:21Z","snapshot_observed_at":"2026-08-07T00:06:20.341178Z","submitted_at":"2020-12-17T18:57:28Z","title":"Taming Transformers for High-Resolution Image Synthesis","version":3},"cited_work":{"arxiv_id":"2012.09841","doi":"10.48550/arxiv.2012.09841","metadata_source":"arxiv_reference","pith_arxiv_id":"2012.09841","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Esser, R","venue":null,"work_id":"b467cc9a-4a7a-4b7e-a4e5-d966dc3be597","year":2012},"citing_paper":{"arxiv_id":"2605.07915","last_updated":"2026-05-08T15:52:51Z","snapshot_observed_at":"2026-08-02T05:37:32.685801Z","submitted_at":"2026-05-08T15:52:51Z","title":"What Matters for Diffusion-Friendly Latent Manifold? Prior-Aligned Autoencoders for Latent Diffusion","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-11T01:57:24.033068Z"},"links":{"cited_paper":"/paper/2012.09841","citing_paper":"/paper/2605.07915"},"observation_digest":"sha256:bb28aecea64858693828bd24fa8f23d1c63218653424a85fd1a4d4a406577fdd","observation_id":"5b12fbaa-9ad2-42d8-b177-119cdc997842","resolution":{"observed_at":"2026-05-11T04:05:57.417886Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09841","last_updated":"2021-06-23T16:07:21Z","snapshot_observed_at":"2026-08-07T00:06:20.341178Z","submitted_at":"2020-12-17T18:57:28Z","title":"Taming Transformers for High-Resolution Image Synthesis","version":3},"cited_work":{"arxiv_id":"2012.09841","doi":"10.48550/arxiv.2012.09841","metadata_source":"arxiv_reference","pith_arxiv_id":"2012.09841","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Esser, R","venue":null,"work_id":"b467cc9a-4a7a-4b7e-a4e5-d966dc3be597","year":2012},"citing_paper":{"arxiv_id":"2605.12011","last_updated":"2026-05-12T12:00:48Z","snapshot_observed_at":"2026-08-02T23:56:46.052228Z","submitted_at":"2026-05-12T12:00:48Z","title":"CaloArt: Large-Patch x-Prediction Diffusion Transformers for High-Granularity Calorimeter Shower Generation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-13T04:40:25.725622Z"},"links":{"cited_paper":"/paper/2012.09841","citing_paper":"/paper/2605.12011"},"observation_digest":"sha256:27dbb0cb1189587a669e04077c0877d15b5b998e383d3a91f785d40de8e4cea7","observation_id":"734f5076-98ec-43e1-8c66-86eb436b1fa8","resolution":{"observed_at":"2026-05-13T04:42:15.836286Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09841","last_updated":"2021-06-23T16:07:21Z","snapshot_observed_at":"2026-08-07T00:06:20.341178Z","submitted_at":"2020-12-17T18:57:28Z","title":"Taming Transformers for High-Resolution Image Synthesis","version":3},"cited_work":{"arxiv_id":"2012.09841","doi":"10.48550/arxiv.2012.09841","metadata_source":"arxiv_reference","pith_arxiv_id":"2012.09841","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Esser, R","venue":null,"work_id":"b467cc9a-4a7a-4b7e-a4e5-d966dc3be597","year":2012},"citing_paper":{"arxiv_id":"2605.25012","last_updated":"2026-05-24T11:32:30Z","snapshot_observed_at":"2026-07-06T23:35:01.860096Z","submitted_at":"2026-05-24T11:32:30Z","title":"Learning from Semantic Dictionaries: Discriminative Codebook Contrastive Learning for Unified Visual Representation and Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T12:28:33.099835Z"},"links":{"cited_paper":"/paper/2012.09841","citing_paper":"/paper/2605.25012"},"observation_digest":"sha256:ef427c8ad3eda1fb00efd6d3b738a82297358691f439ca2637a27ecec58823b4","observation_id":"03843ae1-6ea9-475b-a954-43b6d8fe80ca","resolution":{"observed_at":"2026-06-30T12:34:38.743266Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09841","last_updated":"2021-06-23T16:07:21Z","snapshot_observed_at":"2026-08-07T00:06:20.341178Z","submitted_at":"2020-12-17T18:57:28Z","title":"Taming Transformers for High-Resolution Image Synthesis","version":3},"cited_work":{"arxiv_id":"2012.09841","doi":"10.48550/arxiv.2012.09841","metadata_source":"arxiv_reference","pith_arxiv_id":"2012.09841","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Esser, R","venue":null,"work_id":"b467cc9a-4a7a-4b7e-a4e5-d966dc3be597","year":2012},"citing_paper":{"arxiv_id":"2605.30341","last_updated":"2026-05-28T17:59:26Z","snapshot_observed_at":"2026-07-06T23:39:38.845840Z","submitted_at":"2026-05-28T17:59:26Z","title":"GPIC: A Giant Permissive Image Corpus for Visual Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T07:36:21.262064Z"},"links":{"cited_paper":"/paper/2012.09841","citing_paper":"/paper/2605.30341"},"observation_digest":"sha256:388da874697d2e3de862354c8bff0004595c1f36772a2399bc0f067af00f6378","observation_id":"aa44a522-961e-4bbc-942b-d6f2520129dc","resolution":{"observed_at":"2026-06-29T07:43:14.161246Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09841","last_updated":"2021-06-23T16:07:21Z","snapshot_observed_at":"2026-08-07T00:06:20.341178Z","submitted_at":"2020-12-17T18:57:28Z","title":"Taming Transformers for High-Resolution Image Synthesis","version":3},"cited_work":{"arxiv_id":"2012.09841","doi":"10.48550/arxiv.2012.09841","metadata_source":"arxiv_reference","pith_arxiv_id":"2012.09841","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Esser, R","venue":null,"work_id":"b467cc9a-4a7a-4b7e-a4e5-d966dc3be597","year":2012},"citing_paper":{"arxiv_id":"2606.02211","last_updated":"2026-06-01T13:10:49Z","snapshot_observed_at":"2026-08-02T18:41:16.377453Z","submitted_at":"2026-06-01T13:10:49Z","title":"Consistency Training while Mitigating Obfuscation via Rate Matching","version":1},"reference_index":141,"source":"arxiv_source","source_observed_at":"2026-06-28T14:25:43.147442Z"},"links":{"cited_paper":"/paper/2012.09841","citing_paper":"/paper/2606.02211"},"observation_digest":"sha256:ce29f58ccbafb552228383adee10bcb6769b455a9174eb2e83373271c456a9c1","observation_id":"1dc90202-abb1-4242-bb93-fc2e14f65420","resolution":{"observed_at":"2026-06-28T14:32:18.108266Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09841","last_updated":"2021-06-23T16:07:21Z","snapshot_observed_at":"2026-08-07T00:06:20.341178Z","submitted_at":"2020-12-17T18:57:28Z","title":"Taming Transformers for High-Resolution Image Synthesis","version":3},"cited_work":{"arxiv_id":"2012.09841","doi":"10.48550/arxiv.2012.09841","metadata_source":"arxiv_reference","pith_arxiv_id":"2012.09841","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Esser, R","venue":null,"work_id":"b467cc9a-4a7a-4b7e-a4e5-d966dc3be597","year":2012},"citing_paper":{"arxiv_id":"2606.02305","last_updated":"2026-06-01T14:25:36Z","snapshot_observed_at":"2026-07-06T23:42:44.661608Z","submitted_at":"2026-06-01T14:25:36Z","title":"Mapping Whisper Representations to Human ECoG Responses with Interpretable Time-Resolved Neural Encoding","version":1},"reference_index":128,"source":"arxiv_source","source_observed_at":"2026-06-28T11:39:30.563754Z"},"links":{"cited_paper":"/paper/2012.09841","citing_paper":"/paper/2606.02305"},"observation_digest":"sha256:8a4fc8d239e401075016ba22e30cb00102006ac17ceff19fa7068e24f1fc408f","observation_id":"e0631fdc-ce03-4906-ba42-240e4f13806d","resolution":{"observed_at":"2026-06-28T11:42:04.140355Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09841","last_updated":"2021-06-23T16:07:21Z","snapshot_observed_at":"2026-08-07T00:06:20.341178Z","submitted_at":"2020-12-17T18:57:28Z","title":"Taming Transformers for High-Resolution Image Synthesis","version":3},"cited_work":{"arxiv_id":"2012.09841","doi":"10.48550/arxiv.2012.09841","metadata_source":"arxiv_reference","pith_arxiv_id":"2012.09841","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Esser, R","venue":null,"work_id":"b467cc9a-4a7a-4b7e-a4e5-d966dc3be597","year":2012},"citing_paper":{"arxiv_id":"2606.08032","last_updated":"2026-06-06T07:50:50Z","snapshot_observed_at":"2026-08-05T12:36:21.118127Z","submitted_at":"2026-06-06T07:50:50Z","title":"Variational Proximal Policy Optimization","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-06-27T19:22:23.768249Z"},"links":{"cited_paper":"/paper/2012.09841","citing_paper":"/paper/2606.08032"},"observation_digest":"sha256:761a26d6ff408d9681cf7fa860929590c7444fb63213119f70710a831877d4fb","observation_id":"7aa61616-3ae2-417a-b70b-fa8eb1c68ca9","resolution":{"observed_at":"2026-07-02T21:57:26.059020Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09841","last_updated":"2021-06-23T16:07:21Z","snapshot_observed_at":"2026-08-07T00:06:20.341178Z","submitted_at":"2020-12-17T18:57:28Z","title":"Taming Transformers for High-Resolution Image Synthesis","version":3},"cited_work":{"arxiv_id":"2012.09841","doi":"10.48550/arxiv.2012.09841","metadata_source":"arxiv_reference","pith_arxiv_id":"2012.09841","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Esser, R","venue":null,"work_id":"b467cc9a-4a7a-4b7e-a4e5-d966dc3be597","year":2012},"citing_paper":{"arxiv_id":"2606.11363","last_updated":"2026-06-09T18:43:29Z","snapshot_observed_at":"2026-08-06T10:47:54.873857Z","submitted_at":"2026-06-09T18:43:29Z","title":"NSVQ: Mitigating Codebook Collapse by Stabilizing Encoder Drift in Vector Quantization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T13:18:47.472178Z"},"links":{"cited_paper":"/paper/2012.09841","citing_paper":"/paper/2606.11363"},"observation_digest":"sha256:fe0d12cb04b204ac6899d0be3b6e5d381c946e22b6b5a5636c76a596c35abd50","observation_id":"542bbc52-ab6e-49ae-9736-e90bc4695b2c","resolution":{"observed_at":"2026-07-03T05:27:39.708579Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09841","last_updated":"2021-06-23T16:07:21Z","snapshot_observed_at":"2026-08-07T00:06:20.341178Z","submitted_at":"2020-12-17T18:57:28Z","title":"Taming Transformers for High-Resolution Image Synthesis","version":3},"cited_work":{"arxiv_id":"2012.09841","doi":"10.48550/arxiv.2012.09841","metadata_source":"arxiv_reference","pith_arxiv_id":"2012.09841","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Esser, R","venue":null,"work_id":"b467cc9a-4a7a-4b7e-a4e5-d966dc3be597","year":2012},"citing_paper":{"arxiv_id":"2606.19151","last_updated":"2026-06-17T14:56:42Z","snapshot_observed_at":"2026-07-29T21:37:47.699702Z","submitted_at":"2026-06-17T14:56:42Z","title":"The Market in the Model: Latent Diffusion as Neural Economy","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T19:05:25.386543Z"},"links":{"cited_paper":"/paper/2012.09841","citing_paper":"/paper/2606.19151"},"observation_digest":"sha256:38b89e2898cfe95ea7c9f6c505284fe2166d05e6876e1a0f45bf987fbfcc652c","observation_id":"70464072-1d41-4a12-98c3-acceea611229","resolution":{"observed_at":"2026-07-04T02:49:24.758638Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09841","last_updated":"2021-06-23T16:07:21Z","snapshot_observed_at":"2026-08-07T00:06:20.341178Z","submitted_at":"2020-12-17T18:57:28Z","title":"Taming Transformers for High-Resolution Image Synthesis","version":3},"cited_work":{"arxiv_id":"2012.09841","doi":"10.48550/arxiv.2012.09841","metadata_source":"arxiv_reference","pith_arxiv_id":"2012.09841","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Esser, R","venue":null,"work_id":"b467cc9a-4a7a-4b7e-a4e5-d966dc3be597","year":2012},"citing_paper":{"arxiv_id":"2606.19195","last_updated":"2026-06-17T15:35:38Z","snapshot_observed_at":"2026-08-06T01:19:08.037803Z","submitted_at":"2026-06-17T15:35:38Z","title":"Moebius: 0.2B Lightweight Image Inpainting Framework with 10B-Level Performance","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T21:03:43.962738Z"},"links":{"cited_paper":"/paper/2012.09841","citing_paper":"/paper/2606.19195"},"observation_digest":"sha256:f9d976cf724d844040d31723e9a6a93105a390691fcd0d2aa26934937df51771","observation_id":"9f2441b9-0330-4bcb-b0a0-5d1c596fbad7","resolution":{"observed_at":"2026-07-04T00:39:17.090513Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09841","last_updated":"2021-06-23T16:07:21Z","snapshot_observed_at":"2026-08-07T00:06:20.341178Z","submitted_at":"2020-12-17T18:57:28Z","title":"Taming Transformers for High-Resolution Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.09841","snapshot_observed_at":"2026-08-01T13:39:00.040780Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.19064","last_updated":"2026-07-22T15:23:32Z","snapshot_observed_at":"2026-08-06T06:06:33.902183Z","submitted_at":"2026-07-21T12:55:34Z","title":"Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:00.040780Z"},"links":{"cited_paper":"/paper/2012.09841","citing_paper":"/paper/2607.19064"},"observation_digest":"sha256:300f63103cd23d2e47de05f2503c3d85e0579d449710d2f6ede104cb760771ac","observation_id":"d0707cb4-3fa8-4053-8994-3dca0f5a748d","resolution":{"observed_at":"2026-08-01T13:39:00.040780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09841","last_updated":"2021-06-23T16:07:21Z","snapshot_observed_at":"2026-08-07T00:06:20.341178Z","submitted_at":"2020-12-17T18:57:28Z","title":"Taming Transformers for High-Resolution Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.09841","snapshot_observed_at":"2026-08-03T16:50:35.363661Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.28945","last_updated":"2026-07-31T01:57:07Z","snapshot_observed_at":"2026-08-05T23:12:09.495581Z","submitted_at":"2026-07-31T01:57:07Z","title":"FairDiffuseVQVAE: Sampling-Time Fairness in Tabular Diffusion via Conditional Refinement of Vector-Quantized Latents","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-03T16:50:35.363661Z"},"links":{"cited_paper":"/paper/2012.09841","citing_paper":"/paper/2607.28945"},"observation_digest":"sha256:dcb7749206226fe585b1fa54910b75ccc93eded17834716106b1d71260e17e4f","observation_id":"01433ba0-a80d-4a11-b89c-51a8c8fefd1a","resolution":{"observed_at":"2026-08-03T16:50:35.363661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2012.09841/citation-record","integrity":"/paper/2012.09841/integrity","json":"/paper/2012.09841/citation-record.json","paper":"/paper/2012.09841"},"outbound":[],"paper":{"arxiv_id":"2012.09841","last_updated":"2021-06-23T16:07:21Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T00:06:20.341178Z","submitted_at":"2020-12-17T18:57:28Z","title":"Taming Transformers for High-Resolution Image Synthesis"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 24 inbound Pith citation observations for arXiv:2012.09841."}