{"as_of":"2026-08-13T03:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:abf17ddd131003b0f1692c47a4b025112e315573af8ac26c261e6618d8dc4c08","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T23:02:16.499212Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.02929/citation-record","integrity":"/paper/2412.02929/integrity","json":"/paper/2412.02929/citation-record.json","paper":"/paper/2412.02929"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:02:18.313479Z","title":null,"venue":null,"work_id":"cf1aa4cb-316b-443a-ba8a-a53f242bdda9","year":2023},"citing_paper":{"arxiv_id":"2412.02929","last_updated":"2025-02-22T05:58:21Z","snapshot_observed_at":"2026-08-12T10:38:46.097532Z","submitted_at":"2024-12-04T00:42:15Z","title":"Panoptic Diffusion Models: co-generation of images and segmentation maps","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T23:02:16.000083Z"},"links":{"citing_paper":"/paper/2412.02929"},"observation_digest":"sha256:d7dad77189961cc17401db422d867e4d86cea272d2eaa0e47ee88181ca75cad2","observation_id":"c31c460b-5add-45ee-b833-7e31738708ed","resolution":{"observed_at":"2026-08-11T23:02:18.322481Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:02:18.277132Z","title":null,"venue":null,"work_id":"a3527983-239e-4abb-9da6-2956bda055fe","year":2023},"citing_paper":{"arxiv_id":"2412.02929","last_updated":"2025-02-22T05:58:21Z","snapshot_observed_at":"2026-08-12T10:38:46.097532Z","submitted_at":"2024-12-04T00:42:15Z","title":"Panoptic Diffusion Models: co-generation of images and segmentation maps","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T23:02:16.012177Z"},"links":{"citing_paper":"/paper/2412.02929"},"observation_digest":"sha256:30f2896cb6325222de0436ed606c6d0eea06786e02bc2986d23f1d134b10ca5d","observation_id":"88cc893e-d035-4e98-953a-923af3235568","resolution":{"observed_at":"2026-08-11T23:02:18.288285Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12945","last_updated":"2024-02-05T16:36:30Z","snapshot_observed_at":"2026-08-08T15:14:24.281572Z","submitted_at":"2024-01-23T18:05:25Z","title":"Lumiere: A Space-Time Diffusion Model for Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12945","snapshot_observed_at":"2026-08-11T23:02:16.019599Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02929","last_updated":"2025-02-22T05:58:21Z","snapshot_observed_at":"2026-08-12T10:38:46.097532Z","submitted_at":"2024-12-04T00:42:15Z","title":"Panoptic Diffusion Models: co-generation of images and segmentation maps","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T23:02:16.019599Z"},"links":{"cited_paper":"/paper/2401.12945","citing_paper":"/paper/2412.02929"},"observation_digest":"sha256:8c2fa2074ea31e43ffadc92d51d7c04ad06e74f5636c28b8ea205961b24c72e8","observation_id":"3b50c668-e893-49fc-8d9f-0ca408a7dda1","resolution":{"observed_at":"2026-08-11T23:02:16.019599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.03126","last_updated":"2022-03-16T01:35:49Z","snapshot_observed_at":"2026-08-12T01:15:35.596933Z","submitted_at":"2021-12-06T15:55:30Z","title":"Label-Efficient Semantic Segmentation with Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.03126","snapshot_observed_at":"2026-08-11T23:02:16.039278Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.02929","last_updated":"2025-02-22T05:58:21Z","snapshot_observed_at":"2026-08-12T10:38:46.097532Z","submitted_at":"2024-12-04T00:42:15Z","title":"Panoptic Diffusion Models: co-generation of images and segmentation maps","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T23:02:16.039278Z"},"links":{"cited_paper":"/paper/2112.03126","citing_paper":"/paper/2412.02929"},"observation_digest":"sha256:d5171ec3f59a51c1cacf05542fadff7122eecd75c7d9ee9cb2e7c26ab5012bb7","observation_id":"3efdd5f4-98d6-4294-9ed0-ddd137465860","resolution":{"observed_at":"2026-08-11T23:02:16.039278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04248","last_updated":"2023-03-07T21:46:15Z","snapshot_observed_at":"2026-08-09T12:22:44.106674Z","submitted_at":"2023-03-07T21:46:15Z","title":"TRACT: Denoising Diffusion Models with Transitive Closure Time-Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04248","snapshot_observed_at":"2026-08-11T23:02:16.046098Z","title":"A.; Zhai, S.; Hu, S.; Zheng, D.; Talbott, W.; and Gu, E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02929","last_updated":"2025-02-22T05:58:21Z","snapshot_observed_at":"2026-08-12T10:38:46.097532Z","submitted_at":"2024-12-04T00:42:15Z","title":"Panoptic Diffusion Models: co-generation of images and segmentation maps","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T23:02:16.046098Z"},"links":{"cited_paper":"/paper/2303.04248","citing_paper":"/paper/2412.02929"},"observation_digest":"sha256:96756c3de9aac02ede0da902657000ada43535e46752886bc58c2e3a8f0d73da","observation_id":"ac007b57-9c7c-494f-81f2-2b119226ea46","resolution":{"observed_at":"2026-08-11T23:02:16.046098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09800","last_updated":"2023-01-18T17:31:52Z","snapshot_observed_at":"2026-08-06T07:25:23.651829Z","submitted_at":"2022-11-17T18:58:43Z","title":"InstructPix2Pix: Learning to Follow Image Editing Instructions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09800","snapshot_observed_at":"2026-08-11T23:02:16.067052Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02929","last_updated":"2025-02-22T05:58:21Z","snapshot_observed_at":"2026-08-12T10:38:46.097532Z","submitted_at":"2024-12-04T00:42:15Z","title":"Panoptic Diffusion Models: co-generation of images and segmentation maps","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T23:02:16.067052Z"},"links":{"cited_paper":"/paper/2211.09800","citing_paper":"/paper/2412.02929"},"observation_digest":"sha256:ca30f84ce0a31687780be11b6e80433d4da9e099f59e683ad6e07c90c0108cb3","observation_id":"ac375ce6-948c-480a-b0be-7e486dc5038e","resolution":{"observed_at":"2026-08-11T23:02:16.067052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:02:16.078493Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02929","last_updated":"2025-02-22T05:58:21Z","snapshot_observed_at":"2026-08-12T10:38:46.097532Z","submitted_at":"2024-12-04T00:42:15Z","title":"Panoptic Diffusion Models: co-generation of images and segmentation maps","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T23:02:16.078493Z"},"links":{"citing_paper":"/paper/2412.02929"},"observation_digest":"sha256:8a8dd1cd647d13da8b02d6ae509769be2d9105fd848c9f07a9ac4e604c610658","observation_id":"a858f3d0-d82e-4b58-aedd-342878ade90f","resolution":{"observed_at":"2026-08-11T23:02:16.078493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.12872","last_updated":"2020-05-28T17:37:23Z","snapshot_observed_at":"2026-08-12T19:36:54.629925Z","submitted_at":"2020-05-26T17:06:38Z","title":"End-to-End Object Detection with Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.12872","snapshot_observed_at":"2026-08-11T23:02:16.090323Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.02929","last_updated":"2025-02-22T05:58:21Z","snapshot_observed_at":"2026-08-12T10:38:46.097532Z","submitted_at":"2024-12-04T00:42:15Z","title":"Panoptic Diffusion Models: co-generation of images and segmentation maps","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T23:02:16.090323Z"},"links":{"cited_paper":"/paper/2005.12872","citing_paper":"/paper/2412.02929"},"observation_digest":"sha256:232612befa84605ccb0745480361f0fbc26f5bcba917cbf64bdf9f81e7d3e607","observation_id":"6d2e6071-af6b-4aed-9fb5-4c5e5f93ea0d","resolution":{"observed_at":"2026-08-11T23:02:16.090323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:02:18.211826Z","title":null,"venue":null,"work_id":"1cc60d02-0fd3-4496-b774-2e8deb3e1aef","year":2023},"citing_paper":{"arxiv_id":"2412.02929","last_updated":"2025-02-22T05:58:21Z","snapshot_observed_at":"2026-08-12T10:38:46.097532Z","submitted_at":"2024-12-04T00:42:15Z","title":"Panoptic Diffusion Models: co-generation of images and segmentation maps","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T23:02:16.107613Z"},"links":{"citing_paper":"/paper/2412.02929"},"observation_digest":"sha256:89530becbaa4c476962ab737dc29101431ce02251f69b766db6ebac6e49df12d","observation_id":"a9adae15-ba61-4316-8f1a-ae62906337ee","resolution":{"observed_at":"2026-08-11T23:02:18.220125Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.04202","last_updated":"2023-03-01T00:18:33Z","snapshot_observed_at":"2026-08-06T15:11:19.955049Z","submitted_at":"2022-08-08T15:08:40Z","title":"Analog Bits: Generating Discrete Data using Diffusion Models with Self-Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.04202","snapshot_observed_at":"2026-08-11T23:02:16.120211Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.02929","last_updated":"2025-02-22T05:58:21Z","snapshot_observed_at":"2026-08-12T10:38:46.097532Z","submitted_at":"2024-12-04T00:42:15Z","title":"Panoptic Diffusion Models: co-generation of images and segmentation maps","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T23:02:16.120211Z"},"links":{"cited_paper":"/paper/2208.04202","citing_paper":"/paper/2412.02929"},"observation_digest":"sha256:683381025bcc8fb0cbe2ca087265c7e94a7ebd3e0deb8ede75c80bed060c5f43","observation_id":"2bb28a40-ae9a-4eb5-93b1-5c7126b9263f","resolution":{"observed_at":"2026-08-11T23:02:16.120211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:02:18.183965Z","title":"G.; Kirillov, A.; and Girdhar, R","venue":null,"work_id":"e9996daf-3adb-4a8b-9145-f5e618673579","year":2022},"citing_paper":{"arxiv_id":"2412.02929","last_updated":"2025-02-22T05:58:21Z","snapshot_observed_at":"2026-08-12T10:38:46.097532Z","submitted_at":"2024-12-04T00:42:15Z","title":"Panoptic Diffusion Models: co-generation of images and segmentation maps","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T23:02:16.134880Z"},"links":{"citing_paper":"/paper/2412.02929"},"observation_digest":"sha256:4872560d97311fa6a5be49ad9ebceb598f0bb199b2f82cb8f00ed6e8a18ee399","observation_id":"15f05e15-afec-47e2-97d8-f6010aea47ae","resolution":{"observed_at":"2026-08-11T23:02:18.192262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.05233","last_updated":"2021-06-01T17:49:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-05-11T17:50:24Z","title":"Diffusion Models Beat GANs on Image Synthesis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.05233","snapshot_observed_at":"2026-08-11T23:02:16.142664Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.02929","last_updated":"2025-02-22T05:58:21Z","snapshot_observed_at":"2026-08-12T10:38:46.097532Z","submitted_at":"2024-12-04T00:42:15Z","title":"Panoptic Diffusion Models: co-generation of images and segmentation maps","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T23:02:16.142664Z"},"links":{"cited_paper":"/paper/2105.05233","citing_paper":"/paper/2412.02929"},"observation_digest":"sha256:f09ed880139e097f179f525467f74c6de6b70fec57dce46638b7950b4733a3b5","observation_id":"c1c3e792-ce05-4203-97b2-c5347f133105","resolution":{"observed_at":"2026-08-11T23:02:16.142664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.13131","last_updated":"2022-03-24T15:44:50Z","snapshot_observed_at":"2026-08-06T19:08:21.390272Z","submitted_at":"2022-03-24T15:44:50Z","title":"Make-A-Scene: Scene-Based Text-to-Image Generation with Human Priors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.13131","snapshot_observed_at":"2026-08-11T23:02:16.155084Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.02929","last_updated":"2025-02-22T05:58:21Z","snapshot_observed_at":"2026-08-12T10:38:46.097532Z","submitted_at":"2024-12-04T00:42:15Z","title":"Panoptic Diffusion Models: co-generation of images and segmentation maps","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T23:02:16.155084Z"},"links":{"cited_paper":"/paper/2203.13131","citing_paper":"/paper/2412.02929"},"observation_digest":"sha256:762c48ab31fdf2e6cff01b9bc46dfffb991d9fa396de11e30b1a07a62eb57f67","observation_id":"35a9d9f2-af4d-44a4-a181-5ecd624b11de","resolution":{"observed_at":"2026-08-11T23:02:16.155084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.08083","last_updated":"2015-09-27T15:10:14Z","snapshot_observed_at":"2026-08-10T10:04:53.772315Z","submitted_at":"2015-04-30T05:13:08Z","title":"Fast R-CNN","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.08083","snapshot_observed_at":"2026-08-11T23:02:16.163082Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.02929","last_updated":"2025-02-22T05:58:21Z","snapshot_observed_at":"2026-08-12T10:38:46.097532Z","submitted_at":"2024-12-04T00:42:15Z","title":"Panoptic Diffusion Models: co-generation of images and segmentation maps","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T23:02:16.163082Z"},"links":{"cited_paper":"/paper/1504.08083","citing_paper":"/paper/2412.02929"},"observation_digest":"sha256:f62e30a30feadd8cb13503dbff6824e1193d80f7400f22b31263b97c48a3804d","observation_id":"b25e4795-2b40-4407-8704-2a64523c38b6","resolution":{"observed_at":"2026-08-11T23:02:16.163082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.14822","last_updated":"2022-03-03T10:49:30Z","snapshot_observed_at":"2026-07-06T12:13:17.374586Z","submitted_at":"2021-11-29T18:59:46Z","title":"Vector Quantized Diffusion Model for Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.14822","snapshot_observed_at":"2026-08-11T23:02:16.173684Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.02929","last_updated":"2025-02-22T05:58:21Z","snapshot_observed_at":"2026-08-12T10:38:46.097532Z","submitted_at":"2024-12-04T00:42:15Z","title":"Panoptic Diffusion Models: co-generation of images and segmentation maps","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T23:02:16.173684Z"},"links":{"cited_paper":"/paper/2111.14822","citing_paper":"/paper/2412.02929"},"observation_digest":"sha256:5d4c1ae0758ff3ab76178edb35b8abaa38bbc7b6deecfba87e1e09367359116f","observation_id":"5822a77d-c2f4-42fe-900d-169e0d7d1681","resolution":{"observed_at":"2026-08-11T23:02:16.173684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1703.06870","last_updated":"2018-01-24T07:54:08Z","snapshot_observed_at":"2026-08-08T19:08:12.187509Z","submitted_at":"2017-03-20T17:53:38Z","title":"Mask R-CNN","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.06870","snapshot_observed_at":"2026-08-11T23:02:16.187064Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.02929","last_updated":"2025-02-22T05:58:21Z","snapshot_observed_at":"2026-08-12T10:38:46.097532Z","submitted_at":"2024-12-04T00:42:15Z","title":"Panoptic Diffusion Models: co-generation of images and segmentation maps","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T23:02:16.187064Z"},"links":{"cited_paper":"/paper/1703.06870","citing_paper":"/paper/2412.02929"},"observation_digest":"sha256:74feb906b5b3d065e9f59f782a291972accb98ffdb2d9735d3a9e4846dabc728","observation_id":"7bd73e04-4e2d-4fef-8019-88e28974dff9","resolution":{"observed_at":"2026-08-11T23:02:16.187064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01626","last_updated":"2022-08-02T17:55:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-02T17:55:41Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01626","snapshot_observed_at":"2026-08-11T23:02:16.206928Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.02929","last_updated":"2025-02-22T05:58:21Z","snapshot_observed_at":"2026-08-12T10:38:46.097532Z","submitted_at":"2024-12-04T00:42:15Z","title":"Panoptic Diffusion Models: co-generation of images and segmentation maps","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T23:02:16.206928Z"},"links":{"cited_paper":"/paper/2208.01626","citing_paper":"/paper/2412.02929"},"observation_digest":"sha256:3913c13973e65f738461685a56b3c9ed1134f439f3717b83f1bf1163b26d7649","observation_id":"bd231f9c-3c9f-4ea7-bf37-06913bb3fa24","resolution":{"observed_at":"2026-08-11T23:02:16.206928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-11T23:02:16.217583Z","title":"L.; and Choi, Y","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.02929","last_updated":"2025-02-22T05:58:21Z","snapshot_observed_at":"2026-08-12T10:38:46.097532Z","submitted_at":"2024-12-04T00:42:15Z","title":"Panoptic Diffusion Models: co-generation of images and segmentation maps","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T23:02:16.217583Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2412.02929"},"observation_digest":"sha256:4a742395489bb09d4f37473ad3287c8bf3e7d83696a3fa6f48e52a7f4669d601","observation_id":"5a66836b-5dc7-4da0-8900-02125e3c1cad","resolution":{"observed_at":"2026-08-11T23:02:16.217583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:02:16.227848Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.02929","last_updated":"2025-02-22T05:58:21Z","snapshot_observed_at":"2026-08-12T10:38:46.097532Z","submitted_at":"2024-12-04T00:42:15Z","title":"Panoptic Diffusion Models: co-generation of images and segmentation maps","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T23:02:16.227848Z"},"links":{"citing_paper":"/paper/2412.02929"},"observation_digest":"sha256:54b91b007545b13135cf661f8bdcad5d5820e4640084605cb1f399e9cea62c18","observation_id":"c0a36c3a-218a-4767-9e75-7d66b46ee420","resolution":{"observed_at":"2026-08-11T23:02:16.227848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-11T23:02:16.233602Z","title":"P.; Poole, B.; Norouzi, M.; Fleet, D","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.02929","last_updated":"2025-02-22T05:58:21Z","snapshot_observed_at":"2026-08-12T10:38:46.097532Z","submitted_at":"2024-12-04T00:42:15Z","title":"Panoptic Diffusion Models: co-generation of images and segmentation maps","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T23:02:16.233602Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2412.02929"},"observation_digest":"sha256:459a27a9d7b810dd2c9b7fe43d39c12548126adbf860ba2f8745642d3e23f8bd","observation_id":"35b69ff9-84ce-4c48-8944-7ed43c5c6f44","resolution":{"observed_at":"2026-08-11T23:02:16.233602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:02:18.119813Z","title":null,"venue":null,"work_id":"795325dd-a6bd-4ed0-9f3e-7c7d80f67f49","year":2020},"citing_paper":{"arxiv_id":"2412.02929","last_updated":"2025-02-22T05:58:21Z","snapshot_observed_at":"2026-08-12T10:38:46.097532Z","submitted_at":"2024-12-04T00:42:15Z","title":"Panoptic Diffusion Models: co-generation of images and segmentation maps","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T23:02:16.247982Z"},"links":{"citing_paper":"/paper/2412.02929"},"observation_digest":"sha256:612987e08ed6bb20fda1d38d1d56984534ff1ef74b5e2f593a47ba2176f4df38","observation_id":"db94aef3-4eb0-4099-b04c-0d54378565dc","resolution":{"observed_at":"2026-08-11T23:02:18.133359Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-12T19:28:23.372660Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-11T23:02:16.260018Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.02929","last_updated":"2025-02-22T05:58:21Z","snapshot_observed_at":"2026-08-12T10:38:46.097532Z","submitted_at":"2024-12-04T00:42:15Z","title":"Panoptic Diffusion Models: co-generation of images and segmentation maps","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T23:02:16.260018Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2412.02929"},"observation_digest":"sha256:4fc2156efd16a7115e0177b57f78ff1f60c08528226cb4df9260c84e7eb54d96","observation_id":"b6ac713e-197c-4ce7-a4ca-51b2d7f60476","resolution":{"observed_at":"2026-08-11T23:02:16.260018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.03458","last_updated":"2022-06-22T20:22:29Z","snapshot_observed_at":"2026-07-06T12:57:51.108636Z","submitted_at":"2022-04-07T14:08:02Z","title":"Video Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.03458","snapshot_observed_at":"2026-08-11T23:02:16.276802Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.02929","last_updated":"2025-02-22T05:58:21Z","snapshot_observed_at":"2026-08-12T10:38:46.097532Z","submitted_at":"2024-12-04T00:42:15Z","title":"Panoptic Diffusion Models: co-generation of images and segmentation maps","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T23:02:16.276802Z"},"links":{"cited_paper":"/paper/2204.03458","citing_paper":"/paper/2412.02929"},"observation_digest":"sha256:2915ebeffa1ff21aa2dc376f5b93cb20b93c457678d9124cf48625b373d3b684","observation_id":"fcd4a93b-9525-4d35-a818-df5ecec02dcd","resolution":{"observed_at":"2026-08-11T23:02:16.276802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1902.00751","last_updated":"2019-06-13T17:48:30Z","snapshot_observed_at":"2026-07-06T07:30:44.870185Z","submitted_at":"2019-02-02T16:29:47Z","title":"Parameter-Efficient Transfer Learning for NLP","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.00751","snapshot_observed_at":"2026-08-11T23:02:16.294121Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.02929","last_updated":"2025-02-22T05:58:21Z","snapshot_observed_at":"2026-08-12T10:38:46.097532Z","submitted_at":"2024-12-04T00:42:15Z","title":"Panoptic Diffusion Models: co-generation of images and segmentation maps","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T23:02:16.294121Z"},"links":{"cited_paper":"/paper/1902.00751","citing_paper":"/paper/2412.02929"},"observation_digest":"sha256:2f341bfad5971d6383bfb64ce57d1f2576071ea99ec148311ee994474b7a45ba","observation_id":"79ad33f7-d72c-4cf7-b3d6-e87efc439e23","resolution":{"observed_at":"2026-08-11T23:02:16.294121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00868","last_updated":"2019-04-10T18:17:40Z","snapshot_observed_at":"2026-07-06T06:16:56.937835Z","submitted_at":"2018-01-03T00:21:31Z","title":"Panoptic Segmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00868","snapshot_observed_at":"2026-08-11T23:02:16.308050Z","title":"B.; Rother, C.; and Doll \\' a r, P","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.02929","last_updated":"2025-02-22T05:58:21Z","snapshot_observed_at":"2026-08-12T10:38:46.097532Z","submitted_at":"2024-12-04T00:42:15Z","title":"Panoptic Diffusion Models: co-generation of images and segmentation maps","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T23:02:16.308050Z"},"links":{"cited_paper":"/paper/1801.00868","citing_paper":"/paper/2412.02929"},"observation_digest":"sha256:1501ab976ca5a288cf56bb03495532e33348dd5edc7dca7ba9ae8e21558512f4","observation_id":"d7539f6f-d594-4213-8070-4826f9816c4b","resolution":{"observed_at":"2026-08-11T23:02:16.308050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-08-08T05:14:59.435033Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-11T23:02:16.319247Z","title":"C.; Lo, W.-Y.; Doll \\'a r, P.; and Girshick, R","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02929","last_updated":"2025-02-22T05:58:21Z","snapshot_observed_at":"2026-08-12T10:38:46.097532Z","submitted_at":"2024-12-04T00:42:15Z","title":"Panoptic Diffusion Models: co-generation of images and segmentation maps","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T23:02:16.319247Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2412.02929"},"observation_digest":"sha256:eaf21076f82b3e89aea811e7386ab353761d600ea96bcaac24094b5915539a42","observation_id":"31fda55c-7b6e-44da-bba9-849bd293ca29","resolution":{"observed_at":"2026-08-11T23:02:16.319247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1405.0312","last_updated":"2015-02-21T01:48:49Z","snapshot_observed_at":"2026-07-06T03:42:37.507458Z","submitted_at":"2014-05-01T21:43:32Z","title":"Microsoft COCO: Common Objects in Context","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1405.0312","snapshot_observed_at":"2026-08-11T23:02:16.328751Z","title":"L.; and Dollár, P","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.02929","last_updated":"2025-02-22T05:58:21Z","snapshot_observed_at":"2026-08-12T10:38:46.097532Z","submitted_at":"2024-12-04T00:42:15Z","title":"Panoptic Diffusion Models: co-generation of images and segmentation maps","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T23:02:16.328751Z"},"links":{"cited_paper":"/paper/1405.0312","citing_paper":"/paper/2412.02929"},"observation_digest":"sha256:8202cd0343b4d89eb43446d47e0f32549ef687927da0115bf5f285f1b5197afa","observation_id":"af4ea633-9f03-4067-91c7-e81d7a42a611","resolution":{"observed_at":"2026-08-11T23:02:16.328751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:02:18.067027Z","title":null,"venue":null,"work_id":"5180f5ff-0bb8-4107-aa50-8befe5cc9c25","year":2021},"citing_paper":{"arxiv_id":"2412.02929","last_updated":"2025-02-22T05:58:21Z","snapshot_observed_at":"2026-08-12T10:38:46.097532Z","submitted_at":"2024-12-04T00:42:15Z","title":"Panoptic Diffusion Models: co-generation of images and segmentation maps","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T23:02:16.336273Z"},"links":{"citing_paper":"/paper/2412.02929"},"observation_digest":"sha256:6cbe0f6543719e904d58760c2b7be9ec99eaa1f3dcf2bd0121b9876c2bd51569","observation_id":"bec58eb1-74a8-44e4-a5e0-579fd8cb7aec","resolution":{"observed_at":"2026-08-11T23:02:18.076156Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:02:18.020231Z","title":null,"venue":null,"work_id":"9472da39-92ee-4264-8f49-f06dc5b2ed2c","year":2022},"citing_paper":{"arxiv_id":"2412.02929","last_updated":"2025-02-22T05:58:21Z","snapshot_observed_at":"2026-08-12T10:38:46.097532Z","submitted_at":"2024-12-04T00:42:15Z","title":"Panoptic Diffusion Models: co-generation of images and segmentation maps","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T23:02:16.349846Z"},"links":{"citing_paper":"/paper/2412.02929"},"observation_digest":"sha256:12773ad36e41292641501d2aec2ebb2b9adb1a5b36c06b6ed583745ae264aaa6","observation_id":"76bd426b-1779-45ff-b1c0-5456de5382c5","resolution":{"observed_at":"2026-08-11T23:02:18.031568Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01095","last_updated":"2025-05-19T07:56:56Z","snapshot_observed_at":"2026-07-29T20:17:21.488997Z","submitted_at":"2022-11-02T13:14:30Z","title":"DPM-Solver++: Fast Solver for Guided Sampling of Diffusion Probabilistic Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01095","snapshot_observed_at":"2026-08-11T23:02:16.355967Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02929","last_updated":"2025-02-22T05:58:21Z","snapshot_observed_at":"2026-08-12T10:38:46.097532Z","submitted_at":"2024-12-04T00:42:15Z","title":"Panoptic Diffusion Models: co-generation of images and segmentation maps","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T23:02:16.355967Z"},"links":{"cited_paper":"/paper/2211.01095","citing_paper":"/paper/2412.02929"},"observation_digest":"sha256:1df0ed5c3424634c26ac5c047f54847b331a340c728ed95b08ea689e97dc4814","observation_id":"fb74bb59-e557-4024-94df-1cecde5b20fc","resolution":{"observed_at":"2026-08-11T23:02:16.355967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.01073","last_updated":"2022-01-05T00:07:35Z","snapshot_observed_at":"2026-08-08T06:35:17.078531Z","submitted_at":"2021-08-02T17:59:47Z","title":"SDEdit: Guided Image Synthesis and Editing with Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.01073","snapshot_observed_at":"2026-08-11T23:02:16.364545Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.02929","last_updated":"2025-02-22T05:58:21Z","snapshot_observed_at":"2026-08-12T10:38:46.097532Z","submitted_at":"2024-12-04T00:42:15Z","title":"Panoptic Diffusion Models: co-generation of images and segmentation maps","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T23:02:16.364545Z"},"links":{"cited_paper":"/paper/2108.01073","citing_paper":"/paper/2412.02929"},"observation_digest":"sha256:3a368d24846df5b8add7f2040aaa333c0d6e08b12827b30359d359eeddf09b8b","observation_id":"18c465a7-26bb-425c-806b-37e9da8736dd","resolution":{"observed_at":"2026-08-11T23:02:16.364545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.08453","last_updated":"2023-03-20T10:52:26Z","snapshot_observed_at":"2026-07-31T21:11:02.534986Z","submitted_at":"2023-02-16T17:56:08Z","title":"T2I-Adapter: Learning Adapters to Dig out More Controllable Ability for Text-to-Image Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.08453","snapshot_observed_at":"2026-08-11T23:02:16.370213Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02929","last_updated":"2025-02-22T05:58:21Z","snapshot_observed_at":"2026-08-12T10:38:46.097532Z","submitted_at":"2024-12-04T00:42:15Z","title":"Panoptic Diffusion Models: co-generation of images and segmentation maps","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T23:02:16.370213Z"},"links":{"cited_paper":"/paper/2302.08453","citing_paper":"/paper/2412.02929"},"observation_digest":"sha256:863763bf3a21b5dfcd1dccb136c2db0ba94664b2bc20919fa8a2d2e876ef8704","observation_id":"69561496-08c5-4609-980b-956fc524d48b","resolution":{"observed_at":"2026-08-11T23:02:16.370213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.09672","last_updated":"2021-02-18T23:44:17Z","snapshot_observed_at":"2026-08-06T00:36:41.660457Z","submitted_at":"2021-02-18T23:44:17Z","title":"Improved Denoising Diffusion Probabilistic Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.09672","snapshot_observed_at":"2026-08-11T23:02:16.381939Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.02929","last_updated":"2025-02-22T05:58:21Z","snapshot_observed_at":"2026-08-12T10:38:46.097532Z","submitted_at":"2024-12-04T00:42:15Z","title":"Panoptic Diffusion Models: co-generation of images and segmentation maps","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T23:02:16.381939Z"},"links":{"cited_paper":"/paper/2102.09672","citing_paper":"/paper/2412.02929"},"observation_digest":"sha256:8ae9843e52d58024a00b0974ba1696c604a01105ea77c3e2cd2ddf7988dc7ef0","observation_id":"eabc4f59-33f0-4832-8d6f-733ead656708","resolution":{"observed_at":"2026-08-11T23:02:16.381939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10741","last_updated":"2022-03-08T18:18:49Z","snapshot_observed_at":"2026-08-07T12:21:17.790675Z","submitted_at":"2021-12-20T18:42:55Z","title":"GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10741","snapshot_observed_at":"2026-08-11T23:02:16.389772Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.02929","last_updated":"2025-02-22T05:58:21Z","snapshot_observed_at":"2026-08-12T10:38:46.097532Z","submitted_at":"2024-12-04T00:42:15Z","title":"Panoptic Diffusion Models: co-generation of images and segmentation maps","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T23:02:16.389772Z"},"links":{"cited_paper":"/paper/2112.10741","citing_paper":"/paper/2412.02929"},"observation_digest":"sha256:118a96f629f4a2858c48c3a582dc458853ad2bf74f428e34f0cc41dd9b6e0992","observation_id":"88bd928d-ff98-4a93-a389-09d0bf97c754","resolution":{"observed_at":"2026-08-11T23:02:16.389772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09748","last_updated":"2023-03-02T09:06:55Z","snapshot_observed_at":"2026-07-06T14:32:37.317828Z","submitted_at":"2022-12-19T18:59:58Z","title":"Scalable Diffusion Models with Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09748","snapshot_observed_at":"2026-08-11T23:02:16.398212Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.02929","last_updated":"2025-02-22T05:58:21Z","snapshot_observed_at":"2026-08-12T10:38:46.097532Z","submitted_at":"2024-12-04T00:42:15Z","title":"Panoptic Diffusion Models: co-generation of images and segmentation maps","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T23:02:16.398212Z"},"links":{"cited_paper":"/paper/2212.09748","citing_paper":"/paper/2412.02929"},"observation_digest":"sha256:9748980d46f7a20745ff036d783ebdd3f1d38fce91ba8a82d2a1d956efbfd99e","observation_id":"8ee78838-e279-42d8-84e9-f0635eebbf52","resolution":{"observed_at":"2026-08-11T23:02:16.398212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-11T23:02:16.403050Z","title":"W.; Hallacy, C.; Ramesh, A.; Goh, G.; Agarwal, S.; Sastry, G.; Askell, A.; Mishkin, P.; Clark, J.; Krueger, G.; and Sutskever, I","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.02929","last_updated":"2025-02-22T05:58:21Z","snapshot_observed_at":"2026-08-12T10:38:46.097532Z","submitted_at":"2024-12-04T00:42:15Z","title":"Panoptic Diffusion Models: co-generation of images and segmentation maps","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T23:02:16.403050Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2412.02929"},"observation_digest":"sha256:e5db745a4ca706340434592765702338819316464231135a4215734f64f95f8f","observation_id":"fd7b57a5-ab25-4bf0-875c-ad9a38e41b7f","resolution":{"observed_at":"2026-08-11T23:02:16.403050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-11T23:02:16.409097Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.02929","last_updated":"2025-02-22T05:58:21Z","snapshot_observed_at":"2026-08-12T10:38:46.097532Z","submitted_at":"2024-12-04T00:42:15Z","title":"Panoptic Diffusion Models: co-generation of images and segmentation maps","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T23:02:16.409097Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2412.02929"},"observation_digest":"sha256:349588ed0469c71c3152e5649035277cd69a2eba7f2ba1b7566297fbf846c9e2","observation_id":"d9f18862-cafd-4666-ba3a-f5f28b04ae3e","resolution":{"observed_at":"2026-08-11T23:02:16.409097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13686","last_updated":"2024-11-04T13:24:18Z","snapshot_observed_at":"2026-08-13T00:25:14.101781Z","submitted_at":"2024-04-21T15:16:05Z","title":"Hyper-SD: Trajectory Segmented Consistency Model for Efficient Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13686","snapshot_observed_at":"2026-08-11T23:02:16.415341Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02929","last_updated":"2025-02-22T05:58:21Z","snapshot_observed_at":"2026-08-12T10:38:46.097532Z","submitted_at":"2024-12-04T00:42:15Z","title":"Panoptic Diffusion Models: co-generation of images and segmentation maps","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T23:02:16.415341Z"},"links":{"cited_paper":"/paper/2404.13686","citing_paper":"/paper/2412.02929"},"observation_digest":"sha256:4518f968179b49b12d2348da604345a37a50a3a7b76746649b395c3e8e4eebd0","observation_id":"662192fd-169e-42b0-b27f-5552616f6b5a","resolution":{"observed_at":"2026-08-11T23:02:16.415341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10752","last_updated":"2022-04-13T11:38:44Z","snapshot_observed_at":"2026-07-06T12:20:47.369918Z","submitted_at":"2021-12-20T18:55:25Z","title":"High-Resolution Image Synthesis with Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10752","snapshot_observed_at":"2026-08-11T23:02:16.423382Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.02929","last_updated":"2025-02-22T05:58:21Z","snapshot_observed_at":"2026-08-12T10:38:46.097532Z","submitted_at":"2024-12-04T00:42:15Z","title":"Panoptic Diffusion Models: co-generation of images and segmentation maps","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T23:02:16.423382Z"},"links":{"cited_paper":"/paper/2112.10752","citing_paper":"/paper/2412.02929"},"observation_digest":"sha256:a24b670ae4fe5c600796570a46dc00450f862f0821ee4257d23972e7421219ff","observation_id":"9a201378-6f0d-424d-8398-2525f27c4e1a","resolution":{"observed_at":"2026-08-11T23:02:16.423382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11487","last_updated":"2022-05-23T17:42:53Z","snapshot_observed_at":"2026-08-12T12:48:35.419134Z","submitted_at":"2022-05-23T17:42:53Z","title":"Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.11487","snapshot_observed_at":"2026-08-11T23:02:16.429692Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.02929","last_updated":"2025-02-22T05:58:21Z","snapshot_observed_at":"2026-08-12T10:38:46.097532Z","submitted_at":"2024-12-04T00:42:15Z","title":"Panoptic Diffusion Models: co-generation of images and segmentation maps","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T23:02:16.429692Z"},"links":{"cited_paper":"/paper/2205.11487","citing_paper":"/paper/2412.02929"},"observation_digest":"sha256:a07a875379e1edb820be03964492776a9cdcfd4c46380b9e808dae0f26c24f0f","observation_id":"24016c70-76c1-4da2-a0cc-f56fe7ba3241","resolution":{"observed_at":"2026-08-11T23:02:16.429692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.00512","last_updated":"2022-06-07T09:17:35Z","snapshot_observed_at":"2026-08-12T01:14:44.484432Z","submitted_at":"2022-02-01T16:07:25Z","title":"Progressive Distillation for Fast Sampling of Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.00512","snapshot_observed_at":"2026-08-11T23:02:16.438319Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.02929","last_updated":"2025-02-22T05:58:21Z","snapshot_observed_at":"2026-08-12T10:38:46.097532Z","submitted_at":"2024-12-04T00:42:15Z","title":"Panoptic Diffusion Models: co-generation of images and segmentation maps","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T23:02:16.438319Z"},"links":{"cited_paper":"/paper/2202.00512","citing_paper":"/paper/2412.02929"},"observation_digest":"sha256:166f48df7ec8857aa9002827c385e191258ea25ec9b16d39c15665d8a3c2add5","observation_id":"c5b6665e-ac74-465a-879f-4cd85df78345","resolution":{"observed_at":"2026-08-11T23:02:16.438319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-11T23:02:16.449044Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.02929","last_updated":"2025-02-22T05:58:21Z","snapshot_observed_at":"2026-08-12T10:38:46.097532Z","submitted_at":"2024-12-04T00:42:15Z","title":"Panoptic Diffusion Models: co-generation of images and segmentation maps","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T23:02:16.449044Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2412.02929"},"observation_digest":"sha256:a11edec5e0538d08118cc118676713457395f2f6a298bdc936398fd650509bb0","observation_id":"4c8c91fb-2475-4de3-9ee5-aa18cbe7690f","resolution":{"observed_at":"2026-08-11T23:02:16.449044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-11T23:02:16.457103Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.02929","last_updated":"2025-02-22T05:58:21Z","snapshot_observed_at":"2026-08-12T10:38:46.097532Z","submitted_at":"2024-12-04T00:42:15Z","title":"Panoptic Diffusion Models: co-generation of images and segmentation maps","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T23:02:16.457103Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2412.02929"},"observation_digest":"sha256:01e1f54b1031aed3fb8d08d0b20690c4c0c15d776bd4c7ef31ce1b284ba752e6","observation_id":"61701bb5-4ac5-4dfc-9e1a-537ffff3e519","resolution":{"observed_at":"2026-08-11T23:02:16.457103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11681","last_updated":"2024-01-21T13:35:44Z","snapshot_observed_at":"2026-08-01T15:37:46.802850Z","submitted_at":"2023-03-21T08:43:15Z","title":"DiffuMask: Synthesizing Images with Pixel-level Annotations for Semantic Segmentation Using Diffusion Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11681","snapshot_observed_at":"2026-08-11T23:02:16.468739Z","title":"Z.; Zhou, H.; and Shen, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02929","last_updated":"2025-02-22T05:58:21Z","snapshot_observed_at":"2026-08-12T10:38:46.097532Z","submitted_at":"2024-12-04T00:42:15Z","title":"Panoptic Diffusion Models: co-generation of images and segmentation maps","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T23:02:16.468739Z"},"links":{"cited_paper":"/paper/2303.11681","citing_paper":"/paper/2412.02929"},"observation_digest":"sha256:3ca54b185a810bcc60a128d2eed0d5b61303c4e1c7ca29755a7aa486cf068dae","observation_id":"3521bce0-7f52-4caa-bd67-99f5b73b87e7","resolution":{"observed_at":"2026-08-11T23:02:16.468739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:02:17.987549Z","title":null,"venue":null,"work_id":"19c64845-e16e-4226-9b8d-871a995a72e9","year":2023},"citing_paper":{"arxiv_id":"2412.02929","last_updated":"2025-02-22T05:58:21Z","snapshot_observed_at":"2026-08-12T10:38:46.097532Z","submitted_at":"2024-12-04T00:42:15Z","title":"Panoptic Diffusion Models: co-generation of images and segmentation maps","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T23:02:16.480450Z"},"links":{"citing_paper":"/paper/2412.02929"},"observation_digest":"sha256:3320ffade5757833517ec0d5e9a721db8511d909152c944b03f582ea933bd25a","observation_id":"0bb42f90-569b-4d1f-a2ea-4f51cfd724ee","resolution":{"observed_at":"2026-08-11T23:02:17.994081Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:02:16.489698Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.02929","last_updated":"2025-02-22T05:58:21Z","snapshot_observed_at":"2026-08-12T10:38:46.097532Z","submitted_at":"2024-12-04T00:42:15Z","title":"Panoptic Diffusion Models: co-generation of images and segmentation maps","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T23:02:16.489698Z"},"links":{"citing_paper":"/paper/2412.02929"},"observation_digest":"sha256:4462501ddd80d16225ffbe84eb6372bd301504c66cc4505270e1444e81d1672b","observation_id":"b0989b31-8f89-4e87-aaca-5580d41f66fc","resolution":{"observed_at":"2026-08-11T23:02:16.489698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:02:16.499212Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.02929","last_updated":"2025-02-22T05:58:21Z","snapshot_observed_at":"2026-08-12T10:38:46.097532Z","submitted_at":"2024-12-04T00:42:15Z","title":"Panoptic Diffusion Models: co-generation of images and segmentation maps","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T23:02:16.499212Z"},"links":{"citing_paper":"/paper/2412.02929"},"observation_digest":"sha256:5121f045fa85c15f65a6d80d925220c89b3cce769db218f864219d23c98e1a2f","observation_id":"7fbe753d-d4c9-41d4-bf8a-4cfc4af49536","resolution":{"observed_at":"2026-08-11T23:02:16.499212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.02929","last_updated":"2025-02-22T05:58:21Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T10:38:46.097532Z","submitted_at":"2024-12-04T00:42:15Z","title":"Panoptic Diffusion Models: co-generation of images and segmentation maps"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":46,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 0 inbound Pith citation observations for arXiv:2412.02929."}