{"as_of":"2026-08-05T01:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1bd04bbd39ca145561308418047c9d71110e780aa4840d6625e14449f55a6a00","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":26,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T18:48:03.650851Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T13:49:51.397457Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2212.05032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-07-04T13:49:51.397457Z","title":"arXiv preprint arXiv:2212.05032 , year=","venue":null,"work_id":"63b29782-c84e-4467-9583-aee36944de57","year":2022},"citing_paper":{"arxiv_id":"2302.08453","last_updated":"2023-03-20T10:52:26Z","snapshot_observed_at":"2026-07-31T21:11:02.534986Z","submitted_at":"2023-02-16T17:56:08Z","title":"T2I-Adapter: Learning Adapters to Dig out More Controllable Ability for Text-to-Image Diffusion Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-16T22:47:50.355642Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2302.08453"},"observation_digest":"sha256:28511a67008c7de6fdb28166ffbfda1716f9b41c20e57376ab4d0978190d7077","observation_id":"12b77970-2e47-4e10-8810-1350c663fd79","resolution":{"observed_at":"2026-05-16T22:47:50.430263Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2212.05032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-07-04T13:49:51.397457Z","title":"arXiv preprint arXiv:2212.05032 , year=","venue":null,"work_id":"63b29782-c84e-4467-9583-aee36944de57","year":2022},"citing_paper":{"arxiv_id":"2302.12192","last_updated":"2023-02-23T17:34:53Z","snapshot_observed_at":"2026-07-06T14:55:12.100148Z","submitted_at":"2023-02-23T17:34:53Z","title":"Aligning Text-to-Image Models using Human Feedback","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-14T20:39:15.388881Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2302.12192"},"observation_digest":"sha256:40a555515af7da118d71219513101799dfea1697526a1897a7fa2289ddf53d8e","observation_id":"03d7455a-2e79-435a-a75f-e7352e86d6e4","resolution":{"observed_at":"2026-05-14T20:39:15.444332Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2212.05032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-07-04T13:49:51.397457Z","title":"arXiv preprint arXiv:2212.05032 , year=","venue":null,"work_id":"63b29782-c84e-4467-9583-aee36944de57","year":2022},"citing_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T15:22:03.530707Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2307.01952"},"observation_digest":"sha256:6b05e23b560eebc8fda2d7e5b3f79243b737d150ac78fbaa89b6a2f138547aac","observation_id":"f64a06d5-6647-456a-8712-649871df1292","resolution":{"observed_at":"2026-05-10T15:22:03.643258Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2212.05032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-07-04T13:49:51.397457Z","title":"arXiv preprint arXiv:2212.05032 , year=","venue":null,"work_id":"63b29782-c84e-4467-9583-aee36944de57","year":2022},"citing_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-04T23:51:18.339338Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-11T19:43:03.310237Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2403.05135"},"observation_digest":"sha256:abd463caf4d15172c69f84b57f5d92c1e4d1293111e137fe179ee1885f461d86","observation_id":"08251f48-e2f4-4cd0-b116-da77f07a7353","resolution":{"observed_at":"2026-05-11T19:43:03.508187Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2212.05032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-07-04T13:49:51.397457Z","title":"arXiv preprint arXiv:2212.05032 , year=","venue":null,"work_id":"63b29782-c84e-4467-9583-aee36944de57","year":2022},"citing_paper":{"arxiv_id":"2505.19261","last_updated":"2026-04-14T06:42:51Z","snapshot_observed_at":"2026-08-03T06:08:58.835346Z","submitted_at":"2025-05-25T18:33:05Z","title":"Enhancing Text-to-Image Diffusion Transformer via Split-Text Conditioning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-19T13:19:20.215467Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2505.19261"},"observation_digest":"sha256:5c915815326a2ba635b677d7116d20a9885d4241fd15a21f8713e2cd3ad14dc8","observation_id":"4fcc6343-5cbe-4d4d-a45e-68ea7c3543f2","resolution":{"observed_at":"2026-05-19T13:22:19.224983Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-08-04T18:48:03.650851Z","title":"Training-free structured diffusion guidance for compositional text-to-image synthesis.arXiv preprint arXiv:2212.05032, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.650851Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:f814a166f9bb33b0a697e316298f8e3cee21e9affa45fac558d97927bc921443","observation_id":"0f6fadec-312e-44c2-b44d-623bec1bce2f","resolution":{"observed_at":"2026-08-04T18:48:03.650851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2212.05032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-07-04T13:49:51.397457Z","title":"arXiv preprint arXiv:2212.05032 , year=","venue":null,"work_id":"63b29782-c84e-4467-9583-aee36944de57","year":2022},"citing_paper":{"arxiv_id":"2509.17458","last_updated":"2026-04-11T12:35:18Z","snapshot_observed_at":"2026-07-06T22:30:26.679189Z","submitted_at":"2025-09-22T07:51:28Z","title":"CARINOX: Inference-time Scaling with Category-Aware Reward-based Initial Noise Optimization and Exploration","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-18T15:25:39.116881Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2509.17458"},"observation_digest":"sha256:1617a74012550feedc56830a0f0a103c59db783a8a30c27968de35dc0bd98b09","observation_id":"65d00cb5-e0c5-48f8-8a42-d7790a24b1e8","resolution":{"observed_at":"2026-05-18T15:26:33.623984Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2212.05032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-07-04T13:49:51.397457Z","title":"arXiv preprint arXiv:2212.05032 , year=","venue":null,"work_id":"63b29782-c84e-4467-9583-aee36944de57","year":2022},"citing_paper":{"arxiv_id":"2510.20206","last_updated":"2026-05-14T08:53:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-23T04:45:09Z","title":"RAPO++: Cross-Stage Prompt Optimization for Text-to-Video Generation via Data Alignment and Test-Time Scaling","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-18T05:13:42.934115Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2510.20206"},"observation_digest":"sha256:27377eb8d7f2b8fd1a3dccfcec364a9fcd9fe453db0b652dc344f39752d9a67d","observation_id":"fccdcaf9-d61a-4c48-9fdb-cd71446bcd66","resolution":{"observed_at":"2026-05-18T05:15:54.449073Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2212.05032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-07-04T13:49:51.397457Z","title":"arXiv preprint arXiv:2212.05032 , year=","venue":null,"work_id":"63b29782-c84e-4467-9583-aee36944de57","year":2022},"citing_paper":{"arxiv_id":"2604.05906","last_updated":"2026-04-07T14:09:00Z","snapshot_observed_at":"2026-07-30T03:31:11.866242Z","submitted_at":"2026-04-07T14:09:00Z","title":"Selective Aggregation of Attention Maps Improves Diffusion-Based Visual Interpretation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T19:16:51.134397Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2604.05906"},"observation_digest":"sha256:31a4e551ccfdf00bcbbd1777169b8afd2e8ac28b2c7ba2e09ddf06cd8c7c6271","observation_id":"29bd5041-5fe9-428f-8ea7-eef7d831e913","resolution":{"observed_at":"2026-05-10T23:15:47.688792Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2212.05032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-07-04T13:49:51.397457Z","title":"arXiv preprint arXiv:2212.05032 , year=","venue":null,"work_id":"63b29782-c84e-4467-9583-aee36944de57","year":2022},"citing_paper":{"arxiv_id":"2605.06512","last_updated":"2026-05-07T16:22:21Z","snapshot_observed_at":"2026-07-06T23:18:55.724335Z","submitted_at":"2026-05-07T16:22:21Z","title":"DCR: Counterfactual Attractor Guidance for Rare Compositional Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-08T13:06:56.964670Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2605.06512"},"observation_digest":"sha256:87f91272794f1ec6db10cef410836a26f64e32e8576a0fe39a26bf8fcc23f9f8","observation_id":"ee364f6f-b42c-4b45-a243-30a18657619f","resolution":{"observed_at":"2026-05-11T19:01:10.626417Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2212.05032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-07-04T13:49:51.397457Z","title":"arXiv preprint arXiv:2212.05032 , year=","venue":null,"work_id":"63b29782-c84e-4467-9583-aee36944de57","year":2022},"citing_paper":{"arxiv_id":"2605.07253","last_updated":"2026-05-08T05:22:24Z","snapshot_observed_at":"2026-07-06T23:19:41.053744Z","submitted_at":"2026-05-08T05:22:24Z","title":"LENS: Low-Frequency Eigen Noise Shaping for Efficient Diffusion Sampling","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-11T01:43:15.520788Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2605.07253"},"observation_digest":"sha256:26d10332076d8a75f0434b9ff212ab0ae32097bdef344e4a7c50b9b13972d745","observation_id":"5bb50145-cb64-4d02-a65e-017ff25f18d9","resolution":{"observed_at":"2026-05-11T01:45:51.123178Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2212.05032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-07-04T13:49:51.397457Z","title":"arXiv preprint arXiv:2212.05032 , year=","venue":null,"work_id":"63b29782-c84e-4467-9583-aee36944de57","year":2022},"citing_paper":{"arxiv_id":"2605.09313","last_updated":"2026-06-16T05:24:37Z","snapshot_observed_at":"2026-08-01T21:29:44.395199Z","submitted_at":"2026-05-10T04:14:07Z","title":"Attention Sinks in Diffusion Transformers: A Causal Analysis","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T04:18:26.883899Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2605.09313"},"observation_digest":"sha256:0cbdfd1ea59192160bbcd78377591cb447a027835607a161c2d4ed8f5c2ed773","observation_id":"8cc69159-6958-435c-8f6c-388ec1df9ca1","resolution":{"observed_at":"2026-05-12T06:26:24.090203Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2212.05032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-07-04T13:49:51.397457Z","title":"arXiv preprint arXiv:2212.05032 , year=","venue":null,"work_id":"63b29782-c84e-4467-9583-aee36944de57","year":2022},"citing_paper":{"arxiv_id":"2605.09313","last_updated":"2026-06-16T05:24:37Z","snapshot_observed_at":"2026-08-01T21:29:44.395199Z","submitted_at":"2026-05-10T04:14:07Z","title":"Attention Sinks in Diffusion Transformers: A Causal Analysis","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T05:59:16.233848Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2605.09313"},"observation_digest":"sha256:0914df64704e89ac4782630bed6689bf7a5976bd7b84beae462e174d4568d730","observation_id":"c3f8729d-82b8-4f29-a105-a87cb7167e34","resolution":{"observed_at":"2026-05-13T06:02:23.306839Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2212.05032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-07-04T13:49:51.397457Z","title":"arXiv preprint arXiv:2212.05032 , year=","venue":null,"work_id":"63b29782-c84e-4467-9583-aee36944de57","year":2022},"citing_paper":{"arxiv_id":"2605.09313","last_updated":"2026-06-16T05:24:37Z","snapshot_observed_at":"2026-08-01T21:29:44.395199Z","submitted_at":"2026-05-10T04:14:07Z","title":"Attention Sinks in Diffusion Transformers: A Causal Analysis","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T22:47:11.360530Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2605.09313"},"observation_digest":"sha256:c3f269af5853e2aef7b0964e83c66e4c85e8f5c282f48dfdd344b1bdc008133b","observation_id":"47b60213-96fa-4d80-ab69-5dfafd005419","resolution":{"observed_at":"2026-07-01T13:45:46.114494Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2212.05032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-07-04T13:49:51.397457Z","title":"arXiv preprint arXiv:2212.05032 , year=","venue":null,"work_id":"63b29782-c84e-4467-9583-aee36944de57","year":2022},"citing_paper":{"arxiv_id":"2605.14988","last_updated":"2026-05-14T15:50:25Z","snapshot_observed_at":"2026-07-06T23:26:23.179482Z","submitted_at":"2026-05-14T15:50:25Z","title":"Compositional Video Generation via Inference-Time Guidance","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T21:33:27.227307Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2605.14988"},"observation_digest":"sha256:84409a15e5107a9400b00bbf9fe032ef1fb0c2f97f5ee3628713adaab1fe91ad","observation_id":"d648d496-52c2-45c1-ab5a-33079e3428c2","resolution":{"observed_at":"2026-06-30T21:35:04.306183Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2212.05032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-07-04T13:49:51.397457Z","title":"arXiv preprint arXiv:2212.05032 , year=","venue":null,"work_id":"63b29782-c84e-4467-9583-aee36944de57","year":2022},"citing_paper":{"arxiv_id":"2605.19750","last_updated":"2026-05-19T12:18:15Z","snapshot_observed_at":"2026-07-06T23:30:25.609722Z","submitted_at":"2026-05-19T12:18:15Z","title":"CPC-VAR:Continual Personalized and Compositional Generation in Visual Autoregressive Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-20T07:01:01.427273Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2605.19750"},"observation_digest":"sha256:11242df8a32b8e37b812614cf3c599ceb6f5886615808f947fdb91a55707c54f","observation_id":"720ae636-c248-4476-93c7-f3337a2457d0","resolution":{"observed_at":"2026-05-20T07:03:06.228228Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2212.05032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-07-04T13:49:51.397457Z","title":"arXiv preprint arXiv:2212.05032 , year=","venue":null,"work_id":"63b29782-c84e-4467-9583-aee36944de57","year":2022},"citing_paper":{"arxiv_id":"2605.21466","last_updated":"2026-06-30T17:59:52Z","snapshot_observed_at":"2026-08-02T01:16:29.352385Z","submitted_at":"2026-05-20T17:52:10Z","title":"StreamEdit: Training-Free Video Editing via Few-Step Streaming Video Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-21T04:53:55.386923Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2605.21466"},"observation_digest":"sha256:21671c87718ac5bf8d1bc194c887563b653ab9e41c8e670dc2b8ba48993570f9","observation_id":"782b6b6a-8fde-47f8-8e3b-18af6c844fca","resolution":{"observed_at":"2026-05-21T04:53:57.664463Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2212.05032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-07-04T13:49:51.397457Z","title":"arXiv preprint arXiv:2212.05032 , year=","venue":null,"work_id":"63b29782-c84e-4467-9583-aee36944de57","year":2022},"citing_paper":{"arxiv_id":"2605.21466","last_updated":"2026-06-30T17:59:52Z","snapshot_observed_at":"2026-08-02T01:16:29.352385Z","submitted_at":"2026-05-20T17:52:10Z","title":"StreamEdit: Training-Free Video Editing via Few-Step Streaming Video Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-01T07:49:06.391436Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2605.21466"},"observation_digest":"sha256:ccb5d1b1fb92210eb4a8a323586f1e2a15b82c54a18ba2fa23a24bfee384c0b8","observation_id":"304ea553-bb51-4421-b1b6-5591912f833b","resolution":{"observed_at":"2026-07-01T07:55:30.883532Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2212.05032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-07-04T13:49:51.397457Z","title":"arXiv preprint arXiv:2212.05032 , year=","venue":null,"work_id":"63b29782-c84e-4467-9583-aee36944de57","year":2022},"citing_paper":{"arxiv_id":"2605.23178","last_updated":"2026-05-22T02:56:34Z","snapshot_observed_at":"2026-08-01T22:25:10.209018Z","submitted_at":"2026-05-22T02:56:34Z","title":"Composing People Together: Iterative Pose-Image Generation for Multi-Person Interaction Scenes","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-25T05:07:14.227821Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2605.23178"},"observation_digest":"sha256:6f1c8258ec71f7e29cff5813c5cea7550ed3ab898d1b63cb2078c0ba15f3a06f","observation_id":"b2d2d9a4-d7f0-41bd-9b4d-34c4207bfcc6","resolution":{"observed_at":"2026-05-25T05:10:22.311115Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2212.05032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-07-04T13:49:51.397457Z","title":"arXiv preprint arXiv:2212.05032 , year=","venue":null,"work_id":"63b29782-c84e-4467-9583-aee36944de57","year":2022},"citing_paper":{"arxiv_id":"2606.07568","last_updated":"2026-05-26T02:19:47Z","snapshot_observed_at":"2026-07-06T23:47:10.030985Z","submitted_at":"2026-05-26T02:19:47Z","title":"A Systematic Study of Behavioral Cloning for Scientific Data Annotation","version":1},"reference_index":248,"source":"arxiv_source","source_observed_at":"2026-06-29T16:23:08.402194Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2606.07568"},"observation_digest":"sha256:18a731afd72fad8eb3454d84c74c668aaece1e0e5a231d68224908ebd745c811","observation_id":"5760107d-dd91-4e26-b3ac-12b0b44a9b92","resolution":{"observed_at":"2026-06-29T16:23:39.138875Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2212.05032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-07-04T13:49:51.397457Z","title":"arXiv preprint arXiv:2212.05032 , year=","venue":null,"work_id":"63b29782-c84e-4467-9583-aee36944de57","year":2022},"citing_paper":{"arxiv_id":"2606.10653","last_updated":"2026-06-09T09:59:09Z","snapshot_observed_at":"2026-08-01T14:27:47.156242Z","submitted_at":"2026-06-09T09:59:09Z","title":"STEDiff: Strengthening Text Embedding for Text-to-Image Alignment in Diffusion Model","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-27T13:50:32.005383Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2606.10653"},"observation_digest":"sha256:1d876f7575899b7a99435645e3ec62ec7c9c20a0562644d586e8babbd5db8b73","observation_id":"105303c1-30a3-4a3c-a992-5fe208e33fcb","resolution":{"observed_at":"2026-07-03T04:37:36.511852Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2212.05032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-07-04T13:49:51.397457Z","title":"arXiv preprint arXiv:2212.05032 , year=","venue":null,"work_id":"63b29782-c84e-4467-9583-aee36944de57","year":2022},"citing_paper":{"arxiv_id":"2606.27377","last_updated":"2026-07-07T04:28:57Z","snapshot_observed_at":"2026-08-04T22:03:39.582837Z","submitted_at":"2026-06-25T17:59:58Z","title":"DanceOPD: On-Policy Generative Field Distillation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-26T04:55:42.018348Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2606.27377"},"observation_digest":"sha256:96c869571e72c34c1e43a4cd1d718b5b39343021f0f6aa067c80be43788df9c1","observation_id":"f69efa5a-cb66-4c16-b4a6-3b3890fddd85","resolution":{"observed_at":"2026-07-04T13:49:51.398979Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-07-12T11:44:54.717393Z","title":"Training-free structured diffusion guidance for compositional text-to-image synthesis","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.27377","last_updated":"2026-07-07T04:28:57Z","snapshot_observed_at":"2026-08-04T22:03:39.582837Z","submitted_at":"2026-06-25T17:59:58Z","title":"DanceOPD: On-Policy Generative Field Distillation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-12T11:44:54.717393Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2606.27377"},"observation_digest":"sha256:1a4d0b3e59e73440d13980ed2dc6fce6589d312cf33a0cc383cece95629cc495","observation_id":"d94b44ea-a8d8-4d31-b04b-70f4329ba23d","resolution":{"observed_at":"2026-07-12T11:44:54.717393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-07-11T19:17:19.634242Z","title":"arXiv preprint arXiv:2212.05032 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04423","last_updated":"2026-07-07T07:27:22Z","snapshot_observed_at":"2026-08-04T06:57:07.480777Z","submitted_at":"2026-07-05T17:33:59Z","title":"Transferability Between Understanding and Generation in Unified Multimodal Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-11T19:17:19.634242Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2607.04423"},"observation_digest":"sha256:924053a2d05ffd3ef10e0856b8c1cd3679e854a2b4c6bb555b90ae815aa12af9","observation_id":"afde7bb3-2214-4971-ae5b-b145f454a45c","resolution":{"observed_at":"2026-07-11T19:17:19.634242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-08-02T13:55:30.481624Z","title":"E., and Wang, W","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21606","last_updated":"2026-05-16T16:56:52Z","snapshot_observed_at":"2026-08-02T13:55:23.781077Z","submitted_at":"2026-05-16T16:56:52Z","title":"TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-02T13:55:30.481624Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2607.21606"},"observation_digest":"sha256:374c0b0e860cdaca7736729c3a6a3bc56a9d9942271ebbae5574ee91bd41d810","observation_id":"339b0c4a-a215-44da-a5ab-bdcf8ee4323e","resolution":{"observed_at":"2026-08-02T13:55:30.481624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-07-30T23:29:03.384400Z","title":"arXiv preprint arXiv:2212.05032 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26706","last_updated":"2026-07-29T09:52:20Z","snapshot_observed_at":"2026-08-03T10:55:37.719124Z","submitted_at":"2026-07-29T09:52:20Z","title":"TPD: Temporal Prior Decoupling for Text-to-Video Diffusion Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-07-30T23:29:03.384400Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2607.26706"},"observation_digest":"sha256:0b2d1aeda32f39834cfadea461e32434d3ab5d9cc474f94a85afe72070971652","observation_id":"addfe0cf-821c-4bd2-81bf-bb8f86ce90d6","resolution":{"observed_at":"2026-07-30T23:29:03.384400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2212.05032/citation-record","integrity":"/paper/2212.05032/integrity","json":"/paper/2212.05032/citation-record.json","paper":"/paper/2212.05032"},"outbound":[],"paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 26 inbound Pith citation observations for arXiv:2212.05032."}