{"as_of":"2026-08-17T12:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2c002ba27e1e73c73433084e17fd23db4187a216826a1ec8baaf722558c15af3","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:38:56.502033Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T21:33:27.227307Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T21:35:04.259967Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.15032","last_updated":"2025-04-30T01:00:18Z","snapshot_observed_at":"2026-08-16T11:32:39.797649Z","submitted_at":"2025-04-21T11:41:22Z","title":"DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":"2504.15032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.15032","snapshot_observed_at":"2026-06-30T21:35:04.259967Z","title":null,"venue":null,"work_id":"8f8b0438-c904-41dd-9b10-1635bd1181e9","year":2025},"citing_paper":{"arxiv_id":"2605.14988","last_updated":"2026-05-14T15:50:25Z","snapshot_observed_at":"2026-08-17T11:52:57.884743Z","submitted_at":"2026-05-14T15:50:25Z","title":"Compositional Video Generation via Inference-Time Guidance","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T21:33:27.227307Z"},"links":{"cited_paper":"/paper/2504.15032","citing_paper":"/paper/2605.14988"},"observation_digest":"sha256:c7075bd0b77f742694f522360087d237ee8f1d2bdbaae9cd74dad7432df4021c","observation_id":"911de681-d7df-48b8-b4da-f25b67fbfcb0","resolution":{"observed_at":"2026-06-30T21:35:04.261918Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2504.15032/citation-record","integrity":"/paper/2504.15032/integrity","json":"/paper/2504.15032/citation-record.json","paper":"/paper/2504.15032"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-16T11:38:55.315973Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15032","last_updated":"2025-04-30T01:00:18Z","snapshot_observed_at":"2026-08-16T11:32:39.797649Z","submitted_at":"2025-04-21T11:41:22Z","title":"DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T11:38:55.315973Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2504.15032"},"observation_digest":"sha256:d2a6d5719e2d8fa33fb07da33e019f6f5e8c47a7f24b5e0d0de9d47801d25535","observation_id":"fc1e8b19-f754-4def-afa1-4a2047942201","resolution":{"observed_at":"2026-08-16T11:38:55.315973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:38:57.865933Z","title":null,"venue":null,"work_id":"2ceb8073-d86a-443e-87ae-19220dbb799d","year":2024},"citing_paper":{"arxiv_id":"2504.15032","last_updated":"2025-04-30T01:00:18Z","snapshot_observed_at":"2026-08-16T11:32:39.797649Z","submitted_at":"2025-04-21T11:41:22Z","title":"DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T11:38:55.356513Z"},"links":{"citing_paper":"/paper/2504.15032"},"observation_digest":"sha256:bfcca72b4995f6a510506c59fba1940e500d20e376fb173d18bd7325399e544a","observation_id":"c56c60b0-eab1-44aa-85f1-f90b8c875ce0","resolution":{"observed_at":"2026-08-16T11:38:57.870553Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:38:57.850403Z","title":null,"venue":null,"work_id":"86df8d12-6f36-4399-b616-13bf6b3cc18e","year":2024},"citing_paper":{"arxiv_id":"2504.15032","last_updated":"2025-04-30T01:00:18Z","snapshot_observed_at":"2026-08-16T11:32:39.797649Z","submitted_at":"2025-04-21T11:41:22Z","title":"DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T11:38:55.361616Z"},"links":{"citing_paper":"/paper/2504.15032"},"observation_digest":"sha256:2a8101421ea88befe3b06d19c311a90ff44ac5b2bc6c6da250d5783d6b4ea701","observation_id":"ae4febf7-efe7-4ef1-842c-27bd7950c498","resolution":{"observed_at":"2026-08-16T11:38:57.855493Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:38:55.367928Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15032","last_updated":"2025-04-30T01:00:18Z","snapshot_observed_at":"2026-08-16T11:32:39.797649Z","submitted_at":"2025-04-21T11:41:22Z","title":"DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T11:38:55.367928Z"},"links":{"citing_paper":"/paper/2504.15032"},"observation_digest":"sha256:bd31595b3193c02ecac66f281010da15ea50141cc9120b69c5a8b05d9532ee0f","observation_id":"b7aaadd8-88aa-4d45-a89f-ab50a33894c5","resolution":{"observed_at":"2026-08-16T11:38:55.367928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-16T11:38:55.409287Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.15032","last_updated":"2025-04-30T01:00:18Z","snapshot_observed_at":"2026-08-16T11:32:39.797649Z","submitted_at":"2025-04-21T11:41:22Z","title":"DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T11:38:55.409287Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2504.15032"},"observation_digest":"sha256:638ad9e7d30fd6dd98c8dd1177297b48fa46a208738f34552c55ffe6151d1cf4","observation_id":"8915d4d0-c98d-4165-bf56-141f54b6a871","resolution":{"observed_at":"2026-08-16T11:38:55.409287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-08-12T14:50:50.360929Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-16T11:38:55.461777Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15032","last_updated":"2025-04-30T01:00:18Z","snapshot_observed_at":"2026-08-16T11:32:39.797649Z","submitted_at":"2025-04-21T11:41:22Z","title":"DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T11:38:55.461777Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2504.15032"},"observation_digest":"sha256:67f0e65b1d2db067b31182ff070d464965fe36c1f62fa898a38589ab06c88f1a","observation_id":"baac6e2e-17fe-45fc-b81d-1def25df5160","resolution":{"observed_at":"2026-08-16T11:38:55.461777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-08-13T08:59:59.906684Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-08-16T11:38:55.469167Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.15032","last_updated":"2025-04-30T01:00:18Z","snapshot_observed_at":"2026-08-16T11:32:39.797649Z","submitted_at":"2025-04-21T11:41:22Z","title":"DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T11:38:55.469167Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2504.15032"},"observation_digest":"sha256:a54d63114173b6bcdfc00fd628651e9c0daf938b225de7d5ce91516e74665cf9","observation_id":"cdf6d5fb-8dc6-48ee-b62d-fe614fd19d2d","resolution":{"observed_at":"2026-08-16T11:38:55.469167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:38:57.823185Z","title":null,"venue":null,"work_id":"a53e67e1-81bb-4ccd-85c8-06256c3da027","year":2020},"citing_paper":{"arxiv_id":"2504.15032","last_updated":"2025-04-30T01:00:18Z","snapshot_observed_at":"2026-08-16T11:32:39.797649Z","submitted_at":"2025-04-21T11:41:22Z","title":"DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T11:38:55.474668Z"},"links":{"citing_paper":"/paper/2504.15032"},"observation_digest":"sha256:2399377611c7b5d007df381b3800a2b6fe6aaa51d4365f0d665b73d5e2e1c3a4","observation_id":"42d7b1f1-9202-4776-bd4c-46c558b539a7","resolution":{"observed_at":"2026-08-16T11:38:57.828051Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:38:57.807429Z","title":null,"venue":null,"work_id":"8bce9fc3-9e7f-440c-9104-f11c283231bd","year":2023},"citing_paper":{"arxiv_id":"2504.15032","last_updated":"2025-04-30T01:00:18Z","snapshot_observed_at":"2026-08-16T11:32:39.797649Z","submitted_at":"2025-04-21T11:41:22Z","title":"DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T11:38:55.514140Z"},"links":{"citing_paper":"/paper/2504.15032"},"observation_digest":"sha256:a23fa6ad8566ed43728666ce518de402eaf22282e1f30cf0b99f390191f6ffc1","observation_id":"a3b67969-f92b-4813-baf9-e29ce2e9ce73","resolution":{"observed_at":"2026-08-16T11:38:57.812305Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:38:57.791455Z","title":null,"venue":null,"work_id":"5e6daf25-798a-4e63-9890-87ca5dccb494","year":2024},"citing_paper":{"arxiv_id":"2504.15032","last_updated":"2025-04-30T01:00:18Z","snapshot_observed_at":"2026-08-16T11:32:39.797649Z","submitted_at":"2025-04-21T11:41:22Z","title":"DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T11:38:55.633779Z"},"links":{"citing_paper":"/paper/2504.15032"},"observation_digest":"sha256:effc8ac85ecdd90e25f1996045dd19a1c24d38ede47e4268ff00b6b7d337d7f0","observation_id":"1adc9ee1-5ca6-440d-9447-fc99c245f768","resolution":{"observed_at":"2026-08-16T11:38:57.796753Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:38:55.638748Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15032","last_updated":"2025-04-30T01:00:18Z","snapshot_observed_at":"2026-08-16T11:32:39.797649Z","submitted_at":"2025-04-21T11:41:22Z","title":"DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T11:38:55.638748Z"},"links":{"citing_paper":"/paper/2504.15032"},"observation_digest":"sha256:e64d7c77bb8a0bc2677f245a5757016f8659df86780a46c65cd7008ab2468ba4","observation_id":"24526033-28e8-4c88-833f-c98904083465","resolution":{"observed_at":"2026-08-16T11:38:55.638748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:38:57.762454Z","title":null,"venue":null,"work_id":"abdffb40-df74-4f9b-b56a-272116e5f075","year":2024},"citing_paper":{"arxiv_id":"2504.15032","last_updated":"2025-04-30T01:00:18Z","snapshot_observed_at":"2026-08-16T11:32:39.797649Z","submitted_at":"2025-04-21T11:41:22Z","title":"DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T11:38:55.644743Z"},"links":{"citing_paper":"/paper/2504.15032"},"observation_digest":"sha256:a2100fc66cf4917ee9fdbe0a45ef6ec446db46581d14cfbc8157a7f8da9b4c38","observation_id":"6076dc4f-05e5-4cfb-b6c1-4312f49783fb","resolution":{"observed_at":"2026-08-16T11:38:57.767562Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15115","last_updated":"2026-04-20T17:59:36Z","snapshot_observed_at":"2026-08-02T10:06:23.710148Z","submitted_at":"2024-11-22T18:31:47Z","title":"Self-Correcting Text-to-Video Generation with Misalignment Detection and Localized Refinement","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15115","snapshot_observed_at":"2026-08-16T11:38:55.649734Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15032","last_updated":"2025-04-30T01:00:18Z","snapshot_observed_at":"2026-08-16T11:32:39.797649Z","submitted_at":"2025-04-21T11:41:22Z","title":"DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T11:38:55.649734Z"},"links":{"cited_paper":"/paper/2411.15115","citing_paper":"/paper/2504.15032"},"observation_digest":"sha256:9c66f32ae9740d105cac84231ae7555e8651d0c06c07a8cc640da42294e0049d","observation_id":"72e6f281-22b7-4429-b331-f3d5b228809c","resolution":{"observed_at":"2026-08-16T11:38:55.649734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:38:55.669278Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15032","last_updated":"2025-04-30T01:00:18Z","snapshot_observed_at":"2026-08-16T11:32:39.797649Z","submitted_at":"2025-04-21T11:41:22Z","title":"DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T11:38:55.669278Z"},"links":{"citing_paper":"/paper/2504.15032"},"observation_digest":"sha256:46426ececb1207f2663fc8e1d98ee90676221856bdcc651bd8f757bc523efc26","observation_id":"5572cc46-4521-4199-85c9-2437c4ba1daf","resolution":{"observed_at":"2026-08-16T11:38:55.669278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:38:57.747654Z","title":null,"venue":null,"work_id":"19cd5fe7-3b83-48fb-88ae-5abbc8bf4c39","year":2023},"citing_paper":{"arxiv_id":"2504.15032","last_updated":"2025-04-30T01:00:18Z","snapshot_observed_at":"2026-08-16T11:32:39.797649Z","submitted_at":"2025-04-21T11:41:22Z","title":"DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T11:38:55.739116Z"},"links":{"citing_paper":"/paper/2504.15032"},"observation_digest":"sha256:73fcfbd844bd0d2d58443935b9ab3059a171440c3bca16589e39c9047982d52e","observation_id":"3657001b-c1eb-4b7a-8c17-8be7a04e12c5","resolution":{"observed_at":"2026-08-16T11:38:57.752065Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17444","last_updated":"2024-05-04T19:28:10Z","snapshot_observed_at":"2026-08-16T14:56:25.243355Z","submitted_at":"2023-09-29T17:54:46Z","title":"LLM-grounded Video Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17444","snapshot_observed_at":"2026-08-16T11:38:55.786092Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15032","last_updated":"2025-04-30T01:00:18Z","snapshot_observed_at":"2026-08-16T11:32:39.797649Z","submitted_at":"2025-04-21T11:41:22Z","title":"DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T11:38:55.786092Z"},"links":{"cited_paper":"/paper/2309.17444","citing_paper":"/paper/2504.15032"},"observation_digest":"sha256:9339520b8a3e7c0092febd880142ac469dba793194afa329d0e0413a67e71ef8","observation_id":"9dd5b4c0-c77b-4860-964b-df036d1ecee4","resolution":{"observed_at":"2026-08-16T11:38:55.786092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00131","last_updated":"2024-11-28T14:07:45Z","snapshot_observed_at":"2026-08-13T21:19:07.777045Z","submitted_at":"2024-11-28T14:07:45Z","title":"Open-Sora Plan: Open-Source Large Video Generation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00131","snapshot_observed_at":"2026-08-16T11:38:55.791379Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15032","last_updated":"2025-04-30T01:00:18Z","snapshot_observed_at":"2026-08-16T11:32:39.797649Z","submitted_at":"2025-04-21T11:41:22Z","title":"DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T11:38:55.791379Z"},"links":{"cited_paper":"/paper/2412.00131","citing_paper":"/paper/2504.15032"},"observation_digest":"sha256:2b8dce4d11a5ca16b8942b32f585c7d205d7ece1c048b7a312a27cfdd2c7a7c6","observation_id":"af967b1c-a57d-4ea7-b91e-083b60a522a7","resolution":{"observed_at":"2026-08-16T11:38:55.791379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-16T11:38:55.797294Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15032","last_updated":"2025-04-30T01:00:18Z","snapshot_observed_at":"2026-08-16T11:32:39.797649Z","submitted_at":"2025-04-21T11:41:22Z","title":"DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T11:38:55.797294Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2504.15032"},"observation_digest":"sha256:f1d307af7e2925e444cc898c1f637ca67f176133b77bdec5861e9bf97cd40c14","observation_id":"3cb24077-7fdf-47d5-96b8-ac71649689f2","resolution":{"observed_at":"2026-08-16T11:38:55.797294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-16T11:38:55.852349Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.15032","last_updated":"2025-04-30T01:00:18Z","snapshot_observed_at":"2026-08-16T11:32:39.797649Z","submitted_at":"2025-04-21T11:41:22Z","title":"DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T11:38:55.852349Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2504.15032"},"observation_digest":"sha256:54dcf1c96dfa0dcfdf8b7dd69250eb2725ed4f292b332627c030308f9d4e2432","observation_id":"9416d8c3-2a26-493c-89db-a4fe362986f2","resolution":{"observed_at":"2026-08-16T11:38:55.852349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03048","last_updated":"2025-05-01T09:40:21Z","snapshot_observed_at":"2026-08-13T10:28:06.516901Z","submitted_at":"2024-01-05T19:55:15Z","title":"Latte: Latent Diffusion Transformer for Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03048","snapshot_observed_at":"2026-08-16T11:38:55.894919Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15032","last_updated":"2025-04-30T01:00:18Z","snapshot_observed_at":"2026-08-16T11:32:39.797649Z","submitted_at":"2025-04-21T11:41:22Z","title":"DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T11:38:55.894919Z"},"links":{"cited_paper":"/paper/2401.03048","citing_paper":"/paper/2504.15032"},"observation_digest":"sha256:3c09d7b385e78579520e812c9705ba214296c7751bfb758a9438a44576c3936b","observation_id":"a9512284-926a-49ef-b503-95b70d0f5b98","resolution":{"observed_at":"2026-08-16T11:38:55.894919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:38:57.731289Z","title":null,"venue":null,"work_id":"9753eac8-b53e-415b-af23-73fe6a2cde52","year":2023},"citing_paper":{"arxiv_id":"2504.15032","last_updated":"2025-04-30T01:00:18Z","snapshot_observed_at":"2026-08-16T11:32:39.797649Z","submitted_at":"2025-04-21T11:41:22Z","title":"DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T11:38:55.900066Z"},"links":{"citing_paper":"/paper/2504.15032"},"observation_digest":"sha256:f9c437b0182bbc3f248f57f486f42b261df9c0eef07811d36db47840692e9527","observation_id":"32971621-eea4-4e93-9e9c-aa6e4e22e06e","resolution":{"observed_at":"2026-08-16T11:38:57.736964Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:38:57.715934Z","title":null,"venue":null,"work_id":"31355878-ef78-427d-a7ea-af837f81eac4","year":2024},"citing_paper":{"arxiv_id":"2504.15032","last_updated":"2025-04-30T01:00:18Z","snapshot_observed_at":"2026-08-16T11:32:39.797649Z","submitted_at":"2025-04-21T11:41:22Z","title":"DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T11:38:55.904192Z"},"links":{"citing_paper":"/paper/2504.15032"},"observation_digest":"sha256:517489f31e730a37d26bc30ffca617b313d2f5fa966872ae42e191b16b12b640","observation_id":"c41b15af-5175-48d0-b8dc-04c6545a6557","resolution":{"observed_at":"2026-08-16T11:38:57.720935Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:38:57.701266Z","title":null,"venue":null,"work_id":"919cbdb6-5187-4783-9a2b-5ac849212c30","year":2022},"citing_paper":{"arxiv_id":"2504.15032","last_updated":"2025-04-30T01:00:18Z","snapshot_observed_at":"2026-08-16T11:32:39.797649Z","submitted_at":"2025-04-21T11:41:22Z","title":"DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T11:38:55.909132Z"},"links":{"citing_paper":"/paper/2504.15032"},"observation_digest":"sha256:02a760bb6990ba12e19e11efde761a1f8454d510b1f9940cfe72428f24ab5ad0","observation_id":"3d36c0c2-8b2b-4113-969c-9982f52b919a","resolution":{"observed_at":"2026-08-16T11:38:57.705489Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:38:55.955106Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2504.15032","last_updated":"2025-04-30T01:00:18Z","snapshot_observed_at":"2026-08-16T11:32:39.797649Z","submitted_at":"2025-04-21T11:41:22Z","title":"DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T11:38:55.955106Z"},"links":{"citing_paper":"/paper/2504.15032"},"observation_digest":"sha256:3e4b6559a7b3b46359e80ff075b0965c576baf78ffba0d035389a717e41469b8","observation_id":"ed177db3-3dac-4713-a46f-aab34561543d","resolution":{"observed_at":"2026-08-16T11:38:55.955106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:38:57.674363Z","title":null,"venue":null,"work_id":"17317c47-278a-4469-9e59-c6dd12dce942","year":2024},"citing_paper":{"arxiv_id":"2504.15032","last_updated":"2025-04-30T01:00:18Z","snapshot_observed_at":"2026-08-16T11:32:39.797649Z","submitted_at":"2025-04-21T11:41:22Z","title":"DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T11:38:55.980137Z"},"links":{"citing_paper":"/paper/2504.15032"},"observation_digest":"sha256:027e69c33dce414fec09022ae17cbc492a7e8be1055a47b4644e74e503b8eb18","observation_id":"0dde9bbd-980b-42c3-b4ad-d01ae77e4e6f","resolution":{"observed_at":"2026-08-16T11:38:57.679907Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:38:57.602305Z","title":null,"venue":null,"work_id":"b1732e2e-fa08-43f4-adee-d222c433dadf","year":2024},"citing_paper":{"arxiv_id":"2504.15032","last_updated":"2025-04-30T01:00:18Z","snapshot_observed_at":"2026-08-16T11:32:39.797649Z","submitted_at":"2025-04-21T11:41:22Z","title":"DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T11:38:55.985458Z"},"links":{"citing_paper":"/paper/2504.15032"},"observation_digest":"sha256:d282d425dce93fa480dfe7c842483db39d5cae3715371def345c75fb94abcaa9","observation_id":"613fa81d-b4a5-425c-b444-bc9174f0434d","resolution":{"observed_at":"2026-08-16T11:38:57.663520Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-16T11:38:55.990494Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.15032","last_updated":"2025-04-30T01:00:18Z","snapshot_observed_at":"2026-08-16T11:32:39.797649Z","submitted_at":"2025-04-21T11:41:22Z","title":"DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T11:38:55.990494Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2504.15032"},"observation_digest":"sha256:0d4a834a1843c2a52f9d3d675c618ca360bb9e49a070add2f9d82dc33cfbfe8d","observation_id":"7beabbaa-cbe8-45ca-9f08-310a75918033","resolution":{"observed_at":"2026-08-16T11:38:55.990494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:38:57.518948Z","title":null,"venue":null,"work_id":"d0b24507-a001-4345-b75a-9b497344efce","year":2023},"citing_paper":{"arxiv_id":"2504.15032","last_updated":"2025-04-30T01:00:18Z","snapshot_observed_at":"2026-08-16T11:32:39.797649Z","submitted_at":"2025-04-21T11:41:22Z","title":"DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T11:38:55.995559Z"},"links":{"citing_paper":"/paper/2504.15032"},"observation_digest":"sha256:b5ae414613e51b559de745d733c8b9c9e65b256ff409a83b098a550748a62e29","observation_id":"c1a0e452-3caf-4fb6-bee6-fa9fde5eae33","resolution":{"observed_at":"2026-08-16T11:38:57.523876Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14505","last_updated":"2025-01-15T18:57:31Z","snapshot_observed_at":"2026-08-16T13:32:38.331661Z","submitted_at":"2024-07-19T17:58:36Z","title":"T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14505","snapshot_observed_at":"2026-08-16T11:38:56.000113Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15032","last_updated":"2025-04-30T01:00:18Z","snapshot_observed_at":"2026-08-16T11:32:39.797649Z","submitted_at":"2025-04-21T11:41:22Z","title":"DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T11:38:56.000113Z"},"links":{"cited_paper":"/paper/2407.14505","citing_paper":"/paper/2504.15032"},"observation_digest":"sha256:1c10ecdcf80d106b01cce0e9684f5dd7ff385c21ff180ce73b31ec6f66566126","observation_id":"7e6a5336-4fb6-4046-b100-00ced9bff224","resolution":{"observed_at":"2026-08-16T11:38:56.000113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:38:56.100205Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15032","last_updated":"2025-04-30T01:00:18Z","snapshot_observed_at":"2026-08-16T11:32:39.797649Z","submitted_at":"2025-04-21T11:41:22Z","title":"DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T11:38:56.100205Z"},"links":{"citing_paper":"/paper/2504.15032"},"observation_digest":"sha256:717baa71ff673a7469bbc363323153adb7aaf3b749d001eb2b88b34c4c8524a1","observation_id":"1299d69b-a9ad-4aac-b6ad-47693f86cfa7","resolution":{"observed_at":"2026-08-16T11:38:56.100205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:38:57.426325Z","title":null,"venue":null,"work_id":"13dbd3c1-eb7d-4450-a92d-c4624afc84a0","year":2024},"citing_paper":{"arxiv_id":"2504.15032","last_updated":"2025-04-30T01:00:18Z","snapshot_observed_at":"2026-08-16T11:32:39.797649Z","submitted_at":"2025-04-21T11:41:22Z","title":"DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T11:38:56.105478Z"},"links":{"citing_paper":"/paper/2504.15032"},"observation_digest":"sha256:568e4e95255c3de0bb09f194b6cba9cbd41c1c0c8f03634dff8d5dc654e29fd1","observation_id":"795cb09b-e949-4ecf-92be-d7ba9e8f2979","resolution":{"observed_at":"2026-08-16T11:38:57.498145Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06571","last_updated":"2023-08-12T13:53:10Z","snapshot_observed_at":"2026-08-14T13:59:50.878772Z","submitted_at":"2023-08-12T13:53:10Z","title":"ModelScope Text-to-Video Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06571","snapshot_observed_at":"2026-08-16T11:38:56.110607Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15032","last_updated":"2025-04-30T01:00:18Z","snapshot_observed_at":"2026-08-16T11:32:39.797649Z","submitted_at":"2025-04-21T11:41:22Z","title":"DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T11:38:56.110607Z"},"links":{"cited_paper":"/paper/2308.06571","citing_paper":"/paper/2504.15032"},"observation_digest":"sha256:44150dfa652cb8824a6e8d5043d93968abad0db6044fa0ed5051a6c35fa36c6a","observation_id":"f0897d71-c876-4a6c-a6d7-1b65d8cf5ea8","resolution":{"observed_at":"2026-08-16T11:38:56.110607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:38:57.409471Z","title":null,"venue":null,"work_id":"87d1d3de-3868-4e7a-ac7e-1edc80d5cc50","year":2024},"citing_paper":{"arxiv_id":"2504.15032","last_updated":"2025-04-30T01:00:18Z","snapshot_observed_at":"2026-08-16T11:32:39.797649Z","submitted_at":"2025-04-21T11:41:22Z","title":"DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T11:38:56.116007Z"},"links":{"citing_paper":"/paper/2504.15032"},"observation_digest":"sha256:58d8b225efbae92cc14fae6a562548c59d00ceb6408e1f843484ac54fc28df40","observation_id":"11ad6f87-b13a-41bd-b4d7-03fc6acbf91e","resolution":{"observed_at":"2026-08-16T11:38:57.414981Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:38:56.232674Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15032","last_updated":"2025-04-30T01:00:18Z","snapshot_observed_at":"2026-08-16T11:32:39.797649Z","submitted_at":"2025-04-21T11:41:22Z","title":"DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T11:38:56.232674Z"},"links":{"citing_paper":"/paper/2504.15032"},"observation_digest":"sha256:8e975667e681c89c616ac6cf903de3a7aa8015c6a55c8e03683b3d4afdd0e329","observation_id":"1489a850-a254-4e07-88a8-e634659fa11a","resolution":{"observed_at":"2026-08-16T11:38:56.232674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:38:57.298590Z","title":null,"venue":null,"work_id":"e1e5e184-5785-4fe3-9122-5f909d966ba6","year":2023},"citing_paper":{"arxiv_id":"2504.15032","last_updated":"2025-04-30T01:00:18Z","snapshot_observed_at":"2026-08-16T11:32:39.797649Z","submitted_at":"2025-04-21T11:41:22Z","title":"DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T11:38:56.237848Z"},"links":{"citing_paper":"/paper/2504.15032"},"observation_digest":"sha256:511e215eec940a734e47e1ff7e1badb2abfe8ba9ea8e5cdb689011ab5ad8f8c3","observation_id":"a5a1af0c-a4a4-4eec-89c7-e6400aca9c47","resolution":{"observed_at":"2026-08-16T11:38:57.364566Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:38:56.244253Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.15032","last_updated":"2025-04-30T01:00:18Z","snapshot_observed_at":"2026-08-16T11:32:39.797649Z","submitted_at":"2025-04-21T11:41:22Z","title":"DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T11:38:56.244253Z"},"links":{"citing_paper":"/paper/2504.15032"},"observation_digest":"sha256:5bf8004036bdc76f11d66372eb360934b96f5753177fd8dfbb65a77f647fa496","observation_id":"22575f0d-1d20-43f5-bac7-6b0fb6494cd4","resolution":{"observed_at":"2026-08-16T11:38:56.244253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06182","last_updated":"2024-06-10T16:27:47Z","snapshot_observed_at":"2026-08-16T13:44:28.909111Z","submitted_at":"2024-06-10T16:27:47Z","title":"Compositional Video Generation as Flow Equalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06182","snapshot_observed_at":"2026-08-16T11:38:56.350546Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15032","last_updated":"2025-04-30T01:00:18Z","snapshot_observed_at":"2026-08-16T11:32:39.797649Z","submitted_at":"2025-04-21T11:41:22Z","title":"DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T11:38:56.350546Z"},"links":{"cited_paper":"/paper/2407.06182","citing_paper":"/paper/2504.15032"},"observation_digest":"sha256:dc8faa1b5d7d2c9bfde7b4e44852460dc282d75e2eb56f40670f492335962815","observation_id":"bcfcccdf-4b6e-4b30-ae2c-dc54a3fa1812","resolution":{"observed_at":"2026-08-16T11:38:56.350546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-08-15T19:52:28.153954Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-16T11:38:56.355959Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15032","last_updated":"2025-04-30T01:00:18Z","snapshot_observed_at":"2026-08-16T11:32:39.797649Z","submitted_at":"2025-04-21T11:41:22Z","title":"DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T11:38:56.355959Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2504.15032"},"observation_digest":"sha256:0fb003d037714ec51113000fa83b40bccf8eb1a996d19018f461fae85bca339a","observation_id":"5d6793a2-41cd-46b2-964d-0aa5e736e876","resolution":{"observed_at":"2026-08-16T11:38:56.355959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:38:57.270999Z","title":null,"venue":null,"work_id":"35d23bef-b9c9-4e75-b282-059afdf702f9","year":2024},"citing_paper":{"arxiv_id":"2504.15032","last_updated":"2025-04-30T01:00:18Z","snapshot_observed_at":"2026-08-16T11:32:39.797649Z","submitted_at":"2025-04-21T11:41:22Z","title":"DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T11:38:56.361597Z"},"links":{"citing_paper":"/paper/2504.15032"},"observation_digest":"sha256:55552b25a375a3923d3b5d684f35e6a360ea2f9192884ac9ff9d8f81da72e10a","observation_id":"ad0d7eca-59f1-467e-860b-853566b1b909","resolution":{"observed_at":"2026-08-16T11:38:57.276931Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:38:57.085284Z","title":null,"venue":null,"work_id":"b99f2964-662d-4df1-9784-aeb8957da2d1","year":2023},"citing_paper":{"arxiv_id":"2504.15032","last_updated":"2025-04-30T01:00:18Z","snapshot_observed_at":"2026-08-16T11:32:39.797649Z","submitted_at":"2025-04-21T11:41:22Z","title":"DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T11:38:56.367389Z"},"links":{"citing_paper":"/paper/2504.15032"},"observation_digest":"sha256:1f0bb18cf3f6101824ab8b32e6b666a65466ba1d76438bcb9cd330975d2cd927","observation_id":"8fae7207-7b95-4fbb-a5ab-c742c31a2cf6","resolution":{"observed_at":"2026-08-16T11:38:57.222291Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07563","last_updated":"2025-01-13T18:53:08Z","snapshot_observed_at":"2026-08-15T10:37:02.636043Z","submitted_at":"2025-01-13T18:53:08Z","title":"Training-Free Motion-Guided Video Generation with Enhanced Temporal Consistency Using Motion Consistency Loss","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07563","snapshot_observed_at":"2026-08-16T11:38:56.428360Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.15032","last_updated":"2025-04-30T01:00:18Z","snapshot_observed_at":"2026-08-16T11:32:39.797649Z","submitted_at":"2025-04-21T11:41:22Z","title":"DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T11:38:56.428360Z"},"links":{"cited_paper":"/paper/2501.07563","citing_paper":"/paper/2504.15032"},"observation_digest":"sha256:51617ba1942a5205c7a4ff15e227ef8cd9718c0e9d7b2f236802c4da13d118bc","observation_id":"ea0fe744-da71-4426-83f7-31946946eb64","resolution":{"observed_at":"2026-08-16T11:38:56.428360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20404","last_updated":"2024-12-29T08:52:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-29T08:52:49Z","title":"Open-Sora: Democratizing Efficient Video Production for All","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20404","snapshot_observed_at":"2026-08-16T11:38:56.490298Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15032","last_updated":"2025-04-30T01:00:18Z","snapshot_observed_at":"2026-08-16T11:32:39.797649Z","submitted_at":"2025-04-21T11:41:22Z","title":"DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T11:38:56.490298Z"},"links":{"cited_paper":"/paper/2412.20404","citing_paper":"/paper/2504.15032"},"observation_digest":"sha256:7a88d8e6fa11ee9fe27c65fd04c731a8e5a5bb2f5b49f83a7d514279b7e1fc8e","observation_id":"43c1b86e-8d44-46d7-bca4-01f728fe3da8","resolution":{"observed_at":"2026-08-16T11:38:56.490298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:38:57.036101Z","title":null,"venue":null,"work_id":"97f89e3d-25e1-4854-bb5c-4769a56f5c9a","year":2024},"citing_paper":{"arxiv_id":"2504.15032","last_updated":"2025-04-30T01:00:18Z","snapshot_observed_at":"2026-08-16T11:32:39.797649Z","submitted_at":"2025-04-21T11:41:22Z","title":"DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T11:38:56.496843Z"},"links":{"citing_paper":"/paper/2504.15032"},"observation_digest":"sha256:c44623dd4dc8deff2bd8121cea0504352603a8f925ef8182df807b9f772124c8","observation_id":"b270a4a5-6b2b-4c53-96fb-4cda48cae5c8","resolution":{"observed_at":"2026-08-16T11:38:57.073069Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-16T11:38:56.502033Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15032","last_updated":"2025-04-30T01:00:18Z","snapshot_observed_at":"2026-08-16T11:32:39.797649Z","submitted_at":"2025-04-21T11:41:22Z","title":"DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T11:38:56.502033Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2504.15032"},"observation_digest":"sha256:2cef1ff0658ba8edabacf18b04ab0acf4296544febbb7aa2811e08cef2c660ff","observation_id":"7fe75d5f-7201-455b-a915-7c3d8fdff275","resolution":{"observed_at":"2026-08-16T11:38:56.502033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11708","last_updated":"2024-05-05T04:50:54Z","snapshot_observed_at":"2026-08-16T14:25:42.389620Z","submitted_at":"2024-01-22T06:16:29Z","title":"Mastering Text-to-Image Diffusion: Recaptioning, Planning, and Generating with Multimodal LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.11708","snapshot_observed_at":"2026-08-16T11:38:56.249658Z","title":"arXiv preprint arXiv:2401.11708 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15032","last_updated":"2025-04-30T01:00:18Z","snapshot_observed_at":"2026-08-16T11:32:39.797649Z","submitted_at":"2025-04-21T11:41:22Z","title":"DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-16T11:38:56.249658Z"},"links":{"cited_paper":"/paper/2401.11708","citing_paper":"/paper/2504.15032"},"observation_digest":"sha256:a491cb66c33b30f4fc937c9bbfc1b3813aeac4da289f2499d30c7ad00f3b1ec5","observation_id":"2d42e04f-a0b0-41d2-adb3-fabe87a9bd6c","resolution":{"observed_at":"2026-08-16T11:38:56.249658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.15032","last_updated":"2025-04-30T01:00:18Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T11:32:39.797649Z","submitted_at":"2025-04-21T11:41:22Z","title":"DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":45,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 1 inbound Pith citation observation for arXiv:2504.15032."}