{"as_of":"2026-08-07T06:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a7ca540775c1c9de48496e4ce71f23904a7420e1eef8bdf35a66afff716c4162","coverage":[{"denominator":76,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":76,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T06:51:31.625416Z","state":"measured"},{"denominator":76,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":76,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.13768/citation-record","integrity":"/paper/2606.13768/integrity","json":"/paper/2606.13768/citation-record.json","paper":"/paper/2606.13768"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:31.625416Z","title":"Ac3d: Analyzing and improving 3d camera control in video diffusion transformers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:a1dc6e929cf05b054cb43d61758b779dea83ad42bab06bf7a6cfaa6c6f714e59","observation_id":"f6104b72-b142-44d4-9371-71eb3b1ff32c","resolution":{"observed_at":"2026-06-27T06:51:31.625416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:31.625416Z","title":"Lindell, and Sergey Tulyakov","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:a53066374a3506b6e4d14893750da7d938ff6f888cb13b131081b8765ce6142e","observation_id":"ea5016a8-e1d7-4f0b-b8c0-53a10d266f18","resolution":{"observed_at":"2026-06-27T06:51:31.625416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:31.625416Z","title":"Recammaster: Camera-controlled generative rendering from a single video","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:8dd1f5b42be109d5ab3e0bed0a3b0ec2b34fbba72f8ded639197e2b7e0f7762e","observation_id":"7ce5cee6-92f1-4e3c-8519-193f641a8eb4","resolution":{"observed_at":"2026-06-27T06:51:31.625416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:e50ce5ccda45d83ab6fa836e604db6c2bc2e1f9eff25c9a101be44aa0bab3688","observation_id":"9e23e60b-4d0b-4f02-b86a-74624d7c3ab5","resolution":{"observed_at":"2026-07-03T14:58:32.686085Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:31.625416Z","title":"Align your latents: High-resolution video synthesis with latent diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:03e2656d980079b850cf07efd41afbb36f0520c76d80acb818cf4914ddb9a3e9","observation_id":"2bbd54e3-6be3-4b19-b9a5-20b4eaff7e43","resolution":{"observed_at":"2026-06-27T06:51:31.625416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:31.625416Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:e9ee06639d39f9d329c72f7b574bdb413700ac942e93da912eeb783cc8c8fb14","observation_id":"015daa91-bbf9-453e-9494-49316ec3cdc6","resolution":{"observed_at":"2026-06-27T06:51:31.625416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:31.625416Z","title":"Emerging properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:0e1e37c0141e2e90e86d567029c86828793da102eb389a068b44c88e8161cb7d","observation_id":"e2367946-0b23-41b0-b75d-df4b5a36d4f9","resolution":{"observed_at":"2026-06-27T06:51:31.625416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19512","last_updated":"2023-10-30T13:12:40Z","snapshot_observed_at":"2026-07-06T16:40:28.142296Z","submitted_at":"2023-10-30T13:12:40Z","title":"VideoCrafter1: Open Diffusion Models for High-Quality Video Generation","version":1},"cited_work":{"arxiv_id":"2310.19512","doi":"10.48550/arxiv.2310.19512","metadata_source":"pith","pith_arxiv_id":"2310.19512","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VideoCrafter1: Open Diffusion Models for High-Quality Video Generation","venue":"cs.CV","work_id":"4d4486c5-6317-4d8d-bb5b-3b100d732a83","year":2023},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"cited_paper":"/paper/2310.19512","citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:0e115522cee2445c34d9ba589b9081ed8a99557646fa6f5da0d79dfc7ad3bbaf","observation_id":"e1744c67-9dbb-4be7-80a3-7d97eacb7b11","resolution":{"observed_at":"2026-07-03T14:58:32.686951Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:31.625416Z","title":"VideoCrafter2: Overcoming data limitations for high-quality video diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:30dcf7690b800de7e15ead9f75e24f1a2931a1cdef9cbee0f9f839bfc0cd9ae6","observation_id":"30dde09f-2aff-4682-a7b2-cb0edd88e2f8","resolution":{"observed_at":"2026-06-27T06:51:31.625416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14404","last_updated":"2023-04-27T17:59:32Z","snapshot_observed_at":"2026-07-06T15:20:53.397829Z","submitted_at":"2023-04-27T17:59:32Z","title":"Motion-Conditioned Diffusion Model for Controllable Video Synthesis","version":1},"cited_work":{"arxiv_id":"2304.14404","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.14404","snapshot_observed_at":"2026-07-03T22:49:00.819668Z","title":"Motion- Conditioned Diffusion Model for Controllable Video Synthesis","venue":null,"work_id":"4f9964d7-7be1-4a28-a838-32c54a1da3e5","year":2023},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"cited_paper":"/paper/2304.14404","citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:8d66ff912508ccd0529ad766d3f75a1c227691ff7c74e23e068aadc7ae5ff864","observation_id":"78e66e4e-123a-44f7-abad-d37aeea71e56","resolution":{"observed_at":"2026-07-03T14:58:32.692480Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:31.625416Z","title":"Panda-70m: Captioning 70m videos with multiple cross-modality teachers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:bc760ec263a0b03a34dce5fa83f059ecdc0c270dcc819f2a3614055c8ec67355","observation_id":"f7466fc9-82a0-4e9b-a9b0-0178d7a6a69b","resolution":{"observed_at":"2026-06-27T06:51:31.625416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:31.625416Z","title":"Multi-subject open-set personalization in video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:08c5985349b13cc0ba01e1e241eda6555c326809f5d8dc8a30b4f22824b326e1","observation_id":"02e4881a-43cf-40f6-87ad-cf6d14068d64","resolution":{"observed_at":"2026-06-27T06:51:31.625416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:31.625416Z","title":"Omni-attribute: Open-vocabulary attribute encoder for visual concept personalization","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:c5c757d819cf06be59d3af7eb9740732a1f7ff51a27486f2605e8ce735252da7","observation_id":"38a82a05-6ec5-427c-b0aa-7976e2a684eb","resolution":{"observed_at":"2026-06-27T06:51:31.625416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:31.625416Z","title":"Canvas-to-image: Compositional image generation with multimodal controls.ACM TOG, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:4987c9395abac0871fbef2d542f16d79545593edfe733e8faa64dfc683f1446f","observation_id":"df26ffff-10bf-4f80-8012-3f417272d535","resolution":{"observed_at":"2026-06-27T06:51:31.625416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:31.625416Z","title":"MAGREF: Masked guidance for any-reference video generation with subject disentanglement","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:415e5893839e42fd11a4b3a4a396b72d850fb14ce6d4a1fded3a32b6e95c704c","observation_id":"feb0b589-15bf-42db-8c8e-8155e14c3e28","resolution":{"observed_at":"2026-06-27T06:51:31.625416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:31.625416Z","title":"VIMI: Grounding video generation through multi-modal instruction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:853d5354456e8d3fd425e978dde784416cef98c1284e10e1077bb0a3a0688713","observation_id":"b412c0f4-fca4-4d8a-ab09-8263b91d6f75","resolution":{"observed_at":"2026-06-27T06:51:31.625416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02436","last_updated":"2025-04-03T09:50:50Z","snapshot_observed_at":"2026-08-02T14:38:26.145151Z","submitted_at":"2025-04-03T09:50:50Z","title":"SkyReels-A2: Compose Anything in Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":"2504.02436","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.02436","snapshot_observed_at":"2026-07-04T21:10:09.697793Z","title":"Skyreels-a2: Compose anything in video diffusion transformers","venue":null,"work_id":"68c0143f-c4c7-49b9-8128-0d821f39406e","year":2025},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"cited_paper":"/paper/2504.02436","citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:5269bd312d0f0bacf4c4de6ee8708f8f1fbe2faaffd4c3fbe50180d3b9ddc38d","observation_id":"929fbd2a-cce8-4503-a2d1-03045acf5f06","resolution":{"observed_at":"2026-07-03T14:58:32.689770Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:31.625416Z","title":"An image is worth one word: Personalizing text-to-image generation using textual inversion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:382daae63624bcbc97879133005e87f25a2cd2a466592e608dd8ae3276694b10","observation_id":"4d28c185-364a-4c55-b4a6-b031e187ab2d","resolution":{"observed_at":"2026-06-27T06:51:31.625416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:31.625416Z","title":"Alchemint: Fine-grained temporal control for multi-reference consistent video generation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:d4986606726090ed3d3696014c37686808dc43f4e48c403ad656b027532d8603","observation_id":"a3b9ad1a-1a8c-492a-91c1-23ee646d103b","resolution":{"observed_at":"2026-06-27T06:51:31.625416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:31.625416Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:15f03758432b793fba6ed127507d5c626baad03edaa644abe592e620dbfe98ac","observation_id":"31c8dce4-6e5e-43a0-82d2-fb402b0ae8bc","resolution":{"observed_at":"2026-06-27T06:51:31.625416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:31.625416Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:bd171358ed784d8342f7fe2fc51dc12a2def0da7d2959b1b0387fb61305cbc66","observation_id":"87b5f316-5e8b-4c7f-9c63-38ac4f0b23bb","resolution":{"observed_at":"2026-06-27T06:51:31.625416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:31.625416Z","title":"Animatediff: Animate your personalized text-to-image diffusion models without specific tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:51286cb07b6f3d2c317bee5f1fa376278cc5f7e8a9aa66bea537f051863555ca","observation_id":"f6f76064-a709-453d-8bae-6cd9d01a20cf","resolution":{"observed_at":"2026-06-27T06:51:31.625416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:31.625416Z","title":"Photorealistic video generation with diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:7ca11711efaeaef493f208890394f7a822bb137e438db95bb41276a1f11161e1","observation_id":"20a1df95-1002-44f9-8334-5eb662953502","resolution":{"observed_at":"2026-06-27T06:51:31.625416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00103","last_updated":"2024-12-30T19:00:25Z","snapshot_observed_at":"2026-07-06T20:14:54.297131Z","submitted_at":"2024-12-30T19:00:25Z","title":"LTX-Video: Realtime Video Latent Diffusion","version":1},"cited_work":{"arxiv_id":"2501.00103","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.00103","snapshot_observed_at":"2026-07-09T07:56:04.699528Z","title":"LTX-Video: Realtime Video Latent Diffusion","venue":"cs.CV","work_id":"cee5c521-3ce9-466e-a035-1e42f89254f4","year":2024},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"cited_paper":"/paper/2501.00103","citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:05f45c4f252cf83bf0736c1ce0275d8797a14d395f27f381a3dbb9828f54d359","observation_id":"ec0880b4-3cb2-4a5f-9d5b-efcfc77b4487","resolution":{"observed_at":"2026-07-03T14:58:32.665170Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:31.625416Z","title":"Cameractrl: Enabling camera control for video diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:76703703c10e9a6643fa6b868af921b747f7e218b6896632d642f11520b65480","observation_id":"2991f70d-87ea-45ff-8bbd-249844bf6057","resolution":{"observed_at":"2026-06-27T06:51:31.625416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2210.02303","doi":"10.48550/arxiv.2210.02303","metadata_source":"pith","pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","venue":"cs.CV","work_id":"bb20d241-dc6f-4b0a-b071-fd43a2cbd57f","year":2022},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:353839a3764f81b4dcbf45fa436cb60c92082eee953aed94b21602175cc0ad37","observation_id":"e2c5fa17-c872-431f-8061-452c9d54644c","resolution":{"observed_at":"2026-07-03T14:58:32.677702Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:59.676131+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:59.676131+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:31.625416Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:96b6ddc33982806b7581da21b0a72d74802900e4f144bd7e60162b6c682cd163","observation_id":"8bbab9ab-8248-484d-aacb-7312312f60a3","resolution":{"observed_at":"2026-06-27T06:51:31.625416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:31.625416Z","title":"Classifier-free diffusion guidance","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:56862aef86680d8a5b8d0fb04f7b6d1571b2a6c900e151e3cde29652de3387db","observation_id":"c48f48a8-2d47-4c20-8cf7-c7bc595fc5f1","resolution":{"observed_at":"2026-06-27T06:51:31.625416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:31.625416Z","title":"Video diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:7861ce95fe24bf686e46511778372b2f13a46f6cdb2befdf11f69c80887abb92","observation_id":"89f93e06-7771-4823-bba6-641603b04eab","resolution":{"observed_at":"2026-06-27T06:51:31.625416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04698","last_updated":"2025-05-13T06:42:52Z","snapshot_observed_at":"2026-08-01T04:05:23.005533Z","submitted_at":"2025-01-08T18:59:01Z","title":"ConceptMaster: Multi-Concept Video Customization on Diffusion Transformer Models Without Test-Time Tuning","version":2},"cited_work":{"arxiv_id":"2501.04698","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.04698","snapshot_observed_at":"2026-07-04T21:10:09.709506Z","title":"Concept-master: Multi-concept video customiza- tion on diffusion transformer models without test-time tun- ing","venue":null,"work_id":"ae8f2f13-a6ee-490c-b4fd-4997c888edd7","year":2025},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"cited_paper":"/paper/2501.04698","citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:28c3d5235a7ef75b2fe589d108c279d03002846977fd2c6e74eac024e59dddde","observation_id":"dbcb1a7e-0dca-4051-bdbc-f1294d9c43a6","resolution":{"observed_at":"2026-07-03T14:58:32.691488Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:31.625416Z","title":"Vace: All-in-one video creation and editing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:6b26800049347f63b9965991b9724dc0d78291574a0ea7af0dd57d1c5e8b8216","observation_id":"404a22c2-d98f-4e00-8ea1-83934ed2eacd","resolution":{"observed_at":"2026-06-27T06:51:31.625416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:31.625416Z","title":"Analyzing and improving the training dynamics of diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:d087a8f27f7efcc53eac0fbade560bddbf5b93a7851a4e9a79c1ff3eaabde32b","observation_id":"aad4d851-8205-40c0-ad81-8be58366c0a8","resolution":{"observed_at":"2026-06-27T06:51:31.625416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17725","last_updated":"2024-10-23T09:55:22Z","snapshot_observed_at":"2026-07-06T19:38:22.461739Z","submitted_at":"2024-10-23T09:55:22Z","title":"YOLOv11: An Overview of the Key Architectural Enhancements","version":1},"cited_work":{"arxiv_id":"2410.17725","doi":"10.48550/arxiv.2410.17725","metadata_source":"pith","pith_arxiv_id":"2410.17725","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"YOLOv11: An Overview of the Key Architectural Enhancements","venue":"cs.CV","work_id":"17e84c13-a2a4-4b25-9b05-ca4ca212abfa","year":2024},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"cited_paper":"/paper/2410.17725","citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:247925c13c18f680f5bfebe0042422c9b3cf206fcf53943f16147d6995b2c506","observation_id":"b2c3d81d-0f4f-4103-9115-e42669359b5f","resolution":{"observed_at":"2026-07-03T14:58:32.680165Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-16T22:51:55.782635+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-16T22:51:55.782635+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":"1312.6114","doi":"10.2139/ssrn.4269703","metadata_source":"pith","pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Auto-Encoding Variational Bayes","venue":"stat.ML","work_id":"97d95295-30e1-42b4-bbf6-85f0fa4edb44","year":2013},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:4ba3ba55d4492457e8f4dff08cec1c7295a0be30e39668eb90e3db8e908d4ef2","observation_id":"b851678e-88fe-4794-a0f0-0323fff329f5","resolution":{"observed_at":"2026-07-03T14:58:32.703880Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:7717acc93bf72e571e116a77bca672b4e8eb6069636dc484099ea763059250d6","observation_id":"ec5c6c4a-abeb-4520-8b50-5767c89bb03d","resolution":{"observed_at":"2026-07-03T14:58:32.706367Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:31.625416Z","title":"Multi-concept customization of text-to-image diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:df5137bde2239c05181bcbb7b1052687da743a323d29156c09ea9921a1ce065c","observation_id":"41c00bd4-5b3e-44f5-af06-3eb83dc6d9e5","resolution":{"observed_at":"2026-06-27T06:51:31.625416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:31.625416Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:172dab96e791b9b7f27df412462a089d10a7737e7a7aff095810245a68e450f1","observation_id":"8f329e82-fb60-4342-b879-bdbe3100a1a9","resolution":{"observed_at":"2026-06-27T06:51:31.625416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:31.625416Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:0c52e47ad4e98805a29061a79df0dfb2249c720da5a804ac8c0aa67a2a0cfa12","observation_id":"bb271991-7c05-4676-8f9a-492c64e91d39","resolution":{"observed_at":"2026-06-27T06:51:31.625416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:31.625416Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:c5f38acd07e7c080aa09179ceb3784b872149af5a05c43ede8b40acb904d6a8d","observation_id":"611ee308-1d3a-46b0-8d65-8d44032dbacd","resolution":{"observed_at":"2026-06-27T06:51:31.625416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:31.625416Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:b2163e8b18e2472537883130fb009f7fb377d191d57fc88d500cf4cb0210a4bd","observation_id":"b20959e3-fed8-4722-8c2a-e68a6d169ef2","resolution":{"observed_at":"2026-06-27T06:51:31.625416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":"1711.05101","doi":"10.1137/1.9781611972825.47","metadata_source":"pith","pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Decoupled Weight Decay Regularization","venue":"cs.LG","work_id":"07ef7360-d385-4033-83f7-8384a6325204","year":2017},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:3de26dd1ce2a7e1cd5c03425a9dafb5ec1eae3b04c1556c9bb2ac79f6276d0fc","observation_id":"4234153d-55c2-4b53-8b5f-00e9edb5de4a","resolution":{"observed_at":"2026-07-03T14:58:32.696363Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.25746","doi":"10.48550/arxiv.2603.25746","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Shotstream: Streaming multi-shot video generation for interactive storytelling","venue":"arXiv (Cornell University)","work_id":"eabcc1e0-ee6b-47bf-90fc-2e4fa7704243","year":2026},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:1c5dff31600a86379e8bcccd3109611f9e73f9d9a7687b0b3936fa236f94d82e","observation_id":"b56ab870-cd7e-4432-a428-1d9c94b7cea3","resolution":{"observed_at":"2026-07-03T14:58:32.683686Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-10T19:18:55.664338+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T19:18:55.664338+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:31.625416Z","title":"Snap video: Scaled spatiotemporal transformers for text-to-video synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:b0b5196d493cba953d621cf9f2ffa9775cd17d84e34566efdbefaeca17cd1b62","observation_id":"d70daff3-0009-4dee-86e2-888dac9bfb02","resolution":{"observed_at":"2026-06-27T06:51:31.625416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:212f6f42bb3dbe2e3c5a9520460433eb9fa76fae1ea074711238c67077a7bb8b","observation_id":"4ac015e7-79ba-4e6e-b96c-2b9ee440e29d","resolution":{"observed_at":"2026-07-03T14:58:32.675289Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:31.625416Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:a2fb08dd7cc94c9604af905090aa261b7ee8d819ebb82f4e4872361ef6c3d478","observation_id":"8ff06ff5-d427-43c8-9468-8a6f1be3e2ed","resolution":{"observed_at":"2026-06-27T06:51:31.625416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.13720","doi":"10.48550/arxiv.2410.13720","metadata_source":"pith","pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Movie Gen: A Cast of Media Foundation Models","venue":"cs.CV","work_id":"a6a118b0-002f-4b19-881f-7f1183e0d7d8","year":2024},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:fc33d52af92cfe1186bfefefac12c5921ad65f9f2a06646339980d56bf386538","observation_id":"37904cc5-059d-4c5f-85aa-0fee332f9c6e","resolution":{"observed_at":"2026-07-03T14:58:32.681149Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.20820","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T14:58:32.692579Z","title":"Layercomposer: Interactive personalized t2i via spatially-aware layered canvas","venue":null,"work_id":"35e5e581-ebfd-49e3-9439-96e977ff389c","year":2025},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:f22b15c38bec78f6e63be3117317fbef6be0c1b51dd5811965d3ce82e5054df1","observation_id":"ca975ae9-8356-4c32-8f55-12c3608b0896","resolution":{"observed_at":"2026-07-03T14:58:32.694060Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:31.625416Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:7a915beaf68e8a51732bea552ebe07ca7e4d1937c677ca97b8cbf9ba1c904b14","observation_id":"f0bdf0d8-1a0a-4f88-b247-166b3cbaf444","resolution":{"observed_at":"2026-06-27T06:51:31.625416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:31.625416Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:fb421e1a10bb7834fd6c2160f2eba8298d0896057295557df6bb1bb220fb7ef9","observation_id":"52072d23-5343-42ab-9bb5-5b13710bbc9f","resolution":{"observed_at":"2026-06-27T06:51:31.625416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":"2408.00714","doi":"10.1038/s41598-025-97590-3","metadata_source":"pith","pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SAM 2: Segment Anything in Images and Videos","venue":"cs.CV","work_id":"acc13f66-d814-44f9-9688-375688bf2d4a","year":2024},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:5c2d6df4959bedccaa7b33c17259cbd45ec0417c8b13e889e2da3bf2eeadae86","observation_id":"1f33f638-54a3-4c44-8939-1a58bb149832","resolution":{"observed_at":"2026-07-03T14:58:32.702291Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-24T04:24:23.885301+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T04:24:23.885301+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:31.625416Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:db7b7ca1b574e03f32fdd5a472d42f66ab88c398151c633b3c40f35194da8989","observation_id":"168c4d45-fd82-4e33-bef5-a80b19ae8023","resolution":{"observed_at":"2026-06-27T06:51:31.625416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:31.625416Z","title":"U-net: Convolutional networks for biomedical image segmentation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:5fc41f7d56e4edec9aed91b21c72d74dbdf4eefc1a8ea7e3bb15e74e12f796ce","observation_id":"60d0a075-5422-4c88-aab4-913227e6b0c2","resolution":{"observed_at":"2026-06-27T06:51:31.625416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:31.625416Z","title":"Dream- booth: Fine tuning text-to-image diffusion models for subject-driven generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:8e524436ccdef1806b4b99d6a5bf76fbb6311259b33ef1269d19ce42f1010915","observation_id":"0c244490-2848-498c-b116-72218a63458f","resolution":{"observed_at":"2026-06-27T06:51:31.625416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:31.625416Z","title":"Instantbooth: Personalized text-to-image generation without test-time finetuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:ae4c5af7fad0f42c02ea726974d67995d98a5ddbb7fa96ca306b11c87d5ff6ac","observation_id":"3c720a4a-a65a-42d2-b289-c4a92beb2d3b","resolution":{"observed_at":"2026-06-27T06:51:31.625416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:31.625416Z","title":"Make-a-video: Text-to-video generation without text-video data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:4537d5574d3ab6b5e8901e96fd1b097fe2f752d878cf7d49050b9fa28eb1b5dd","observation_id":"16ea7515-21c2-4db1-b28a-e07a16005868","resolution":{"observed_at":"2026-06-27T06:51:31.625416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:31.625416Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:f31f171d14419fd17a1dd821360dc7b427d9699ae3cf282fc7eebe54cef9fc25","observation_id":"1d128ae0-929f-485f-a68c-b5d3f4e60c49","resolution":{"observed_at":"2026-06-27T06:51:31.625416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:31.625416Z","title":"Generative modeling by estimating gradients of the data distribution","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:ed73dd6fe5e60eb27701aec8940c219d5501be1aa54aaa3c8277d7a07e979b10","observation_id":"9c89c692-3b50-46fd-bfcc-0623289bd7db","resolution":{"observed_at":"2026-06-27T06:51:31.625416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:31.625416Z","title":"Roformer: Enhanced transformer with rotary position embedding.Neurocomputing, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:94cfd1f6530e348a1bc4ab218ebad707ef58e8ddf4defbaeb6cca11e1e355f7a","observation_id":"f4d14097-7200-445e-b35b-e1a56d76d4d1","resolution":{"observed_at":"2026-06-27T06:51:31.625416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15804","last_updated":"2026-04-21T03:35:14Z","snapshot_observed_at":"2026-08-01T22:56:50.755050Z","submitted_at":"2026-04-17T08:05:46Z","title":"Qwen3.5-Omni Technical Report","version":2},"cited_work":{"arxiv_id":"2604.15804","doi":"10.48550/arxiv.2604.15804","metadata_source":"pith","pith_arxiv_id":"2604.15804","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Qwen3.5-Omni Technical Report","venue":"cs.CL","work_id":"9d0aeac4-3b94-4a09-af62-5e32286fdf5f","year":2026},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"cited_paper":"/paper/2604.15804","citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:42a17d92c0b61f9ab8259366ff77f3659b34200b9934d65a07f827f03db9a7bd","observation_id":"991111a4-6f70-49aa-98f7-b9d74bee78d1","resolution":{"observed_at":"2026-07-03T14:58:32.682380Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:31.625416Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:3270687f7ab918078f865beaf0d4067780715473ba15456f9912d190eec85cf6","observation_id":"b561600a-770c-4c56-98a5-26e4adce2ddc","resolution":{"observed_at":"2026-06-27T06:51:31.625416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":"2503.20314","doi":"10.1109/19.492748","metadata_source":"pith","pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":"cs.CV","work_id":"ad3ebc3b-4224-46c9-b61d-bcf135da0a7c","year":2025},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:9307f21d53668f8e614c2a995bd974ecbfda5c07c38e4871876d5af969e2696a","observation_id":"77267649-46f7-4057-bd89-aedd6e2a3860","resolution":{"observed_at":"2026-07-03T14:58:32.646463Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:31.625416Z","title":"Echoshot: Multi-shot portrait video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:4c8772ffdd41dd704043fe9b4b8b8e7cc9646260b8f4cd0934f3af3e6afdc9a6","observation_id":"ce45a103-ef1e-4b33-9831-a1f8085f576b","resolution":{"observed_at":"2026-06-27T06:51:31.625416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":"2409.12191","doi":"10.48550/arxiv.2409.12191","metadata_source":"pith","pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","venue":"cs.CV","work_id":"8abcfe4f-e0fb-44b7-9123-448fac95f90a","year":2024},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:d4600ba8dc83d0b1cbf2994db153c13403aab2ecfd791656c2adedd6bb6395b2","observation_id":"79e59e81-3d6f-4707-862e-9a48206763e6","resolution":{"observed_at":"2026-07-03T14:58:32.699096Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07519","last_updated":"2024-02-02T16:15:22Z","snapshot_observed_at":"2026-08-06T23:08:20.817133Z","submitted_at":"2024-01-15T07:50:18Z","title":"InstantID: Zero-shot Identity-Preserving Generation in Seconds","version":2},"cited_work":{"arxiv_id":"2401.07519","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.07519","snapshot_observed_at":"2026-07-04T10:19:46.873019Z","title":"InstantID: Zero-shot Identity-Preserving Generation in Seconds","venue":"cs.CV","work_id":"85490b0d-f13f-4217-a587-51a62742c242","year":2024},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"cited_paper":"/paper/2401.07519","citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:184d6c5459000ae8f4ed099a768886254b5b89a6cf864b66a9e42ad9cb028ef6","observation_id":"155faac5-5c1a-4051-a82b-47ccaee73fcc","resolution":{"observed_at":"2026-07-03T14:58:32.672973Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:31.625416Z","title":"Multishotmaster: A controllable multi-shot video generation framework","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:93217e032e35b490456ee11fc14270d122f91fb627e94b223d451517e966e884","observation_id":"81dba3ff-edd7-4923-8f01-1d434024e175","resolution":{"observed_at":"2026-06-27T06:51:31.625416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:31.625416Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:863276d15f11d530f1680d278e091e4033df9b6025a28f795a162a9548e64386","observation_id":"e7d0ea8d-a8ac-4dfc-b040-1b0fde765500","resolution":{"observed_at":"2026-06-27T06:51:31.625416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":"2212.03191","doi":"10.48550/arxiv.2212.03191","metadata_source":"pith","pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","venue":"cs.CV","work_id":"780aaeee-ac26-46b1-b6ff-64a7a624e694","year":2022},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:6c49095e707e99110d370f6f0f7262ba797e1eaea5d68edc8307075c1ca1c7b0","observation_id":"298abd9b-abef-4d23-bef4-ee332f59169d","resolution":{"observed_at":"2026-07-03T14:58:32.699908Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:31.625416Z","title":"Motionctrl: A unified and flexible motion controller for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:ef29ba01ec23f4f8f65bab50d77db598f35d7cabf510df079537c1aeeaa9db0a","observation_id":"f993a9cf-8ee8-4f37-88e2-ff6c3014d967","resolution":{"observed_at":"2026-06-27T06:51:31.625416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02324","last_updated":"2025-08-04T11:49:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-04T11:49:20Z","title":"Qwen-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2508.02324","doi":"10.48550/arxiv.2508.02324","metadata_source":"pith","pith_arxiv_id":"2508.02324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-Image Technical Report","venue":"cs.CV","work_id":"d06d7ecc-7579-4f89-a60b-4278a0f3c562","year":2025},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"cited_paper":"/paper/2508.02324","citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:265573773fb82963ce57392edbd44d5227f5f00ffa5add83dda4a7afa334093d","observation_id":"b5ca9d57-bf4f-4b9d-96a3-20edc99b3089","resolution":{"observed_at":"2026-07-03T14:58:32.684451Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-21T15:23:05.016381+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T15:23:05.016381+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:31.625416Z","title":"Cinetrans: Learning to generate videos with cinematic transitions via masked diffusion models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:40e49798f38af898e612ea1957e67b7cd196e6548e2c9bb7d60bb3fbe6a40280","observation_id":"3fc1eacc-2cd6-46c4-8a12-e4780db5b8d0","resolution":{"observed_at":"2026-06-27T06:51:31.625416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:31.625416Z","title":"Mind the time: Temporally-controlled multi-event video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:d8869af3ee1edae0afdc27212e91ebbbb0517fc1b388b80dfe2c35d4d97220e3","observation_id":"5a4078be-78a6-4762-acc1-5017e4a0ffd9","resolution":{"observed_at":"2026-06-27T06:51:31.625416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:31.625416Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:a4510086c9996a9da48293a0e000e0b6e8393f21cd4443a4ee3324e46d27a415","observation_id":"b3138c81-0460-4087-bb9f-40f607229dd5","resolution":{"observed_at":"2026-06-27T06:51:31.625416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":"2308.06721","doi":"10.48550/arxiv.2308.06721","metadata_source":"pith","pith_arxiv_id":"2308.06721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","venue":"cs.CV","work_id":"98e51b10-54bd-4251-8a2d-f79bd6215c19","year":2023},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"cited_paper":"/paper/2308.06721","citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:87156074189d5e90ce3682bf0d7f57aa5b2189fd0ab3dd0ed6b65aa428ee5082","observation_id":"99a10ca4-03b7-480d-8305-e8cd3c940e03","resolution":{"observed_at":"2026-07-03T14:58:32.694799Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:20:08.139662+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:20:08.139662+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:51:31.625416Z","title":"Tora2: Motion and appearance customized diffusion transformer for multi-entity video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:199d5e91ae0c8bde1e908fef7fe4e3bc5c52a65aa6c2acb8a03e32af2dbb1762","observation_id":"86ad5365-d368-4850-a056-a7984a6b33c1","resolution":{"observed_at":"2026-06-27T06:51:31.625416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"cited_work":{"arxiv_id":"2304.11277","doi":"10.48550/arxiv.2304.11277","metadata_source":"pith","pith_arxiv_id":"2304.11277","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","venue":"cs.DC","work_id":"bee7755e-b855-401d-813a-06ae9451d768","year":2023},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"cited_paper":"/paper/2304.11277","citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:09f7c478a26741f243aa145d33a9a25898eb9e6cbe613446430785b948283ce4","observation_id":"43462894-aa82-40ca-b881-a46be9f8caab","resolution":{"observed_at":"2026-07-03T14:58:32.678800Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-20T14:22:13.496008+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T14:22:13.496008+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15957","last_updated":"2024-12-04T12:54:44Z","snapshot_observed_at":"2026-07-06T19:37:03.013065Z","submitted_at":"2024-10-21T12:36:27Z","title":"CamI2V: Camera-Controlled Image-to-Video Diffusion Model","version":3},"cited_work":{"arxiv_id":"2410.15957","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.15957","snapshot_observed_at":"2026-07-08T13:14:53.143564Z","title":"Cami2v: Camera-controlled image-to-video diffusion model","venue":"cs.CV","work_id":"dfc5b040-8e44-47be-8714-65cc5b5f8400","year":2024},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"cited_paper":"/paper/2410.15957","citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:b85ba90bf2933efac88f1480dd09fd3500e715f6609d95a9340f6acab8a28a35","observation_id":"27df140f-a41d-413f-a1c9-0491c03558ef","resolution":{"observed_at":"2026-07-03T14:58:32.701652Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation"},"reference_resolution":{"displayed":76,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":51,"verified_exact":24,"verified_fuzzy":0},"total_outbound_references":76},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 76 of 76 outbound references and 0 inbound Pith citation observations for arXiv:2606.13768."}