{"as_of":"2026-08-08T08:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:52d33ddad87f84970298af9b9ca3eb09d9e3faa69fda444235471f228c8b99bc","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:01:02.423170Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.22980/citation-record","integrity":"/paper/2505.22980/integrity","json":"/paper/2505.22980/citation-record.json","paper":"/paper/2505.22980"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T13:00:56.424420Z","title":"GPT-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:56.424420Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:5b1053c571753f36bd625a4c7f05b932edbf0a7486f329d3f14e653deb9b2b7d","observation_id":"6c51cfaf-ecdf-40d7-ad8c-681e9defe6fb","resolution":{"observed_at":"2026-08-07T13:00:56.424420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:11.006844Z","title":"Frozen in time: A joint video and im- age encoder for end-to-end retrieval","venue":null,"work_id":"b8d5b3f0-ed30-4e57-8098-b27ec4fca872","year":2021},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:56.521401Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:e6bebbd403ccd373958234a949ef698925cf86dd5a6c1fc12f5255de6f3bc354","observation_id":"1d82a762-a827-434e-bece-cc68cfb7d6f8","resolution":{"observed_at":"2026-08-07T13:01:11.203309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12945","last_updated":"2024-02-05T16:36:30Z","snapshot_observed_at":"2026-08-07T01:22:41.601795Z","submitted_at":"2024-01-23T18:05:25Z","title":"Lumiere: A Space-Time Diffusion Model for Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12945","snapshot_observed_at":"2026-08-07T13:00:56.611108Z","title":"Lumiere: A space-time diffusion model for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:56.611108Z"},"links":{"cited_paper":"/paper/2401.12945","citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:9349d94911d715fb475174c03956817aa6f65ce5a153c44ed8f6a35c8d76c44d","observation_id":"be240a50-c82f-4585-9e23-60e5a9698fa5","resolution":{"observed_at":"2026-08-07T13:00:56.611108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:10.676342Z","title":"Multidiffusion: Fusing diffusion paths for con- trolled image generation","venue":null,"work_id":"51d495b1-7ac8-46bd-90a8-b464f6587aeb","year":2023},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:56.724522Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:73f7f99db01bae9a2008ccefbbd7ff22955c3912a83051c86232ca95102872b4","observation_id":"43d0e7af-36c5-4746-99e5-dd6195be5d4a","resolution":{"observed_at":"2026-08-07T13:01:10.845129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T13:00:56.872776Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets.arXiv preprint arXiv:2311.15127, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:56.872776Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:df8203fc0f697305341f2c4e72bba01b0ad7e5ec619e109221dc2a564cab16ee","observation_id":"842663ce-81b1-4b8c-8aa1-fa07edf8a6ab","resolution":{"observed_at":"2026-08-07T13:00:56.872776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:10.340079Z","title":"Align your latents: High-resolution video synthesis with latent diffusion models","venue":null,"work_id":"ba066d9d-813b-438a-a702-32019bcad08d","year":null},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:56.970597Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:b762399a413c15b272c58ac4a6c5c3a425c77ed542d889f4299971bf319d54a6","observation_id":"36d37ad9-256f-4803-b3a0-9f2618fed3e0","resolution":{"observed_at":"2026-08-07T13:01:10.495466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00990","last_updated":"2025-04-14T02:18:19Z","snapshot_observed_at":"2026-07-06T16:42:00.138744Z","submitted_at":"2023-11-02T04:38:50Z","title":"VideoDreamer: Customized Multi-Subject Text-to-Video Generation with Disen-Mix Finetuning on Language-Video Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.00990","snapshot_observed_at":"2026-08-07T13:00:57.039138Z","title":"Videodreamer: Customized multi-subject text-to- video generation with disen-mix finetuning.arXiv preprint arXiv:2311.00990, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:57.039138Z"},"links":{"cited_paper":"/paper/2311.00990","citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:7e3344fa13b0c831bcac5d6869612726c881e4c58b91a3f57b26eb5c90c87109","observation_id":"a7ccfdea-b328-485b-9aa7-2f6d59470f66","resolution":{"observed_at":"2026-08-07T13:00:57.039138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:09.973629Z","title":"Videocrafter2: Overcoming data limitations for high- quality video diffusion models","venue":null,"work_id":"b86c1ecb-7015-4303-b4e1-88212dbc4be5","year":2024},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:57.143508Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:9c0d4b1b3eaf96caef8b756f7f5de7326ae51b5fe403d801191dac84a138c7a0","observation_id":"9b6071c2-fd71-4667-990e-1f617c379fd0","resolution":{"observed_at":"2026-08-07T13:01:10.125256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:09.687403Z","title":"Panda-70m: Captioning 70m videos with multiple cross-modality teachers","venue":null,"work_id":"36fedcc1-d19a-4e01-a74b-133900ac1a20","year":2024},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:57.188341Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:c1d803dc86c39e51b2f3fa82ea87a38b3f11ce70cf4ab30092de33985cc0a474","observation_id":"b335be6a-f2fe-4445-abf3-c8838c6ffc80","resolution":{"observed_at":"2026-08-07T13:01:09.819009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:00:57.269517Z","title":"Sora as an agi world model? a complete survey on text-to-video generation.arXiv preprint arXiv:2403.05131, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:57.269517Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:ddc3186a2543516e2a681e3e7e0bcf284dfbd05f395283ed087eff1e3c7eceed","observation_id":"86692de2-767f-4608-8f4a-42cd3c20b68f","resolution":{"observed_at":"2026-08-07T13:00:57.269517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:09.380686Z","title":"Data-Juicer Sandbox: A Comprehensive Suite for Multimodal Data-Model Co-development","venue":null,"work_id":"eb3031fc-95b9-492b-b0db-ea5f426b26ef","year":2024},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:57.433196Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:d4e873f8d22acaf7cf6a43280cd5a8a150c91f013b891f2e8597d353788a0ca7","observation_id":"9ccaa405-75ef-4749-abaa-783b7ae51a71","resolution":{"observed_at":"2026-08-07T13:01:09.551068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:08.982181Z","title":"DiffSynth-Studio: Enjoy the magic of Diffusion models!https://github.com/ modelscope/DiffSynth-Studio, 2024","venue":null,"work_id":"4cc0c532-c129-419b-8b52-599d1c9f684a","year":2024},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:57.582602Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:39e3a63b6445424267077dd2fd12f0a968a4e5d8822b453a1f9f9625d4395493","observation_id":"9b25e274-37d8-4f14-9df1-b3ea4c4abc93","resolution":{"observed_at":"2026-08-07T13:01:09.166354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:08.709492Z","title":"Animatediff: Animate your personalized text-to-image diffusion models without specific tuning.International Conference on Learn- ing Representations, 2024","venue":null,"work_id":"8ce1a6e9-b814-48fa-8f93-78cdea3e4bfd","year":2024},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:57.717505Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:c1f998388e211b22632840490cf4fd102e8c5cdb83fb104fc4f8b885a170acd4","observation_id":"3935d16d-c838-4c6e-a3c0-37efa2f38078","resolution":{"observed_at":"2026-08-07T13:01:08.832656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-08-07T13:00:57.842598Z","title":"Latent video diffusion models for high-fidelity video generation with arbitrary lengths","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:57.842598Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:e389c17ca4221564da7a360fcd93b5ef334f4df62184c2e2c0563b4d9bda41e4","observation_id":"37fc4c8d-8a6f-458c-a9a0-ec81da22db58","resolution":{"observed_at":"2026-08-07T13:00:57.842598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:08.341019Z","title":"CLIPScore: a reference- free evaluation metric for image captioning","venue":null,"work_id":"41f64cd4-e485-4dc9-93ac-7e6bb0509588","year":2021},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:57.985309Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:a725f84376f989268138d29428acb4c87219325b23573976ba79054d6564a118","observation_id":"6f32561d-1157-4416-8631-f864ad6099ec","resolution":{"observed_at":"2026-08-07T13:01:08.484965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-07T13:00:58.093105Z","title":"Examples of failure cases are shown: (a) Overlapping bounding boxes may lead to anomalies","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:58.093105Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:6d9e21f5ed4c065c8d160c29ac9b034ac74fedc327ef5087e6d638d22115f495","observation_id":"d1933484-4e79-4734-841f-0027a4878843","resolution":{"observed_at":"2026-08-07T13:00:58.093105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:00:58.197779Z","title":"Denois- ing diffusion probabilistic models.Advances in neural information processing systems, 33:6840–6851, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:58.197779Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:2d59542cb8f5ae15a6bbc9302c3a00c9de59f1cbffae3c30b439c62498adb980","observation_id":"33db6231-caa2-4980-810c-6cb240c89537","resolution":{"observed_at":"2026-08-07T13:00:58.197779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.03458","last_updated":"2022-06-22T20:22:29Z","snapshot_observed_at":"2026-07-06T12:57:51.108636Z","submitted_at":"2022-04-07T14:08:02Z","title":"Video Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.03458","snapshot_observed_at":"2026-08-07T13:00:58.322441Z","title":"Video diffusion models.arXiv:2204.03458,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:58.322441Z"},"links":{"cited_paper":"/paper/2204.03458","citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:e5d379e256255a5fbac80a2637dbdcd3d7f2c40d17e96959579ed39b5a29a7ad","observation_id":"9a3b2a17-96da-4b8b-b8e0-5a45bb38fc4c","resolution":{"observed_at":"2026-08-07T13:00:58.322441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15868","last_updated":"2022-05-29T19:02:15Z","snapshot_observed_at":"2026-07-06T13:15:58.303738Z","submitted_at":"2022-05-29T19:02:15Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15868","snapshot_observed_at":"2026-08-07T13:00:58.427430Z","title":"Cogvideo: Large-scale pretraining for text-to-video generation via transformers.arXiv preprint arXiv:2205.15868, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:58.427430Z"},"links":{"cited_paper":"/paper/2205.15868","citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:d549fd0e9102d8fde075638d75390ceeff25938223d28e722c0ffc4d0723d63d","observation_id":"caa1bd13-a401-4165-ba1b-c5537d101575","resolution":{"observed_at":"2026-08-07T13:00:58.427430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:08.311930Z","title":"Vbench: Comprehensive benchmark suite for video generative models","venue":null,"work_id":"a3968884-fb3a-4f63-ac1c-ab9fdc4b023a","year":2024},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:58.539695Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:4ffbc859e160c2e56617dd617773ed6b267429bd0d2cbf696bcb5182170c8449","observation_id":"50e588c3-2169-4d3c-acd8-eae01d532af9","resolution":{"observed_at":"2026-08-07T13:01:08.315535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:08.304758Z","title":"High-quality Text-to-video Models","venue":null,"work_id":"b1a58f95-3ec0-4af2-ba35-3cef1e5778c0","year":2024},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:58.658289Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:53f6bde5a0da2253039d96befc6b2e70552bbad5b52cf2ccc800c4df752e4dfe","observation_id":"6015e7c6-9ffa-4ff7-b1aa-9ed77f66ca46","resolution":{"observed_at":"2026-08-07T13:01:08.307585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:08.045352Z","title":"KLING AI: Next-Generation AI Creative Studio.https://www.klingai.com/, 2024","venue":null,"work_id":"be19bdb8-d713-4359-8d12-c234b09d1245","year":2024},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:58.748386Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:1185abbacd23ac46311bb2182ac837036a6a472e10354dd4c70d2d25b55c5d70","observation_id":"b974e219-4fb0-4c1e-ae84-95e7459971bd","resolution":{"observed_at":"2026-08-07T13:01:08.180073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:07.716840Z","title":"Multi-concept cus- tomization of text-to-image diffusion","venue":null,"work_id":"3d2924c7-4bae-4886-a85b-8817b749a023","year":1931},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:58.858770Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:dbfef990bc73c019da11456e923c3ef9800e2e4428694157a74bfd3f6bd5db3f","observation_id":"272c985e-138a-496a-b615-57a1b4732816","resolution":{"observed_at":"2026-08-07T13:01:07.862669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00651","last_updated":"2024-03-20T17:28:02Z","snapshot_observed_at":"2026-07-06T16:55:41.420301Z","submitted_at":"2023-12-01T15:24:38Z","title":"TrackDiffusion: Tracklet-Conditioned Video Generation via Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00651","snapshot_observed_at":"2026-08-07T13:00:58.952626Z","title":"Trackdiffusion: Tracklet- conditioned video generation via diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:58.952626Z"},"links":{"cited_paper":"/paper/2312.00651","citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:5f6b618906484c7e05e08f2c2a3a4e94f86e54c829e9e7883791c895a9aec1d7","observation_id":"2233dae1-8b17-4b73-b21d-c9aca587af4f","resolution":{"observed_at":"2026-08-07T13:00:58.952626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:07.580167Z","title":"Gligen: Open-set grounded text-to- image generation","venue":null,"work_id":"250a5700-7f3f-4cbe-b5bc-154f94d418f8","year":2023},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:59.025274Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:0806a37d2a2a31631e546a0af6a6d54e7ecec54c7a01151c85b1c7159ac7f763","observation_id":"be3c788d-8ee8-4078-a85b-caa23787f32f","resolution":{"observed_at":"2026-08-07T13:01:07.638758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:07.426335Z","title":"Movideo: Motion-aware video generation with diffusion model","venue":null,"work_id":"65f63c7c-1927-4bc4-9e1c-48226b7f5093","year":2025},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:59.091672Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:0cc1278be12a9825780df6c995921c363a56ed07b6031025f1ea970efe863bb5","observation_id":"80044332-1829-4001-9a49-611707efe2e6","resolution":{"observed_at":"2026-08-07T13:01:07.496035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:07.284039Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36, 2024","venue":null,"work_id":"149a068d-485f-4f98-8ec6-16d77640ce0c","year":2024},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:59.172626Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:61c5b905b3ee64a26bf7cb5375fa2f665e3aecbfb26d718f6502acd2592742d6","observation_id":"ff403e82-cb7a-4ac2-a7ee-489674d20e87","resolution":{"observed_at":"2026-08-07T13:01:07.343576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02236","last_updated":"2023-06-04T02:33:12Z","snapshot_observed_at":"2026-08-06T15:51:21.815246Z","submitted_at":"2023-06-04T02:33:12Z","title":"Detector Guidance for Multi-Object Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2306.02236","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.02236","snapshot_observed_at":"2026-08-07T13:01:02.885255Z","title":"Detector Guidance for Multi-Object Text-to-Image Generation","venue":"cs.CV","work_id":"58d238a7-ba8b-43bb-a8dc-9c0c5d6e66e2","year":2023},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:59.268187Z"},"links":{"cited_paper":"/paper/2306.02236","citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:a85663a0c380a1e7d04c9c814045a84fff330ae20fc427827190af10cc77d9a3","observation_id":"a634ebcf-1c1d-4882-9502-b3558c670a96","resolution":{"observed_at":"2026-08-07T13:01:03.014410Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17177","last_updated":"2024-04-17T18:41:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-27T03:30:58Z","title":"Sora: A Review on Background, Technology, Limitations, and Opportunities of Large Vision Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17177","snapshot_observed_at":"2026-08-07T13:00:59.360313Z","title":"Sora: A re- view on background, technology, limitations, and op- portunities of large vision models.arXiv preprint arXiv:2402.17177, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:59.360313Z"},"links":{"cited_paper":"/paper/2402.17177","citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:0fe9ea3ade019d7572458d2745d43c9dc42c6f7b22323a5c12c2b50b15269b4f","observation_id":"be93cda6-eecb-4039-958a-99d6463f79db","resolution":{"observed_at":"2026-08-07T13:00:59.360313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:07.080737Z","title":"Lumaai.https://lumalabs.ai/,","venue":null,"work_id":"9e2a00e9-2d64-4cbf-99d7-e1858d378842","year":null},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:59.480131Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:1b9b91713d8b6250ec29af4644a9e7f220d2def62f5cf4745393e403f1d8e127","observation_id":"4ab781fb-589e-4f9b-93fb-8ee640cf5507","resolution":{"observed_at":"2026-08-07T13:01:07.181827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:06.608871Z","title":"Vidm: Video implicit diffusion models","venue":null,"work_id":"8b6b1e17-43a6-4dd4-90aa-74acfea123ae","year":2023},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:59.677588Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:2f01a11cd64e0230bd7243b35b6b0f9570db072c21d50d9cb0f36a808a9d17ca","observation_id":"32ae22fd-4d49-4c6d-ad5c-14872d010344","resolution":{"observed_at":"2026-08-07T13:01:06.675171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:06.440100Z","title":"Hailuo AI: Captivating AI Videos Gen- erated with Hailuo AI .https://hailuoai","venue":null,"work_id":"578856fa-5309-4b9b-afda-10fb37bd6f79","year":2024},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:59.744083Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:2dcebfacb23524619f8706cbbb371bcc621ff90a346b9daf22d4e1268a593a74","observation_id":"37de2084-99d7-4691-bb74-cfadb942a24d","resolution":{"observed_at":"2026-08-07T13:01:06.512260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01329","last_updated":"2023-02-02T18:58:58Z","snapshot_observed_at":"2026-07-06T14:47:48.494911Z","submitted_at":"2023-02-02T18:58:58Z","title":"Dreamix: Video Diffusion Models are General Video Editors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.01329","snapshot_observed_at":"2026-08-07T13:00:59.801514Z","title":"Dreamix: Video diffusion models are general video editors.arXiv preprint arXiv:2302.01329, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:59.801514Z"},"links":{"cited_paper":"/paper/2302.01329","citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:4aab56c2e292089e9f94ad4f43b361db8b6854db615a8bbfd9c50c433038fcca","observation_id":"00d20cf3-5a94-4aab-a214-7fbe8a35b8a0","resolution":{"observed_at":"2026-08-07T13:00:59.801514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18072","last_updated":"2024-10-23T17:56:11Z","snapshot_observed_at":"2026-08-07T10:24:39.020859Z","submitted_at":"2024-10-23T17:56:11Z","title":"WorldSimBench: Towards Video Generation Models as World Simulators","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18072","snapshot_observed_at":"2026-08-07T13:00:59.855458Z","title":"Worldsimbench: Towards video gen- eration models as world simulators.arXiv preprint arXiv:2410.18072, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:59.855458Z"},"links":{"cited_paper":"/paper/2410.18072","citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:2d9fa795f5a076c9f868c89ba9614ca877871b0f8ed37a9ff13eb08c63a8bdd8","observation_id":"ed0700fb-40f1-46c2-b9df-8dc13412dc53","resolution":{"observed_at":"2026-08-07T13:00:59.855458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16863","last_updated":"2024-06-24T17:59:56Z","snapshot_observed_at":"2026-07-06T18:36:12.298104Z","submitted_at":"2024-06-24T17:59:56Z","title":"FreeTraj: Tuning-Free Trajectory Control in Video Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16863","snapshot_observed_at":"2026-08-07T13:00:59.932469Z","title":"Freetraj: Tuning- free trajectory control in video diffusion models.arXiv preprint arXiv:2406.16863, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:59.932469Z"},"links":{"cited_paper":"/paper/2406.16863","citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:5f9dc928e54886174c4a27019ca5ae07314fbabd81df501b8af9ee4e15075228","observation_id":"ccd886c3-2fdb-4825-9188-ee47f941fb16","resolution":{"observed_at":"2026-08-07T13:00:59.932469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:00:59.991815Z","title":"High- resolution image synthesis with latent diffusion mod- els","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:59.991815Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:0a2f8806ccef2ba04b4643a86c274ebf82d30c6494d59e5d213a59c827e39164","observation_id":"b61f693c-65c2-4189-8e45-07b895997203","resolution":{"observed_at":"2026-08-07T13:00:59.991815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:06.231011Z","title":"Gen-2: Generate novel videos with text, im- ages or video clips, 2024","venue":null,"work_id":"ef30f10e-af11-4e5b-aa73-2ea860b95c45","year":2024},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:00.054526Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:ada412436c10a4a074b7c561457673aec7a70d3e95c8fbed8bd7a941711f015a","observation_id":"077b15c3-383c-4714-9e5e-ec3e29d03024","resolution":{"observed_at":"2026-08-07T13:01:06.325296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:06.092316Z","title":"Introducing Gen-3 Alpha: A New Frontier for Video Generation, 2024","venue":null,"work_id":"ff691e39-07de-4bc6-a23f-8d83787ca4fb","year":2024},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:00.104985Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:eef35e7e33b0a08c3c4dae2f4a93f68106e932fba00a9534736faf9ba50dead4","observation_id":"0d5210f5-31b9-4dd7-9af0-34f0764c78a1","resolution":{"observed_at":"2026-08-07T13:01:06.166910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-07T13:01:00.153544Z","title":"Make-a-video: Text- to-video generation without text-video data.arXiv preprint arXiv:2209.14792, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:00.153544Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:08672e40960e671cd8f905271f9359ffd0fd6d80e3108047ec74ad72c6675d2c","observation_id":"55510d57-fa72-422a-81f8-f760346fd4d4","resolution":{"observed_at":"2026-08-07T13:01:00.153544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-07T13:01:00.214571Z","title":"Denoising diffusion implicit models.arXiv preprint arXiv:2010.02502, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:00.214571Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:78108c43a3029905ade343f7cf98849d16cd00a31345e87c611b7dcde7062ca6","observation_id":"d567d424-2a2d-472e-ab42-d20348480375","resolution":{"observed_at":"2026-08-07T13:01:00.214571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-07-06T03:01:10.229407Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-07T13:01:00.283843Z","title":"Ucf101: A dataset of 101 human actions classes from videos in the wild.arXiv preprint arXiv:1212.0402, 2012","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:00.283843Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:bf8cc5856f38da199076501cb283b0feff75932915aa4f5d234a2c5dc07f099a","observation_id":"b94524fd-15c5-4b14-a04b-404da42a760b","resolution":{"observed_at":"2026-08-07T13:01:00.283843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:05.937487Z","title":"Raft: Recurrent all-pairs field transforms for optical flow","venue":null,"work_id":"390a5240-9f05-437b-ac9e-4f85d43fe532","year":2020},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:00.331605Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:86f11b1cacdb66423a3b2b06fb7aee638dd4dd89ae6a4d61ab4296b5ff0ce411","observation_id":"cf967497-233e-4b07-818c-d3b7f7e4bfe7","resolution":{"observed_at":"2026-08-07T13:01:06.011982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T13:01:00.389339Z","title":"Llama: Open and effi- cient foundation language models.arXiv preprint arXiv:2302.13971, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:00.389339Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:57fefce64348fceb3f521f1d7d24671b07ff3c5073d087ab062c26032493545c","observation_id":"d42c452d-9d30-4735-b207-c73d02727e5c","resolution":{"observed_at":"2026-08-07T13:01:00.389339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:05.749874Z","title":"Fvd: A new metric for video generation","venue":null,"work_id":"68d1be36-eb58-4d4e-93fa-b5e020e57fe3","year":null},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:00.436115Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:90623e5277dcf62eb9ead6257da400a2e4633bcf83291f1c05181b69aabf27c9","observation_id":"9c91d916-d50f-466b-ae54-23f87b483035","resolution":{"observed_at":"2026-08-07T13:01:05.828168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:05.611056Z","title":"Vchitect 2.0: Embark on a Visual Fan- tasy Journey.https://vchitect.intern- ai.org.cn/, 2024","venue":null,"work_id":"844eb00b-3815-44a3-bec1-d73ad023b73f","year":2024},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:00.504131Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:784c3e0c5818c8d5336d4d37c72badeddbcac19ba4a73d68ed1dea33b3983eb6","observation_id":"c9b98d0c-7c9f-4cf4-8689-727ac648b204","resolution":{"observed_at":"2026-08-07T13:01:05.693951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02399","last_updated":"2022-10-05T17:18:28Z","snapshot_observed_at":"2026-08-04T09:09:48.463217Z","submitted_at":"2022-10-05T17:18:28Z","title":"Phenaki: Variable Length Video Generation From Open Domain Textual Description","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02399","snapshot_observed_at":"2026-08-07T13:01:00.551776Z","title":"Phenaki: Variable length video gen- eration from open domain textual description.arXiv preprint arXiv:2210.02399, 2022","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:00.551776Z"},"links":{"cited_paper":"/paper/2210.02399","citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:0324f203d6c9c1ed37b736a15a50625cfe9a5db3579f57418e32dd5426428e59","observation_id":"7728518b-2d64-4a24-aa08-5fe07fb488c1","resolution":{"observed_at":"2026-08-07T13:01:00.551776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06571","last_updated":"2023-08-12T13:53:10Z","snapshot_observed_at":"2026-08-07T17:54:54.749604Z","submitted_at":"2023-08-12T13:53:10Z","title":"ModelScope Text-to-Video Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06571","snapshot_observed_at":"2026-08-07T13:01:00.629908Z","title":"Mod- elscope text-to-video technical report.arXiv preprint arXiv:2308.06571, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:00.629908Z"},"links":{"cited_paper":"/paper/2308.06571","citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:a853b18596fb3809817e555efa842aa4a4f9576c55fbb596b0bb69352c187e25","observation_id":"b92d328c-fdd7-4fc2-8881-e6dc1d5cc576","resolution":{"observed_at":"2026-08-07T13:01:00.629908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01566","last_updated":"2024-02-02T16:59:48Z","snapshot_observed_at":"2026-08-05T10:16:25.180895Z","submitted_at":"2024-02-02T16:59:48Z","title":"Boximator: Generating Rich and Controllable Motions for Video Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01566","snapshot_observed_at":"2026-08-07T13:01:00.698486Z","title":"Boximator: Generating rich and controllable motions for video synthesis.arXiv preprint arXiv:2402.01566, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:00.698486Z"},"links":{"cited_paper":"/paper/2402.01566","citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:facf641bdf1debf621c028cde6eda279a4ac2496f3716c6f94b05197ea2bee3b","observation_id":"76bd7851-616f-47fe-a686-038e71947e91","resolution":{"observed_at":"2026-08-07T13:01:00.698486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-07T13:01:00.755454Z","title":"CogVLM: Visual ex- pert for pretrained language models.arXiv preprint arXiv:2311.03079, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:00.755454Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:a60049a0f2f1f075a38e4db329bcd619da17fa035e192c509ba587f1e9c37e4f","observation_id":"0bd7da98-74db-4435-9e17-d1bf73de581c","resolution":{"observed_at":"2026-08-07T13:01:00.755454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-07T13:01:00.803646Z","title":"Emu3: 15 Next-token prediction is all you need.arXiv preprint arXiv:2409.18869, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:00.803646Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:8a4ee04b62a568dc6acac6be798665456b187a2173708cdc9f8ad33546c4d2e1","observation_id":"77514227-2a4a-46c9-a9b4-dbef5600b2ae","resolution":{"observed_at":"2026-08-07T13:01:00.803646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09985","last_updated":"2024-01-18T14:01:20Z","snapshot_observed_at":"2026-08-07T06:47:36.460071Z","submitted_at":"2024-01-18T14:01:20Z","title":"WorldDreamer: Towards General World Models for Video Generation via Predicting Masked Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09985","snapshot_observed_at":"2026-08-07T13:01:00.850247Z","title":"Worlddreamer: Towards general world models for video genera- tion via predicting masked tokens.arXiv preprint arXiv:2401.09985, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:00.850247Z"},"links":{"cited_paper":"/paper/2401.09985","citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:fff9e006037130a14bc5794a480182d5e81fb521a934b919b93a82951b575873","observation_id":"5527bad4-bd6c-4d2a-a004-2ab86e607bdb","resolution":{"observed_at":"2026-08-07T13:01:00.850247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:05.374459Z","title":"LaVie: High-quality video generation with cascaded latent diffusion mod- els.IJCV, 2024","venue":null,"work_id":"b16bb3c8-6fa2-45ba-a89d-2fd38613ba3d","year":2024},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:00.900024Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:7891db229e999a6994931035b509ea6097c4e456b80e614d3a89b42f57c42659","observation_id":"5b73f522-f386-48ad-8fa6-f7b34042c99f","resolution":{"observed_at":"2026-08-07T13:01:05.494450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:00.965204Z","title":"Customvideo: Cus- tomizing text-to-video generation with multiple sub- jects.arXiv preprint arXiv:2401.09962, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:00.965204Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:94a1c0aff267a8bad7e93ccfd2ea1b9f0db2c0caf7a421cf7b91ca40b6403c43","observation_id":"0969d8ed-1fb6-4f3b-99cf-9b277420cd86","resolution":{"observed_at":"2026-08-07T13:01:00.965204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:05.120432Z","title":"Grit: A generative region-to-text transformer for ob- ject understanding","venue":null,"work_id":"9e48767f-05e1-40a5-bab6-a9b22b1b93e8","year":2025},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:01.016503Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:f9ae7bad2dc483d64585e03de82a5e638e4d17ca0897a1f010c6beae2b64c15f","observation_id":"25ef5394-9984-4e2d-ba69-6861e8466566","resolution":{"observed_at":"2026-08-07T13:01:05.242780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07537","last_updated":"2024-07-25T09:10:52Z","snapshot_observed_at":"2026-07-06T17:00:37.507046Z","submitted_at":"2023-12-12T18:59:16Z","title":"FreeInit: Bridging Initialization Gap in Video Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07537","snapshot_observed_at":"2026-08-07T13:01:01.085135Z","title":"Freeinit: Bridging initializa- tion gap in video diffusion models.arXiv preprint arXiv:2312.07537, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:01.085135Z"},"links":{"cited_paper":"/paper/2312.07537","citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:9790e4a9da49e846d8f80c1392034e349e0ae224f3ab2044a1b933257ba40b90","observation_id":"a5b9fce2-6191-40d8-9afd-ef79d6c2815a","resolution":{"observed_at":"2026-08-07T13:01:01.085135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:04.862010Z","title":"Dynamicrafter: An- imating open-domain images with video diffusion pri- ors","venue":null,"work_id":"0d43f170-10c8-419e-9704-c216da75f781","year":2024},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:01.159014Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:564dd733fdfcc6b28993de69387fc6ea945fc4615b95c718e154960a0fd88997","observation_id":"81dc84f9-3b18-4b54-ba9f-d8405d3a5837","resolution":{"observed_at":"2026-08-07T13:01:04.971631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:04.592944Z","title":"MSR- VTT: A large video description dataset for bridging video and language","venue":null,"work_id":"04b2dfa6-4b88-4b1e-8330-2a57ee1e4c86","year":2016},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:01.271572Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:cb31df7d23573cdbb222e2fe534740d85bac914153ef33f4e179c95bb1304b86","observation_id":"591e9272-6616-4805-bcaa-020b06632107","resolution":{"observed_at":"2026-08-07T13:01:04.732407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:04.319436Z","title":"Advancing high-resolution video- language representation with large-scale video tran- scriptions","venue":null,"work_id":"586645b9-e410-4d8d-86ea-390491da107a","year":2022},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:01.363298Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:5ba04de77da7a4ad360543bfc083ec6361c3c65f155e929dbdf1849ee373e779","observation_id":"5dd678f3-210e-4785-8b6f-57f08c563b28","resolution":{"observed_at":"2026-08-07T13:01:04.458872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:04.027941Z","title":"Video in- stance segmentation","venue":null,"work_id":"e7513e25-632a-4f09-b610-0ac4897939c7","year":2019},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:01.481638Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:dbac350e0bc1ca69a0b504d9f115bcd2ab9de7c74eae6d91da6f28d23a18ee45","observation_id":"bdfe9b52-8ebb-4196-94bb-615dfa0b7647","resolution":{"observed_at":"2026-08-07T13:01:04.185001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16111","last_updated":"2024-03-24T12:04:06Z","snapshot_observed_at":"2026-08-04T02:42:31.266467Z","submitted_at":"2024-03-24T12:04:06Z","title":"EVA: Zero-shot Accurate Attributes and Multi-Object Video Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16111","snapshot_observed_at":"2026-08-07T13:01:01.607138Z","title":"Eva: Zero-shot accurate attributes and multi-object video editing.arXiv preprint arXiv:2403.16111, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:01.607138Z"},"links":{"cited_paper":"/paper/2403.16111","citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:5b64ae8ec01811e721e4eadf83ccf012bfed08d9f3b82ccd7027dfd8ff9036f3","observation_id":"dc07aed5-accc-4f00-9c2c-b2af7ecc7e2a","resolution":{"observed_at":"2026-08-07T13:01:01.607138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-07T13:01:01.724034Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer.arXiv preprint arXiv:2408.06072,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:01.724034Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:d7013423e40ad46886cd953cdfbf025a852cae1fb1b4568caf4f33103f5e1114","observation_id":"b7e031dc-3a43-4f2c-95a1-ce678daf7a23","resolution":{"observed_at":"2026-08-07T13:01:01.724034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:03.747003Z","title":"Show-1: Marrying pixel and latent diffusion models for text-to-video generation.Interna- tional Journal of Computer Vision, pages 1–15, 2024","venue":null,"work_id":"58af8666-e628-4ebf-b8c3-315aafc09ee1","year":2024},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:01.876054Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:1287abe82a7d7cbf2ff10fa77f9a856ad59b05e81e3d974e302f761fdb0269d7","observation_id":"1095eefb-eac3-49e4-a793-9812637b7ad5","resolution":{"observed_at":"2026-08-07T13:01:03.849630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04145","last_updated":"2023-11-07T17:16:06Z","snapshot_observed_at":"2026-08-02T12:25:34.488259Z","submitted_at":"2023-11-07T17:16:06Z","title":"I2VGen-XL: High-Quality Image-to-Video Synthesis via Cascaded Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04145","snapshot_observed_at":"2026-08-07T13:01:02.040690Z","title":"I2vgen-xl: High-quality image-to-video synthesis via cascaded diffusion mod- els.arXiv preprint arXiv:2311.04145, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:02.040690Z"},"links":{"cited_paper":"/paper/2311.04145","citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:00fc89c4913f1c5f5d0c94f5ec78c35511b9175c8d108ebbc69889eb3b245b66","observation_id":"274b38f8-d867-4814-bdab-22d674d6b567","resolution":{"observed_at":"2026-08-07T13:01:02.040690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:03.509689Z","title":"Real-time vehicle detection based on improved yolo v5.Sustainability, 14(19):12274, 2022","venue":null,"work_id":"959036db-9c66-4a77-a234-a714c8103e29","year":2022},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:02.166347Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:afa7177dda21db46c5c2edbe7eed6e6246c5f703f346dd7e603c424abd5ca748","observation_id":"4a86a191-9976-4ebc-9f37-0abae1793df8","resolution":{"observed_at":"2026-08-07T13:01:03.624415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:03.263249Z","title":"Open-sora: Democratizing efficient video production for all, March 2024","venue":null,"work_id":"9c021196-aaad-433a-b974-c11816f5c60b","year":2024},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:02.307369Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:ccb098276db204b15597dde623ca6928e893bc1b47a489a643b541b93bfec1b0","observation_id":"2111eff1-6b07-4239-8e8b-1b32f1cb52c7","resolution":{"observed_at":"2026-08-07T13:01:03.398534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11018","last_updated":"2023-05-11T11:23:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-20T16:40:31Z","title":"MagicVideo: Efficient Video Generation With Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11018","snapshot_observed_at":"2026-08-07T13:01:02.423170Z","title":"Magicvideo: Efficient video generation with latent diffusion models.arXiv preprint arXiv:2211.11018, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:02.423170Z"},"links":{"cited_paper":"/paper/2211.11018","citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:3d376f1d972424ee4097ac7420d37776c955c764970fbb3192817e72e40f5b25","observation_id":"808ab046-08ce-426e-8557-ccebdeab53d0","resolution":{"observed_at":"2026-08-07T13:01:02.423170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:06.825059Z","title":"2, 5, 7, 8","venue":null,"work_id":"5e1f3ef7-4b17-4ae3-aaa2-f6df394b333f","year":2024},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:59.590268Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:d60c5e078a78cd3e60f8faa6ec45c4028388d6aaf60a7a790b40cadb26561403","observation_id":"53331444-f74f-4ea2-b685-554cd1e63306","resolution":{"observed_at":"2026-08-07T13:01:06.966840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":1,"verified_fuzzy":34},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 0 inbound Pith citation observations for arXiv:2505.22980."}