{"as_of":"2026-08-04T22:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:98d190b4c66ad09a2cfa67c8ef3d087f85b67b87bb14a328fbc7a74147aebcb0","coverage":[{"denominator":190,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T15:06:02.084336Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.17248/citation-record","integrity":"/paper/2605.17248/integrity","json":"/paper/2605.17248/citation-record.json","paper":"/paper/2605.17248"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19901","last_updated":"2025-06-03T07:32:50Z","snapshot_observed_at":"2026-07-06T21:30:37.657153Z","submitted_at":"2025-05-26T12:29:34Z","title":"Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM","version":3},"cited_work":{"arxiv_id":"2505.19901","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19901","snapshot_observed_at":"2026-06-29T08:53:15.680626Z","title":"Dynamic-i2v: Exploring image-to-video generation models via multimodal llm","venue":null,"work_id":"9266cd54-9756-4fb8-b591-0f27847b0656","year":2025},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"cited_paper":"/paper/2505.19901","citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:78ac18f47902b9f3cefb8d71e56e9f4ec5e4fbdf51399a448b093299f4ce6ed8","observation_id":"e67b3fd2-7807-4c03-8bda-11054505215b","resolution":{"observed_at":"2026-05-20T15:08:25.017943Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Levitor: 3d trajectory oriented image-to-video synthesis","venue":null,"work_id":"38d5cf5f-16ce-45cf-9301-fb7a4fe2c41d","year":2025},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:0a316e7c7b5ae8d7d1aab11459adf3abf4aa07fdd7c1852b8b2b8a53726998fd","observation_id":"36b8d225-314c-4049-9e5f-ce747b065a28","resolution":{"observed_at":"2026-05-20T15:08:25.595639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Motioncanvas: Cinematic shot design with controllable image-to-video generation","venue":null,"work_id":"aa6d04ab-288c-4999-981c-5602de841d00","year":2025},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:4e9e44b6eefaad187699523fccfc86b75badaceeaeaef121737a93197984ea9c","observation_id":"f606e89c-42d9-4b8c-8850-f94e22b8f6c0","resolution":{"observed_at":"2026-05-20T15:08:25.597679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Versatile transi- tion generation with image-to-video diffusion","venue":null,"work_id":"c3fa1e51-089c-4edb-82be-99e68799ec19","year":2025},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:5dfe3930d3e4dfd44304511bc14d9abc882dc0a02bc80eae960010818d7e74b6","observation_id":"d2b3a2d2-86c6-4dd5-9d3e-b9c204d4e716","resolution":{"observed_at":"2026-05-20T15:08:25.572179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09733","last_updated":"2025-03-12T18:26:34Z","snapshot_observed_at":"2026-07-06T20:51:32.396503Z","submitted_at":"2025-03-12T18:26:34Z","title":"I2V3D: Controllable image-to-video generation with 3D guidance","version":1},"cited_work":{"arxiv_id":"2503.09733","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.09733","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"I2v3d: Controllable image-to-video generation with 3d guidance","venue":null,"work_id":"45c49670-e378-442d-bb11-290165190680","year":2025},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"cited_paper":"/paper/2503.09733","citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:86c63945577ad5303eea3525f3737634c5ccf8b25e198f3ad9817177dbecec3b","observation_id":"ba14aaba-fcb0-4aaf-9ec2-7df6539dcc39","resolution":{"observed_at":"2026-05-20T15:08:24.945708Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Realcam-i2v: Real-world image-to-video generation with interactive complex camera control","venue":null,"work_id":"8d4a87a9-e6ba-42f6-914e-bfbe42cff581","year":2025},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:849fcfb4bc2650e06e1b508b7853dcb625a0faaaf1a4f945e36f9cd19fc10453","observation_id":"2863e652-76e9-4999-821f-9f6253e99504","resolution":{"observed_at":"2026-05-20T15:08:25.561052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Extrapolating and decoupling image-to-video generation models: Motion modeling is easier than you think","venue":null,"work_id":"4b8cd449-3ac4-4d58-ab21-eec75a2bd5b3","year":2025},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:aefbefb1377142e9155fbbf4894cd0569939521c2e62aaf282cf1f7ece290602","observation_id":"c7148ad5-71d6-47eb-8d88-81dcf2fdcb97","resolution":{"observed_at":"2026-05-20T15:08:25.549321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05729","last_updated":"2026-05-26T12:06:13Z","snapshot_observed_at":"2026-08-03T11:36:12.571402Z","submitted_at":"2026-01-09T11:15:27Z","title":"TAGRPO: Boosting GRPO on Image-to-Video Generation with Direct Trajectory Alignment","version":2},"cited_work":{"arxiv_id":"2601.05729","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.05729","snapshot_observed_at":"2026-07-03T22:39:01.018902Z","title":"Tagrpo: Boosting grpo on image-to-video generation with direct trajectory alignment","venue":"cs.CV","work_id":"9f6f8f81-2192-4286-b3c7-4b50b3de4d70","year":2026},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"cited_paper":"/paper/2601.05729","citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:bc8f7fce5633735bb9636f2a0624553f70a3c26c0c7a9fd67d1d360f4a26cb62","observation_id":"a8fd0231-a46d-4d01-980f-c96e6e9c270d","resolution":{"observed_at":"2026-05-27T02:05:10.361398Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":"1312.6114","doi":"10.2139/ssrn.4269703","metadata_source":"pith","pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Auto-Encoding Variational Bayes","venue":"stat.ML","work_id":"97d95295-30e1-42b4-bbf6-85f0fa4edb44","year":2013},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:3a27dfeb52fbbc3f6cd57a9e4144893b07d454ef21dc6f121b2fe5340d4ba734","observation_id":"0d7e91d0-8ef4-4653-bb30-84df74251c45","resolution":{"observed_at":"2026-05-20T15:08:24.904452Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02230","last_updated":"2024-10-03T06:36:14Z","snapshot_observed_at":"2026-08-03T13:50:14.837121Z","submitted_at":"2024-06-04T11:48:44Z","title":"I4VGen: Image as Free Stepping Stone for Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":"2406.02230","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.02230","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"I4vgen: Image as free stepping stone for text-to-video generation","venue":null,"work_id":"f6f1f64f-a272-4608-b4bc-160eefdb2507","year":2024},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"cited_paper":"/paper/2406.02230","citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:06a2a88e9ffb348cf8d346054297734e50151232f06520793420c0501f2762f8","observation_id":"193e0cdc-121c-4244-86cc-c45c3e6c1ebd","resolution":{"observed_at":"2026-05-20T15:08:25.059265Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-02T11:56:15.393496Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":"2311.10709","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-07-02T12:36:57.125908Z","title":"Emu video: Factorizing text-to-video generation by explicit image conditioning","venue":null,"work_id":"7d56a470-9715-47bc-bf18-dec97e1c8fc5","year":2023},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:93e6c9463255e7de9f7380066dd10f4aaca91e96fb05592a4aa6af29945c807a","observation_id":"f3495b01-7d04-45d5-9b88-553a08e7dddf","resolution":{"observed_at":"2026-05-20T15:08:24.886841Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rv-gan: Recurrent gan for uncondi- tional video generation","venue":null,"work_id":"e389fe3e-7f9e-4ead-ac6f-fe194a0429bc","year":2022},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:f4c2606e13aef1961cec74dac34bcf117eac6d2b581b0e18f8d96b31a2e8a062","observation_id":"b8b8d41d-065a-4a34-9a07-dda032062504","resolution":{"observed_at":"2026-05-20T15:08:25.602035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Styleinv: A temporal style modulated inversion network for unconditional video generation","venue":null,"work_id":"300a53c3-d8e5-4d87-8617-8c72d82eb7ea","year":2023},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:58d04dc1475cd82fc79fc9688f28c39c09172a62f1d82c6abd3605de139bf8ad","observation_id":"3a0dd6ce-d37e-44d4-8473-6290a1b2cab9","resolution":{"observed_at":"2026-05-20T15:08:25.592075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06202","last_updated":"2024-09-10T04:14:11Z","snapshot_observed_at":"2026-07-06T19:12:57.997252Z","submitted_at":"2024-09-10T04:14:11Z","title":"RealisDance: Equip controllable character animation with realistic hands","version":1},"cited_work":{"arxiv_id":"2409.06202","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.06202","snapshot_observed_at":"2026-07-02T16:27:09.294258Z","title":"Realisdance: Equip controllable character anima- tion with realistic hands.arXiv preprint arXiv:2409.06202","venue":null,"work_id":"ff09ab68-70c3-4100-a15a-fb6e6c04dbc2","year":2024},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"cited_paper":"/paper/2409.06202","citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:61a0a51dde9ba5d479b96812eafd39d8a73353123e4aab467cd8cdcdc884b38f","observation_id":"6f9771aa-e97c-445f-a9d8-ac3d78b021c7","resolution":{"observed_at":"2026-05-20T15:08:24.993741Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Animate anyone: Consistent and controllable image-to-video synthesis for character animation","venue":null,"work_id":"4e2f557c-23b5-4e3b-bf73-208c1c7883ad","year":2024},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:d870f78508e698eb61fea725d7dd78c1e1b216e0a92f62388d0daa177f3801eb","observation_id":"31d8d594-9608-436b-b27c-258c85e8b316","resolution":{"observed_at":"2026-05-20T15:08:25.593878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02509","last_updated":"2024-06-04T17:27:19Z","snapshot_observed_at":"2026-08-04T13:02:12.217544Z","submitted_at":"2024-06-04T17:27:19Z","title":"CamCo: Camera-Controllable 3D-Consistent Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":"2406.02509","doi":"10.48550/arxiv.2406.02509","metadata_source":"pith","pith_arxiv_id":"2406.02509","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"CamCo: Camera-Controllable 3D-Consistent Image-to-Video Generation","venue":"cs.CV","work_id":"ef36842f-bbba-4a74-9df2-ec15c109c1b3","year":2024},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"cited_paper":"/paper/2406.02509","citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:e3d331bc65d2dff8e30c7f3d8ea1edde11f2475a36b75f2ea6f1dbec21a48f6f","observation_id":"921615d0-a7ed-4614-a581-37658dc3e769","resolution":{"observed_at":"2026-05-20T15:08:25.015035Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mofa-video: Controllable image animation via generative motion field adaptions in frozen image-to-video diffusion model","venue":null,"work_id":"f3669925-7b57-41fa-bbfc-d92769cebc11","year":2024},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:f37c811195bd5ac55cc7e8e73e3367e20904e180141f6f06479f379062972373","observation_id":"753366d8-3d0b-485e-b266-37b2cff9b381","resolution":{"observed_at":"2026-05-20T15:08:25.585731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Champ: Controllable and consistent human image animation with 3d parametric guidance","venue":null,"work_id":"ea7571b5-abaf-46df-9b62-fd37ff81d9aa","year":2024},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:f8602a0b3051f0047efcab5f4de349128d8e7106b446fe475b2b5251620dc94d","observation_id":"2a146f3e-34a5-431d-89a5-f7af8da1e221","resolution":{"observed_at":"2026-05-20T15:08:25.587975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.21188","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Human video generation from a single image with 3d pose and view control","venue":null,"work_id":"48b9dc36-0de9-43b9-944b-70a56f774764","year":2026},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:665d0d2eeafac09329292421038ac656fd7232babf99aa1e070daa3bbaf4163b","observation_id":"cac2e851-c6ac-468a-a4fe-7e729446be15","resolution":{"observed_at":"2026-05-20T15:08:24.996575Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pia: Your per- sonalized image animator via plug-and-play modules in text-to-image models","venue":null,"work_id":"da1fd5ef-95a3-44dc-a0ae-4a30ae5a4868","year":2024},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:1905787d8541a06f1e31a4d3e7f8815290b012d8f94427f34de84089896c624a","observation_id":"87de3532-45ad-4ba8-be0a-02b787ab86e8","resolution":{"observed_at":"2026-05-20T15:08:25.589952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Customcrafter: Customized video generation with preserving motion and concept composition abilities","venue":null,"work_id":"573e23b3-2350-44fb-a20f-062800eb7ea6","year":2025},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:5fbc7319db521c42f2ae43197e23681ab6e8018a4eb700b30e3e9dd2533efa12","observation_id":"3ad9652d-2f89-4682-8a22-79022ea3db3e","resolution":{"observed_at":"2026-05-20T15:08:25.583666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"U-net: Convolutional net- works for biomedical image segmentation","venue":null,"work_id":"35186c91-c786-421f-ab0a-39eb56510763","year":2015},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:5555019acab792a989f2d195c00b4f5aa7fc0c78dc271c3546f49421460e95b3","observation_id":"914f5b0a-7577-441f-945c-56e29a4232ea","resolution":{"observed_at":"2026-05-20T15:08:25.599679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-07-11T02:27:48.842637Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:e1c1f82f0337f149287e13af23019c0c35bb7d8e202935dd4d8d79f8b04004e6","observation_id":"8efb43ff-674e-4034-8dc9-8749e1d6bfd7","resolution":{"observed_at":"2026-05-20T15:08:24.836751Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Megactor-sigma: Unlocking flexible mixed-modal control in portrait animation with diffusion transformer","venue":null,"work_id":"40b398c3-cd4b-4439-b761-cbabe204d0a7","year":2025},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:15bcdec8c0a62606878c9f7a46692c900d5a6bb63fe3a851d786fb29bd1ef5d5","observation_id":"aee5d195-de3b-412b-ab50-00ee33455078","resolution":{"observed_at":"2026-05-20T15:08:25.569624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tora: Trajectory-oriented diffusion transformer for video generation","venue":null,"work_id":"78338920-5881-4355-9ac9-dc1b12046f83","year":2025},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:2682e8b73e8d1ba01306ff854454edca2a10ca1b3b94d7c52084c70341736622","observation_id":"33d676b7-41da-4ff0-8520-737134646b04","resolution":{"observed_at":"2026-05-20T15:08:25.576226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-07-06T20:32:48.089559Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"cited_work":{"arxiv_id":"2502.04847","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04847","snapshot_observed_at":"2026-07-02T16:27:09.332551Z","title":"Humandit: Pose-guided diffusion transformer for long- form human motion video generation","venue":null,"work_id":"f79a82ad-b302-40d3-bc68-724b8d3220d9","year":2025},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"cited_paper":"/paper/2502.04847","citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:2009dbf08e85d031da76aec04d28fd24351e2264f81bc15d2ab21f90f921f489","observation_id":"5881a7e2-485c-4bac-a8df-f1ade38fdddb","resolution":{"observed_at":"2026-05-20T15:08:25.067557Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey on video diffusion models","venue":null,"work_id":"35f626ac-83f5-40df-b25f-deeeab261240","year":2024},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:2bfa9f6e954b6b0265722a486926fc1dbe2955720b8baa7bac55219f39337bc5","observation_id":"c1e261c3-3a7b-421e-a903-81b430fcc8f9","resolution":{"observed_at":"2026-05-20T15:08:25.574194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.16081","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T22:56:20.629369Z","title":"Survey of video diffusion models: Foundations, implementations, and applications","venue":null,"work_id":"1ef6c907-32cb-4acb-8837-7fe5c5bd99f9","year":2025},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:be23b059a615febcf3d8eb09a20bbfe7dc124db31f116f6b14b6b706e4fdc946","observation_id":"a1b7d3c8-b19c-40d2-beb2-db4152aff9d0","resolution":{"observed_at":"2026-05-20T15:08:24.907470Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.16869","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:47:05.833119Z","title":"Controllable video generation: A survey.arXiv preprint arXiv:2507.16869","venue":null,"work_id":"a9598a61-86be-4dc1-9b59-62c3641e0113","year":2025},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:061c14a4b42157ef8068e9c8968c61762ae38b6a83fd344206767cd9efa0e557","observation_id":"0051b4b2-b253-4fb3-816a-fe8b3c481697","resolution":{"observed_at":"2026-05-20T15:08:25.091177Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07111","last_updated":"2024-06-26T04:58:39Z","snapshot_observed_at":"2026-07-06T18:43:51.723237Z","submitted_at":"2024-06-26T04:58:39Z","title":"Diffusion Model-Based Video Editing: A Survey","version":1},"cited_work":{"arxiv_id":"2407.07111","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.07111","snapshot_observed_at":"2026-07-04T03:29:29.539815Z","title":"Diffusion model-based video editing: A survey","venue":null,"work_id":"863e4945-5bd6-4521-957f-2ab931bb18df","year":2024},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"cited_paper":"/paper/2407.07111","citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:d637bdea11680d5364b684e3ba8cf708e520077c97709c5343ad87812c329613","observation_id":"252cea71-a2fe-4c2b-96ba-92c193f26b01","resolution":{"observed_at":"2026-05-20T15:08:24.877644Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient diffusion models: A comprehen- sive survey from principles to practices","venue":null,"work_id":"49336bff-03f8-4252-84f5-7cc3bc79cc09","year":2025},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:ce5518a8fe5449c32f356b0372c5bcd9ad3defa83e42288e63de83f57f962af2","observation_id":"709d4a90-7986-46b4-8c7d-236a2f05d178","resolution":{"observed_at":"2026-05-20T15:08:25.699322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.04999","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bridging text and video generation: A survey","venue":null,"work_id":"29c8e950-0c26-4281-bb5b-3ad354e4cc1b","year":2025},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:a2b1a5d8a7fc2fa5283c39b3608a6eef3c5097e5aed3c07205d316532d0c4e12","observation_id":"47dfc75c-8cb1-4943-b7be-0a6dadbc1dbd","resolution":{"observed_at":"2026-05-20T15:08:24.895678Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Human motion video generation: A survey","venue":null,"work_id":"8eec265d-45bf-48a9-92c3-cc5a44cb5e70","year":2025},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:84e956dc3f7cf85329e02a0e1711a814578cdcd99fba743f2d7952ce6f41793a","observation_id":"53442def-81b5-482c-a2af-20333ea2ec21","resolution":{"observed_at":"2026-05-20T15:08:25.742894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffusion models: A comprehensive survey of methods and applications","venue":null,"work_id":"589c9810-8810-4f0a-90a2-83f6d4783339","year":2023},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:750ea6aefd4fbbee947065bd03cd847879206d4d65c12775d921a52fa180c3e5","observation_id":"1ac307b0-5ed1-49e9-a916-54f830d85d60","resolution":{"observed_at":"2026-05-20T15:08:25.607968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Humanvid: demystifying training data for camera-controllable human image animation","venue":null,"work_id":"78a53a30-a5ae-46de-8a0a-0da74d09ccaf","year":2024},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:582c736067b12ab89fa92a93c83d470df1a77af79ad3ce05d7998339b75c81e6","observation_id":"97900c18-38a0-4e88-926e-cfd18c913156","resolution":{"observed_at":"2026-05-20T15:08:25.628151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unianimate: Taming unified video diffusion models for consistent human image animation","venue":null,"work_id":"798585e0-f64e-4c85-b8b0-852bb348ca7b","year":2025},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:9d001efe767b65ead44407599267b13b71c0078bc5e856c691111a5e8378d97d","observation_id":"4276a0ce-03d1-493a-8389-9196f2bd4039","resolution":{"observed_at":"2026-05-20T15:08:25.626243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dimensionx: Create any 3d and 4d scenes from a single image with decoupled video diffusion","venue":null,"work_id":"8c7291e9-fe5a-41ac-8638-ba37858d7b35","year":2025},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:75aac9b09a81a27e6e3b52aecbb5db7ece97a2f71853dd4a73e045f0a6be3d67","observation_id":"f1ae7e2f-9896-4f4f-b897-11cd13479180","resolution":{"observed_at":"2026-05-20T15:08:25.630020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.09255","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T13:19:51.086118Z","title":"Phyrpr: Training-free physics- constrained video generation","venue":null,"work_id":"97d7b45f-54ed-4893-9139-0dae55bc279e","year":2026},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:e764cb7fb1bf62d7b62520132ec7d4c843dd1ce853eed76cc5a3be60f33e20b5","observation_id":"c60ef36a-043e-4396-8ea5-db360eb7b6f1","resolution":{"observed_at":"2026-05-20T15:08:24.847199Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Prompt image to life: Training- free text-driven image-to-video generation","venue":null,"work_id":"7d6c68d8-dbcd-4eee-a30a-d0ce0c8c8b16","year":null},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:8e9f997b1420bfb705923dd879defe1cb350b545934e0561d0978ac61048f7cd","observation_id":"2d89cf5b-0feb-47bf-84e1-6f44294690f5","resolution":{"observed_at":"2026-05-20T15:08:25.567518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09113","last_updated":"2025-06-28T11:58:23Z","snapshot_observed_at":"2026-08-01T16:09:18.068564Z","submitted_at":"2025-06-10T17:56:11Z","title":"Seedance 1.0: Exploring the Boundaries of Video Generation Models","version":2},"cited_work":{"arxiv_id":"2506.09113","doi":"10.48550/arxiv.2506.09113","metadata_source":"pith","pith_arxiv_id":"2506.09113","snapshot_observed_at":"2026-07-11T01:07:45.150925Z","title":"Seedance 1.0: Exploring the Boundaries of Video Generation Models","venue":"cs.CV","work_id":"b2e36b5d-99e4-45b4-9358-64f6d3501983","year":2025},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"cited_paper":"/paper/2506.09113","citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:65f50cbfa2a9211ccf2dfe03deb45bd45977e2e60e203ce61c33440e4ac37630","observation_id":"9d4839fd-97af-445d-ad7f-a84ba8a67f84","resolution":{"observed_at":"2026-05-20T15:08:25.044183Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.24695","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T16:29:57.329294Z","title":"Sana-video: Efficient video generation with block linear diffusion transformer","venue":null,"work_id":"37d92c42-ae43-4ef7-adfa-5faf1c48d1a0","year":2025},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:a94026139678a1d0fc09049b03a44db559583c5a28991db45b4233c6598b8b79","observation_id":"ff07801d-dd27-4c82-bd21-de0febbd925c","resolution":{"observed_at":"2026-05-20T15:08:24.850686Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Frame context packing and drift prevention in next-frame-prediction video diffusion models","venue":null,"work_id":"65afc233-2f77-4c08-a3c6-dad0419607d8","year":2025},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:89da5c5b35e651dad495e40d97673ba89744276ea6e9b6df93b237168effb332","observation_id":"d54cba92-b90b-4233-be10-6d9665ea6936","resolution":{"observed_at":"2026-05-20T15:08:25.565296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06145","last_updated":"2025-02-10T04:20:11Z","snapshot_observed_at":"2026-07-06T20:33:43.357335Z","submitted_at":"2025-02-10T04:20:11Z","title":"Animate Anyone 2: High-Fidelity Character Image Animation with Environment Affordance","version":1},"cited_work":{"arxiv_id":"2502.06145","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06145","snapshot_observed_at":"2026-07-02T20:37:22.289098Z","title":"Animate anyone 2: High-fidelity character image animation with environment affordance","venue":null,"work_id":"227a43eb-7b6b-4148-be31-f115fb53763c","year":2025},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"cited_paper":"/paper/2502.06145","citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:8467854c8572370d80b95685587de58bbca45eda57a3fe8a52bb84159595caaa","observation_id":"87999a67-c371-4800-8290-61e5181416ec","resolution":{"observed_at":"2026-05-20T15:08:24.999689Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Make-a-video: Text-to-video generation without text-video data","venue":null,"work_id":"0c0d6bfd-4370-4433-b58e-e1dcc002bea7","year":2023},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:3c36c3ff7b453243e47db43f8e9145e51700211418973833ac0914db43d55a83","observation_id":"08da3ec7-550d-4401-881e-fee6273673be","resolution":{"observed_at":"2026-05-20T15:08:25.579960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mvportrait: Text-guided motion and emotion control for multi-view vivid portrait animation","venue":null,"work_id":"dc0b0b2f-b007-47f2-9994-29a6123c6b90","year":2025},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:ae495aba43aa4042be864c740806d85628d850d69e4c28476414efab806e441e","observation_id":"c90d52e5-8439-4256-a2d9-cdde285f89b4","resolution":{"observed_at":"2026-05-20T15:08:25.559172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stiv: Scalable text and image conditioned video generation","venue":null,"work_id":"6b4b984a-1056-4151-bafd-24351ea86944","year":2025},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:a47f26e4df5073628fda4f38e19c81004e5921ac312b4340f41a28fe1b560558","observation_id":"c769b77b-3a87-4cdf-99cd-6f8a59045b7a","resolution":{"observed_at":"2026-05-20T15:08:25.563168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Conditional image- to-video generation with latent flow diffusion models","venue":null,"work_id":"29225b52-fa0c-40c1-a73b-8fd6701be64d","year":2023},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:9fe79c2477b80ec7507e21ebc3f6e2f9edb59645d0891388764c9b6f5f23c2f5","observation_id":"b59f4670-e35c-47cb-8176-e870111440fa","resolution":{"observed_at":"2026-05-20T15:08:25.557179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20280","last_updated":"2024-10-26T21:12:32Z","snapshot_observed_at":"2026-07-06T19:40:12.973874Z","submitted_at":"2024-10-26T21:12:32Z","title":"MarDini: Masked Autoregressive Diffusion for Video Generation at Scale","version":1},"cited_work":{"arxiv_id":"2410.20280","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.20280","snapshot_observed_at":"2026-07-01T19:16:00.498245Z","title":"Mardini: Masked autoregressive diffusion for video generation at scale","venue":null,"work_id":"c55eb05e-1cd3-4b08-8542-48c1765a085c","year":2024},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"cited_paper":"/paper/2410.20280","citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:0ed68bc5b9bebb2197361ced3f4d384db3fc6ff70f7440d98d1774faa2f5e3da","observation_id":"b30dd2ac-47dc-404d-af0f-14835633f96d","resolution":{"observed_at":"2026-05-20T15:08:25.020789Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00103","last_updated":"2024-12-30T19:00:25Z","snapshot_observed_at":"2026-07-06T20:14:54.297131Z","submitted_at":"2024-12-30T19:00:25Z","title":"LTX-Video: Realtime Video Latent Diffusion","version":1},"cited_work":{"arxiv_id":"2501.00103","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.00103","snapshot_observed_at":"2026-07-09T07:56:04.699528Z","title":"LTX-Video: Realtime Video Latent Diffusion","venue":"cs.CV","work_id":"cee5c521-3ce9-466e-a035-1e42f89254f4","year":2024},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"cited_paper":"/paper/2501.00103","citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:eacb03d2e5f47877f77fe8e7d267620a56a94e36305471bc2e3c84ad389d2b6f","observation_id":"aa75d62e-dd6e-42ea-84ce-5021711de27b","resolution":{"observed_at":"2026-05-20T15:08:24.939443Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14325","last_updated":"2025-03-18T14:58:59Z","snapshot_observed_at":"2026-07-06T20:54:45.985432Z","submitted_at":"2025-03-18T14:58:59Z","title":"LeanVAE: An Ultra-Efficient Reconstruction VAE for Video Diffusion Models","version":1},"cited_work":{"arxiv_id":"2503.14325","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.14325","snapshot_observed_at":"2026-07-03T06:37:42.226326Z","title":"Leanvae: An ultra-efficient reconstruction vae for video diffusion models","venue":null,"work_id":"e96679a5-2941-42fb-9aa7-a7ac8fc29588","year":2025},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"cited_paper":"/paper/2503.14325","citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:197e67c20f4e87fbe6eb58dd26057bd4d50e35011777d6934fafe11c39da3946","observation_id":"bd2ae0c6-21ff-4ae1-8707-21584d30fc06","resolution":{"observed_at":"2026-05-20T15:08:24.898728Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Motion-i2v: Consistent and controllable image-to-video generation with explicit 14 motion modeling","venue":null,"work_id":"48115a17-261d-4ed0-b9af-d8dd5ca8d72f","year":2024},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:e37a86d584278207f6353b3ada467b205ab3dfa15836c887e1825e8657deeca1","observation_id":"42fc4fb1-57d1-4d35-ad35-28bc910e1473","resolution":{"observed_at":"2026-05-20T15:08:25.735909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dynamicrafter: Animating open-domain images with video diffusion priors","venue":null,"work_id":"3072bb37-d8c9-48c1-a510-ac40da2616c6","year":2024},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:9ef9ce0454cdbcb09269ecb9086bc91b1d6cbeb4f11aef8b7713a1fa57a3dba1","observation_id":"77388e56-31c6-4c5e-bf48-3bd726630156","resolution":{"observed_at":"2026-05-20T15:08:25.551277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reducio! generating 1k video within 16 seconds using extremely compressed motion latents","venue":null,"work_id":"0fcd91fc-cde4-4764-884b-403f8b50a760","year":2025},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:d88985873f8bd13a1e3b7ac01e3158d463ba1afc83e2a319c6217b1e1cf59871","observation_id":"713a324d-588e-4ba3-867f-14646e07b39a","resolution":{"observed_at":"2026-05-20T15:08:25.553174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":"2503.20314","doi":"10.1109/19.492748","metadata_source":"pith","pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":"cs.CV","work_id":"ad3ebc3b-4224-46c9-b61d-bcf135da0a7c","year":2025},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:96eb1039c1fd4ed188af1f6f835489c47ad05a6997f5ac427123d375aa5c7031","observation_id":"8b9bb746-04b7-413a-b73f-c0d44a52ca97","resolution":{"observed_at":"2026-05-20T15:08:25.050301Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Emo: Emote portrait alive generating expressive portrait videos with audio2video diffusion model under weak conditions","venue":null,"work_id":"7de80cc2-5589-41d1-b9de-a326ecc61e14","year":2024},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:05e8a650006722da177dc88f6eaaa5d6f14e60f322c4dee202f5e2e9734913a0","observation_id":"952a6411-6e02-4801-9322-f79a5b6cf059","resolution":{"observed_at":"2026-05-20T15:08:25.547417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03099","last_updated":"2025-06-03T17:29:28Z","snapshot_observed_at":"2026-07-06T21:35:56.582332Z","submitted_at":"2025-06-03T17:29:28Z","title":"TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models","version":1},"cited_work":{"arxiv_id":"2506.03099","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03099","snapshot_observed_at":"2026-07-04T16:49:57.653031Z","title":"Talkingmachines: Real-time audio-driven facetime-style video via autoregressive diffusion models","venue":null,"work_id":"0b5d3c51-5773-40e2-a037-6d6cc663e566","year":2025},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"cited_paper":"/paper/2506.03099","citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:c6861c07d46bbc67b3c715739a9cbe01202fd82b0b7dddcfc151af5633d4fd1c","observation_id":"236a9de2-7f14-49b4-af42-24272acc0e49","resolution":{"observed_at":"2026-05-20T15:08:25.053134Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04145","last_updated":"2023-11-07T17:16:06Z","snapshot_observed_at":"2026-08-02T12:25:34.488259Z","submitted_at":"2023-11-07T17:16:06Z","title":"I2VGen-XL: High-Quality Image-to-Video Synthesis via Cascaded Diffusion Models","version":1},"cited_work":{"arxiv_id":"2311.04145","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.04145","snapshot_observed_at":"2026-07-04T14:59:56.012796Z","title":"I2VGen-XL: High-Quality Image-to-Video Synthesis via Cascaded Diffusion Models","venue":"cs.CV","work_id":"aa5d5317-9965-4f23-ba7e-8e2941e66385","year":2023},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"cited_paper":"/paper/2311.04145","citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:33d9daf3f25b785141985dfb2a711e4ad2e3e076ee093dce2071b522eec8ae90","observation_id":"eb16766a-0513-4135-a20b-e9772afed197","resolution":{"observed_at":"2026-05-20T15:08:24.859885Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Trip: Temporal residual learning with image noise prior for image-to-video diffusion models","venue":null,"work_id":"2ac09a44-ac60-4c5d-b8ef-d1fbafbdf993","year":2024},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:609b059ac1cb916723799d6facbb52e5c7481ad27f3cb3e17b3a5f9d5dfc093a","observation_id":"4e0f72f5-7537-430e-9e14-ceaa964ba3c2","resolution":{"observed_at":"2026-05-20T15:08:25.555060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01800","last_updated":"2024-03-05T08:19:51Z","snapshot_observed_at":"2026-07-06T17:38:59.580242Z","submitted_at":"2024-03-04T07:41:50Z","title":"AtomoVideo: High Fidelity Image-to-Video Generation","version":2},"cited_work":{"arxiv_id":"2403.01800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.01800","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Atomovideo: High fidelity image-to-video generation","venue":null,"work_id":"528dfb7a-4803-4383-97db-b90cc474e3f6","year":2024},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"cited_paper":"/paper/2403.01800","citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:2bca4c3cd08bb6606cc62a087bcbf2d5094fb499e39031d15794dc9c30322d0a","observation_id":"27c79576-e43c-47a0-a828-d624a12e2aaa","resolution":{"observed_at":"2026-05-20T15:08:25.041355Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ti2v-zero: Zero-shot image conditioning for text-to-video diffusion models","venue":null,"work_id":"33cd54c3-537c-492d-820b-53ccb90548b4","year":2024},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:1e75f6aa9826e353fb35ab38d8af45b583e95987c6d94905f1318f834e239778","observation_id":"25ccfc7f-3670-4f41-ba59-7101143c5c8d","resolution":{"observed_at":"2026-05-20T15:08:25.578154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04324","last_updated":"2024-07-01T03:57:55Z","snapshot_observed_at":"2026-08-04T02:26:31.748049Z","submitted_at":"2024-02-06T19:08:18Z","title":"ConsistI2V: Enhancing Visual Consistency for Image-to-Video Generation","version":2},"cited_work":{"arxiv_id":"2402.04324","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04324","snapshot_observed_at":"2026-07-02T12:26:56.718648Z","title":"ConsistI2V: Enhancing Vi- sual Consistency for Image-to-Video Generation","venue":null,"work_id":"19dbbe7f-675b-4f8d-a42e-59fde7969cf5","year":2024},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"cited_paper":"/paper/2402.04324","citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:eb971f56e75d5b620e48233c5723b2e402ac567da1a514eaae5c49f040804d4b","observation_id":"b925b51b-5b2a-43ff-90fa-978e17d156c0","resolution":{"observed_at":"2026-05-20T15:08:24.892899Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19512","last_updated":"2023-10-30T13:12:40Z","snapshot_observed_at":"2026-07-06T16:40:28.142296Z","submitted_at":"2023-10-30T13:12:40Z","title":"VideoCrafter1: Open Diffusion Models for High-Quality Video Generation","version":1},"cited_work":{"arxiv_id":"2310.19512","doi":"10.48550/arxiv.2310.19512","metadata_source":"pith","pith_arxiv_id":"2310.19512","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"VideoCrafter1: Open Diffusion Models for High-Quality Video Generation","venue":"cs.CV","work_id":"4d4486c5-6317-4d8d-bb5b-3b100d732a83","year":2023},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"cited_paper":"/paper/2310.19512","citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:d80b8bce93e3af15b8b1dec2d990f6ed0ec41e5689ac809802afad3f47a6922d","observation_id":"72c27364-3008-4e8f-873d-13a92854dac0","resolution":{"observed_at":"2026-05-20T15:08:24.927120Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T07:00:49.103783Z","title":"Videocrafter2: Overcoming data limitations for high-quality video diffusion models","venue":null,"work_id":"1613ff09-f9a2-46d0-b802-321deb74c28e","year":2024},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:c84f7460fcff641e02251cbb085c21dc0a4fd835692315706373f7832a3c877f","observation_id":"0152ffb5-5d5d-4d88-98ed-75ffe5e63772","resolution":{"observed_at":"2026-05-20T15:08:25.545559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20404","last_updated":"2024-12-29T08:52:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-29T08:52:49Z","title":"Open-Sora: Democratizing Efficient Video Production for All","version":1},"cited_work":{"arxiv_id":"2412.20404","doi":"10.48550/arxiv.2412.20404","metadata_source":"pith","pith_arxiv_id":"2412.20404","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Open-Sora: Democratizing Efficient Video Production for All","venue":"cs.CV","work_id":"8b29ba7b-3d84-4281-85b7-9eaf905afd7f","year":2024},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"cited_paper":"/paper/2412.20404","citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:ae0dc0de564b2d4fec064759e1f5bad4017f8e65cfc9822e5b9c22799408eda2","observation_id":"d65c2ceb-7f6b-47d5-9629-fd529f0fc90d","resolution":{"observed_at":"2026-05-20T15:08:24.864731Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00131","last_updated":"2024-11-28T14:07:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-28T14:07:45Z","title":"Open-Sora Plan: Open-Source Large Video Generation Model","version":1},"cited_work":{"arxiv_id":"2412.00131","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.00131","snapshot_observed_at":"2026-07-08T14:44:59.776032Z","title":"Open-Sora Plan: Open-Source Large Video Generation Model","venue":"cs.CV","work_id":"51c0ab25-66f7-4d1a-a028-86b9b1b9e313","year":2024},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"cited_paper":"/paper/2412.00131","citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:ddb64eff16f95d7adb4acc575d1c5be082c4f44c36170832bc8aad52ca29cdbd","observation_id":"46a88673-7abf-4a28-97a7-f456d19489c6","resolution":{"observed_at":"2026-05-20T15:08:24.883653Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CogVideoX: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":"75be396a-7db1-484e-a10d-afd21d14d2a4","year":2025},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:807a9500362a9fa9025246f20489cf745e090911c85c97703a509ab43b9b89a5","observation_id":"7d177fc6-e2c0-42ba-8fb0-964812bed541","resolution":{"observed_at":"2026-05-20T15:08:25.541906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-07-11T01:07:45.135143Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:82eedcaf8aff3228a993f0dd595ecac6980a91516849ab54a573b26bd2218250","observation_id":"86065fa7-ad9c-4285-8ca3-8819491d0f8d","resolution":{"observed_at":"2026-05-20T15:08:24.880796Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mimicmotion: High-quality human motion video generation with confidence-aware pose guidance","venue":null,"work_id":"59de970b-784f-4ffd-b34a-c6444b943fc5","year":2025},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:67c1aa108be50cb0593a636c4b82ba77b5b73b7b965318017c3b91dce203e0ff","observation_id":"0bf08bae-bc58-4366-a9e9-8e3e7f178da6","resolution":{"observed_at":"2026-05-20T15:08:25.543705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Box- imator: Generating rich and controllable motions for video synthesis","venue":null,"work_id":"3b51c229-866f-4690-b8e6-4587a5a3d175","year":2024},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:7abe95d20d45f1a48affaeeb0bae2d39d01af430df3cb78401221f7771770c37","observation_id":"6cc6ed3a-fb32-4cb0-a98f-0008c91ca2fb","resolution":{"observed_at":"2026-05-20T15:08:25.540073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14167","last_updated":"2025-05-20T10:18:29Z","snapshot_observed_at":"2026-08-01T16:00:15.841549Z","submitted_at":"2025-05-20T10:18:29Z","title":"LMP: Leveraging Motion Prior in Zero-Shot Video Generation with Diffusion Transformer","version":1},"cited_work":{"arxiv_id":"2505.14167","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14167","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lmp: Leveraging motion prior in zero-shot video generation with diffusion transformer","venue":null,"work_id":"b4611860-8632-4667-bcb9-c27c9cd575a7","year":2025},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"cited_paper":"/paper/2505.14167","citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:d1243be8944ee7267b89eb43d9c890a6e465068355585e72818d460bb3736bc5","observation_id":"e4fa095e-c650-46ac-90d1-81aff07b1039","resolution":{"observed_at":"2026-05-20T15:08:24.889954Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Movideo: Motion-aware video generation with diffusion model","venue":null,"work_id":"b72be090-69e2-44af-99b6-25d657314295","year":2024},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:b26b5fc65b96fdb9c5a04964b1b821aab9d56d602d769a23f149ea802499f22f","observation_id":"3bbe9811-308a-4866-a77e-fdd21288866f","resolution":{"observed_at":"2026-05-20T15:08:25.603867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Loopy: Taming audio-driven portrait avatar with long-term motion depen- dency","venue":null,"work_id":"67826ce9-710a-4431-a842-277fdbae3b04","year":2025},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:479624b90e461e9e098d6c15659959adf8ec675377f7ca7dfc2f0e18b27937cc","observation_id":"82688681-0220-45a1-b5bc-22b3d483fa7a","resolution":{"observed_at":"2026-05-20T15:08:25.538247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":"2406.08801","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-07-01T22:06:16.996788Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","venue":null,"work_id":"c9aa1ca0-1c1b-4f82-99c8-f3bfda2b1e83","year":2024},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:0ddea2e37c82e5f7565d5b14d29771b92e2129d6a06f528bc44dd2778a526e54","observation_id":"08535c7e-7e6c-4f05-835b-ab2fd1ed2a52","resolution":{"observed_at":"2026-05-20T15:08:24.871201Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07718","last_updated":"2024-10-14T13:35:17Z","snapshot_observed_at":"2026-07-06T19:31:00.754487Z","submitted_at":"2024-10-10T08:34:41Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation","version":2},"cited_work":{"arxiv_id":"2410.07718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.07718","snapshot_observed_at":"2026-07-01T21:46:15.594455Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation","venue":null,"work_id":"a36f46e1-e536-4499-b2bc-ed760196c9cf","year":2024},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"cited_paper":"/paper/2410.07718","citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:db087653ff35d03cf1919e744a0726719da608eccf43b923a8c54fd6e50c0a88","observation_id":"ae3e1715-0ae4-4eb5-ae40-1be6464048d9","resolution":{"observed_at":"2026-05-20T15:08:24.973274Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sonic: Shifting focus to global audio perception in portrait animation","venue":null,"work_id":"2be061db-6fd0-4d92-87cc-6316df5ddbc4","year":2025},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:08b225a536cab7d43383e406b3130ba5d5a5044de921466180c6d19b5b033362","observation_id":"5e455c45-d879-4260-b307-8cf59296b479","resolution":{"observed_at":"2026-05-20T15:08:25.534284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Echomimic: Lifelike audio-driven portrait animations through editable landmark conditions","venue":null,"work_id":"0ad6dbef-83f7-4824-ae33-cf0dc2390a08","year":2025},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:b2d85e7f00f0461b26f385b44b2f7235c3eddcc0af70d46e37c4e4a0b20d3305","observation_id":"70c6e5a4-c7bf-442c-af7c-274447ea89e6","resolution":{"observed_at":"2026-05-20T15:08:25.536232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-07-06T17:51:02.529047Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":"2403.17694","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-07-02T02:16:26.575398Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","venue":null,"work_id":"d41ca9c8-5720-452c-86ce-b4d81eaf7dee","year":2024},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:f738937ed5bc2de3f58736f735f733123df64a12848e599d04f842d4a1e037cd","observation_id":"3c1edea4-37c8-4276-bb89-6a154abf2069","resolution":{"observed_at":"2026-05-20T15:08:24.949010Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-07-06T22:11:19.157797Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"cited_work":{"arxiv_id":"2508.08248","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.08248","snapshot_observed_at":"2026-07-04T10:09:44.567147Z","title":"Stableavatar: Infinite-length audio-driven avatar video generation","venue":null,"work_id":"3574a448-3f7b-4866-9df3-518765342707","year":2025},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"cited_paper":"/paper/2508.08248","citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:549fb5a1ff522ec18d24f9216928ca8c7cf1c32e6b4750c5c42f0d9d89f6c5b7","observation_id":"0a3db86e-b4d9-4a68-af6a-e10d66743f1b","resolution":{"observed_at":"2026-05-20T15:08:24.856783Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18866","last_updated":"2025-06-23T17:33:03Z","snapshot_observed_at":"2026-07-06T21:46:30.250293Z","submitted_at":"2025-06-23T17:33:03Z","title":"OmniAvatar: Efficient Audio-Driven Avatar Video Generation with Adaptive Body Animation","version":1},"cited_work":{"arxiv_id":"2506.18866","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18866","snapshot_observed_at":"2026-07-05T12:41:04.353072Z","title":"Jianzhu Guo, Dingyun Zhang, Xiaoqiang Liu, Zhizhou Zhong, Yuan Zhang, Pengfei Wan, and Di Zhang","venue":"cs.CV","work_id":"39a3b79f-ec88-448d-a078-0ca1e7f561bc","year":2025},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"cited_paper":"/paper/2506.18866","citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:ec0a4002e43a312445f314c091bafb125f3687983e71002350bae0c3673a7eda","observation_id":"bb53b63d-a6e4-40f9-b4d8-54e4e80c6fdc","resolution":{"observed_at":"2026-05-20T15:08:24.840385Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cyberhost: A one-stage diffusion framework for audio-driven talking body generation","venue":null,"work_id":"2766857a-c606-45df-8fa8-bcd07f91dc5c","year":2025},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:546502ba71fb358e96250d2344dbb470ea3e905c1819ef33e5d9bdc28890adb5","observation_id":"ac319c22-00b7-4c7e-9cf8-a61afc71f167","resolution":{"observed_at":"2026-05-20T15:08:25.581775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-07-06T20:22:50.018799Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"cited_work":{"arxiv_id":"2501.10687","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.10687","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Emo2: End- effector guided audio-driven avatar video generation","venue":null,"work_id":"c9b225cf-5ef0-453a-ba3a-7bc87ee83697","year":2025},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"cited_paper":"/paper/2501.10687","citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:a89e021cfd5722afd59bb661c5ee7bfffbea1ab8772377f521312b493d8896d4","observation_id":"2935ab38-1ffd-44af-a3e3-0a45cc479da8","resolution":{"observed_at":"2026-05-20T15:08:24.976159Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-07-06T21:30:46.863005Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"cited_work":{"arxiv_id":"2505.20156","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.20156","snapshot_observed_at":"2026-07-05T12:41:04.394160Z","title":"Hunyuanvideo-avatar: High-fidelity audio-driven human animation for multiple characters","venue":"cs.CV","work_id":"cb746e54-5ed4-4c60-903c-02e347b9ddf0","year":2025},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"cited_paper":"/paper/2505.20156","citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:1726b9b8d4987afe9e5755b9e5a4c676188bca5213e9285c8e4db82102d1370d","observation_id":"6993e1d7-5a78-4019-a386-b96d18e52023","resolution":{"observed_at":"2026-05-20T15:08:25.087991Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15957","last_updated":"2024-12-04T12:54:44Z","snapshot_observed_at":"2026-07-06T19:37:03.013065Z","submitted_at":"2024-10-21T12:36:27Z","title":"CamI2V: Camera-Controlled Image-to-Video Diffusion Model","version":3},"cited_work":{"arxiv_id":"2410.15957","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.15957","snapshot_observed_at":"2026-07-08T13:14:53.143564Z","title":"Cami2v: Camera-controlled image-to-video diffusion model","venue":"cs.CV","work_id":"dfc5b040-8e44-47be-8714-65cc5b5f8400","year":2024},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"cited_paper":"/paper/2410.15957","citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:73d0662073f5699c604ac8c7ef79173c55e4deeb8d91227581b7b3ea423c1243","observation_id":"ace46b62-6745-40c0-abfa-13ec39c0e658","resolution":{"observed_at":"2026-05-20T15:08:24.844018Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.09697","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T21:06:14.281763Z","title":"Efficient camera-controlled video generation of static scenes via sparse diffusion and 3d rendering","venue":null,"work_id":"5496c51c-fab7-4a7e-bc72-17fbd4554552","year":2026},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:396b5b35bc9fac2d2e3a7ed9989bb534259ac61b71acb8aeb1c93771308cb987","observation_id":"09e8c998-c82e-473d-940e-c50a6a539b44","resolution":{"observed_at":"2026-05-20T15:08:25.084980Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Omnihuman-1: Rethinking the scaling-up of one-stage conditioned human animation models","venue":null,"work_id":"3387fc84-9ffe-4772-bf65-80c97ff01bf9","year":2025},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:c8052fdd91c73f7d11956e3cc0bb36b9ee50b51442627ddd08506765f9dd8779","observation_id":"43ab7df5-0d97-429d-a557-753ea580146e","resolution":{"observed_at":"2026-05-20T15:08:25.739350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01827","last_updated":"2024-01-03T16:43:47Z","snapshot_observed_at":"2026-07-06T17:11:17.528395Z","submitted_at":"2024-01-03T16:43:47Z","title":"Moonshot: Towards Controllable Video Generation and Editing with Multimodal Conditions","version":1},"cited_work":{"arxiv_id":"2401.01827","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.01827","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"We’ll Fix it in Post: Improving Text-to-Video Generation with Zero Training 21 ArXivabs/2401.01827(2024),https://api.semanticscholar.org/CorpusID: 266741873","venue":null,"work_id":"5ac20a09-7636-4f22-ae7c-645b985eaf33","year":2024},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"cited_paper":"/paper/2401.01827","citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:b82af0476448efd88794a4e6ba11095718dcf2c0b53f8eb169dfceca24c219b4","observation_id":"bedef5e9-ea40-47e0-b6ea-13d164060923","resolution":{"observed_at":"2026-05-20T15:08:25.079111Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Physgen: Rigid-body physics- grounded image-to-video generation","venue":null,"work_id":"3bb2e11b-5b2c-4f8f-b219-c86693bf8f94","year":2024},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:6a430c002d4ba474d66b9ae94d73b93b740fed6d449ce6671b99f09aa13845dc","observation_id":"32930e22-c51b-4a93-bc8d-f2d3ded64088","resolution":{"observed_at":"2026-05-20T15:08:25.744579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07598","last_updated":"2025-03-11T06:44:25Z","snapshot_observed_at":"2026-07-06T20:50:05.070886Z","submitted_at":"2025-03-10T17:57:04Z","title":"VACE: All-in-One Video Creation and Editing","version":2},"cited_work":{"arxiv_id":"2503.07598","doi":"10.48550/arxiv.2503.07598","metadata_source":"pith","pith_arxiv_id":"2503.07598","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"VACE: All-in-One Video Creation and Editing","venue":"cs.CV","work_id":"c68efbde-3431-4655-a337-87e2871ad6a3","year":2025},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"cited_paper":"/paper/2503.07598","citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:64b77931d3a295282c17e748b0f677890d7b17bcf2c207c7a803c9286e4505c6","observation_id":"8ae14d54-3bf4-47db-a4cf-d6fa3bff7847","resolution":{"observed_at":"2026-05-20T15:08:24.853888Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:14.2036+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:14.2036+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":"cd27e011-0ed0-47b0-8a38-382689113885","year":2023},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:28e7a47b326c0df8ee9aae874db2f8df2dea21ec0ce1444f1292c8ec3f9f81e8","observation_id":"3072df78-89af-4e22-9db2-3d534492851b","resolution":{"observed_at":"2026-05-20T15:08:25.732005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"eebf4273-2cfb-4145-a559-edb24a11d26b","year":2022},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:237ec6c680b418dba8c178e4b6daeebb244d03379175bb66feaa19303423c4ed","observation_id":"cca5894e-0512-47b0-b770-44e5e7f80b15","resolution":{"observed_at":"2026-05-20T15:08:25.737628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attention is all you need","venue":null,"work_id":"b1bbf6b2-bdc7-44c8-bc0f-458dfed20d93","year":2017},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:f452f7c67d34620ed16adda384c9501d41cd8d1f3c7b8bc6516ae0597b419579","observation_id":"fff0aeaf-d652-4557-871b-af0fda830e77","resolution":{"observed_at":"2026-05-20T15:08:25.728450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval","venue":null,"work_id":"504c32df-0d9a-4ca4-b440-757480a52738","year":2021},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:020a22d22d8945e6874141c9861b991cfbd4fe9bbaa1c003721bba122a8185bf","observation_id":"3e795b0f-8a52-481a-bf3d-b2d75be41f3d","resolution":{"observed_at":"2026-05-20T15:08:25.726678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advancing high-resolution video-language representation with large-scale video transcriptions","venue":null,"work_id":"0c8648ed-0293-4ca0-b4a5-4ff75a4fb4d3","year":2022},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:0b3b98af8da27e54150f529ec3e5dcdd82e60e40c282ce95ba388219dede6d93","observation_id":"daa326e9-d757-4586-a8d7-2d2ceb0df7dd","resolution":{"observed_at":"2026-05-20T15:08:25.730247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Panda- 70m: Captioning 70m videos with multiple cross-modality teachers","venue":null,"work_id":"85f27890-b428-4f09-9dc8-78aa3ec19e98","year":2024},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:cba96bb0600642d3a2b3412841c6f0a90c362d4c10008667fcc190be415a1d50","observation_id":"7f1dbc1e-ab94-4e00-a371-652e61343673","resolution":{"observed_at":"2026-05-20T15:08:25.733884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Magicanimate: Temporally consistent human image animation using diffusion model","venue":null,"work_id":"b3af5a5a-76c1-49f2-b6d1-f77d4e9cadd6","year":2024},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:aa5c5bb44962b1327c9acf28d6ff7c92b93d7c54f474c41dd904e09bf1360671","observation_id":"920a0b01-eaf5-4d3e-8f98-09ee574490ef","resolution":{"observed_at":"2026-05-20T15:08:25.746347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":"130f2b87-2b22-4a2a-a163-c208ee33c081","year":2022},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:1bfebfae1838e4661cf2aaa6704b380f62f9c0831477a0f0ba2ad75ebd1b6f8a","observation_id":"6d53814f-8387-422a-a285-c58f3ffdc237","resolution":{"observed_at":"2026-05-20T15:08:25.722679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Laion coco: 600m synthetic captions from laion2b-en","venue":null,"work_id":"1fc30646-9ffe-4be7-8f1c-15feefb28340","year":2022},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:13a3d09b4ae808d1ca34768bc666198324b7200d79e8f44d484e3747d893c390","observation_id":"e786b949-1868-41bf-850e-f709df767b6c","resolution":{"observed_at":"2026-05-20T15:08:25.724521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Journeydb: A benchmark for generative image understanding","venue":null,"work_id":"31791e0c-8ebb-4c64-8fd1-dade6587a260","year":2023},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:1b9f1bc114638de79f4da6c7bffe592fd7730fb74f6fd916ffa2c2b27d1b59e2","observation_id":"911eacd2-6850-477d-b84d-fb21be659649","resolution":{"observed_at":"2026-05-20T15:08:25.720877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Make pixels dance: High-dynamic video generation","venue":null,"work_id":"bc46cbe2-ddc3-479c-94ff-ac0ddf71286d","year":2024},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:ce2b5a8a04ceee2c005ea8a13f5adc4a7068b25128bb9acbea24264bc7d61e1f","observation_id":"27f8bfe7-0efe-4bc4-8efa-fee60dcb5816","resolution":{"observed_at":"2026-05-20T15:08:25.718948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02371","last_updated":"2025-02-13T10:13:24Z","snapshot_observed_at":"2026-08-02T14:57:48.676109Z","submitted_at":"2024-07-02T15:40:29Z","title":"OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation","version":3},"cited_work":{"arxiv_id":"2407.02371","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.02371","snapshot_observed_at":"2026-07-05T16:41:18.954519Z","title":"OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation","venue":"cs.CV","work_id":"00dd95a8-d503-4a41-9603-785dcf4a0b8e","year":2024},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"cited_paper":"/paper/2407.02371","citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:6401456a5910d0c93ddc14d5de2369ca961c68aa48e496a68be5856079513242","observation_id":"a9e7a628-5e75-4739-a9e1-224028a44cee","resolution":{"observed_at":"2026-05-20T15:08:24.867893Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":0,"verified_exact":42,"verified_fuzzy":56},"total_outbound_references":190},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 100 of 190 outbound references and 0 inbound Pith citation observations for arXiv:2605.17248."}