{"as_of":"2026-08-16T07:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:952bfd8d9d77e23d1b5abc1444af650cab6dec087fd9215a017edb23360d9e6c","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":58,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:57:28.806572Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T12:36:57.125908Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-13T05:22:58.925946Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":"2311.10709","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-07-02T12:36:57.125908Z","title":"Emu video: Factorizing text-to-video generation by explicit image conditioning","venue":null,"work_id":"7d56a470-9715-47bc-bf18-dec97e1c8fc5","year":2023},"citing_paper":{"arxiv_id":"2402.17177","last_updated":"2024-04-17T18:41:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-27T03:30:58Z","title":"Sora: A Review on Background, Technology, Limitations, and Opportunities of Large Vision Models","version":3},"reference_index":196,"source":"pdf_text","source_observed_at":"2026-05-13T13:43:11.024069Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2402.17177"},"observation_digest":"sha256:53cf2a56b03b936691f2ab76360e50290f32de70619cd5c9e438137408665145","observation_id":"ee8b18b6-b8ba-42f6-bc35-867b0c0204fc","resolution":{"observed_at":"2026-05-13T13:43:11.281861Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-13T05:22:58.925946Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":"2311.10709","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-07-02T12:36:57.125908Z","title":"Emu video: Factorizing text-to-video generation by explicit image conditioning","venue":null,"work_id":"7d56a470-9715-47bc-bf18-dec97e1c8fc5","year":2023},"citing_paper":{"arxiv_id":"2404.12377","last_updated":"2024-04-18T17:58:03Z","snapshot_observed_at":"2026-08-12T22:44:50.325579Z","submitted_at":"2024-04-18T17:58:03Z","title":"RoboDreamer: Learning Compositional World Models for Robot Imagination","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-05-15T20:47:30.225116Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2404.12377"},"observation_digest":"sha256:9405109a18b3bbd12c4a2a69ecdac6543a625fa5c0f177115657342e71432234","observation_id":"3cb89a74-e556-407c-ab97-f64cabe95f79","resolution":{"observed_at":"2026-05-15T20:47:30.309561Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-13T05:22:58.925946Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":"2311.10709","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-07-02T12:36:57.125908Z","title":"Emu video: Factorizing text-to-video generation by explicit image conditioning","venue":null,"work_id":"7d56a470-9715-47bc-bf18-dec97e1c8fc5","year":2023},"citing_paper":{"arxiv_id":"2405.10314","last_updated":"2024-05-16T17:59:05Z","snapshot_observed_at":"2026-08-15T07:34:03.035482Z","submitted_at":"2024-05-16T17:59:05Z","title":"CAT3D: Create Anything in 3D with Multi-View Diffusion Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-19T21:29:51.062396Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2405.10314"},"observation_digest":"sha256:b18f37fdb96fed7c3d2fa8e066c0ab711343818b2e21b1d57c50eb7601f71a38","observation_id":"cb5caf97-71c3-4f11-abcf-dfb6933fb220","resolution":{"observed_at":"2026-05-19T21:29:51.149871Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-13T05:22:58.925946Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":"2311.10709","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-07-02T12:36:57.125908Z","title":"Emu video: Factorizing text-to-video generation by explicit image conditioning","venue":null,"work_id":"7d56a470-9715-47bc-bf18-dec97e1c8fc5","year":2023},"citing_paper":{"arxiv_id":"2408.14837","last_updated":"2025-04-24T03:03:57Z","snapshot_observed_at":"2026-08-14T07:06:06.462400Z","submitted_at":"2024-08-27T07:46:07Z","title":"Diffusion Models Are Real-Time Game Engines","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-05-16T12:04:44.162343Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2408.14837"},"observation_digest":"sha256:e01b772f5d99165d8616691c65888fc9119d21a5c56b824904c9f2454157b511","observation_id":"3dae8dae-6b11-4043-a03c-219153506474","resolution":{"observed_at":"2026-05-16T12:04:44.249890Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-13T05:22:58.925946Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":"2311.10709","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-07-02T12:36:57.125908Z","title":"Emu video: Factorizing text-to-video generation by explicit image conditioning","venue":null,"work_id":"7d56a470-9715-47bc-bf18-dec97e1c8fc5","year":2023},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-08-15T00:36:59.684390Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:a49b2a331cbced4c628fec98c19d741e765604c6e92d01f35fc9f4dc6ae9c14d","observation_id":"12b802e2-f91b-4393-b4ce-c66e0fd20f86","resolution":{"observed_at":"2026-05-15T12:17:01.365911Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-13T05:22:58.925946Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-08-12T16:22:43.898673Z","title":"Emu video: Fac- torizing text-to-video generation by explicit image conditioning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13503","last_updated":"2024-11-20T17:54:41Z","snapshot_observed_at":"2026-08-12T19:44:40.357419Z","submitted_at":"2024-11-20T17:54:41Z","title":"VBench++: Comprehensive and Versatile Benchmark Suite for Video Generative Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:43.898673Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2411.13503"},"observation_digest":"sha256:1b151e9fbb39e5e492b0fef24d49d0fa63690253efdcfbd00db8356fff523b10","observation_id":"c66e20ca-dc1f-4a25-88e9-b04316bbde4c","resolution":{"observed_at":"2026-08-12T16:22:43.898673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-13T05:22:58.925946Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":"2311.10709","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-07-02T12:36:57.125908Z","title":"Emu video: Factorizing text-to-video generation by explicit image conditioning","venue":null,"work_id":"7d56a470-9715-47bc-bf18-dec97e1c8fc5","year":2023},"citing_paper":{"arxiv_id":"2411.13549","last_updated":"2026-05-06T19:17:31Z","snapshot_observed_at":"2026-08-15T01:49:34.697725Z","submitted_at":"2024-11-20T18:58:31Z","title":"KFC-W: Generating 3D-Consistent Videos from Unposed Internet Photos","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-23T16:47:09.717923Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2411.13549"},"observation_digest":"sha256:e055c43cb3fce0433c85299e6ed0b821097c562d024a9aa47f18441e5fa07325","observation_id":"0eb5f3c8-f23e-4dfe-b862-5d4e6a6e63e7","resolution":{"observed_at":"2026-05-23T16:48:12.448381Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-13T05:22:58.925946Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-08-12T12:56:32.823672Z","title":"Emu video: Factoriz- ing text-to-video generation by explicit image conditioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16683","last_updated":"2025-03-24T16:08:09Z","snapshot_observed_at":"2026-08-13T06:45:26.027668Z","submitted_at":"2024-11-25T18:59:57Z","title":"Generative Omnimatte: Learning to Decompose Video into Layers","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T12:56:32.823672Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2411.16683"},"observation_digest":"sha256:356e722afe95f467dc8aba170b9ef10012a4992c64bcc474df0d43fe45f068d4","observation_id":"e5049670-8073-4e81-a47b-7d23aaf1a366","resolution":{"observed_at":"2026-08-12T12:56:32.823672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-13T05:22:58.925946Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-08-12T14:23:52.756008Z","title":"Girdhar, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16725","last_updated":"2025-08-02T02:01:09Z","snapshot_observed_at":"2026-08-12T17:12:51.907014Z","submitted_at":"2024-11-23T03:54:22Z","title":"$\\textit{Revelio}$: Interpreting and leveraging semantic information in diffusion models","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T14:23:52.756008Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2411.16725"},"observation_digest":"sha256:14831f4b7ca550341bdef12d804457f1497be21de3861a2d8c92382a34f46af5","observation_id":"754f10b5-a258-4902-ad67-7b47db1fafff","resolution":{"observed_at":"2026-08-12T14:23:52.756008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-13T05:22:58.925946Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-08-12T12:58:57.137762Z","title":"Emu video: Factoriz- ing text-to-video generation by explicit image conditioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-16T00:08:43.707460Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.137762Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:3d979182170aa3e559d96b1553e08c2d506c991e3feaae9577e43031af4d1744","observation_id":"f0625430-8b40-479d-b21c-e00cb918bcaa","resolution":{"observed_at":"2026-08-12T12:58:57.137762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-13T05:22:58.925946Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-08-12T12:00:01.084536Z","title":"Emu video: Factoriz- ing text-to-video generation by explicit image conditioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17698","last_updated":"2025-03-17T17:44:37Z","snapshot_observed_at":"2026-08-16T07:29:11.626505Z","submitted_at":"2024-11-26T18:59:58Z","title":"Video-Guided Foley Sound Generation with Multimodal Controls","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T12:00:01.084536Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2411.17698"},"observation_digest":"sha256:31e5430704f68d99ead5f7805373d2d643f81caac0980f448485579c7e96c578","observation_id":"e8d0ba44-3b67-4b21-a455-a9981a39633c","resolution":{"observed_at":"2026-08-12T12:00:01.084536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-13T05:22:58.925946Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-08-12T12:36:49.208146Z","title":"Emu video: Factoriz- ing text-to-video generation by explicit image conditioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17765","last_updated":"2025-07-30T10:27:47Z","snapshot_observed_at":"2026-08-13T20:21:47.311352Z","submitted_at":"2024-11-26T04:21:22Z","title":"I2VControl: Disentangled and Unified Video Motion Synthesis Control","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T12:36:49.208146Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2411.17765"},"observation_digest":"sha256:394ee138a8da5aeec4b31b99e6ecbb1f3f4bef7a257e56f789490cbb93813131","observation_id":"e2956df3-1384-4350-818a-87ae39263b43","resolution":{"observed_at":"2026-08-12T12:36:49.208146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-13T05:22:58.925946Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-08-12T11:44:39.856443Z","title":"Emu video: Factoriz- ing text-to-video generation by explicit image conditioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17949","last_updated":"2024-11-27T00:10:27Z","snapshot_observed_at":"2026-08-12T17:12:54.075325Z","submitted_at":"2024-11-27T00:10:27Z","title":"ROICtrl: Boosting Instance Control for Visual Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T11:44:39.856443Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2411.17949"},"observation_digest":"sha256:b3f95454f0655afd506fff1e44ebe3ba0c198192631e543a33c9c7d6ae5bc89e","observation_id":"fcd1968c-67b0-4456-bd70-fd12bf6b028d","resolution":{"observed_at":"2026-08-12T11:44:39.856443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-13T05:22:58.925946Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-08-12T10:09:30.551819Z","title":"Emu video: Factoriz- ing text-to-video generation by explicit image conditioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19548","last_updated":"2024-11-29T08:47:46Z","snapshot_observed_at":"2026-08-15T17:12:37.171263Z","submitted_at":"2024-11-29T08:47:46Z","title":"ReconDreamer: Crafting World Models for Driving Scene Reconstruction via Online Restoration","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T10:09:30.551819Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2411.19548"},"observation_digest":"sha256:3735c4375f19d0e0811b4a569486a39e4892b3c5e8bb7dda87dc0cf4fb8118b8","observation_id":"0936cd5f-c0a4-4279-b6ab-c5135c9b3780","resolution":{"observed_at":"2026-08-12T10:09:30.551819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-13T05:22:58.925946Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-08-12T04:31:13.377340Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01343","last_updated":"2024-12-02T10:07:59Z","snapshot_observed_at":"2026-08-14T08:54:56.324272Z","submitted_at":"2024-12-02T10:07:59Z","title":"MoTrans: Customized Motion Transfer with Text-driven Video Diffusion Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T04:31:13.377340Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2412.01343"},"observation_digest":"sha256:bcf8c22bdea875e486fea5273a4e9b8f6e8312e0c2e5a078e226a7ce5875ecac","observation_id":"15fc769f-c302-4013-a2d4-a16049c5069e","resolution":{"observed_at":"2026-08-12T04:31:13.377340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-13T05:22:58.925946Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-08-12T00:59:22.373007Z","title":"Emu video: Factoriz- ing text-to-video generation by explicit image conditioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01821","last_updated":"2024-12-02T18:58:23Z","snapshot_observed_at":"2026-08-14T17:37:06.716611Z","submitted_at":"2024-12-02T18:58:23Z","title":"World-consistent Video Diffusion with Explicit 3D Modeling","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:22.373007Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2412.01821"},"observation_digest":"sha256:52f9806dbab5fc8b23221b7a51acaa26bc948a35a6035e34a3492db84626d865","observation_id":"9b9ddeb9-6603-4097-b682-afc21f3c449a","resolution":{"observed_at":"2026-08-12T00:59:22.373007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-13T05:22:58.925946Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-08-12T00:04:08.767955Z","title":"Emu video: Factoriz- ing text-to-video generation by explicit image conditioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-14T02:39:08.853226Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.767955Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:7115fa65828b17c3e8d35293ae2c7842894acbe5eefe7b7532389973ac6d0fad","observation_id":"71c850b4-401d-4bf5-9ee1-348ffdf0f099","resolution":{"observed_at":"2026-08-12T00:04:08.767955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-13T05:22:58.925946Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-08-11T23:15:09.578329Z","title":"Emu video: Factoriz- ing text-to-video generation by explicit image conditioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02700","last_updated":"2025-03-27T21:38:09Z","snapshot_observed_at":"2026-08-15T08:14:12.017325Z","submitted_at":"2024-12-03T18:59:56Z","title":"Motion Prompting: Controlling Video Generation with Motion Trajectories","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T23:15:09.578329Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2412.02700"},"observation_digest":"sha256:42d9d04653f5b592190fdec1d569f968321b40d4bc5a6229ad01d9d6c2b67da7","observation_id":"1886df4d-cb7a-4ed0-b01e-aea208aaa508","resolution":{"observed_at":"2026-08-11T23:15:09.578329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-13T05:22:58.925946Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-08-11T22:18:09.768273Z","title":"Emu video: Factoriz- ing text-to-video generation by explicit image conditioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03572","last_updated":"2025-04-11T19:20:22Z","snapshot_observed_at":"2026-08-14T05:03:21.311347Z","submitted_at":"2024-12-04T18:59:45Z","title":"Navigation World Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T22:18:09.768273Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2412.03572"},"observation_digest":"sha256:c91252668adefa9498441d386ca595aa70c758040e254bd1151f1f41703c035b","observation_id":"026324f5-ada2-4885-bae7-ef28f7f22124","resolution":{"observed_at":"2026-08-11T22:18:09.768273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-13T05:22:58.925946Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":"2311.10709","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-07-02T12:36:57.125908Z","title":"Emu video: Factorizing text-to-video generation by explicit image conditioning","venue":null,"work_id":"7d56a470-9715-47bc-bf18-dec97e1c8fc5","year":2023},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-13T14:41:45.809481Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:ca2aaedc7494f756ba49b6b875093d3cb6625d7ed886cebc710da6f1b02f7263","observation_id":"681ba316-c6ff-45ab-9fc8-5b1b6a570203","resolution":{"observed_at":"2026-05-23T07:42:43.581649Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-13T05:22:58.925946Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-08-11T21:30:03.687129Z","title":"Emu video: Factoriz- ing text-to-video generation by explicit image conditioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-15T22:25:04.518918Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.687129Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:af0cf2b0f85c08154792cf10954f3e659cee843e4e0df1fc46ab22a4f59a9690","observation_id":"ec7def8e-cb2a-45f5-80aa-6db2cea31c5e","resolution":{"observed_at":"2026-08-11T21:30:03.687129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-13T05:22:58.925946Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-08-11T18:36:18.856072Z","title":"Emu video: Factorizing text-to-video generation by explicit image conditioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07760","last_updated":"2024-12-10T18:55:17Z","snapshot_observed_at":"2026-08-15T07:13:18.216373Z","submitted_at":"2024-12-10T18:55:17Z","title":"SynCamMaster: Synchronizing Multi-Camera Video Generation from Diverse Viewpoints","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T18:36:18.856072Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2412.07760"},"observation_digest":"sha256:be077cee7a3fbda327da32a0bf8754378c9dd97b6dcdd872ee6d17642c13a5c4","observation_id":"30e2ec5f-24e8-411b-aac1-02ccbc6817ed","resolution":{"observed_at":"2026-08-11T18:36:18.856072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-13T05:22:58.925946Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-08-11T17:26:29.097766Z","title":"Girdhar, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09043","last_updated":"2024-12-12T08:10:31Z","snapshot_observed_at":"2026-08-13T19:15:46.872006Z","submitted_at":"2024-12-12T08:10:31Z","title":"DrivingRecon: Large 4D Gaussian Reconstruction Model For Autonomous Driving","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T17:26:29.097766Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2412.09043"},"observation_digest":"sha256:856588a169d2c6eaaa133469a1321f638006b252c50b747a904a3da8eaf2b7b5","observation_id":"25442122-0eaa-4598-bfad-f4a1aed5da86","resolution":{"observed_at":"2026-08-11T17:26:29.097766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-13T05:22:58.925946Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-08-11T16:43:08.238185Z","title":"EMU Video: Factoriz- ing text-to-video generation by explicit image conditioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-15T01:14:53.670017Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.238185Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:a8c561be23518f92ad7a523f1e9adcd4f808e7859a7a87253e1437a0175ce622","observation_id":"e1c7108d-86e9-429d-a487-cdda0b005945","resolution":{"observed_at":"2026-08-11T16:43:08.238185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-13T05:22:58.925946Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-08-11T15:40:19.814698Z","title":"Emu video: Factorizing text-to-video generation by explicit image conditioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-15T23:32:38.858163Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.814698Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:2e1038e7c0b2c58e9446071cf14d5ef505740c01158d3955e625c537fa7a4578","observation_id":"9c3d6d94-b945-458c-b211-343982de1c5e","resolution":{"observed_at":"2026-08-11T15:40:19.814698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-13T05:22:58.925946Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-08-11T15:16:34.031763Z","title":"Emu video: Factoriz- ing text-to-video generation by explicit image conditioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11198","last_updated":"2024-12-15T14:21:19Z","snapshot_observed_at":"2026-08-13T09:34:29.011572Z","submitted_at":"2024-12-15T14:21:19Z","title":"GEM: A Generalizable Ego-Vision Multimodal World Model for Fine-Grained Ego-Motion, Object Dynamics, and Scene Composition Control","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T15:16:34.031763Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2412.11198"},"observation_digest":"sha256:0f1dc07419e99f0624e73cc9d5ba14b041ab569f0c39ae52bffe7fd897b8304f","observation_id":"ed0f69db-665f-483b-b7db-d425581e2d33","resolution":{"observed_at":"2026-08-11T15:16:34.031763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-13T05:22:58.925946Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-08-11T13:23:35.238481Z","title":"Emu video: Factoriz- ing text-to-video generation by explicit image conditioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13190","last_updated":"2025-01-07T22:06:07Z","snapshot_observed_at":"2026-08-13T07:00:55.921010Z","submitted_at":"2024-12-17T18:59:33Z","title":"MotionBridge: Dynamic Video Inbetweening with Flexible Controls","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T13:23:35.238481Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2412.13190"},"observation_digest":"sha256:850600de42b77f25fdab8c61f484ae4414638824fea41af03b57b1ed6239a7ec","observation_id":"48ecadf3-075f-4935-9102-38e3f58ebf4e","resolution":{"observed_at":"2026-08-11T13:23:35.238481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-13T05:22:58.925946Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-08-11T11:38:24.477461Z","title":"Emu video: Factoriz- ing text-to-video generation by explicit image conditioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-14T01:58:04.323386Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.477461Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:1122f4f3285a2f8a7a4091e60c84098b01b4129b3e734c11c241db54bfdaa125","observation_id":"d08671be-7965-4847-96e7-52a5dd099746","resolution":{"observed_at":"2026-08-11T11:38:24.477461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-13T05:22:58.925946Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-08-11T00:10:16.462262Z","title":"Emu video: Factoriz- ing text-to-video generation by explicit image conditioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19645","last_updated":"2024-12-30T02:50:45Z","snapshot_observed_at":"2026-08-14T12:25:58.793163Z","submitted_at":"2024-12-27T13:49:25Z","title":"VideoMaker: Zero-shot Customized Video Generation with the Inherent Force of Video Diffusion Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T00:10:16.462262Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2412.19645"},"observation_digest":"sha256:e85bb97a9e694cf227923f84770833cee60fbfdbf8cf4856cdcb7673d2bbf365","observation_id":"b742eb0c-580f-4f5b-b34d-c306fa973399","resolution":{"observed_at":"2026-08-11T00:10:16.462262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-13T05:22:58.925946Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-08-10T22:25:25.605678Z","title":"Emu video: Factorizing text-to-video generation by explicit image conditioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01790","last_updated":"2025-03-18T10:47:27Z","snapshot_observed_at":"2026-08-13T05:44:11.203234Z","submitted_at":"2025-01-03T12:45:22Z","title":"Ingredients: Blending Custom Photos with Video Diffusion Transformers","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:25.605678Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2501.01790"},"observation_digest":"sha256:9c3fd07777a8fc0c56ba88c1314e2d4fd2872b6ac2126edd04759ecdd71e4595","observation_id":"bcb5023a-3e47-4494-b766-3ca7526411e2","resolution":{"observed_at":"2026-08-10T22:25:25.605678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-13T05:22:58.925946Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-08-10T22:01:56.958288Z","title":"Emu video: Factoriz- ing text-to-video generation by explicit image conditioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-14T07:01:40.730073Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:56.958288Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:e5e0be58309c97bff1245a162a5ad15349df60df6905f40f794bf36295dc5f13","observation_id":"f1465803-95ba-4758-900e-5490b1021b54","resolution":{"observed_at":"2026-08-10T22:01:56.958288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-13T05:22:58.925946Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-08-10T18:53:00.095026Z","title":"Emu video: Factorizing text-to-video generation by explicit image conditioning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10928","last_updated":"2025-04-19T14:52:08Z","snapshot_observed_at":"2026-08-10T18:47:01.186615Z","submitted_at":"2025-01-19T03:19:47Z","title":"Generative Physical AI in Vision: A Survey","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T18:53:00.095026Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2501.10928"},"observation_digest":"sha256:d6755adc58353707733e9d6049e7ef192ae4d22cc5ab13589748d04e4da46841","observation_id":"0fb7dced-ad04-48dd-8b2a-487eaa9b2b66","resolution":{"observed_at":"2026-08-10T18:53:00.095026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-13T05:22:58.925946Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-08-09T22:56:36.059679Z","title":"S., Shah, A., Yin, X., Parikh, D., and Misra, I","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.059679Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:3023572d71f20ab45a3c10d684be0ce759dfc9a3005bc358db810377ad370a0f","observation_id":"1c0bdc77-daf9-4d5d-a6c7-979593719cff","resolution":{"observed_at":"2026-08-09T22:56:36.059679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-13T05:22:58.925946Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-08-08T21:07:32.265159Z","title":"S., Shah, A., Yin, X., Parikh, D., and Misra, I","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-15T10:28:42.385124Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.265159Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:3ee67f3fb3c0425ccae6833a92899b790fe94a99e35aa9746aaaa189bde7a145","observation_id":"e7d2e53e-9376-4a61-a257-5282fcc8e6c7","resolution":{"observed_at":"2026-08-08T21:07:32.265159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-13T05:22:58.925946Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-08-08T11:51:13.196287Z","title":"org/CorpusID:258762178","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07737","last_updated":"2025-02-12T14:50:50Z","snapshot_observed_at":"2026-08-14T05:04:22.144350Z","submitted_at":"2025-02-11T17:57:53Z","title":"Next Block Prediction: Video Generation via Semi-Autoregressive Modeling","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T11:51:13.196287Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2502.07737"},"observation_digest":"sha256:717afe286eacf6b23d8bb28cc5904e2ae9912041155959284903533d6d15d68e","observation_id":"73e4a5ff-ba75-45d7-9cc4-40c385a0e376","resolution":{"observed_at":"2026-08-08T11:51:13.196287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-13T05:22:58.925946Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-08-09T11:21:20.449710Z","title":"Emu video: Factoriz- ing text-to-video generation by explicit image conditioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07802","last_updated":"2025-02-04T22:03:26Z","snapshot_observed_at":"2026-08-09T14:38:43.851921Z","submitted_at":"2025-02-04T22:03:26Z","title":"Movie Weaver: Tuning-Free Multi-Concept Video Personalization with Anchored Prompts","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-09T11:21:20.449710Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2502.07802"},"observation_digest":"sha256:7f863c1c2ef9652af9b806854f2e3541f2b3d8e2f497a1c65fa54edbeda41bda","observation_id":"9411a428-63b1-4420-979f-a9456d8543e8","resolution":{"observed_at":"2026-08-09T11:21:20.449710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-13T05:22:58.925946Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-08-07T19:40:21.199001Z","title":"Emu video: Factoriz- ing text-to-video generation by explicit image conditioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-15T17:40:50.646997Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.199001Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:f15ea82f05995dc19645606ac17b3766dfbf67bd15b2408aab55c0e7fb4aabbd","observation_id":"9622a6ce-725c-4a86-812f-9090e3a01a44","resolution":{"observed_at":"2026-08-07T19:40:21.199001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-13T05:22:58.925946Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":"2311.10709","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-07-02T12:36:57.125908Z","title":"Emu video: Factorizing text-to-video generation by explicit image conditioning","venue":null,"work_id":"7d56a470-9715-47bc-bf18-dec97e1c8fc5","year":2023},"citing_paper":{"arxiv_id":"2503.00200","last_updated":"2025-04-24T20:02:43Z","snapshot_observed_at":"2026-08-14T06:14:38.487820Z","submitted_at":"2025-02-28T21:38:17Z","title":"Unified Video Action Model","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-13T17:50:29.675358Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2503.00200"},"observation_digest":"sha256:56559e96261d76e7c611e0a7cfe5d28bd1b3c06db67ad65c5f82eae9be5f0bba","observation_id":"ae12a699-9f90-485d-98fc-2c21d24d3013","resolution":{"observed_at":"2026-05-13T17:50:29.739035Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-13T05:22:58.925946Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":"2311.10709","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-07-02T12:36:57.125908Z","title":"Emu video: Factorizing text-to-video generation by explicit image conditioning","venue":null,"work_id":"7d56a470-9715-47bc-bf18-dec97e1c8fc5","year":2023},"citing_paper":{"arxiv_id":"2503.06310","last_updated":"2026-05-19T15:23:11Z","snapshot_observed_at":"2026-08-09T02:58:00.845337Z","submitted_at":"2025-03-08T19:04:36Z","title":"Scene-Action Prompt Fusion for Coherent Text-to-Video Storytelling","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-23T00:07:39.286486Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2503.06310"},"observation_digest":"sha256:7548b7ba185c55ea5a0be7dc1b5ce75a4d91fa2cf96ba0d9a30af68dec154686","observation_id":"2e1445b9-2383-4218-86fc-de697303dfc7","resolution":{"observed_at":"2026-05-23T00:12:17.853066Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-13T05:22:58.925946Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-08-16T00:57:28.806572Z","title":"Emu video: Factorizing text-to-video gen- eration by explicit image conditioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02417","last_updated":"2025-05-08T08:30:12Z","snapshot_observed_at":"2026-08-16T00:49:19.326831Z","submitted_at":"2025-05-05T07:22:54Z","title":"T2S: High-resolution Time Series Generation with Text-to-Series Diffusion Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T00:57:28.806572Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2505.02417"},"observation_digest":"sha256:3972e03d19f9fcbfc7d76f8490e87d8354ce49addaff022ba2fb773d8743a43e","observation_id":"19c71e63-3ee7-4435-aa98-11c0b565e9ce","resolution":{"observed_at":"2026-08-16T00:57:28.806572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-13T05:22:58.925946Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":"2311.10709","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-07-02T12:36:57.125908Z","title":"Emu video: Factorizing text-to-video generation by explicit image conditioning","venue":null,"work_id":"7d56a470-9715-47bc-bf18-dec97e1c8fc5","year":2023},"citing_paper":{"arxiv_id":"2505.16819","last_updated":"2026-05-19T15:22:52Z","snapshot_observed_at":"2026-08-01T07:12:14.758494Z","submitted_at":"2025-05-22T15:54:42Z","title":"Character-Centered Dialogue Generation from Scene-Level Prompts","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-22T13:31:43.083678Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2505.16819"},"observation_digest":"sha256:5de86e4c29e320ae8f8732bb8685c2e5c02787abad6a7be8a3aff41e1b4367ec","observation_id":"e049380e-28a3-4eb2-b774-cb6c72371dfd","resolution":{"observed_at":"2026-05-22T13:34:53.714162Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-13T05:22:58.925946Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-08-07T13:28:10.219773Z","title":"Girdhar, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21876","last_updated":"2026-05-28T08:11:37Z","snapshot_observed_at":"2026-08-14T12:12:34.816304Z","submitted_at":"2025-05-28T01:45:26Z","title":"EPiC: Efficient Video Camera Control Learning with Precise Anchor-Video Guidance","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:10.219773Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2505.21876"},"observation_digest":"sha256:5437f811c834e660e9cf0d9b51cb5355754019ef09854d8fec8782ead6f83b73","observation_id":"e17a50bd-73a3-493e-989c-9ce2743ee4c2","resolution":{"observed_at":"2026-08-07T13:28:10.219773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-13T05:22:58.925946Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-08-07T11:31:49.473885Z","title":"Emu video: Factoriz- ing text-to-video generation by explicit image conditioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02327","last_updated":"2025-06-02T23:50:40Z","snapshot_observed_at":"2026-08-13T05:41:29.683076Z","submitted_at":"2025-06-02T23:50:40Z","title":"Medical World Model: Generative Simulation of Tumor Evolution for Treatment Planning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:31:49.473885Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2506.02327"},"observation_digest":"sha256:edfb4349d46eb6fc8848221b1c4fa6f344bdbd84244f329ea3c2a73c1424c4cf","observation_id":"70454a36-adb2-49a2-80ba-a43db546785d","resolution":{"observed_at":"2026-08-07T11:31:49.473885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-13T05:22:58.925946Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-08-07T04:29:56.147229Z","title":"Emu video: Factoriz- ing text-to-video generation by explicit image conditioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10507","last_updated":"2025-06-30T07:13:23Z","snapshot_observed_at":"2026-08-09T14:38:23.123656Z","submitted_at":"2025-06-12T09:09:28Z","title":"Edit360: 2D Image Edits to 3D Assets from Any Angle","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:56.147229Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2506.10507"},"observation_digest":"sha256:78decaa4a4fd2f2c4656dfd939ae1bc6571f0cfab486a067e7b7224963cceb48","observation_id":"6f2b9577-c8c0-446a-9ca7-5e76c575eab1","resolution":{"observed_at":"2026-08-07T04:29:56.147229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-13T05:22:58.925946Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-08-06T22:57:41.606777Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20134","last_updated":"2025-06-25T05:05:09Z","snapshot_observed_at":"2026-08-14T01:40:04.812398Z","submitted_at":"2025-06-25T05:05:09Z","title":"From 2D to 3D Cognition: A Brief Survey of General World Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T22:57:41.606777Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2506.20134"},"observation_digest":"sha256:c0f4496a850507614a9567bfdebc2e29c2d6eeed233cb11f67140150577f014f","observation_id":"761b04be-0f23-4ca1-be7d-3d9049da1c52","resolution":{"observed_at":"2026-08-06T22:57:41.606777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-13T05:22:58.925946Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-08-06T22:41:38.554878Z","title":"Emu video: Factoriz- ing text-to-video generation by explicit image conditioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20946","last_updated":"2025-06-26T02:25:16Z","snapshot_observed_at":"2026-08-13T15:55:25.676487Z","submitted_at":"2025-06-26T02:25:16Z","title":"Consistent Zero-shot 3D Texture Synthesis Using Geometry-aware Diffusion and Temporal Video Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:38.554878Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2506.20946"},"observation_digest":"sha256:2c373286a44d177ebeac3509189199e88808cf80ba12b02b2dcaf43b99eb4306","observation_id":"520d1e4f-28c8-4986-9d4f-61ed11c87aea","resolution":{"observed_at":"2026-08-06T22:41:38.554878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-13T05:22:58.925946Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-08-06T19:25:28.048695Z","title":"Emu video: Factoriz- ing text-to-video generation by explicit image conditioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05678","last_updated":"2025-07-08T05:00:17Z","snapshot_observed_at":"2026-08-06T19:17:57.988428Z","submitted_at":"2025-07-08T05:00:17Z","title":"LiON-LoRA: Rethinking LoRA Fusion to Unify Controllable Spatial and Temporal Generation for Video Diffusion","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:28.048695Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2507.05678"},"observation_digest":"sha256:d1bb763fde52167e0a56113498b34827262da9692782495a28b93bc3e768994f","observation_id":"3f5dd659-901c-45e7-aeb2-0eab12855c8c","resolution":{"observed_at":"2026-08-06T19:25:28.048695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-13T05:22:58.925946Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-08-05T17:45:16.195972Z","title":"Emu video: Factorizing text-to-video generation by explicit image conditioning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-13T06:51:53.063809Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:16.195972Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2508.15761"},"observation_digest":"sha256:fc47aa57975c2d634a41d6ac8c6a303141120c55d92497e13e3fd76f0381c990","observation_id":"aca4e05c-c417-4e7a-8288-279394392d66","resolution":{"observed_at":"2026-08-05T17:45:16.195972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-13T05:22:58.925946Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":"2311.10709","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-07-02T12:36:57.125908Z","title":"Emu video: Factorizing text-to-video generation by explicit image conditioning","venue":null,"work_id":"7d56a470-9715-47bc-bf18-dec97e1c8fc5","year":2023},"citing_paper":{"arxiv_id":"2509.24702","last_updated":"2026-04-06T10:12:03Z","snapshot_observed_at":"2026-08-02T11:34:44.120596Z","submitted_at":"2025-09-29T12:32:54Z","title":"Enhancing Physical Plausibility in Video Generation by Reasoning the Implausibility","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-18T12:55:42.679016Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2509.24702"},"observation_digest":"sha256:cb4c211fce862b0b4196cd9efb885acb5878a95518dd504dd362cef9b8c087c1","observation_id":"fb7500c6-0093-41dd-9a46-b97ba90ea362","resolution":{"observed_at":"2026-05-18T12:56:24.364040Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-13T05:22:58.925946Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":"2311.10709","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-07-02T12:36:57.125908Z","title":"Emu video: Factorizing text-to-video generation by explicit image conditioning","venue":null,"work_id":"7d56a470-9715-47bc-bf18-dec97e1c8fc5","year":2023},"citing_paper":{"arxiv_id":"2602.07775","last_updated":"2026-05-03T01:49:14Z","snapshot_observed_at":"2026-08-15T00:49:04.808892Z","submitted_at":"2026-02-08T02:16:02Z","title":"Rolling Sink: Bridging Limited-Horizon Training and Open-Ended Testing in Autoregressive Video Diffusion","version":6},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-16T07:02:38.876518Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2602.07775"},"observation_digest":"sha256:4d39b1bc3cba20ba80ff46f4c8346dbc98f5fdd6b2aeb7d91d4f3c28f9c6ae83","observation_id":"397bf284-b29c-40b2-9a61-7039541f728b","resolution":{"observed_at":"2026-05-16T07:07:29.800902Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-13T05:22:58.925946Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":"2311.10709","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-07-02T12:36:57.125908Z","title":"Emu video: Factorizing text-to-video generation by explicit image conditioning","venue":null,"work_id":"7d56a470-9715-47bc-bf18-dec97e1c8fc5","year":2023},"citing_paper":{"arxiv_id":"2604.06339","last_updated":"2026-04-07T18:17:05Z","snapshot_observed_at":"2026-08-16T06:51:21.904839Z","submitted_at":"2026-04-07T18:17:05Z","title":"Evolution of Video Generative Foundations","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-10T18:41:38.616611Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2604.06339"},"observation_digest":"sha256:a2372cbc8de362893e4a2fd8107f51f42d3722f7cf8779ebbd6216b3eb31675b","observation_id":"b44a179a-fd78-4e80-866a-b537cbe73adc","resolution":{"observed_at":"2026-05-11T00:05:51.865212Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-13T05:22:58.925946Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":"2311.10709","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-07-02T12:36:57.125908Z","title":"Emu video: Factorizing text-to-video generation by explicit image conditioning","venue":null,"work_id":"7d56a470-9715-47bc-bf18-dec97e1c8fc5","year":2023},"citing_paper":{"arxiv_id":"2604.19741","last_updated":"2026-06-03T18:09:47Z","snapshot_observed_at":"2026-08-12T19:41:37.821685Z","submitted_at":"2026-04-21T17:59:03Z","title":"CityRAG: Stepping Into a City via Spatially-Grounded Video Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:54.935053Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2604.19741"},"observation_digest":"sha256:4ce35db640d172f54e54639e3b75fe3e504ad057596229da2b47cf060352d490","observation_id":"8aae5da8-096e-45ae-86a1-e987c5ee7132","resolution":{"observed_at":"2026-05-11T13:11:24.307510Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-13T05:22:58.925946Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":"2311.10709","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-07-02T12:36:57.125908Z","title":"Emu video: Factorizing text-to-video generation by explicit image conditioning","venue":null,"work_id":"7d56a470-9715-47bc-bf18-dec97e1c8fc5","year":2023},"citing_paper":{"arxiv_id":"2605.06512","last_updated":"2026-05-07T16:22:21Z","snapshot_observed_at":"2026-08-15T16:32:41.066580Z","submitted_at":"2026-05-07T16:22:21Z","title":"DCR: Counterfactual Attractor Guidance for Rare Compositional Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T13:06:56.964670Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2605.06512"},"observation_digest":"sha256:f5a0e31e5e033d71c94f980a5a2ad6a1e2157c9b65944ef39ff4bf1325be6e82","observation_id":"d2706235-b757-457b-8195-09d8ec60f07d","resolution":{"observed_at":"2026-05-11T19:01:09.626148Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-13T05:22:58.925946Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":"2311.10709","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-07-02T12:36:57.125908Z","title":"Emu video: Factorizing text-to-video generation by explicit image conditioning","venue":null,"work_id":"7d56a470-9715-47bc-bf18-dec97e1c8fc5","year":2023},"citing_paper":{"arxiv_id":"2605.14487","last_updated":"2026-05-14T07:27:39Z","snapshot_observed_at":"2026-08-11T04:01:43.208982Z","submitted_at":"2026-05-14T07:27:39Z","title":"Head Forcing: Long Autoregressive Video Generation via Head Heterogeneity","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T02:31:48.593354Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2605.14487"},"observation_digest":"sha256:3ac7f1ceef11e0c35fdde4b3e365e80a8155ba2384d0e7bb3c237ca98c65aa15","observation_id":"eb7a8750-1c8c-42cb-8804-28603fa479e0","resolution":{"observed_at":"2026-05-15T02:33:32.158143Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-13T05:22:58.925946Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":"2311.10709","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-07-02T12:36:57.125908Z","title":"Emu video: Factorizing text-to-video generation by explicit image conditioning","venue":null,"work_id":"7d56a470-9715-47bc-bf18-dec97e1c8fc5","year":2023},"citing_paper":{"arxiv_id":"2605.17019","last_updated":"2026-05-16T14:45:32Z","snapshot_observed_at":"2026-08-15T01:10:33.213882Z","submitted_at":"2026-05-16T14:45:32Z","title":"StreamingEffect: Real-Time Human-Centric Video Effect Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-19T20:11:47.359922Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2605.17019"},"observation_digest":"sha256:5c1847f6672cfdcb98a0b5333cee2eee5d883754a01527b421cdbee807bcd742","observation_id":"150be9d5-dcc2-4da5-ab76-cf4c28c30415","resolution":{"observed_at":"2026-05-19T20:12:44.842188Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-13T05:22:58.925946Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":"2311.10709","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-07-02T12:36:57.125908Z","title":"Emu video: Factorizing text-to-video generation by explicit image conditioning","venue":null,"work_id":"7d56a470-9715-47bc-bf18-dec97e1c8fc5","year":2023},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-16T00:14:17.051626Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:bd6c7c9c6b6e1e37cbb04ce85f88eb868c2ed45c77f7254e63a02fa38645469f","observation_id":"f3495b01-7d04-45d5-9b88-553a08e7dddf","resolution":{"observed_at":"2026-05-20T15:08:24.886841Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-13T05:22:58.925946Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":"2311.10709","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-07-02T12:36:57.125908Z","title":"Emu video: Factorizing text-to-video generation by explicit image conditioning","venue":null,"work_id":"7d56a470-9715-47bc-bf18-dec97e1c8fc5","year":2023},"citing_paper":{"arxiv_id":"2606.06361","last_updated":"2026-06-17T07:38:02Z","snapshot_observed_at":"2026-08-03T04:40:21.011532Z","submitted_at":"2026-06-04T16:30:39Z","title":"Physics in 2-Steps: Locking Motion Priors Before Visual Refinement Erases Them","version":2},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-06-28T01:58:00.336605Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2606.06361"},"observation_digest":"sha256:5a3b5e3cc0fbfc912da2d79dcccb0c355790079098a8479498b0168a9f7c8f09","observation_id":"c51df560-1140-455f-b80a-4d35e944fb67","resolution":{"observed_at":"2026-07-02T12:36:57.127543Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-13T05:22:58.925946Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-07-30T23:29:03.450404Z","title":"arXiv preprint arXiv:2311.10709 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26706","last_updated":"2026-07-29T09:52:20Z","snapshot_observed_at":"2026-08-12T12:50:54.795978Z","submitted_at":"2026-07-29T09:52:20Z","title":"TPD: Temporal Prior Decoupling for Text-to-Video Diffusion Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-07-30T23:29:03.450404Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2607.26706"},"observation_digest":"sha256:21a3493283df83865bcefb4973797e11f3ea73ae275841bd52eea7284a562eae","observation_id":"055ba8a3-e502-43ba-b1ce-7629263d1522","resolution":{"observed_at":"2026-07-30T23:29:03.450404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2311.10709/citation-record","integrity":"/paper/2311.10709/integrity","json":"/paper/2311.10709/citation-record.json","paper":"/paper/2311.10709"},"outbound":[],"paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T05:22:58.925946Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 58 inbound Pith citation observations for arXiv:2311.10709."}