{"as_of":"2026-08-14T20:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:994244cdaa36213f8d4300223bb182fc98ff6a8b84af860c40619cd90f211c7f","coverage":[{"denominator":18,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T10:24:49.068878Z","state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T23:53:47.431172Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-21T18:44:18.942934Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.16677","last_updated":"2024-12-21T15:59:07Z","snapshot_observed_at":"2026-08-12T22:19:43.995810Z","submitted_at":"2024-12-21T15:59:07Z","title":"VAST 1.0: A Unified Framework for Controllable and Consistent Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16677","snapshot_observed_at":"2026-08-11T23:53:47.431172Z","title":"Vast 1.0: A unified framework for control- lable and consistent video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02114","last_updated":"2025-03-18T10:51:59Z","snapshot_observed_at":"2026-08-14T18:46:42.225384Z","submitted_at":"2024-12-03T03:10:19Z","title":"Beyond Generation: Unlocking Universal Editing via Self-Supervised Fine-Tuning","version":2},"reference_index":115,"source":"pdf_text","source_observed_at":"2026-08-11T23:53:47.431172Z"},"links":{"cited_paper":"/paper/2412.16677","citing_paper":"/paper/2412.02114"},"observation_digest":"sha256:9cc0827e0bc7fcdc797e2905bb6805f508000d5823e137ddeee67ede1e461e18","observation_id":"b1aa08bc-0f4d-4052-994c-abd93f8ad72c","resolution":{"observed_at":"2026-08-11T23:53:47.431172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16677","last_updated":"2024-12-21T15:59:07Z","snapshot_observed_at":"2026-08-12T22:19:43.995810Z","submitted_at":"2024-12-21T15:59:07Z","title":"VAST 1.0: A Unified Framework for Controllable and Consistent Video Generation","version":1},"cited_work":{"arxiv_id":"2412.16677","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16677","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vast 1.0: A unified framework for controllable and con- sistent video generation.arXiv preprint arXiv:2412.16677","venue":null,"work_id":"1ac4b582-7eb1-4b83-8c5b-0c815654adcc","year":null},"citing_paper":{"arxiv_id":"2511.18719","last_updated":"2026-05-15T07:47:36Z","snapshot_observed_at":"2026-08-14T15:03:57.968025Z","submitted_at":"2025-11-24T03:21:17Z","title":"Seeing What Matters: Visual Preference Policy Optimization for Visual Generation","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-21T18:42:29.327151Z"},"links":{"cited_paper":"/paper/2412.16677","citing_paper":"/paper/2511.18719"},"observation_digest":"sha256:293c4bd5d30af51d9d47063af41d33c18ee50ad1902f964360009bac98cdcff2","observation_id":"8b3a5cc3-1b17-4459-93f8-fa63ce348853","resolution":{"observed_at":"2026-05-21T18:44:18.944678Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.16677/citation-record","integrity":"/paper/2412.16677/integrity","json":"/paper/2412.16677/citation-record.json","paper":"/paper/2412.16677"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:24:49.001121Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16677","last_updated":"2024-12-21T15:59:07Z","snapshot_observed_at":"2026-08-12T22:19:43.995810Z","submitted_at":"2024-12-21T15:59:07Z","title":"VAST 1.0: A Unified Framework for Controllable and Consistent Video Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T10:24:49.001121Z"},"links":{"citing_paper":"/paper/2412.16677"},"observation_digest":"sha256:45e581a38a9bdaf372c728c6e2452fee8d7f422fc4ab26103309dc8de9c539c2","observation_id":"09382561-80d6-463c-a2df-045f3f2d2440","resolution":{"observed_at":"2026-08-11T10:24:49.001121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11784","last_updated":"2025-06-04T13:32:44Z","snapshot_observed_at":"2026-08-13T15:03:17.064420Z","submitted_at":"2024-07-16T14:40:07Z","title":"Data-Juicer Sandbox: A Feedback-Driven Suite for Multimodal Data-Model Co-development","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11784","snapshot_observed_at":"2026-08-11T10:24:49.005408Z","title":"Data-juicer sand- box: A comprehensive suite for multimodal data-model co- development","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16677","last_updated":"2024-12-21T15:59:07Z","snapshot_observed_at":"2026-08-12T22:19:43.995810Z","submitted_at":"2024-12-21T15:59:07Z","title":"VAST 1.0: A Unified Framework for Controllable and Consistent Video Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T10:24:49.005408Z"},"links":{"cited_paper":"/paper/2407.11784","citing_paper":"/paper/2412.16677"},"observation_digest":"sha256:430fecca49de8ff5bfd380e73ed45ca0ac1639ce5c251225423795cd45e6eae3","observation_id":"7df2682a-f629-4616-b242-57dfc7ddb588","resolution":{"observed_at":"2026-08-11T10:24:49.005408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11499","last_updated":"2024-03-15T19:19:28Z","snapshot_observed_at":"2026-08-13T10:09:02.594270Z","submitted_at":"2023-09-20T17:58:05Z","title":"DreamLLM: Synergistic Multimodal Comprehension and Creation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11499","snapshot_observed_at":"2026-08-11T10:24:49.009445Z","title":"Dreamllm: Synergistic multimodal com- prehension and creation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16677","last_updated":"2024-12-21T15:59:07Z","snapshot_observed_at":"2026-08-12T22:19:43.995810Z","submitted_at":"2024-12-21T15:59:07Z","title":"VAST 1.0: A Unified Framework for Controllable and Consistent Video Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T10:24:49.009445Z"},"links":{"cited_paper":"/paper/2309.11499","citing_paper":"/paper/2412.16677"},"observation_digest":"sha256:2e73a7c0e4074fe55aa622316e1c7c7c61d008d8f65026c68ec0b9649dbdfade","observation_id":"8c27129b-7164-433b-9ee9-e1bca00a984a","resolution":{"observed_at":"2026-08-11T10:24:49.009445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:24:49.466759Z","title":"Scaling recti- fied flow transformers for high-resolution image synthesis","venue":null,"work_id":"754839ed-0062-4cc2-b4c2-0648666f91f4","year":2024},"citing_paper":{"arxiv_id":"2412.16677","last_updated":"2024-12-21T15:59:07Z","snapshot_observed_at":"2026-08-12T22:19:43.995810Z","submitted_at":"2024-12-21T15:59:07Z","title":"VAST 1.0: A Unified Framework for Controllable and Consistent Video Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T10:24:49.013987Z"},"links":{"citing_paper":"/paper/2412.16677"},"observation_digest":"sha256:45ef86d235f2c9c02305a03aab00b9b8c899b4e8cceb82ef9af643cd3fbdea09","observation_id":"ba25012f-3605-4a7a-8e87-0c4f9a4b25e8","resolution":{"observed_at":"2026-08-11T10:24:49.470751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:24:49.454368Z","title":"Diffit: Diffusion vision transformers for im- age generation","venue":null,"work_id":"5df11788-9066-42e3-8d42-6f6f0e42899e","year":2025},"citing_paper":{"arxiv_id":"2412.16677","last_updated":"2024-12-21T15:59:07Z","snapshot_observed_at":"2026-08-12T22:19:43.995810Z","submitted_at":"2024-12-21T15:59:07Z","title":"VAST 1.0: A Unified Framework for Controllable and Consistent Video Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T10:24:49.018340Z"},"links":{"citing_paper":"/paper/2412.16677"},"observation_digest":"sha256:2c84cd905c240def7de993d917311555af5d4bce7913303bdc7deddcb27ee6f5","observation_id":"d9d54ad9-cd32-48cd-afd1-0fa606eb6d86","resolution":{"observed_at":"2026-08-11T10:24:49.458244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23277","last_updated":"2024-10-31T18:03:51Z","snapshot_observed_at":"2026-08-12T22:11:46.933367Z","submitted_at":"2024-10-30T17:55:52Z","title":"SlowFast-VGen: Slow-Fast Learning for Action-Driven Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23277","snapshot_observed_at":"2026-08-11T10:24:49.022079Z","title":"Slowfast-vgen: Slow- fast learning for action-driven long video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16677","last_updated":"2024-12-21T15:59:07Z","snapshot_observed_at":"2026-08-12T22:19:43.995810Z","submitted_at":"2024-12-21T15:59:07Z","title":"VAST 1.0: A Unified Framework for Controllable and Consistent Video Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T10:24:49.022079Z"},"links":{"cited_paper":"/paper/2410.23277","citing_paper":"/paper/2412.16677"},"observation_digest":"sha256:6eebd0b3315199046c36d806c8f61701f68d25bd3b3a32403b5c85cf95a3155b","observation_id":"d79a8987-6c7f-489e-864a-ad9668a63011","resolution":{"observed_at":"2026-08-11T10:24:49.022079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:24:49.441620Z","title":"Vbench: Comprehensive bench- mark suite for video generative models","venue":null,"work_id":"89dfcdff-53e6-45a5-b098-24f2c4984343","year":2024},"citing_paper":{"arxiv_id":"2412.16677","last_updated":"2024-12-21T15:59:07Z","snapshot_observed_at":"2026-08-12T22:19:43.995810Z","submitted_at":"2024-12-21T15:59:07Z","title":"VAST 1.0: A Unified Framework for Controllable and Consistent Video Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T10:24:49.026013Z"},"links":{"citing_paper":"/paper/2412.16677"},"observation_digest":"sha256:c896b124de5fb21844da4fdcc2027096d6736b9c06e631841908129761ed7edb","observation_id":"05f61d18-0d99-49db-8404-6ef8265a1799","resolution":{"observed_at":"2026-08-11T10:24:49.445511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-13T14:41:45.809481Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-11T10:24:49.029739Z","title":"Hunyuanvideo: A systematic framework for large video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16677","last_updated":"2024-12-21T15:59:07Z","snapshot_observed_at":"2026-08-12T22:19:43.995810Z","submitted_at":"2024-12-21T15:59:07Z","title":"VAST 1.0: A Unified Framework for Controllable and Consistent Video Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T10:24:49.029739Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2412.16677"},"observation_digest":"sha256:b85b5d8fc75a8d8c502a222c74cf6d60915c349debbd4589484825cb89953d80","observation_id":"5bcfc8a2-6d09-4320-acf9-f388c1ca58d4","resolution":{"observed_at":"2026-08-11T10:24:49.029739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:24:49.033826Z","title":"T2v- turbo-v2: Enhancing video generation model post-training through data, reward, and conditional guidance design.arXiv preprint arXiv:2410.05677, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16677","last_updated":"2024-12-21T15:59:07Z","snapshot_observed_at":"2026-08-12T22:19:43.995810Z","submitted_at":"2024-12-21T15:59:07Z","title":"VAST 1.0: A Unified Framework for Controllable and Consistent Video Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T10:24:49.033826Z"},"links":{"citing_paper":"/paper/2412.16677"},"observation_digest":"sha256:30587c75c591bc95ef6bc18d50cd397b48b586f346a89aab64c1795f75430703","observation_id":"4fac470a-31af-4315-91e0-70463c397db1","resolution":{"observed_at":"2026-08-11T10:24:49.033826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:24:49.037648Z","title":"Dit-3d: Exploring plain diffusion transformers for 3d shape generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16677","last_updated":"2024-12-21T15:59:07Z","snapshot_observed_at":"2026-08-12T22:19:43.995810Z","submitted_at":"2024-12-21T15:59:07Z","title":"VAST 1.0: A Unified Framework for Controllable and Consistent Video Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T10:24:49.037648Z"},"links":{"citing_paper":"/paper/2412.16677"},"observation_digest":"sha256:d79d425b2784333c8ddab9b7b0ae4ca3175f4278e69b51b07a52ec673ff8ef58","observation_id":"c118094e-9a73-4b41-b5ca-0254a92d7744","resolution":{"observed_at":"2026-08-11T10:24:49.037648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:24:49.043061Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16677","last_updated":"2024-12-21T15:59:07Z","snapshot_observed_at":"2026-08-12T22:19:43.995810Z","submitted_at":"2024-12-21T15:59:07Z","title":"VAST 1.0: A Unified Framework for Controllable and Consistent Video Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T10:24:49.043061Z"},"links":{"citing_paper":"/paper/2412.16677"},"observation_digest":"sha256:31327fd8e37475595df6fdcd55e8be73dd1317b54d8deece75b05080a8bcf598","observation_id":"def6c258-3859-42a0-a486-30ffb2e67923","resolution":{"observed_at":"2026-08-11T10:24:49.043061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-14T11:08:32.950294Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-11T10:24:49.047094Z","title":"Movie gen: A cast of media foundation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16677","last_updated":"2024-12-21T15:59:07Z","snapshot_observed_at":"2026-08-12T22:19:43.995810Z","submitted_at":"2024-12-21T15:59:07Z","title":"VAST 1.0: A Unified Framework for Controllable and Consistent Video Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T10:24:49.047094Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2412.16677"},"observation_digest":"sha256:f56acdac6724f02ca1f7bc647e8b7ef8c85a197faa78dd62fd24f290d176ab28","observation_id":"c1f75ec1-89c1-45bc-bac4-a982c6823d39","resolution":{"observed_at":"2026-08-11T10:24:49.047094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14988","last_updated":"2022-09-29T17:50:40Z","snapshot_observed_at":"2026-07-06T13:57:54.539656Z","submitted_at":"2022-09-29T17:50:40Z","title":"DreamFusion: Text-to-3D using 2D Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14988","snapshot_observed_at":"2026-08-11T10:24:49.051028Z","title":"Dreamfusion: Text-to-3d using 2d diffusion","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16677","last_updated":"2024-12-21T15:59:07Z","snapshot_observed_at":"2026-08-12T22:19:43.995810Z","submitted_at":"2024-12-21T15:59:07Z","title":"VAST 1.0: A Unified Framework for Controllable and Consistent Video Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T10:24:49.051028Z"},"links":{"cited_paper":"/paper/2209.14988","citing_paper":"/paper/2412.16677"},"observation_digest":"sha256:444633a05f44a9357521e94a2d9642a6d2232fffbd134183ac5ba6bf66f3f69e","observation_id":"2f480d80-3b41-490b-87e3-8341f7d81d84","resolution":{"observed_at":"2026-08-11T10:24:49.051028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:24:49.413655Z","title":"Motion-i2v: Consistent and controllable image-to-video generation with explicit motion 7 Prompt: Two Monkey Kings are locked in combat before the Heavenly Palace","venue":null,"work_id":"6b70c14f-8cdc-4c52-825e-4b0f4af99c0a","year":2024},"citing_paper":{"arxiv_id":"2412.16677","last_updated":"2024-12-21T15:59:07Z","snapshot_observed_at":"2026-08-12T22:19:43.995810Z","submitted_at":"2024-12-21T15:59:07Z","title":"VAST 1.0: A Unified Framework for Controllable and Consistent Video Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T10:24:49.055098Z"},"links":{"citing_paper":"/paper/2412.16677"},"observation_digest":"sha256:00cc5971b4777ba8694529dde0bb7b7f0894782107dbad72aecdd6ce2afd6744","observation_id":"a65f3370-e173-4533-8e53-c5d815200eaa","resolution":{"observed_at":"2026-08-11T10:24:49.417962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:24:49.399033Z","title":"Mo- tionbooth: Motion-aware customized text-to-video genera- tion","venue":null,"work_id":"c624c542-59a8-4fc8-b7f4-8249d31c736c","year":2024},"citing_paper":{"arxiv_id":"2412.16677","last_updated":"2024-12-21T15:59:07Z","snapshot_observed_at":"2026-08-12T22:19:43.995810Z","submitted_at":"2024-12-21T15:59:07Z","title":"VAST 1.0: A Unified Framework for Controllable and Consistent Video Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T10:24:49.058271Z"},"links":{"citing_paper":"/paper/2412.16677"},"observation_digest":"sha256:179c8ea9e9fc7c6adee1cd442528312282b28056c83dfb9894242f169e81041c","observation_id":"94d78ad9-1d78-4526-8916-c046804f7966","resolution":{"observed_at":"2026-08-11T10:24:49.404937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-11T10:24:49.061795Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16677","last_updated":"2024-12-21T15:59:07Z","snapshot_observed_at":"2026-08-12T22:19:43.995810Z","submitted_at":"2024-12-21T15:59:07Z","title":"VAST 1.0: A Unified Framework for Controllable and Consistent Video Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T10:24:49.061795Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2412.16677"},"observation_digest":"sha256:a1395d8a5e4ef6560bdb40769570c307b9574cc2201e385b86350fcf1ae20262","observation_id":"7bf19f34-23ac-4f69-bd0c-09317a677ee3","resolution":{"observed_at":"2026-08-11T10:24:49.061795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:24:49.065419Z","title":"From slow bidirectional to fast causal video generators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16677","last_updated":"2024-12-21T15:59:07Z","snapshot_observed_at":"2026-08-12T22:19:43.995810Z","submitted_at":"2024-12-21T15:59:07Z","title":"VAST 1.0: A Unified Framework for Controllable and Consistent Video Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T10:24:49.065419Z"},"links":{"citing_paper":"/paper/2412.16677"},"observation_digest":"sha256:9ab82e4ac3bfc212d51f6cb3b500285908331e24d35e5b6e0985305e95a081a3","observation_id":"af8a5d82-04c7-4a79-9807-529b60e2f226","resolution":{"observed_at":"2026-08-11T10:24:49.065419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:24:49.068878Z","title":"Is sora a world simulator? a comprehensive survey on general world models and beyond","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16677","last_updated":"2024-12-21T15:59:07Z","snapshot_observed_at":"2026-08-12T22:19:43.995810Z","submitted_at":"2024-12-21T15:59:07Z","title":"VAST 1.0: A Unified Framework for Controllable and Consistent Video Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T10:24:49.068878Z"},"links":{"citing_paper":"/paper/2412.16677"},"observation_digest":"sha256:aacb0056529e4212e2a60f02011c27be2e6e98575e0400e80bfba163d7e2bf44","observation_id":"e085841b-7cf6-43c8-8401-05ff5f122ca6","resolution":{"observed_at":"2026-08-11T10:24:49.068878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.16677","last_updated":"2024-12-21T15:59:07Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T22:19:43.995810Z","submitted_at":"2024-12-21T15:59:07Z","title":"VAST 1.0: A Unified Framework for Controllable and Consistent Video Generation"},"reference_resolution":{"displayed":18,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":5},"total_outbound_references":18},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 18 of 18 outbound references and 2 inbound Pith citation observations for arXiv:2412.16677."}