{"as_of":"2026-08-05T22:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:428db48d9b422b1ea5047bbe6df6194b38905249f6dc1ff7935fcabe9a36bd67","coverage":[{"denominator":296,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-19T08:02:23.002090Z","state":"measured"},{"denominator":157,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":157,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":57,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T20:49:51.095103Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":"2502.10248","doi":"10.48550/arxiv.2502.10248","metadata_source":"pith","pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","venue":"cs.CV","work_id":"f9be7275-0997-4f96-bbde-dcd6ea138476","year":2025},"citing_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-22T23:05:32.595632Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2503.20314"},"observation_digest":"sha256:b21cd8b04fecda7a06386ce0a403646670e811d12b7f0b29c1998f7607e6575a","observation_id":"44c1afa1-920b-4ea5-98cf-fd32047b824f","resolution":{"observed_at":"2026-05-22T23:07:14.457899Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":"2502.10248","doi":"10.48550/arxiv.2502.10248","metadata_source":"pith","pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","venue":"cs.CV","work_id":"f9be7275-0997-4f96-bbde-dcd6ea138476","year":2025},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:9787c60fb3bb59e161e4b6ba45172e4a571689db036584f842175bd6ee9c56ce","observation_id":"31dcae6c-86f1-42e0-880c-09d71cdcfaf0","resolution":{"observed_at":"2026-05-19T08:02:24.560574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":"2502.10248","doi":"10.48550/arxiv.2502.10248","metadata_source":"pith","pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","venue":"cs.CV","work_id":"f9be7275-0997-4f96-bbde-dcd6ea138476","year":2025},"citing_paper":{"arxiv_id":"2505.13211","last_updated":"2025-05-19T14:58:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-19T14:58:50Z","title":"MAGI-1: Autoregressive Video Generation at Scale","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-13T20:31:15.700943Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2505.13211"},"observation_digest":"sha256:6f513af10c25721eeca7eaa95a6ec758f693785c2b801b1e42905f76e3fda178","observation_id":"eed6a369-57ed-43b2-a4a0-53823b0bb2fe","resolution":{"observed_at":"2026-05-19T08:02:24.560574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":"2502.10248","doi":"10.48550/arxiv.2502.10248","metadata_source":"pith","pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","venue":"cs.CV","work_id":"f9be7275-0997-4f96-bbde-dcd6ea138476","year":2025},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:7a6e83bb6aeef2307af920bb78a1bdf56c5c9737fa625d1ffbf81b24700d38ab","observation_id":"0d4a097e-ebf6-431b-9307-90e7333825a0","resolution":{"observed_at":"2026-05-19T08:02:24.560574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":"2502.10248","doi":"10.48550/arxiv.2502.10248","metadata_source":"pith","pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","venue":"cs.CV","work_id":"f9be7275-0997-4f96-bbde-dcd6ea138476","year":2025},"citing_paper":{"arxiv_id":"2506.22832","last_updated":"2026-04-09T11:44:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-28T09:53:17Z","title":"Listener-Rewarded Thinking in VLMs for Image Preferences","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-19T07:38:52.273903Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2506.22832"},"observation_digest":"sha256:d3aa6073c527e6daba51b15030a3d35b7ad77046f98681a6fde40374a91da13c","observation_id":"6b1207d8-4f4c-4907-b48b-14a385e92439","resolution":{"observed_at":"2026-05-19T08:02:24.560574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-05T20:49:51.095103Z","title":"Step-video-t2v technical report: The practice, challenges, and future of video foundation model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09858","last_updated":"2025-08-13T14:50:19Z","snapshot_observed_at":"2026-08-05T20:49:47.618789Z","submitted_at":"2025-08-13T14:50:19Z","title":"HumanGenesis: Agent-Based Geometric and Generative Modeling for Synthetic Human Dynamics","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T20:49:51.095103Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2508.09858"},"observation_digest":"sha256:522a5ace9f0f72f5182959fa7c345aa988143c5963f6b669d355af7d37571b04","observation_id":"c5b055b0-4dc3-45c1-8a2a-1d4c08733252","resolution":{"observed_at":"2026-08-05T20:49:51.095103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-05T17:45:17.186768Z","title":"Step-video-t2v technical report: The practice, challenges, and future of video foundation model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-05T17:45:13.859636Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:17.186768Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2508.15761"},"observation_digest":"sha256:74fa0d4ad32c92ac06bd093d8bc08039ea8b64a2c633317d272649c8cda472b8","observation_id":"8802044d-ba60-45f8-967f-f8ae9eaab0df","resolution":{"observed_at":"2026-08-05T17:45:17.186768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-05T00:05:47.622882Z","title":"Step-video-t2v technical report: The practice, challenges, and future of video foundation model.arXiv preprint arXiv:2502.10248, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06155","last_updated":"2025-09-07T17:55:03Z","snapshot_observed_at":"2026-08-05T00:05:44.790684Z","submitted_at":"2025-09-07T17:55:03Z","title":"UniVerse-1: Unified Audio-Video Generation via Stitching of Experts","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T00:05:47.622882Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2509.06155"},"observation_digest":"sha256:e1ad03282330cc01b169da9f5ef5435acb612dfbc5aa3d82551752e7e262c966","observation_id":"566e6d69-9a7f-4b12-a148-f183e1019dc6","resolution":{"observed_at":"2026-08-05T00:05:47.622882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-04T20:08:58.832391Z","title":"Step-video-t2v technical report: The practice, challenges, and future of video foundation model.arXiv preprint arXiv:2502.10248, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08826","last_updated":"2025-09-10T17:59:31Z","snapshot_observed_at":"2026-08-04T20:08:51.890283Z","submitted_at":"2025-09-10T17:59:31Z","title":"RewardDance: Reward Scaling in Visual Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T20:08:58.832391Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2509.08826"},"observation_digest":"sha256:a7ebaad714443b3f1f668266b91ec2a0614928ece96ab104374753c43ae72e45","observation_id":"e5445f7e-d9e2-48ea-89bf-662cbd1b64c2","resolution":{"observed_at":"2026-08-04T20:08:58.832391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-04T18:58:10.953460Z","title":"arXiv:2502.10248","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09547","last_updated":"2025-09-11T15:39:27Z","snapshot_observed_at":"2026-08-04T18:58:10.341082Z","submitted_at":"2025-09-11T15:39:27Z","title":"Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T18:58:10.953460Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2509.09547"},"observation_digest":"sha256:7261afc6617bfa632e9a4b2b33000d97cd22fdb372389ecab5e5b5824518509f","observation_id":"70974366-1796-44bb-9adf-73557c0f3467","resolution":{"observed_at":"2026-08-04T18:58:10.953460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":"2502.10248","doi":"10.48550/arxiv.2502.10248","metadata_source":"pith","pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","venue":"cs.CV","work_id":"f9be7275-0997-4f96-bbde-dcd6ea138476","year":2025},"citing_paper":{"arxiv_id":"2509.24702","last_updated":"2026-04-06T10:12:03Z","snapshot_observed_at":"2026-08-02T11:34:44.120596Z","submitted_at":"2025-09-29T12:32:54Z","title":"Enhancing Physical Plausibility in Video Generation by Reasoning the Implausibility","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-18T12:55:42.679016Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2509.24702"},"observation_digest":"sha256:2a2d03b4e0e980df40e99464747ebf1d89bd3a06e807ee5f98003efe874ca768","observation_id":"b966e68f-0b2e-4e8e-af02-c24edfaacfdd","resolution":{"observed_at":"2026-05-19T08:02:24.560574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-04T10:49:48.658757Z","title":"Step-video-t2v technical report: The practice, challenges, and future of video foundation model.arXiv preprint arXiv:2502.10248, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-04T10:49:46.339959Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T10:49:48.658757Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2510.08377"},"observation_digest":"sha256:941db68f241f09830a1c04437810e1c60da235a8186b27273ea6955dc7248448","observation_id":"8a4bf5bb-9ddc-4ecb-9c1e-0b0b518987e1","resolution":{"observed_at":"2026-08-04T10:49:48.658757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":"2502.10248","doi":"10.48550/arxiv.2502.10248","metadata_source":"pith","pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","venue":"cs.CV","work_id":"f9be7275-0997-4f96-bbde-dcd6ea138476","year":2025},"citing_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T02:31:34.927101Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2511.18870"},"observation_digest":"sha256:85574980669dba6c39c974fe8067abf0cf92ba4638785a8488d732ee9c612e55","observation_id":"e52145d8-551f-44ff-963f-decce4ea2148","resolution":{"observed_at":"2026-05-19T08:02:24.560574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-03T18:25:55.724129Z","title":"Step-video-t2v technical re- port: The practice, challenges, and future of video founda- tion model.arXiv preprint arXiv:2502.10248, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.05394","last_updated":"2026-07-24T07:04:43Z","snapshot_observed_at":"2026-08-03T18:25:53.262934Z","submitted_at":"2025-12-05T03:20:02Z","title":"Delving into Latent Spectral Biasing of Video VAEs for Superior Diffusability","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T18:25:55.724129Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2512.05394"},"observation_digest":"sha256:f3daa7ef22c490653011212a7861ab91e0a60b1a0a8f96f422014a00d2b48ac5","observation_id":"78382ff9-3617-408b-b8a7-f2b23c649fe4","resolution":{"observed_at":"2026-08-03T18:25:55.724129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":"2502.10248","doi":"10.48550/arxiv.2502.10248","metadata_source":"pith","pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","venue":"cs.CV","work_id":"f9be7275-0997-4f96-bbde-dcd6ea138476","year":2025},"citing_paper":{"arxiv_id":"2512.13281","last_updated":"2026-05-07T09:33:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T12:41:23Z","title":"VideoASMR-Bench: Can AI-Generated ASMR Videos Fool VLMs and Humans?","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-16T21:46:43.353305Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2512.13281"},"observation_digest":"sha256:66d3cc531c95aa2299987b960ef507e0563c183f573a9fdb688936beeb4e4b70","observation_id":"58b1a2bb-31ae-4566-bf77-29274feb2d93","resolution":{"observed_at":"2026-05-19T08:02:24.560574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-03T11:04:32.252418Z","title":"Step-video-t2v technical report: The practice, challenges, and future of video foundation model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.07773","last_updated":"2026-07-10T09:39:56Z","snapshot_observed_at":"2026-08-03T11:04:29.339883Z","submitted_at":"2026-01-12T17:52:11Z","title":"Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:32.252418Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2601.07773"},"observation_digest":"sha256:f5fd55e63711bdc520cb6d1eb84aa607ab7ea30ed25991c853ac3e452674955b","observation_id":"98638ac3-139f-431d-9cf9-f47b4921b9ca","resolution":{"observed_at":"2026-08-03T11:04:32.252418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-03T08:04:51.652932Z","title":"Make the yellow puppy raise its left front paw wave hello","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.18340","last_updated":"2026-06-01T10:57:40Z","snapshot_observed_at":"2026-08-04T18:52:13.724600Z","submitted_at":"2026-01-26T10:28:09Z","title":"Beyond Rigid: Benchmarking Non-Rigid Video Editing","version":2},"reference_index":379,"source":"pdf_text","source_observed_at":"2026-08-03T08:04:51.652932Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2601.18340"},"observation_digest":"sha256:9418f4d5e5bb133f5ab2a0fe758bd82b5ff1e2fe81954b003a54371b7c27658d","observation_id":"6c7e2aae-f7a7-4913-91ca-698675b9abf6","resolution":{"observed_at":"2026-08-03T08:04:51.652932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":"2502.10248","doi":"10.48550/arxiv.2502.10248","metadata_source":"pith","pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","venue":"cs.CV","work_id":"f9be7275-0997-4f96-bbde-dcd6ea138476","year":2025},"citing_paper":{"arxiv_id":"2601.21798","last_updated":"2026-05-15T11:47:00Z","snapshot_observed_at":"2026-08-02T04:56:07.337606Z","submitted_at":"2026-01-29T14:42:46Z","title":"CG-MLLM: Captioning and Generating 3D content via Multi-modal Large Language Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-21T14:48:21.787919Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2601.21798"},"observation_digest":"sha256:8ad28ef555d6d198e88c5ed7c8df5b965b92b87642b9fccd895f5c6481b445d4","observation_id":"9edbeec9-48e9-47c3-9ad7-030279c654b5","resolution":{"observed_at":"2026-05-21T14:50:14.801537Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":"2502.10248","doi":"10.48550/arxiv.2502.10248","metadata_source":"pith","pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","venue":"cs.CV","work_id":"f9be7275-0997-4f96-bbde-dcd6ea138476","year":2025},"citing_paper":{"arxiv_id":"2602.04939","last_updated":"2026-05-08T16:47:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-04T16:47:37Z","title":"SynthForensics: Benchmarking and Evaluating People-Centric Synthetic Video Deepfakes","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-16T07:32:30.580643Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2602.04939"},"observation_digest":"sha256:208def05536288a9eb50d5f14ee3ff13ced554441e024ec99526a40e34ad3aac","observation_id":"9deb6519-0c9e-448f-bdd1-1f7fa87fdf40","resolution":{"observed_at":"2026-05-19T08:02:24.560574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":"2502.10248","doi":"10.48550/arxiv.2502.10248","metadata_source":"pith","pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","venue":"cs.CV","work_id":"f9be7275-0997-4f96-bbde-dcd6ea138476","year":2025},"citing_paper":{"arxiv_id":"2602.13669","last_updated":"2026-04-22T07:41:44Z","snapshot_observed_at":"2026-07-06T22:45:53.926021Z","submitted_at":"2026-02-14T08:32:38Z","title":"EchoTorrent: Towards Swift, Sustained, and Streaming Multi-Modal Video Generation","version":5},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-15T22:20:16.320171Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2602.13669"},"observation_digest":"sha256:173d0980a32653ca636e7905b52297e804641ffc1f6a6170470aa030e3538b04","observation_id":"9c7ac717-3e3a-48fb-9ebb-72ff1e99671f","resolution":{"observed_at":"2026-05-19T08:02:24.560574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-07-14T22:56:23.337858Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.13402","last_updated":"2026-06-29T23:43:05Z","snapshot_observed_at":"2026-08-03T00:48:30.265316Z","submitted_at":"2026-03-12T00:16:56Z","title":"Event-Driven Video Generation","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-14T22:56:23.337858Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2603.13402"},"observation_digest":"sha256:872fe6464cd1fe1647386e94ec44c04f87c78b97f005f0ec6b59502c7991ea13","observation_id":"5112e65a-e406-4eb6-865b-585573014806","resolution":{"observed_at":"2026-07-14T22:56:23.337858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-03T00:56:28.335209Z","title":"arXiv preprint arXiv:2502.10248 (2025) 3","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.02330","last_updated":"2026-07-30T19:00:35Z","snapshot_observed_at":"2026-08-05T22:10:04.077169Z","submitted_at":"2026-04-02T17:59:58Z","title":"ActionParty: Multi-Subject Action Binding in Generative Video Games","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T00:56:28.335209Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2604.02330"},"observation_digest":"sha256:cfdf7707bd6e72c118652492445345f01cc2ad79e0b4aca25ccabd2f3285f9a5","observation_id":"11af68b9-8d46-46fb-895f-0186e44043c4","resolution":{"observed_at":"2026-08-03T00:56:28.335209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":"2502.10248","doi":"10.48550/arxiv.2502.10248","metadata_source":"pith","pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","venue":"cs.CV","work_id":"f9be7275-0997-4f96-bbde-dcd6ea138476","year":2025},"citing_paper":{"arxiv_id":"2604.06339","last_updated":"2026-04-07T18:17:05Z","snapshot_observed_at":"2026-07-06T22:54:53.308309Z","submitted_at":"2026-04-07T18:17:05Z","title":"Evolution of Video Generative Foundations","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-10T18:41:38.616611Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2604.06339"},"observation_digest":"sha256:c3c65dcd60f7b35b75b5ccee51b991c1de2869b0364acd857bdf5a38fbff1112","observation_id":"45280eac-eeb0-46f0-856c-4213cafa5701","resolution":{"observed_at":"2026-05-19T08:02:24.560574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":"2502.10248","doi":"10.48550/arxiv.2502.10248","metadata_source":"pith","pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","venue":"cs.CV","work_id":"f9be7275-0997-4f96-bbde-dcd6ea138476","year":2025},"citing_paper":{"arxiv_id":"2604.15911","last_updated":"2026-04-17T10:11:39Z","snapshot_observed_at":"2026-07-06T23:03:21.422544Z","submitted_at":"2026-04-17T10:11:39Z","title":"Efficient Video Diffusion Models: Advancements and Challenges","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-10T08:28:29.706249Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2604.15911"},"observation_digest":"sha256:e9c154bd424d6ad9b75a010b6f06ac52951c17e0026a21afd92dd55683d24550","observation_id":"a0c1f447-6ba6-4461-a89f-a9e5ca911a87","resolution":{"observed_at":"2026-05-19T08:02:24.560574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":"2502.10248","doi":"10.48550/arxiv.2502.10248","metadata_source":"pith","pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","venue":"cs.CV","work_id":"f9be7275-0997-4f96-bbde-dcd6ea138476","year":2025},"citing_paper":{"arxiv_id":"2604.16503","last_updated":"2026-05-19T02:31:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T15:09:39Z","title":"Motif-Video 2B: Technical Report","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T15:50:04.001693Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2604.16503"},"observation_digest":"sha256:b8abe4ab446f8f9b2586af37fa25987aada7f299dd8864b8fe4ea2bb27126de6","observation_id":"6616cf1e-aa88-4c11-b187-2035ae3fb2cb","resolution":{"observed_at":"2026-05-19T08:02:24.560574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":"2502.10248","doi":"10.48550/arxiv.2502.10248","metadata_source":"pith","pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","venue":"cs.CV","work_id":"f9be7275-0997-4f96-bbde-dcd6ea138476","year":2025},"citing_paper":{"arxiv_id":"2604.16503","last_updated":"2026-05-19T02:31:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T15:09:39Z","title":"Motif-Video 2B: Technical Report","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-21T00:12:23.096146Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2604.16503"},"observation_digest":"sha256:9ac12f321136ab1a2403c3cb777d39bd82dec6ee6a9d7a2c1b7e0e68830c6e73","observation_id":"5e529286-57be-4923-bc51-63bd9064b1ce","resolution":{"observed_at":"2026-05-21T00:13:53.097527Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":"2502.10248","doi":"10.48550/arxiv.2502.10248","metadata_source":"pith","pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","venue":"cs.CV","work_id":"f9be7275-0997-4f96-bbde-dcd6ea138476","year":2025},"citing_paper":{"arxiv_id":"2604.17195","last_updated":"2026-07-06T16:02:36Z","snapshot_observed_at":"2026-07-12T19:05:14.645592Z","submitted_at":"2026-04-19T01:51:41Z","title":"DreamShot: Personalized Storyboard Synthesis with Video Diffusion Prior","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T07:21:45.633310Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2604.17195"},"observation_digest":"sha256:1d5c24bfef2f817dac5610ae4b4e3797cc599919079f59a969405d8b4266ef91","observation_id":"ce6aff6d-cd09-4797-8266-a6ec2589d1e2","resolution":{"observed_at":"2026-05-19T08:02:24.560574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":"2502.10248","doi":"10.48550/arxiv.2502.10248","metadata_source":"pith","pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","venue":"cs.CV","work_id":"f9be7275-0997-4f96-bbde-dcd6ea138476","year":2025},"citing_paper":{"arxiv_id":"2604.27505","last_updated":"2026-05-20T07:08:10Z","snapshot_observed_at":"2026-07-06T23:12:57.730833Z","submitted_at":"2026-04-30T06:54:39Z","title":"Leveraging Verifier-Based Reinforcement Learning in Image Editing","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-07T08:00:33.307429Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2604.27505"},"observation_digest":"sha256:879fb34254e1e1ec32159c29315e24090dc61ffb1965558993d755ad5a07aafa","observation_id":"f55539d9-13c8-43c1-9ab3-87e8da5cf939","resolution":{"observed_at":"2026-05-19T08:02:24.560574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":"2502.10248","doi":"10.48550/arxiv.2502.10248","metadata_source":"pith","pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","venue":"cs.CV","work_id":"f9be7275-0997-4f96-bbde-dcd6ea138476","year":2025},"citing_paper":{"arxiv_id":"2604.27505","last_updated":"2026-05-20T07:08:10Z","snapshot_observed_at":"2026-07-06T23:12:57.730833Z","submitted_at":"2026-04-30T06:54:39Z","title":"Leveraging Verifier-Based Reinforcement Learning in Image Editing","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-21T09:11:02.183133Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2604.27505"},"observation_digest":"sha256:3ca26a83fefc0f734e414f79232bff085b9ba358aa3753c2ed72e57a8ab0d88c","observation_id":"87934217-edb9-465f-930d-db6142090418","resolution":{"observed_at":"2026-05-21T09:14:05.928718Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":"2502.10248","doi":"10.48550/arxiv.2502.10248","metadata_source":"pith","pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","venue":"cs.CV","work_id":"f9be7275-0997-4f96-bbde-dcd6ea138476","year":2025},"citing_paper":{"arxiv_id":"2605.09433","last_updated":"2026-05-10T09:13:40Z","snapshot_observed_at":"2026-07-06T23:21:30.897592Z","submitted_at":"2026-05-10T09:13:40Z","title":"Offline Preference Optimization for Rectified Flow with Noise-Tracked Pairs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-12T02:10:27.595446Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2605.09433"},"observation_digest":"sha256:2063b69be03055902e174f82026839a2e9bd722497430149d1c3798c3d10fbb0","observation_id":"0ce52856-1c69-46a6-804b-832e1d875b22","resolution":{"observed_at":"2026-05-19T08:02:24.560574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":"2502.10248","doi":"10.48550/arxiv.2502.10248","metadata_source":"pith","pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","venue":"cs.CV","work_id":"f9be7275-0997-4f96-bbde-dcd6ea138476","year":2025},"citing_paper":{"arxiv_id":"2605.10730","last_updated":"2026-05-11T15:34:56Z","snapshot_observed_at":"2026-07-06T23:22:37.355450Z","submitted_at":"2026-05-11T15:34:56Z","title":"Qwen-Image-2.0 Technical Report","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-12T04:21:18.312613Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2605.10730"},"observation_digest":"sha256:f0674837697aac082dde9f3df5671b4b21422bf437233119984fb35534908699","observation_id":"84501807-5c5d-40ce-ab05-21253e441eaf","resolution":{"observed_at":"2026-05-19T08:02:24.560574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":"2502.10248","doi":"10.48550/arxiv.2502.10248","metadata_source":"pith","pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","venue":"cs.CV","work_id":"f9be7275-0997-4f96-bbde-dcd6ea138476","year":2025},"citing_paper":{"arxiv_id":"2605.11596","last_updated":"2026-05-22T11:14:55Z","snapshot_observed_at":"2026-08-02T00:51:15.968858Z","submitted_at":"2026-05-12T06:22:16Z","title":"HorizonDrive: Self-Corrective Autoregressive World Model for Long-horizon Driving Simulation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-13T01:16:15.422226Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2605.11596"},"observation_digest":"sha256:5fa5ae615257aeb2b0e3d76422b55391084e06042ae486a7dcdbe4062e176be1","observation_id":"01c147af-d55c-4188-99ee-759ec01aca87","resolution":{"observed_at":"2026-05-19T08:02:24.560574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":"2502.10248","doi":"10.48550/arxiv.2502.10248","metadata_source":"pith","pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","venue":"cs.CV","work_id":"f9be7275-0997-4f96-bbde-dcd6ea138476","year":2025},"citing_paper":{"arxiv_id":"2605.11596","last_updated":"2026-05-22T11:14:55Z","snapshot_observed_at":"2026-08-02T00:51:15.968858Z","submitted_at":"2026-05-12T06:22:16Z","title":"HorizonDrive: Self-Corrective Autoregressive World Model for Long-horizon Driving Simulation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-25T06:31:26.421088Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2605.11596"},"observation_digest":"sha256:ebec83a3ec348ebc4bcf7807311489cfdaed7cf50dc9c24fe2d3aa20fcda2fd7","observation_id":"d427552a-f2fe-4715-a1fb-3be5be616e75","resolution":{"observed_at":"2026-05-25T06:35:24.933805Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":"2502.10248","doi":"10.48550/arxiv.2502.10248","metadata_source":"pith","pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","venue":"cs.CV","work_id":"f9be7275-0997-4f96-bbde-dcd6ea138476","year":2025},"citing_paper":{"arxiv_id":"2605.13565","last_updated":"2026-05-13T14:04:56Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T14:04:56Z","title":"Qwen-Image-VAE-2.0 Technical Report","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-14T19:53:25.849049Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2605.13565"},"observation_digest":"sha256:a6855f990ffe25edf485e1f4f63a21159f1c90063d95e24c536929b52ea3d3e3","observation_id":"9a1d3f35-bb45-4a63-9302-acba56d47bde","resolution":{"observed_at":"2026-05-19T08:02:24.560574Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":"2502.10248","doi":"10.48550/arxiv.2502.10248","metadata_source":"pith","pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","venue":"cs.CV","work_id":"f9be7275-0997-4f96-bbde-dcd6ea138476","year":2025},"citing_paper":{"arxiv_id":"2605.14513","last_updated":"2026-05-14T07:57:55Z","snapshot_observed_at":"2026-08-02T01:59:59.234796Z","submitted_at":"2026-05-14T07:57:55Z","title":"HASTE: Training-Free Video Diffusion Acceleration via Head-Wise Adaptive Sparse Attention","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-15T05:17:48.403406Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2605.14513"},"observation_digest":"sha256:29ef65056048c3996cd36a8023aaf0d5cbe09902ff65a5daf7c7ac70ddc511d0","observation_id":"658e9d79-8cae-437e-943c-f6038e0cc3e8","resolution":{"observed_at":"2026-05-19T08:02:24.560574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":"2502.10248","doi":"10.48550/arxiv.2502.10248","metadata_source":"pith","pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","venue":"cs.CV","work_id":"f9be7275-0997-4f96-bbde-dcd6ea138476","year":2025},"citing_paper":{"arxiv_id":"2605.14843","last_updated":"2026-05-14T13:48:17Z","snapshot_observed_at":"2026-08-03T20:37:03.419024Z","submitted_at":"2026-05-14T13:48:17Z","title":"MechVerse: Evaluating Physical Motion Consistency in Video Generation Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-30T21:37:15.414734Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2605.14843"},"observation_digest":"sha256:09ec163609f4436bcb6a9d3203089e2cd71da0cdbc44fafbc24c9d85750d7ad4","observation_id":"b95885bf-e0f8-4cda-a132-16357f26e81a","resolution":{"observed_at":"2026-07-01T14:25:46.377582Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":"2502.10248","doi":"10.48550/arxiv.2502.10248","metadata_source":"pith","pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","venue":"cs.CV","work_id":"f9be7275-0997-4f96-bbde-dcd6ea138476","year":2025},"citing_paper":{"arxiv_id":"2605.15190","last_updated":"2026-05-14T17:59:30Z","snapshot_observed_at":"2026-08-03T08:24:27.614764Z","submitted_at":"2026-05-14T17:59:30Z","title":"RAVEN: Real-time Autoregressive Video Extrapolation with Consistency-model GRPO","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T20:38:28.328436Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2605.15190"},"observation_digest":"sha256:460c03b16e60c43a85c5b6b2514fd53c2da34f00ef342e818c26ccbe1c425915","observation_id":"bca9dbe6-be37-4f29-ad2b-7996904c7f08","resolution":{"observed_at":"2026-07-01T14:35:47.172418Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":"2502.10248","doi":"10.48550/arxiv.2502.10248","metadata_source":"pith","pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","venue":"cs.CV","work_id":"f9be7275-0997-4f96-bbde-dcd6ea138476","year":2025},"citing_paper":{"arxiv_id":"2605.16649","last_updated":"2026-05-15T21:39:46Z","snapshot_observed_at":"2026-07-06T23:27:48.303599Z","submitted_at":"2026-05-15T21:39:46Z","title":"AtlasVid: Efficient Ultra-High-Resolution Long Video Generation via Decoupled Global-Local Modeling","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-20T18:26:57.735246Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2605.16649"},"observation_digest":"sha256:8b181edb9d7df615eaf97c39307daa78d23abc459aaf09e0010b8a2fdccd47ca","observation_id":"ecead28d-b9d4-4590-ab41-ecf0a83832a6","resolution":{"observed_at":"2026-05-20T18:28:53.009080Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":"2502.10248","doi":"10.48550/arxiv.2502.10248","metadata_source":"pith","pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","venue":"cs.CV","work_id":"f9be7275-0997-4f96-bbde-dcd6ea138476","year":2025},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-04T16:01:22.114748Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-20T11:46:52.658984Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:91e0e989feceb0d83ce03ff2f4e7f3649185578b4af3a5d1414eb034307db288","observation_id":"58ef28cc-f69a-4fb4-82e9-fea7321a3ea3","resolution":{"observed_at":"2026-05-20T11:48:14.937697Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":"2502.10248","doi":"10.48550/arxiv.2502.10248","metadata_source":"pith","pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","venue":"cs.CV","work_id":"f9be7275-0997-4f96-bbde-dcd6ea138476","year":2025},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-04T16:01:22.114748Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:e6360aeea578ac1d4721a0dea8088db13bbc5fd587743632e69eee33d8fda507","observation_id":"8e42cb5d-e659-4374-9e79-958876ff0e86","resolution":{"observed_at":"2026-05-21T07:59:50.631393Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":"2502.10248","doi":"10.48550/arxiv.2502.10248","metadata_source":"pith","pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","venue":"cs.CV","work_id":"f9be7275-0997-4f96-bbde-dcd6ea138476","year":2025},"citing_paper":{"arxiv_id":"2605.22344","last_updated":"2026-05-21T11:30:29Z","snapshot_observed_at":"2026-07-06T23:32:39.761431Z","submitted_at":"2026-05-21T11:30:29Z","title":"Bernini: Latent Semantic Planning for Video Diffusion","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-22T06:39:47.124605Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2605.22344"},"observation_digest":"sha256:b993491637a9575ff1afa277204131a64bd01a990c936a31f32e95d818960507","observation_id":"9f8f8f6d-c0f6-41ad-a266-038ebbde8907","resolution":{"observed_at":"2026-05-22T06:41:10.495860Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":"2502.10248","doi":"10.48550/arxiv.2502.10248","metadata_source":"pith","pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","venue":"cs.CV","work_id":"f9be7275-0997-4f96-bbde-dcd6ea138476","year":2025},"citing_paper":{"arxiv_id":"2605.30083","last_updated":"2026-05-28T15:30:04Z","snapshot_observed_at":"2026-07-06T23:39:24.682426Z","submitted_at":"2026-05-28T15:30:04Z","title":"Future Forcing: Future-aware Training-free KV Cache Policy for Autoregressive Video Generation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-29T08:30:00.438334Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2605.30083"},"observation_digest":"sha256:f2e633bffcb842c10559781ccb8c135843cd0f1c27332dbcdf909592319d6cac","observation_id":"52033316-44b7-4c17-9bb6-4103ef7e26a0","resolution":{"observed_at":"2026-06-29T08:33:15.136397Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":"2502.10248","doi":"10.48550/arxiv.2502.10248","metadata_source":"pith","pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","venue":"cs.CV","work_id":"f9be7275-0997-4f96-bbde-dcd6ea138476","year":2025},"citing_paper":{"arxiv_id":"2605.30325","last_updated":"2026-05-28T17:57:07Z","snapshot_observed_at":"2026-07-06T23:39:38.845840Z","submitted_at":"2026-05-28T17:57:07Z","title":"Veda: Scalable Video Diffusion via Distilled Sparse Attention","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T07:54:13.390911Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2605.30325"},"observation_digest":"sha256:14a74fb9f23470fcd806448d4355abae369823cae42c8af0eb9396ad2b865339","observation_id":"2003d70b-23fc-4d66-9163-b9d369efd0a3","resolution":{"observed_at":"2026-06-29T08:03:14.707775Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":"2502.10248","doi":"10.48550/arxiv.2502.10248","metadata_source":"pith","pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","venue":"cs.CV","work_id":"f9be7275-0997-4f96-bbde-dcd6ea138476","year":2025},"citing_paper":{"arxiv_id":"2606.03578","last_updated":"2026-06-02T12:47:14Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:47:14Z","title":"Diffusing in the Right Space: A Systematic Study of Latent Diffusability","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-28T10:44:24.318786Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2606.03578"},"observation_digest":"sha256:df1421acabd1fd9ee69adab4b635631b44384c5385e1f8ef7e13833abc990503","observation_id":"bfa28da5-434f-435f-acdd-876ba781297a","resolution":{"observed_at":"2026-07-02T02:36:27.627576Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":"2502.10248","doi":"10.48550/arxiv.2502.10248","metadata_source":"pith","pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","venue":"cs.CV","work_id":"f9be7275-0997-4f96-bbde-dcd6ea138476","year":2025},"citing_paper":{"arxiv_id":"2606.11670","last_updated":"2026-06-10T05:29:09Z","snapshot_observed_at":"2026-08-02T09:31:53.764896Z","submitted_at":"2026-06-10T05:29:09Z","title":"ARGUS: Stacked Multi-View Identity Mosaic Injection for Subject-Preserving Video Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-27T10:46:56.871174Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2606.11670"},"observation_digest":"sha256:e0ce1676f5718db587c3ee2c1cd1ca6b7867b15f621caee6aff3ad78210f3f51","observation_id":"5b87e6b5-7b92-4ffb-b7bc-59df73892939","resolution":{"observed_at":"2026-07-03T08:17:45.965420Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":"2502.10248","doi":"10.48550/arxiv.2502.10248","metadata_source":"pith","pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","venue":"cs.CV","work_id":"f9be7275-0997-4f96-bbde-dcd6ea138476","year":2025},"citing_paper":{"arxiv_id":"2606.26916","last_updated":"2026-06-25T11:53:27Z","snapshot_observed_at":"2026-07-07T00:01:10.711037Z","submitted_at":"2026-06-25T11:53:27Z","title":"PhysRAG: Enhancing Physics-Awareness in Video Generation via Retrieval-Augmented Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-26T05:16:53.011837Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2606.26916"},"observation_digest":"sha256:e74c5861187c174758d3f0bb7a35e83d3a65f2f4c2624059bc6d37cb2d30c912","observation_id":"be1cef6d-5305-4b0b-8ec0-2c394241452d","resolution":{"observed_at":"2026-07-04T13:19:51.099723Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":"2502.10248","doi":"10.48550/arxiv.2502.10248","metadata_source":"pith","pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","venue":"cs.CV","work_id":"f9be7275-0997-4f96-bbde-dcd6ea138476","year":2025},"citing_paper":{"arxiv_id":"2606.31326","last_updated":"2026-06-30T08:29:29Z","snapshot_observed_at":"2026-07-07T00:05:02.977105Z","submitted_at":"2026-06-30T08:29:29Z","title":"Bridging Video Understanding and Generation in a Unified Framework","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-01T05:57:54.653504Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2606.31326"},"observation_digest":"sha256:7c74edf5360b14d9ffa35a2f46e62d7bc6e3eb73e5571e8cee4c63b8cf5ecde0","observation_id":"49a440ee-1c15-421f-aa6d-ff5c44ac9f06","resolution":{"observed_at":"2026-07-01T10:05:40.323766Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":"2502.10248","doi":"10.48550/arxiv.2502.10248","metadata_source":"pith","pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","venue":"cs.CV","work_id":"f9be7275-0997-4f96-bbde-dcd6ea138476","year":2025},"citing_paper":{"arxiv_id":"2607.01222","last_updated":"2026-07-01T17:56:39Z","snapshot_observed_at":"2026-08-04T02:18:09.786163Z","submitted_at":"2026-07-01T17:56:39Z","title":"Ink3D: Sculpting 3D Assets with Extremely Complex Textures via Video Generative Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-02T13:16:16.676244Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2607.01222"},"observation_digest":"sha256:4dcd69673b2af6f6f5f96332198942e09b92f212a6ac70a552896e48f82d4424","observation_id":"48e00456-ad5a-47f8-9b9c-604d58d01147","resolution":{"observed_at":"2026-07-02T13:16:58.114308Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":"2502.10248","doi":"10.48550/arxiv.2502.10248","metadata_source":"pith","pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","venue":"cs.CV","work_id":"f9be7275-0997-4f96-bbde-dcd6ea138476","year":2025},"citing_paper":{"arxiv_id":"2607.01701","last_updated":"2026-07-02T04:50:33Z","snapshot_observed_at":"2026-07-07T00:07:13.555571Z","submitted_at":"2026-07-02T04:50:33Z","title":"Arachne: Orchestrating Cascades for Efficient Text-to-Video Model Training","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-03T06:27:48.935774Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2607.01701"},"observation_digest":"sha256:287eb521a15c16ae0804cf6ebff3347d079813bfcc44ca0604c81bd1b400e337","observation_id":"87c8e050-6a90-45cb-9540-c7003dc306b4","resolution":{"observed_at":"2026-07-03T06:37:42.051191Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":"2502.10248","doi":"10.48550/arxiv.2502.10248","metadata_source":"pith","pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","venue":"cs.CV","work_id":"f9be7275-0997-4f96-bbde-dcd6ea138476","year":2025},"citing_paper":{"arxiv_id":"2607.06291","last_updated":"2026-07-07T13:59:57Z","snapshot_observed_at":"2026-07-10T23:18:23.453807Z","submitted_at":"2026-07-07T13:59:57Z","title":"AlayaWorld: Long-Horizon and Playable Video World Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-08T10:53:28.412288Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2607.06291"},"observation_digest":"sha256:068656e1b7f6bfdc8bb45573bf0295eaaff57cd0d84d7df959e6b13bbab5913e","observation_id":"a949b09d-e383-4613-8c74-1d71f7095a61","resolution":{"observed_at":"2026-07-08T10:54:49.302808Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-02T03:51:49.407043Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13770","last_updated":"2026-07-15T12:31:19Z","snapshot_observed_at":"2026-08-04T07:14:56.560936Z","submitted_at":"2026-07-15T12:31:19Z","title":"Kaleido: Algorithm-Hardware Co-Design for Video Diffusion Transformers by Exploiting Latent Space Correlations","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T03:51:49.407043Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2607.13770"},"observation_digest":"sha256:3064e49b37e2450f018b2ce8e264d41578900494af36a0692f32886aaa0bd02e","observation_id":"3b0ab594-a380-4434-8d80-9a12d2a319ca","resolution":{"observed_at":"2026-08-02T03:51:49.407043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-01T22:45:27.121517Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15650","last_updated":"2026-07-17T05:56:42Z","snapshot_observed_at":"2026-08-01T22:45:24.072338Z","submitted_at":"2026-07-17T05:56:42Z","title":"DiTango: Cost-Effective Parallel Diffusion Generation with Selective Attention State Reuse","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T22:45:27.121517Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2607.15650"},"observation_digest":"sha256:15439b8c07589273980a220d1c6803ac7da564d3f4c86f3cfed004a04bf1826b","observation_id":"4199c132-968a-48cf-9678-9358b7234195","resolution":{"observed_at":"2026-08-01T22:45:27.121517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-01T20:07:44.492273Z","title":"Step-video-t2v technical report: The practice, challenges, and future of video foundation model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-01T20:07:37.038914Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:44.492273Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:b72699650822ec07f0fe24d5443eeb5c28daaaeada60bf52343799f339715409","observation_id":"377abb5b-dc37-4e3c-acf3-546a995b061c","resolution":{"observed_at":"2026-08-01T20:07:44.492273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-01T19:06:40.851302Z","title":"arXiv preprint arXiv:2502.10248 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17097","last_updated":"2026-07-19T06:41:53Z","snapshot_observed_at":"2026-08-01T19:06:10.554986Z","submitted_at":"2026-07-19T06:41:53Z","title":"HarmoHOI: Harmonizing Appearance and 3D Motion for Multi-view Hand-Object Interaction Synthesis","version":1},"reference_index":124,"source":"arxiv_source","source_observed_at":"2026-08-01T19:06:40.851302Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2607.17097"},"observation_digest":"sha256:98905e9e87b8e5fe3220bae509c5ad48bf2749256d91db59e759210b22487267","observation_id":"da3bfc9d-02b5-4098-9c30-bb6e38287aa2","resolution":{"observed_at":"2026-08-01T19:06:40.851302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-01T13:16:13.928886Z","title":"Step-Video-T2V technical report: The practice, challenges, and future of video foundation model.arXiv preprint arXiv:2502.10248, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19191","last_updated":"2026-07-21T15:26:50Z","snapshot_observed_at":"2026-08-04T08:23:36.523544Z","submitted_at":"2026-07-21T15:26:50Z","title":"ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPU","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T13:16:13.928886Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2607.19191"},"observation_digest":"sha256:a282021df52cedcf6c020e024457dc34e019a3d1ca0e6cf0d1587c768302bca9","observation_id":"3f4ba15e-323c-462c-bc24-32f845b45eeb","resolution":{"observed_at":"2026-08-01T13:16:13.928886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-01T08:28:03.582314Z","title":"Step-video-t2v technical report: The practice, challenges, and future of video foundation model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27380","last_updated":"2026-07-29T18:38:23Z","snapshot_observed_at":"2026-08-02T23:26:16.524563Z","submitted_at":"2026-07-29T18:38:23Z","title":"VideoCoCo: Code-as-CoT for Physically-Consistent Video Generation via an Agentic Dual-Engine System","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T08:28:03.582314Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2607.27380"},"observation_digest":"sha256:625e696dd92528214a201fc0db1c1a78980e980775f7a231c58e9ef81c60c009","observation_id":"fb4d8cc3-cee3-48df-a927-b53def6cf275","resolution":{"observed_at":"2026-08-01T08:28:03.582314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-03T16:36:47.838947Z","title":"Step-Video-T2V Technical Re- port: The Practice, Challenges, and Future of Video Founda- tion Model.arXiv preprint arXiv:2502.10248, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28955","last_updated":"2026-07-31T02:19:25Z","snapshot_observed_at":"2026-08-05T22:11:06.835100Z","submitted_at":"2026-07-31T02:19:25Z","title":"Retrieval-Driven Training-Free AI-Generated Video Attribution","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T16:36:47.838947Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2607.28955"},"observation_digest":"sha256:cdc6d5b451da1c493b192b1f35fe6d0d6974f7ebbe2ca39db29c3b10f5e9b2e8","observation_id":"d08a136b-85b4-4c8a-a2c8-25ec90a6b775","resolution":{"observed_at":"2026-08-03T16:36:47.838947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.10248/citation-record","integrity":"/paper/2502.10248/integrity","json":"/paper/2502.10248/citation-record.json","paper":"/paper/2502.10248"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video generation models as world simulators","venue":null,"work_id":"9f5077e4-e2ea-4923-8aec-32117c1f2934","year":2024},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:43414a5a631a32139caa0c8c803d68bfd3427f90392ebe503ce56f1eb1c7c78f","observation_id":"e3db04c6-63d9-40ae-b163-e2319fa8a309","resolution":{"observed_at":"2026-05-19T08:02:24.416179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"33e25f8e-5852-420b-b0c8-1d729b5803df","year":2024},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:08e62deec2f1077d6344cfd6526c5ab3faf3cd70ed124c38073090ed60a7cfdf","observation_id":"1b51e1fb-457a-4895-8318-b1c0ca725923","resolution":{"observed_at":"2026-05-19T08:02:24.425629Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7e79a09f-c578-4001-9d8f-7c3bd35ff4af","year":2024},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:49ba4aa031b3360ddc9b9af4434d5bcc853991eee1b7f70a578ccce2e27189a1","observation_id":"88567e7a-6b3e-4fd1-b6c9-75ce464fcd7b","resolution":{"observed_at":"2026-05-19T08:02:24.430257Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c75944a6-9825-4b2e-9211-e6a7700d0468","year":2024},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:4c154ee16621960c632acef063e254c643ead426d306945152998cffcedadc7a","observation_id":"57ba1ca1-fe51-44d4-a7a6-6b92721c1d77","resolution":{"observed_at":"2026-05-19T08:02:24.440335Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gen-3 alpha","venue":null,"work_id":"7af3c13e-0cfc-4218-8f89-855d5493d82b","year":2024},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:fcfd6b6f142747c7ed763b295b66e2cd21a81b299d01570d6ccf54b9226f418e","observation_id":"d0afb639-d642-455f-9e5a-ffb9b0a4d967","resolution":{"observed_at":"2026-05-19T08:02:24.444978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:73bf98753fdea98868682c5a81132a6be272f5463096d07cd0bde6726b3f8c5d","observation_id":"ce52b633-263e-4d43-b961-5582384821aa","resolution":{"observed_at":"2026-05-19T08:02:23.931507Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Open-sora: Democratizing efficient video production for all","venue":null,"work_id":"070b81dc-0e42-413a-be77-34433c1ad9fd","year":2024},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:91c92721cb8a3404e2b199031f1395f9c74c0e9dea5d86badd0ea543a8d8fe77","observation_id":"9726da56-2ba2-4d0d-b533-89429094b715","resolution":{"observed_at":"2026-05-19T08:02:24.449409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03206","last_updated":"2024-03-05T18:45:39Z","snapshot_observed_at":"2026-07-06T17:40:01.975792Z","submitted_at":"2024-03-05T18:45:39Z","title":"Scaling Rectified Flow Transformers for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":"2403.03206","doi":"10.48550/arxiv.2403.03206","metadata_source":"pith","pith_arxiv_id":"2403.03206","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Rectified Flow Transformers for High-Resolution Image Synthesis","venue":"cs.CV","work_id":"4dc55d76-271e-42dd-878f-c20546599c69","year":2024},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"cited_paper":"/paper/2403.03206","citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:62309cefa6f984b40b38bb85992a0f265269dc70db5e1f2b97a759a284e36ad1","observation_id":"6db8b2d6-a5b2-4c8e-8364-99b4949da35a","resolution":{"observed_at":"2026-05-19T08:02:24.057710Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T11:19:49.764146+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T11:19:49.764146+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09748","last_updated":"2023-03-02T09:06:55Z","snapshot_observed_at":"2026-07-06T14:32:37.317828Z","submitted_at":"2022-12-19T18:59:58Z","title":"Scalable Diffusion Models with Transformers","version":2},"cited_work":{"arxiv_id":"2212.09748","doi":"10.48550/arxiv.2212.09748","metadata_source":"pith","pith_arxiv_id":"2212.09748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scalable Diffusion Models with Transformers","venue":"cs.CV","work_id":"a3a05169-18b1-42bb-8775-eada50163437","year":2022},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"cited_paper":"/paper/2212.09748","citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:40c83d1e2d93239330a5c4cfa43163935455aa5deef909352445e358995dfe06","observation_id":"1dcf930d-2b7a-4ff3-82b0-f0adb14fe80e","resolution":{"observed_at":"2026-05-19T08:02:23.796342Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:30.266292+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:30.266292+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.13720","doi":"10.48550/arxiv.2410.13720","metadata_source":"pith","pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Movie Gen: A Cast of Media Foundation Models","venue":"cs.CV","work_id":"a6a118b0-002f-4b19-881f-7f1183e0d7d8","year":2024},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:23155357aad09a4be2b29f421c79cdc610a6daa9d27c29464a9c37f6879a9b89","observation_id":"61cba769-5fc5-465b-898d-433d921fd919","resolution":{"observed_at":"2026-05-19T08:02:23.924392Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language model beats diffusion - tokenizer is key to visual generation","venue":null,"work_id":"de4fd4e8-ee69-4638-918b-150984d153be","year":2024},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:17d1a2b94daf8666b61029768f472ba8fdba77277a7e8452e4e2a3f7b8bde2ab","observation_id":"424b6607-d5d1-489b-9526-98c0a24c22ae","resolution":{"observed_at":"2026-05-19T08:02:24.453959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"cited_work":{"arxiv_id":"2501.03575","doi":"10.48550/arxiv.2501.03575","metadata_source":"pith","pith_arxiv_id":"2501.03575","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cosmos World Foundation Model Platform for Physical AI","venue":"cs.CV","work_id":"a2dba24c-318d-476a-8b21-4289c265810c","year":2025},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"cited_paper":"/paper/2501.03575","citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:c874fe5913a35a21b9763fc7e0fbab41f0321dc3a07f7039444506516134f533","observation_id":"6f1d706e-5be6-48ce-a7eb-88a2acd01955","resolution":{"observed_at":"2026-05-19T08:02:23.962171Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:29.560535+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:29.560535+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17459","last_updated":"2025-04-11T12:31:07Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T14:23:53Z","title":"WF-VAE: Enhancing Video VAE by Wavelet-Driven Energy Flow for Latent Video Diffusion Model","version":3},"cited_work":{"arxiv_id":"2411.17459","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.17459","snapshot_observed_at":"2026-06-28T23:12:46.604761Z","title":"Wf-vae: Enhancing video vae by wavelet-driven energy flow for latent video diffusion model","venue":null,"work_id":"c74a932f-ebe4-4f2b-bc0e-19df7d304c51","year":2024},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"cited_paper":"/paper/2411.17459","citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:a9be3b8a081241ce1b45ba2a20a7977f7a555044587b9057fe902214509fdf8f","observation_id":"097c1c8e-d302-4d82-a71c-7411e8f83ff5","resolution":{"observed_at":"2026-05-19T08:02:23.987814Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep compression autoencoder for efficient high-resolution diffusion models","venue":null,"work_id":"407f9140-0538-459b-9566-588fa11fa24c","year":2025},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:1542564cb9701d9ef40881059c68d89a9b2f04e225589b8f40a490b989b1bf15","observation_id":"2fdde92b-9479-49f6-a815-d659b52d27e6","resolution":{"observed_at":"2026-05-19T08:02:24.459607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":"2210.02747","doi":"10.1038/s41467-024-47656-z","metadata_source":"pith","pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flow Matching for Generative Modeling","venue":"cs.LG","work_id":"6edb71c4-5d64-40af-a394-9757ea051a36","year":2022},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:d0e1bbbdb6dffe66ada2dd223a133672f3287f012dedfabb19cf7d5e256d62fb","observation_id":"7e75ae10-ae45-4a05-8cbd-7c4ef9fdd5d0","resolution":{"observed_at":"2026-05-19T08:02:24.071750Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"crossref_status_cache"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":"2405.08748","doi":"10.48550/arxiv.2405.08748","metadata_source":"pith","pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","venue":"cs.CV","work_id":"fde63b0b-25e7-43d9-9867-7d6a2ba6d710","year":2024},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:c6d0a6e9c8c2276cd105f1be557ce4a7e4a6c7dc24f94a6be1149fee11793db3","observation_id":"93a71d0d-a75f-49d1-ac8b-be50586c74c0","resolution":{"observed_at":"2026-05-19T08:02:23.310121Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.12409","last_updated":"2022-04-22T18:20:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-08-27T17:35:06Z","title":"Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation","version":2},"cited_work":{"arxiv_id":"2108.12409","doi":"10.48550/arxiv.2108.12409","metadata_source":"pith","pith_arxiv_id":"2108.12409","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation","venue":"cs.CL","work_id":"145b1374-5258-4c00-a433-4db0f5a50749","year":2021},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"cited_paper":"/paper/2108.12409","citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:8f92c6448695ac76d3418e7e054f99b7b08038a2498cde2f7589a10566cc1f23","observation_id":"9f1b91b0-a607-4b5d-bf49-533c2766421b","resolution":{"observed_at":"2026-05-19T08:02:23.584841Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:ecc55a1208c180c4581e669879f51722a2cf522711bda168ebb7bfb9750b7554","observation_id":"a122dd90-5703-4f45-8bdd-e3911295351b","resolution":{"observed_at":"2026-05-19T08:02:23.592279Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-07-06T11:01:58.137141Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"cited_work":{"arxiv_id":"2104.09864","doi":"10.48550/arxiv.2104.09864","metadata_source":"pith","pith_arxiv_id":"2104.09864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","venue":"cs.CL","work_id":"4e5eee26-cd04-4c7a-988f-3e6d1a1f0eb9","year":2021},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"cited_paper":"/paper/2104.09864","citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:9e18f9976fd2213d6ada0b6eb6d6ccc6c0709073246edb51b7e4dced87ab608f","observation_id":"51c3c749-932a-4e8f-b60a-eba91c382e48","resolution":{"observed_at":"2026-05-19T08:02:23.671701Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:49:47.452101+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:49:47.452101+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T09:33:36.354288Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"ee9aa0b5-5aed-4ffd-b640-d1eec1f8e893","year":2022},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:9374f186d965120a2c0b50290a7034e0071521cbf25678d084598bcae25f9ff5","observation_id":"53b383e3-dd01-40b4-85ff-ae94aef16b22","resolution":{"observed_at":"2026-05-19T08:02:24.465394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep reinforcement learning from human preferences","venue":null,"work_id":"c1c174f3-bfe7-43b5-b0fe-b43542017b19","year":2017},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:067c05fe13ba1edd35e1b633115116f07a55b06690542283bf9ae2c2eb49250f","observation_id":"4cac45e3-d861-4402-a285-31e63460f2d1","resolution":{"observed_at":"2026-05-19T08:02:24.470401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":"340b11d3-fed9-43e1-813f-40be7e10070b","year":2024},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:3592993355cebc6f5ef6392074402507a22a6ab72d63e4506ebabebd38821d95","observation_id":"e8c9171a-e6dc-43de-aa6b-882ae4a670fe","resolution":{"observed_at":"2026-05-19T08:02:24.477172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffusion model alignment using direct preference optimization","venue":null,"work_id":"ea54d9a4-3e44-467b-be77-d5631535dc6f","year":2024},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:0787fc941f63099874fe51f933e9155a9836a71b8d1817f8b0c140573811b030","observation_id":"249d6c06-2337-4cda-b5f0-a620e157a6e2","resolution":{"observed_at":"2026-05-19T08:02:24.481525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Using human feedback to fine-tune diffusion models without any reward model","venue":null,"work_id":"3aa262f9-75aa-42fd-af90-7f04666fd0ad","year":2024},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:01a6e01f1afc2b0fe0ef9b2eaba2bf2a01140a2a18acd10fbc583dc8003c00f9","observation_id":"390bbff3-0aca-45be-970a-fc41bf9c2ed6","resolution":{"observed_at":"2026-05-19T08:02:24.487178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":"2209.03003","doi":"10.48550/arxiv.2209.03003","metadata_source":"pith","pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","venue":"cs.LG","work_id":"a1989e1b-d66d-4533-be3a-fb9c5fd62290","year":2022},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:665bb48e9a57057e6088783c2d25400eba6ba01238e1781c5ec0f7fb8a5db99a","observation_id":"436ba729-9325-4305-8163-eb030321a751","resolution":{"observed_at":"2026-05-19T08:02:24.018974Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T22:49:29.244251+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T22:49:29.244251+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20320","last_updated":"2024-10-08T21:40:13Z","snapshot_observed_at":"2026-07-06T18:22:53.072592Z","submitted_at":"2024-05-30T17:56:04Z","title":"Improving the Training of Rectified Flows","version":2},"cited_work":{"arxiv_id":"2405.20320","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20320","snapshot_observed_at":"2026-07-03T04:07:36.773805Z","title":"Improving the training of rectified flows","venue":null,"work_id":"aeceb814-e105-49c0-8b37-733ba768b485","year":2024},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"cited_paper":"/paper/2405.20320","citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:f0c4bbecee55355d235635d8c44a6caca470ab335bff80829f8a86540d060d49","observation_id":"cfd90426-d0ae-43e4-a433-3205fda778ad","resolution":{"observed_at":"2026-05-19T08:02:24.026542Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient large-scale language model training on gpu clusters using megatron-lm","venue":null,"work_id":"f3c6f2e4-4fc7-4219-8345-448671725e34","year":2021},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:865637b59da841671b9404848433f137b495185d0ef5f08ae45064c660cb08cc","observation_id":"374ee2e8-dbe3-4d97-8196-241ec31dd8c1","resolution":{"observed_at":"2026-05-19T08:02:24.491468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reducing activation recomputation in large transformer models","venue":null,"work_id":"01422fbb-d44a-451f-a69e-93ec855e48bd","year":2023},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:10163922a415a4b818b797a4542a4c7a89e1cc687d45fa5c5dc33414b8aaf317","observation_id":"3fb1ec26-f61a-4718-a126-0fbc3e316c31","resolution":{"observed_at":"2026-05-19T08:02:24.498241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01889","last_updated":"2023-11-27T06:38:47Z","snapshot_observed_at":"2026-07-06T16:26:58.234941Z","submitted_at":"2023-10-03T08:44:50Z","title":"Ring Attention with Blockwise Transformers for Near-Infinite Context","version":4},"cited_work":{"arxiv_id":"2310.01889","doi":"10.48550/arxiv.2310.01889","metadata_source":"pith","pith_arxiv_id":"2310.01889","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ring Attention with Blockwise Transformers for Near-Infinite Context","venue":"cs.CL","work_id":"982498c4-e80e-4e66-8c44-c60813be298d","year":2023},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"cited_paper":"/paper/2310.01889","citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:5e21e56cce505097c8b5798bef932c214bf811a81c425919617d49ef374726ca","observation_id":"6e5151fa-990e-414d-a290-97ac6844e0d4","resolution":{"observed_at":"2026-05-19T08:02:24.077796Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:24.101224+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:24.101224+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14509","last_updated":"2023-10-04T16:51:13Z","snapshot_observed_at":"2026-08-04T19:27:31.715261Z","submitted_at":"2023-09-25T20:15:57Z","title":"DeepSpeed Ulysses: System Optimizations for Enabling Training of Extreme Long Sequence Transformer Models","version":2},"cited_work":{"arxiv_id":"2309.14509","doi":"10.48550/arxiv.2309.14509","metadata_source":"pith","pith_arxiv_id":"2309.14509","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSpeed Ulysses: System Optimizations for Enabling Training of Extreme Long Sequence Transformer Models","venue":"cs.LG","work_id":"bb119d0b-c7f0-412a-a426-f74bd6949a51","year":2023},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"cited_paper":"/paper/2309.14509","citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:239297c758bac4191b20012e4d7902649f9d0c6db4a79a217e0429fca14a95ff","observation_id":"78b559a4-8f39-4cc0-a01f-3c47b76d14b5","resolution":{"observed_at":"2026-05-19T08:02:23.291569Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zero: Memory optimizations toward training trillion parameter models","venue":null,"work_id":"9f8233c0-1d1a-4555-abcb-f68d377bf7f5","year":2020},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:ace1dc4b631a8622170e7f845272d77c2acc2e01297c0fdc7585fb37c62bedc2","observation_id":"59c8ac4b-0e32-4482-b50f-29a59eaf51e4","resolution":{"observed_at":"2026-05-19T08:02:24.503153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2408.04275","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T02:39:24.653945Z","title":"Disttrain: Addressing model and data heterogeneity with disaggregated training for multimodal large language models","venue":null,"work_id":"b7cc1521-f3d9-429c-b3d0-9382cdc90533","year":2024},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:26f1be4f1c0fc0bb8086a8292123c36538147d09f05bcdc843eb5572666a338d","observation_id":"92699452-73e7-45cd-947a-6e2afc3ac75f","resolution":{"observed_at":"2026-05-19T08:02:23.564702Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Channels Last Memory Format in PyTorch","venue":null,"work_id":"f98620bc-f880-4108-9a96-fd6ab65864b1","year":2023},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:f60cc03c7a2f690f26a3681c323ed750c5350c55b167865e13a933872e401b58","observation_id":"5afcdcbc-5d7e-4568-a5f8-eedf8c1efd40","resolution":{"observed_at":"2026-05-19T08:02:24.507443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Jordan, and Ion Stoica","venue":null,"work_id":"52e557e6-044b-41c3-a523-d16fc6d507a9","year":2018},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:506d0d30103e86640b92e6d8bd7278c975d1ed23fb98a74565367678618c3aa6","observation_id":"96ebe783-8ae8-4e0a-9c07-6b88701ac625","resolution":{"observed_at":"2026-05-19T08:02:24.511710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pytorch rpc: Distributed deep learning built on tensor-optimized remote procedure calls","venue":null,"work_id":"a1d01e5f-c8fc-415f-a1f7-c024c0699dcf","year":2023},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:f5a6f8d4857795f8ef614293282462e2f25c6849717122d8b0d645009aedc8fd","observation_id":"3b3631c5-b79b-4018-89aa-00fbec5f72e2","resolution":{"observed_at":"2026-05-19T08:02:24.517347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00079","last_updated":"2025-09-03T14:56:29Z","snapshot_observed_at":"2026-07-06T18:38:42.333605Z","submitted_at":"2024-06-24T02:05:32Z","title":"Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving","version":4},"cited_work":{"arxiv_id":"2407.00079","doi":"10.48550/arxiv.2407.00079","metadata_source":"pith","pith_arxiv_id":"2407.00079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mooncake: A kvcache-centric disaggregated architecture for llm serving","venue":"cs.DC","work_id":"eee8f937-db6b-4c48-887b-960ca80c0d81","year":2024},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"cited_paper":"/paper/2407.00079","citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:831c48e6644592ddc94bdc50ad544c8d9795831840e5c4a30ca5af28b931dceb","observation_id":"1597fe2b-4566-4862-95e8-7fe26d69ce6c","resolution":{"observed_at":"2026-05-19T08:02:23.720450Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:20:11.013176+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:20:11.013176+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The llama 3 herd of models, April 2024","venue":null,"work_id":"833fec52-41cb-416e-8e0c-089159cc2218","year":2024},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:6e25a9f0a1d27131b2659134d646ddd8fb41d6ee62b9b88a58c7edae5e91d89c","observation_id":"33fa9489-9a01-4f62-aee0-54cce38f314f","resolution":{"observed_at":"2026-05-19T08:02:24.524622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"PySceneDetect","venue":null,"work_id":"19c7db78-6a0a-4fec-a456-df1e1d49f700","year":null},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:83db6dc89e74f91719b1c0716a4d20bba48d9c7c504edb64685ac89de561a64c","observation_id":"6220c3a1-967c-444b-89f2-dd4e2e8bad5c","resolution":{"observed_at":"2026-05-19T08:02:24.529179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"1392a6ea-d7e8-456a-aaf0-b2e517d497ed","year":null},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:169b108ce44bc0785226cb3d62c8f1bebf6ec7ef1206047a85a2721876fe8933","observation_id":"4a718b9d-7051-47c9-abec-45dcd19d65de","resolution":{"observed_at":"2026-05-19T08:02:24.533677Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Panda-70m: Captioning 70m videos with multiple cross-modality teachers","venue":null,"work_id":"7a99afa6-c36a-4e17-8199-392b5d7a3846","year":2024},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:6517cccb9e3f9469c163f5682868b5e79b218ebe7475c23c96a487e6ee40f4a3","observation_id":"698c0a06-2230-4b30-a24f-5c333ae0832a","resolution":{"observed_at":"2026-05-19T08:02:24.538229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":"5c2e7d3f-2ae8-41e3-b73e-1faa677b1412","year":2022},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:424e560df6e79a5201eef13e0c04d0570cb43dcc3c55f6d3731d4f4ba7fb2708","observation_id":"b69d111d-f1b2-40b2-9ff3-2723e9c50d31","resolution":{"observed_at":"2026-05-19T08:02:24.544287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Clip-based nsfw detector","venue":null,"work_id":"2897dc51-b35a-4c72-8f05-043c23543e25","year":2021},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:331aa50d8323dd0eaaded8bde0d4add275f13e2f1b4188f8318c953e77f2d976","observation_id":"f3ed22ab-8066-4c94-948f-362cbeeefc68","resolution":{"observed_at":"2026-05-19T08:02:24.548641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficientnet: Rethinking model scaling for convolutional neural networks","venue":null,"work_id":"1b28d45e-8f04-4b2c-8a3f-bcb9fcac699a","year":2019},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:69e954be7bcbc5b5c6ef6087017d55ac3e8375cb9b743b945f5f39fc75472a30","observation_id":"7de259bf-3738-4e5d-b8c2-a5445dc425c0","resolution":{"observed_at":"2026-05-19T08:02:24.553407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Paddleocr","venue":null,"work_id":"2ff7bb58-eac8-4f32-b910-3a0ad242b4ed","year":2023},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:cc3e4edcc2dbdf5f4d34dd92dd3d1ff78ce8a19ef8a80bf0915fb2c8fcc1d2cf","observation_id":"a364f9ec-d3d8-4035-b293-6d5c6951667c","resolution":{"observed_at":"2026-05-19T08:02:24.558593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b7bf03e3-2811-4937-ae70-743337a9672c","year":2021},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:a770de4c4acd6b2a5de86992d067faf934e1dcfdab3caf55e6eaed0fa302ae09","observation_id":"7daad267-6ed3-44a5-b876-b5cda10d7c8d","resolution":{"observed_at":"2026-05-19T08:03:01.620226Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diatom autofocusing in brightfield microscopy: a comparative study","venue":null,"work_id":"d355b28a-0973-4b1a-9a00-d50ef687bbed","year":2000},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:2a5c0d5a93067c56393193bbc6628bc32240e9189d282bf7fd69b0e68deb6f17","observation_id":"81735cd3-50dd-4f7c-aeb3-0f7bfcfd589a","resolution":{"observed_at":"2026-05-19T08:03:01.325066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improving image generation with better captions","venue":null,"work_id":"8954ed0a-2a0d-47c5-9bf3-72d784447c97","year":2023},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:fec825b8dc2b2b9c541dc26ff3e5d5cf2f1d3ebc3c39989e7aeed538bac11220","observation_id":"4ff1bcaa-a0ab-43ad-8a6c-765d98a938c5","resolution":{"observed_at":"2026-05-19T08:03:01.467523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Some methods for classification and analysis of multivariate observations","venue":null,"work_id":"71fca9d1-355c-468b-8d1f-c0c4bbe8596c","year":1967},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:e2596b46eeb08ba87553fd68b57da50137910986d5876ab54364e50d91faedee","observation_id":"8ebdd587-9a73-4601-9a99-2bb5b964648d","resolution":{"observed_at":"2026-05-19T08:03:01.483371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.07590","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DSV: Exploiting Dynamic Sparsity to Accelerate Large-Scale Video DiT Training","venue":null,"work_id":"e231bd92-4f4a-4556-beec-1d0a06d6d110","year":2025},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:5b8cd59910d194070bbf819b467010715cdfc573faa6ec5fffea7b4bc055207a","observation_id":"f61c2c9b-4f03-49ce-a065-2a4b73c8d210","resolution":{"observed_at":"2026-05-19T08:02:23.330158Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01392","last_updated":"2024-12-10T01:32:23Z","snapshot_observed_at":"2026-07-06T18:39:38.415138Z","submitted_at":"2024-07-01T15:43:25Z","title":"Diffusion Forcing: Next-token Prediction Meets Full-Sequence Diffusion","version":4},"cited_work":{"arxiv_id":"2407.01392","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.01392","snapshot_observed_at":"2026-07-10T01:46:41.061392Z","title":"M., Du, Y ., Simchowitz, M., Tedrake, R., and Sitzmann, V","venue":"cs.LG","work_id":"e7d25a8e-cc3d-4006-adb8-b4430c78e47f","year":2024},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"cited_paper":"/paper/2407.01392","citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:1ff7ccade977dc596c9a3b6fc2c08da8c2c2f33000b815f2cd08413d5fb9833f","observation_id":"34702d07-6542-437e-a503-2fe9521d526b","resolution":{"observed_at":"2026-05-19T08:02:23.338415Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00103","last_updated":"2024-12-30T19:00:25Z","snapshot_observed_at":"2026-07-06T20:14:54.297131Z","submitted_at":"2024-12-30T19:00:25Z","title":"LTX-Video: Realtime Video Latent Diffusion","version":1},"cited_work":{"arxiv_id":"2501.00103","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.00103","snapshot_observed_at":"2026-07-09T07:56:04.699528Z","title":"LTX-Video: Realtime Video Latent Diffusion","venue":"cs.CV","work_id":"cee5c521-3ce9-466e-a035-1e42f89254f4","year":2024},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"cited_paper":"/paper/2501.00103","citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:bb4ab7d837ab07a93cb7ca62b3425e51b3dc5cb65aee50b509b760b0b8b57348","observation_id":"afda7481-5ba0-4838-b530-1711a28a1ee6","resolution":{"observed_at":"2026-05-19T08:02:23.451641Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-07-06T20:24:03.105038Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"cited_work":{"arxiv_id":"2501.12389","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12389","snapshot_observed_at":"2026-06-29T08:33:15.180082Z","title":"Ni, and Heung-Yeung Shum","venue":null,"work_id":"e1a95892-4377-4549-938b-cfb4947576e9","year":2025},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"cited_paper":"/paper/2501.12389","citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:86bd54c22508dbd9c62a1a8157d6805aab41cd3cb5a7c95e2e141526fd928140","observation_id":"345c7c81-7ca0-4f60-9dcd-030355ebec85","resolution":{"observed_at":"2026-05-19T08:02:23.524350Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:395128f83baf8b108203d01f9c20d8d5b2b1e09d25229604f1666e12dbba14fd","observation_id":"f6b0c620-dc27-4df5-b667-8f25f95a4d3e","resolution":{"observed_at":"2026-05-19T08:02:23.544061Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , journal =","venue":null,"work_id":"5b17f7bc-50f6-4b7c-bfda-2fce124dbde5","year":2024},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:d9cccfe47b730416e9e7f0ba65734e1788bb57194449b51b8a7c3ffc2cf37724","observation_id":"383236cd-3173-4e19-a441-9fb768e7a307","resolution":{"observed_at":"2026-05-19T08:03:01.423896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"cdc6f565-3220-4e35-85d1-ad6ae45ffbd9","year":2024},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:8f5bf3c5ea42d271e69a09bbf431a4eec40f9bf14f1f137941b239ca3267d92d","observation_id":"6bb8a284-d037-4930-b7bc-82170cd6f73a","resolution":{"observed_at":"2026-05-19T08:03:01.500827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"67a42e03-967f-4239-89cf-e445892b2012","year":2024},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:588498b6cdf522c765066cdb19b44f59ab5d17b48795b223f87c4aa724af7641","observation_id":"1e4c5300-0089-4db7-aaf8-9dda2e70d401","resolution":{"observed_at":"2026-05-19T08:03:01.356495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"826e8e0e-7541-4a21-a4dd-3d6256e1453d","year":2025},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:734890470422944f9957b9a60aafca36ad7e99ac8308ad2a5a592329fc8cc000","observation_id":"b2d931d3-ba4b-4117-8aab-26e23e1a1725","resolution":{"observed_at":"2026-05-19T08:03:01.606674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T00:04:22.826963Z","title":"Computer Science","venue":null,"work_id":"61717693-b09f-45f7-b13d-9ba3f01a0549","year":null},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:0530862ce44b652243d9593b6544df1465dbd758eb1f01d86fa70168d61b760c","observation_id":"56820fb5-a3f8-4e25-8b24-51a84497a81d","resolution":{"observed_at":"2026-05-19T08:03:01.561945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"a6bdad7c-0d89-47a8-ba58-a97d1d9c3d52","year":2024},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:021d5ab908c7a4a72d503d0d9579042f71e44eb210ed5e90114e086ae20a7800","observation_id":"04445759-84d1-4007-a6b6-aa4f445b0e57","resolution":{"observed_at":"2026-05-19T08:03:01.280640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:58:00.528796Z","title":"2023 , eprint=","venue":null,"work_id":"c332d2f2-d969-48b5-a066-429b60086332","year":2023},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:7a581eece22a63fa0203612c020ebb01facbca749715ce98098585d218fd5957","observation_id":"9e582ab3-6d34-4dbf-b892-555e7ecb7c85","resolution":{"observed_at":"2026-05-19T08:03:01.583393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"c55db5a0-f07c-4e73-9e61-83443b2446ac","year":2024},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:2fdd0cf94eba3452b71e61658b65e7dfa3a728a892b8a6af363bdedbad60bcb1","observation_id":"ec80df0b-057d-40ac-bd55-801dabc53a30","resolution":{"observed_at":"2026-05-19T08:03:01.618265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"b282d052-3a63-433d-949f-51c27fe2e80f","year":2024},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:d35307ebf75b513d30c221b8fa063350aa34c80d9c84888794b7ed27d32c0080","observation_id":"5ee362d6-1eff-4af4-a14c-8976d9597019","resolution":{"observed_at":"2026-05-19T08:03:01.337535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":"2408.06072","doi":"10.48550/arxiv.2408.06072","metadata_source":"pith","pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","venue":"cs.CV","work_id":"f38fc088-12aa-4bf4-9ecd-08d3e797ccb7","year":2024},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:2b59d410465e7046b6cb319c91a63cc2f0149772f90ab3330bd6ff7757265942","observation_id":"938b2f6f-f49b-42f9-a20e-594e48df9a9c","resolution":{"observed_at":"2026-05-19T08:02:23.981187Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , url =","venue":null,"work_id":"d7655233-6743-4371-864b-d8550cad7f99","year":2024},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:e73f703868fbe6156e3e50e25cbfb980bcddf9a9a0460401092a91f051294b3a","observation_id":"208833bf-b0ca-4eef-a99c-11d0bc2de12a","resolution":{"observed_at":"2026-05-19T08:03:01.546048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00131","last_updated":"2024-11-28T14:07:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-28T14:07:45Z","title":"Open-Sora Plan: Open-Source Large Video Generation Model","version":1},"cited_work":{"arxiv_id":"2412.00131","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.00131","snapshot_observed_at":"2026-07-08T14:44:59.776032Z","title":"Open-Sora Plan: Open-Source Large Video Generation Model","venue":"cs.CV","work_id":"51c0ab25-66f7-4d1a-a028-86b9b1b9e313","year":2024},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"cited_paper":"/paper/2412.00131","citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:4d1ab15b46de8585c187bdc0e29927b1c26f4d5f8b3276b0f0993c5d9604569c","observation_id":"7475e662-ce52-48f3-97e8-f00428f6dfd3","resolution":{"observed_at":"2026-05-19T08:02:23.993679Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"9b0326c1-7214-4796-91f1-1b4ddbced893","year":2025},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:38851fa95d71916d8240364eb9e694b6174c64a6be49fbd934bee48853bbd798","observation_id":"c90974cd-bf48-4d76-9ec8-ca9582573bcc","resolution":{"observed_at":"2026-05-19T08:03:01.573628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , journal =","venue":null,"work_id":"3c2c0ef7-ab1f-4fbb-9af5-66382617086f","year":2024},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:39020fa3457001b0f38e4bf51ed1cf86fc2daea57f4472e6f450b6f2b7a37981","observation_id":"9aea7952-175a-49e6-bf36-687b94cbb0c9","resolution":{"observed_at":"2026-05-19T08:03:01.463370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , journal =","venue":null,"work_id":"866efacd-5615-48b8-9cb8-2819fc9ce029","year":2024},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:d2d50198475e9fc4083bd3bb68261a67a4b4b1921a8d0fec0d763781593cb7ca","observation_id":"bde6ba1a-2c12-43db-a679-a77e55f9fb45","resolution":{"observed_at":"2026-05-19T08:03:01.553871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , journal =","venue":null,"work_id":"6b499657-deba-44ad-ae1c-de2164f0b7ec","year":2024},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:2a2a3d6d1464fff89583c53524b0c189c46b2bb7232b1fb8efed5419e7d6a7ab","observation_id":"9e817465-1af0-458a-8e07-2ac2c852c9de","resolution":{"observed_at":"2026-05-19T08:03:01.592156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , journal =","venue":null,"work_id":"24eb828a-a037-46b4-a751-dd69f19ce851","year":2024},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:d8e8ea2a62813e188f15e778e9bf7292b88b1248ddb27a4d5ab9464d8dad88c3","observation_id":"c86d4304-38f4-4c2a-8e98-6c088b0c8ca9","resolution":{"observed_at":"2026-05-19T08:03:01.602775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T04:46:46.773911Z","title":"2025 , eprint=","venue":null,"work_id":"1fd048bc-aa1c-449a-92ac-506d4bb23094","year":2025},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:2b17a2ba9b4933c94cf75fc89c187925b1bf88c8554b7c4a2e39f99254b18021","observation_id":"ed2c5a0d-8d5a-4d85-948a-e708b64277b1","resolution":{"observed_at":"2026-05-19T08:03:01.351674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"d55837a2-d432-4269-b263-248a62a1ba5b","year":2023},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:843cea56c3d7196b974eb1d4352e5ca43e90f71bbbf17161c531433b94578ab7","observation_id":"5cfb6c52-bd07-458c-970a-895d3de02a3e","resolution":{"observed_at":"2026-05-19T08:03:01.504512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"and Ilharco, Gabriel and Song, Shuran and Kollar, Thomas and Carmon, Yair and Dave, Achal and Heckel, Reinhard and Muennighoff, Niklas and Schmidt, Ludwig , title=","venue":null,"work_id":"24979232-8bfc-494c-85f4-60ddea654b13","year":2024},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:ad7cdfa72ded5ff67837c4bdff32b6dbf68a9642f2bf48fde2b34730ace41fb9","observation_id":"582de9a2-1b1b-41c2-a53b-f398898b442e","resolution":{"observed_at":"2026-05-19T08:03:01.528514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T15:05:03.616349Z","title":"2023 , eprint=","venue":null,"work_id":"aab8e5ca-8400-45a9-a93f-72a6e7d231da","year":2023},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:380ad4c451280b011122cc637fc01ad9164a6651d221e32da686c22b2d123922","observation_id":"5169f380-c5e0-4def-bdd1-48a43e8457ca","resolution":{"observed_at":"2026-05-19T08:03:01.530394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10403","last_updated":"2023-09-13T20:35:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T17:46:53Z","title":"PaLM 2 Technical Report","version":3},"cited_work":{"arxiv_id":"2305.10403","doi":"10.48550/arxiv.2305.10403","metadata_source":"pith","pith_arxiv_id":"2305.10403","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaLM 2 Technical Report","venue":"cs.CL","work_id":"905ee9a7-ea61-4a94-bd62-2600cbe3e315","year":2023},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"cited_paper":"/paper/2305.10403","citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:aabfa120a42dde94b18960e5a3d0dc1a88a3d816bf4debf1fd688525e7db86de","observation_id":"05f79cd2-3e60-472a-a480-73b736354cae","resolution":{"observed_at":"2026-05-19T08:02:23.360355Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.00359","last_updated":"2019-11-15T00:03:54Z","snapshot_observed_at":"2026-07-06T08:34:04.911718Z","submitted_at":"2019-11-01T13:09:28Z","title":"CCNet: Extracting High Quality Monolingual Datasets from Web Crawl Data","version":2},"cited_work":{"arxiv_id":"1911.00359","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1911.00359","snapshot_observed_at":"2026-06-28T17:02:24.078563Z","title":"Ccnet: Extracting high quality monolingual datasets from web crawl data","venue":null,"work_id":"337d24d8-4930-4d71-8336-b3a9a65537b8","year":2020},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"cited_paper":"/paper/1911.00359","citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:0bdf71d5c093df170eb9adf87549c252fbc581ae153aa247f020c7adc7ffd349","observation_id":"c6ceac81-6d16-4aeb-98e0-477ea8bbe813","resolution":{"observed_at":"2026-05-19T08:02:23.384376Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:08a6feff6686dc5eacb9e05de0d883403a1d9ef9c611184ad6c6cbdcb7821dc1","observation_id":"f66bfdee-d959-4ca7-9f0a-fdb399b09517","resolution":{"observed_at":"2026-05-19T08:02:23.391752Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":"2310.06825","doi":"10.48550/arxiv.2310.06825","metadata_source":"pith","pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mistral 7B","venue":"cs.CL","work_id":"eb5e1305-ad11-4875-ad8d-ad8b8f697599","year":2023},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:1f3cdfd60e3b5e083bbda27dfd5a9453eef4ff26bb4559e13a8646501da60a72","observation_id":"9a4bdb57-52db-44ba-84ea-5b98a6f043b1","resolution":{"observed_at":"2026-05-19T08:02:23.415092Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-02T03:08:12.282824+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T03:08:12.282824+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The Twelfth International Conference on Learning Representations , year=","venue":null,"work_id":"5fe50db1-bdec-4de4-80c6-336b6548ca74","year":null},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:4df8060bfaf25e57a39b2f2311c8b65524e7fc500b428c28d2a5a88d9633c608","observation_id":"cf5eedea-4314-42f7-bb11-311f44ac5782","resolution":{"observed_at":"2026-05-19T08:03:01.532515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e73f99c3-5631-43da-9880-6a10dbd5b897","year":null},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:51dbb16a91eb54016964aa178f7df904e8fd816fdd2887f0ee6e1add458a9be8","observation_id":"42719aa2-0294-4d5b-8abf-a17cc92315af","resolution":{"observed_at":"2026-05-19T08:03:01.459534Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"StarCoder: may the source be with you! , journal =","venue":null,"work_id":"fc72ef2b-1855-488c-8cc5-fdab252ef1a1","year":null},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:1c25247616ed0400def78c5f0cfc44f61dac050d86abc41b588b48e537e05e0f","observation_id":"52617cc4-a03e-4774-afd0-4e755f00c81d","resolution":{"observed_at":"2026-05-19T08:03:01.561011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"4b2a85e5-7934-4e57-ba32-e7ac0a26d388","year":2024},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:33b962f6968471f614ea78cc83c85c61dca6e401799201140abcd9d4c84c004d","observation_id":"80514e52-fa1d-47df-a965-6393ddb5fc42","resolution":{"observed_at":"2026-05-19T08:03:01.512343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":"2403.08295","doi":"10.48550/arxiv.2403.08295","metadata_source":"pith","pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemma: Open Models Based on Gemini Research and Technology","venue":"cs.CL","work_id":"a9ea2870-df28-40b8-a9e0-a7e9a116f793","year":2024},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:6d24baa556a5de1d3d7417c5c46be12ec362993fba52ef3970848c6d28887ee9","observation_id":"2e8c8a6a-7384-4052-9e62-380090c3f296","resolution":{"observed_at":"2026-05-19T08:02:23.571195Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":"2309.16609","doi":"10.48550/arxiv.2309.16609","metadata_source":"pith","pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen Technical Report","venue":"cs.CL","work_id":"bb1fd52f-6b2f-437c-9516-37bdf6eb9be8","year":2023},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:4209ae7c11c8ef20d36d5404c08ce125a9bf91a32cd9425a7424798ae72c6a08","observation_id":"20f033f6-595f-4f2b-9f65-8e88f1537a10","resolution":{"observed_at":"2026-05-19T08:02:23.578432Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:15.620681+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:15.620681+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"3f3f4cc5-c7ac-4193-bb0f-efa671514fa5","year":null},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:9e853f8a0b9f158d72e9e86f59e6b2253f62559b132077b9c676b2b969ed78d0","observation_id":"f8a02304-ef88-4a23-a199-55336e0b03dd","resolution":{"observed_at":"2026-05-19T08:03:01.470987Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Microsoft Research Blog , year=","venue":null,"work_id":"b6ff9f35-840a-4be5-a3bd-2770decb5259","year":null},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:be241cb22a095104323f7ec220218183d543c632d216e9814a2e48d07af8547c","observation_id":"c1a9ab32-f2c9-404c-a30e-e0f51168c90c","resolution":{"observed_at":"2026-05-19T08:03:01.556415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-02T13:11:16.882565Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":"2401.02954","doi":"10.48550/arxiv.2401.02954","metadata_source":"pith","pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","venue":"cs.CL","work_id":"01b10587-025b-499d-8ba3-7a538d24c2d6","year":2024},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:dae5ab2ff60548d6a2f795985bb8fa9f1377ce8bf9a3b5a4bbc5b70d0be4979c","observation_id":"375cea56-7ee4-46c8-8e7d-f8386e8f1a49","resolution":{"observed_at":"2026-05-19T08:02:23.605506Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-07-06T16:10:07.931347Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":"2308.12950","doi":"10.48550/arxiv.2308.12950","metadata_source":"pith","pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Code Llama: Open Foundation Models for Code","venue":"cs.CL","work_id":"e73bffa4-7620-47ac-9327-259a60db52ca","year":2023},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:3b61d2e1ae8aac101a60ef34c964e0616176be4ad0ff5e4acaab4c9349bc3f12","observation_id":"2c5cd385-a1f4-4238-929f-7be6eae0d30b","resolution":{"observed_at":"2026-05-19T08:02:23.611249Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:36.742994+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:36.742994+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.947709Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"182dfec9-e0d1-4dd0-a214-31ee386f5df3","year":null},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:c3e9bd84b2e41a964c9e281e47b73d23e4dc7476add66d139abf94b7a11ebd41","observation_id":"d37b6d8b-f2e7-4ca1-8e66-2b13acfb6b95","resolution":{"observed_at":"2026-05-19T08:03:01.536557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10631","last_updated":"2024-03-15T19:14:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-16T17:54:07Z","title":"Llemma: An Open Language Model For Mathematics","version":3},"cited_work":{"arxiv_id":"2310.10631","doi":"10.48550/arxiv.2310.10631","metadata_source":"pith","pith_arxiv_id":"2310.10631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llemma: An Open Language Model For Mathematics","venue":"cs.CL","work_id":"c0820dec-60a1-4f0c-beda-4516eb8e89c9","year":2023},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"cited_paper":"/paper/2310.10631","citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:bd0dbd4c9512c9d8a70da1c308f2d56bb97781429c72babb4da84bcf87f4d5ef","observation_id":"4f79123f-43bb-42fb-a6e8-7b6ada5e23df","resolution":{"observed_at":"2026-05-19T08:17:47.048289Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T13:53:00.912171+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T13:53:00.912171+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06332","last_updated":"2024-05-24T07:09:21Z","snapshot_observed_at":"2026-08-02T16:51:28.092644Z","submitted_at":"2024-02-09T11:22:08Z","title":"InternLM-Math: Open Math Large Language Models Toward Verifiable Reasoning","version":2},"cited_work":{"arxiv_id":"2402.06332","doi":"10.48550/arxiv.2402.06332","metadata_source":"pith","pith_arxiv_id":"2402.06332","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Internlm-math: Open math large language models toward verifiable reasoning","venue":"cs.CL","work_id":"da7fe877-735e-4436-9e53-837121a0b2d0","year":2024},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"cited_paper":"/paper/2402.06332","citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:12cb46197bd0f9920af547d7b2df9f50acc3542edf7fbc8cdbce00c1487ea8d0","observation_id":"3179ab27-421d-4ecb-b699-ce7525ad7db8","resolution":{"observed_at":"2026-05-19T08:02:23.699532Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-05T13:11:04.104454Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":"2305.20050","doi":"10.1007/bf00262952","metadata_source":"pith","pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Let's Verify Step by Step","venue":"cs.LG","work_id":"6d05b790-04c5-4fd2-91b2-ba1dfdd5770f","year":2023},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:2f4531fa637b12530cfe6e8df614adbe6b0619d5680791d725fc79a94792f4c3","observation_id":"d4b983ec-f9d8-4e09-9f41-7173e8d0315d","resolution":{"observed_at":"2026-05-19T08:02:23.712669Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The Twelfth International Conference on Learning Representations , year=","venue":null,"work_id":"e945fb52-f442-44a3-a5a5-bdd2a76b4bb4","year":null},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:9996025686bedfdb43a9dead798d5bf076941a40b65430a797fcd73a9aa0b228","observation_id":"ed18654e-3653-4deb-b6da-9f7ac6f729de","resolution":{"observed_at":"2026-05-19T08:03:01.419752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05175","last_updated":"2024-06-14T05:10:07Z","snapshot_observed_at":"2026-07-06T15:40:16.429096Z","submitted_at":"2023-06-08T13:14:35Z","title":"Large-scale Dataset Pruning with Dynamic Uncertainty","version":3},"cited_work":{"arxiv_id":"2306.05175","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.05175","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2306.05175 , year=","venue":null,"work_id":"c0b1cdc0-4912-4524-9e06-5ddd5ff25a64","year":null},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"cited_paper":"/paper/2306.05175","citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:6a3c0f1e265a46f572e6401abea86641909430a1047efd235a5bfca599c725e8","observation_id":"9f330a17-c10e-487b-8698-8375c9dbe106","resolution":{"observed_at":"2026-05-19T08:02:23.727730Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"NIPS , volume=","venue":null,"work_id":"a7d16688-a611-4070-aac7-b28f41ea9da9","year":null},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:6d7bb4641f6644de00e0d5e9c42fe3b6167efaa6e300edf491fc8a27246746a8","observation_id":"d345aa5e-0f29-4cda-83f2-4a05c6132b5c","resolution":{"observed_at":"2026-05-19T08:03:01.438254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12032","last_updated":"2024-04-06T03:52:04Z","snapshot_observed_at":"2026-07-06T16:09:28.325603Z","submitted_at":"2023-08-23T09:45:29Z","title":"From Quantity to Quality: Boosting LLM Performance with Self-Guided Data Selection for Instruction Tuning","version":5},"cited_work":{"arxiv_id":"2308.12032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.12032","snapshot_observed_at":"2026-06-29T18:33:50.119173Z","title":"arXiv preprint arXiv:2308.12032 , year=","venue":null,"work_id":"f0d3307c-50ad-4166-ad9e-bc03f4382918","year":2024},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"cited_paper":"/paper/2308.12032","citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:1d6e9a7ba896b1d4a01f3c019e9b5c6b6d998f4598a133d04eb53aacdfa0eeb0","observation_id":"755a65f1-c9ee-420e-b1de-c12ed84ad7d4","resolution":{"observed_at":"2026-05-19T08:02:23.882285Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10302","last_updated":"2024-06-03T13:46:16Z","snapshot_observed_at":"2026-08-05T20:16:00.044977Z","submitted_at":"2023-12-16T03:33:12Z","title":"One-Shot Learning as Instruction Data Prospector for Large Language Models","version":4},"cited_work":{"arxiv_id":"2312.10302","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.10302","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2312.10302 , year=","venue":null,"work_id":"89d1b23f-9935-4dfc-926e-4c33646ea329","year":null},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"cited_paper":"/paper/2312.10302","citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:e90086f398d18811e5558d6bc912faa6b0eded5eb8402e24176844543ed9d2b7","observation_id":"e19c190a-a269-4b39-bc60-e79be703cff5","resolution":{"observed_at":"2026-05-19T08:02:23.902576Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08182","last_updated":"2023-11-14T14:10:40Z","snapshot_observed_at":"2026-07-06T16:47:21.000236Z","submitted_at":"2023-11-14T14:10:40Z","title":"Self-Evolved Diverse Data Sampling for Efficient Instruction Tuning","version":1},"cited_work":{"arxiv_id":"2311.08182","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.08182","snapshot_observed_at":"2026-07-02T16:17:09.384028Z","title":"Self-evolved diverse data sampling for efficient instruction tuning","venue":null,"work_id":"df2507fa-a53a-46ea-9a47-2720c4e016d6","year":2023},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"cited_paper":"/paper/2311.08182","citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:0b224db7c10fef97b770f5c354e7aad78e9191ae302d8dddbb8f83e9b531c223","observation_id":"0b3012be-c414-4d6c-81bb-f3c4215a930a","resolution":{"observed_at":"2026-05-19T08:02:23.909152Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ICLR , year=","venue":null,"work_id":"6144cf26-18ff-4f27-bc9a-c48db44e5ba0","year":null},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":103,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:7e270c2439cea70da46754d7cae4255c384e86d456533159d12ec270b6a07030","observation_id":"510cf5ae-db2d-4c7d-a76b-282746e4a2eb","resolution":{"observed_at":"2026-05-19T08:03:01.599136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ICLR , year=","venue":null,"work_id":"bd49504c-88f9-4253-9583-cf7b3891e608","year":null},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":104,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:40b351b1989117f8ea988222f32024bd25419fe5aa2a8d0d4a166eb4518edbbf","observation_id":"85d0480e-642e-47a8-86f7-1f6c1e09f8b1","resolution":{"observed_at":"2026-05-19T08:03:01.600880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":17,"parse_uncertain":0,"unresolved":7,"verified_exact":22,"verified_fuzzy":54},"total_outbound_references":296},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 100 of 296 outbound references and 57 inbound Pith citation observations for arXiv:2502.10248."}