{"as_of":"2026-08-06T21:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8be5e0731b84a6aec5605d5414f5a2c54965f3fd0f74ad5b7ad141b05135d594","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T17:45:18.804726Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":29,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T19:47:32.951504Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-09T03:05:55.272870Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-05T17:45:13.859636Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"cited_work":{"arxiv_id":"2508.15761","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.15761","snapshot_observed_at":"2026-07-09T03:05:55.272870Z","title":"Waver: Wave your way to lifelike video generation","venue":"cs.CV","work_id":"66ede766-4152-4561-898c-408ed2f76aed","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2508.15761","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:4e7c2cf3a5f75924284bc51ddc6f364539132255d079e60c56ab585c7177d0d0","observation_id":"2ec731de-1750-4793-9558-1281b08fe6fe","resolution":{"observed_at":"2026-05-12T23:01:13.834624Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-05T17:45:13.859636Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"cited_work":{"arxiv_id":"2508.15761","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.15761","snapshot_observed_at":"2026-07-09T03:05:55.272870Z","title":"Waver: Wave your way to lifelike video generation","venue":"cs.CV","work_id":"66ede766-4152-4561-898c-408ed2f76aed","year":2025},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":3},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-11T14:08:36.801359Z"},"links":{"cited_paper":"/paper/2508.15761","citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:367fae493861dd1df9190c60273599871040ee1157844c64de66ba40ff26ae7f","observation_id":"afa14257-2158-4131-b74c-0df58f6abedb","resolution":{"observed_at":"2026-05-11T14:08:37.295924Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-05T17:45:13.859636Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.15761","snapshot_observed_at":"2026-08-03T19:47:32.951504Z","title":"Waver: Wave your way to lifelike video generation.arXiv preprint arXiv:2508.15761, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.951504Z"},"links":{"cited_paper":"/paper/2508.15761","citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:c92bf51045fb4d9cccde6fd0dbba3ac97af2709887526d619c72976af62342d9","observation_id":"724d8e93-be20-455a-9c1d-538edb4c1b6a","resolution":{"observed_at":"2026-08-03T19:47:32.951504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-05T17:45:13.859636Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.15761","snapshot_observed_at":"2026-08-03T16:26:00.037365Z","title":"Waver: Wave your way to lifelike video generation.arXiv preprint arXiv:2508.15761, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-06T20:50:45.250688Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-03T16:26:00.037365Z"},"links":{"cited_paper":"/paper/2508.15761","citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:80a7f333413a546f0c473579f8e0be1e411424e373bb33222ac9d7e02c6ed497","observation_id":"69a06d9f-05bd-435d-9b0d-efe3bfd608a5","resolution":{"observed_at":"2026-08-03T16:26:00.037365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-05T17:45:13.859636Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.15761","snapshot_observed_at":"2026-08-03T13:24:49.039779Z","title":"Waver: Wave your way to lifelike video generation.arXiv preprint arXiv:2508.15761, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.24551","last_updated":"2026-06-18T22:13:10Z","snapshot_observed_at":"2026-08-03T13:24:41.191940Z","submitted_at":"2025-12-31T01:19:14Z","title":"PhyGDPO: Physics-Aware Groupwise Direct Preference Optimization for Physically Consistent Text-to-Video Generation","version":4},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-03T13:24:49.039779Z"},"links":{"cited_paper":"/paper/2508.15761","citing_paper":"/paper/2512.24551"},"observation_digest":"sha256:b0250a56eb45a6c680833ba51f33600766b79eb5ef6305961d45b72b2cb3eef0","observation_id":"f7def069-306c-4df1-91ff-f973ef631dfa","resolution":{"observed_at":"2026-08-03T13:24:49.039779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-05T17:45:13.859636Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"cited_work":{"arxiv_id":"2508.15761","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.15761","snapshot_observed_at":"2026-07-09T03:05:55.272870Z","title":"Waver: Wave your way to lifelike video generation","venue":"cs.CV","work_id":"66ede766-4152-4561-898c-408ed2f76aed","year":2025},"citing_paper":{"arxiv_id":"2601.20540","last_updated":"2026-01-28T12:37:01Z","snapshot_observed_at":"2026-08-03T01:29:14.204066Z","submitted_at":"2026-01-28T12:37:01Z","title":"Advancing Open-source World Models","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-16T09:07:00.904794Z"},"links":{"cited_paper":"/paper/2508.15761","citing_paper":"/paper/2601.20540"},"observation_digest":"sha256:d338d89457128986a8e9b197a93d8d821928abedf832fb7fff5fcf7fa2bb6864","observation_id":"a0464ebb-e0b2-463c-bcef-8c271bf33c5f","resolution":{"observed_at":"2026-05-16T09:07:01.074955Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-05T17:45:13.859636Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.15761","snapshot_observed_at":"2026-07-15T14:00:06.859472Z","title":"CoRR abs/2508.15761(2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.06136","last_updated":"2026-06-30T13:32:05Z","snapshot_observed_at":"2026-07-15T14:00:06.335510Z","submitted_at":"2026-03-06T10:45:07Z","title":"Cross-Resolution Distribution Matching for Diffusion Distillation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-15T14:00:06.859472Z"},"links":{"cited_paper":"/paper/2508.15761","citing_paper":"/paper/2603.06136"},"observation_digest":"sha256:d5bddfd833afe4bca69eb1b817f88f195bc99e756cc339483d25f691bbb7766f","observation_id":"74026be0-9d87-44ce-a1a9-9a5eef7330d8","resolution":{"observed_at":"2026-07-15T14:00:06.859472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-05T17:45:13.859636Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.15761","snapshot_observed_at":"2026-07-13T23:09:50.674516Z","title":"arXiv preprint arXiv:2508.15761 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.17461","last_updated":"2026-06-29T18:39:41Z","snapshot_observed_at":"2026-08-01T14:43:22.307571Z","submitted_at":"2026-03-18T08:07:01Z","title":"AR-CoPO: Align Autoregressive Video Generation with Contrastive Policy Optimization","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-13T23:09:50.674516Z"},"links":{"cited_paper":"/paper/2508.15761","citing_paper":"/paper/2603.17461"},"observation_digest":"sha256:fd9f99e9b62e173bfe25f96eb90448158a9768fe3d118dba05de316adc0b0fd7","observation_id":"c1b2290d-c580-4576-8aee-2b709cf12e2c","resolution":{"observed_at":"2026-07-13T23:09:50.674516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-05T17:45:13.859636Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"cited_work":{"arxiv_id":"2508.15761","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.15761","snapshot_observed_at":"2026-07-09T03:05:55.272870Z","title":"Waver: Wave your way to lifelike video generation","venue":"cs.CV","work_id":"66ede766-4152-4561-898c-408ed2f76aed","year":2025},"citing_paper":{"arxiv_id":"2603.28489","last_updated":"2026-07-04T13:25:12Z","snapshot_observed_at":"2026-08-05T11:17:52.410204Z","submitted_at":"2026-03-30T14:23:45Z","title":"Video Generation Models as World Models: Efficient Paradigms, Architectures and Algorithms","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-14T01:35:14.878069Z"},"links":{"cited_paper":"/paper/2508.15761","citing_paper":"/paper/2603.28489"},"observation_digest":"sha256:aefa21cfdf83578cacb3fb50910fd188272b98d6ea957ffa5cc67558c01bed12","observation_id":"1b8d143b-179f-4659-9e02-c2d9ceb834b2","resolution":{"observed_at":"2026-05-14T01:38:35.796175Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-05T17:45:13.859636Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.15761","snapshot_observed_at":"2026-07-13T12:23:05.876881Z","title":"Waver: Wave your way to lifelike video genera- tion.arXiv preprint arXiv:2508.15761, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.03738","last_updated":"2026-04-04T13:50:38Z","snapshot_observed_at":"2026-08-06T04:04:52.686841Z","submitted_at":"2026-04-04T13:50:38Z","title":"Rethinking Position Embedding as a Context Controller for Multi-Reference and Multi-Shot Video Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-13T12:23:05.876881Z"},"links":{"cited_paper":"/paper/2508.15761","citing_paper":"/paper/2604.03738"},"observation_digest":"sha256:8387b329145afa931dd065f101e910870cf6bf018f26c012e25004ae97681bed","observation_id":"8b7a062e-1c68-462e-8a47-b9bc491de0e0","resolution":{"observed_at":"2026-07-13T12:23:05.876881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-05T17:45:13.859636Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"cited_work":{"arxiv_id":"2508.15761","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.15761","snapshot_observed_at":"2026-07-09T03:05:55.272870Z","title":"Waver: Wave your way to lifelike video generation","venue":"cs.CV","work_id":"66ede766-4152-4561-898c-408ed2f76aed","year":2025},"citing_paper":{"arxiv_id":"2604.07966","last_updated":"2026-04-09T08:29:29Z","snapshot_observed_at":"2026-07-06T22:57:09.435331Z","submitted_at":"2026-04-09T08:29:29Z","title":"Lighting-grounded Video Generation with Renderer-based Agent Reasoning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-10T17:34:39.848940Z"},"links":{"cited_paper":"/paper/2508.15761","citing_paper":"/paper/2604.07966"},"observation_digest":"sha256:69e03419803278e1cfeb7e21334e62ba51e9a9068a801128ed8f7aeccfe5b6b7","observation_id":"ef3b42cc-b463-44f8-b0f2-8a3b16fe52db","resolution":{"observed_at":"2026-05-11T06:36:01.794023Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-05T17:45:13.859636Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"cited_work":{"arxiv_id":"2508.15761","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.15761","snapshot_observed_at":"2026-07-09T03:05:55.272870Z","title":"Waver: Wave your way to lifelike video generation","venue":"cs.CV","work_id":"66ede766-4152-4561-898c-408ed2f76aed","year":2025},"citing_paper":{"arxiv_id":"2604.09057","last_updated":"2026-04-16T03:03:01Z","snapshot_observed_at":"2026-07-06T22:58:04.106299Z","submitted_at":"2026-04-10T07:37:03Z","title":"Tora3: Trajectory-Guided Audio-Video Generation with Physical Coherence","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-10T17:13:06.005185Z"},"links":{"cited_paper":"/paper/2508.15761","citing_paper":"/paper/2604.09057"},"observation_digest":"sha256:59dd0bdf736ce724d3d9c291b9713ecf21716c1950ec53d8cf0f8723c4cd3fd5","observation_id":"f830a2ea-8607-42d7-b7b6-95d43bb65b38","resolution":{"observed_at":"2026-05-11T07:20:58.636857Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-05T17:45:13.859636Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"cited_work":{"arxiv_id":"2508.15761","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.15761","snapshot_observed_at":"2026-07-09T03:05:55.272870Z","title":"Waver: Wave your way to lifelike video generation","venue":"cs.CV","work_id":"66ede766-4152-4561-898c-408ed2f76aed","year":2025},"citing_paper":{"arxiv_id":"2604.10103","last_updated":"2026-04-28T08:33:18Z","snapshot_observed_at":"2026-07-06T22:58:47.599383Z","submitted_at":"2026-04-11T08:54:07Z","title":"Long-Horizon Streaming Video Generation via Hybrid Attention with Decoupled Distillation","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-10T16:10:54.363560Z"},"links":{"cited_paper":"/paper/2508.15761","citing_paper":"/paper/2604.10103"},"observation_digest":"sha256:6c6ae81d5a61da6ef128cd7abe438af98ad42bfda120b99a30812acd5d94942d","observation_id":"460cc0c5-792e-4743-aac9-070b9b597dcf","resolution":{"observed_at":"2026-05-11T09:11:12.192300Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-05T17:45:13.859636Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"cited_work":{"arxiv_id":"2508.15761","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.15761","snapshot_observed_at":"2026-07-09T03:05:55.272870Z","title":"Waver: Wave your way to lifelike video generation","venue":"cs.CV","work_id":"66ede766-4152-4561-898c-408ed2f76aed","year":2025},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-08-06T16:53:42.723002Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"cited_paper":"/paper/2508.15761","citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:89ec1042d9a9066f9e48aa2e69c7bb1098fbebac38b0d60bd31641315d0444c7","observation_id":"f57c246d-ff62-4f4c-8b9f-9827500d268f","resolution":{"observed_at":"2026-05-11T11:11:00.740481Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-05T17:45:13.859636Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"cited_work":{"arxiv_id":"2508.15761","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.15761","snapshot_observed_at":"2026-07-09T03:05:55.272870Z","title":"Waver: Wave your way to lifelike video generation","venue":"cs.CV","work_id":"66ede766-4152-4561-898c-408ed2f76aed","year":2025},"citing_paper":{"arxiv_id":"2604.13030","last_updated":"2026-07-07T13:17:16Z","snapshot_observed_at":"2026-07-12T21:00:28.771955Z","submitted_at":"2026-04-14T17:59:03Z","title":"Generative Refinement Networks for Visual Synthesis","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-10T15:41:23.057949Z"},"links":{"cited_paper":"/paper/2508.15761","citing_paper":"/paper/2604.13030"},"observation_digest":"sha256:4879dadf339f6d4826025677e602725fa7eef01ad495c005125567ccee73f754","observation_id":"05dd57c0-3016-4898-bd71-06ee5d78056a","resolution":{"observed_at":"2026-05-11T10:01:03.241453Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-05T17:45:13.859636Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.15761","snapshot_observed_at":"2026-07-12T21:00:35.123495Z","title":"Zhang, H","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.13030","last_updated":"2026-07-07T13:17:16Z","snapshot_observed_at":"2026-07-12T21:00:28.771955Z","submitted_at":"2026-04-14T17:59:03Z","title":"Generative Refinement Networks for Visual Synthesis","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-12T21:00:35.123495Z"},"links":{"cited_paper":"/paper/2508.15761","citing_paper":"/paper/2604.13030"},"observation_digest":"sha256:9b44408bae7557288149c5d6014f783df494caac825a317ca9fdc7af6ba3579d","observation_id":"e49354e9-bd3e-4de8-b4f7-247b1daf69f5","resolution":{"observed_at":"2026-07-12T21:00:35.123495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-05T17:45:13.859636Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"cited_work":{"arxiv_id":"2508.15761","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.15761","snapshot_observed_at":"2026-07-09T03:05:55.272870Z","title":"Waver: Wave your way to lifelike video generation","venue":"cs.CV","work_id":"66ede766-4152-4561-898c-408ed2f76aed","year":2025},"citing_paper":{"arxiv_id":"2604.16503","last_updated":"2026-05-19T02:31:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T15:09:39Z","title":"Motif-Video 2B: Technical Report","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-10T15:50:04.001693Z"},"links":{"cited_paper":"/paper/2508.15761","citing_paper":"/paper/2604.16503"},"observation_digest":"sha256:b5e6cb42a95dc2d499a02f027d41853465f046a54c572638dbbf6d56f411a1a1","observation_id":"7dfa9c71-b93c-4ce6-9898-87eb84b6b02e","resolution":{"observed_at":"2026-05-11T09:50:58.034091Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-05T17:45:13.859636Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"cited_work":{"arxiv_id":"2508.15761","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.15761","snapshot_observed_at":"2026-07-09T03:05:55.272870Z","title":"Waver: Wave your way to lifelike video generation","venue":"cs.CV","work_id":"66ede766-4152-4561-898c-408ed2f76aed","year":2025},"citing_paper":{"arxiv_id":"2604.16503","last_updated":"2026-05-19T02:31:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T15:09:39Z","title":"Motif-Video 2B: Technical Report","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-21T00:12:23.096146Z"},"links":{"cited_paper":"/paper/2508.15761","citing_paper":"/paper/2604.16503"},"observation_digest":"sha256:3cd812fa7e650635eecef37fef4e2b78c1603a6e301be0add0d85a352b2904d6","observation_id":"d6ec98be-bf87-4ad9-afb8-7634299580ae","resolution":{"observed_at":"2026-05-21T00:13:53.012612Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-05T17:45:13.859636Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"cited_work":{"arxiv_id":"2508.15761","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.15761","snapshot_observed_at":"2026-07-09T03:05:55.272870Z","title":"Waver: Wave your way to lifelike video generation","venue":"cs.CV","work_id":"66ede766-4152-4561-898c-408ed2f76aed","year":2025},"citing_paper":{"arxiv_id":"2604.27975","last_updated":"2026-08-04T03:44:13Z","snapshot_observed_at":"2026-08-06T21:32:51.919603Z","submitted_at":"2026-04-30T15:05:06Z","title":"TransVLM: A Vision-Language Framework and Benchmark for Detecting Any Shot Transitions","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-07T07:23:19.988849Z"},"links":{"cited_paper":"/paper/2508.15761","citing_paper":"/paper/2604.27975"},"observation_digest":"sha256:b4f1cd6f8f6dcf3793ce400f067c427724b86049ca0cecfcd687d1fbf23d61e8","observation_id":"fe210a9c-e21c-4fd8-b67c-67dff23bf69e","resolution":{"observed_at":"2026-05-12T10:11:27.866845Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-05T17:45:13.859636Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"cited_work":{"arxiv_id":"2508.15761","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.15761","snapshot_observed_at":"2026-07-09T03:05:55.272870Z","title":"Waver: Wave your way to lifelike video generation","venue":"cs.CV","work_id":"66ede766-4152-4561-898c-408ed2f76aed","year":2025},"citing_paper":{"arxiv_id":"2605.11424","last_updated":"2026-05-12T02:20:31Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T02:20:31Z","title":"VidSplat: Gaussian Splatting Reconstruction with Geometry-Guided Video Diffusion Priors","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:29.091220Z"},"links":{"cited_paper":"/paper/2508.15761","citing_paper":"/paper/2605.11424"},"observation_digest":"sha256:d66b31bd4378b7dd520fc1288093557950eb662d41b9a48691f01a645170b759","observation_id":"e125ad3b-41a2-4b01-b81b-3aa149dd8eab","resolution":{"observed_at":"2026-05-13T02:02:06.263905Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-05T17:45:13.859636Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"cited_work":{"arxiv_id":"2508.15761","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.15761","snapshot_observed_at":"2026-07-09T03:05:55.272870Z","title":"Waver: Wave your way to lifelike video generation","venue":"cs.CV","work_id":"66ede766-4152-4561-898c-408ed2f76aed","year":2025},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":170,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"cited_paper":"/paper/2508.15761","citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:3f6d18455712da6276b3ed67c72ba215dce5f67382739bdd93a3021de6fc42f4","observation_id":"017a3a1c-fcfc-409c-a640-767bee151a10","resolution":{"observed_at":"2026-05-20T15:08:24.970555Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-05T17:45:13.859636Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"cited_work":{"arxiv_id":"2508.15761","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.15761","snapshot_observed_at":"2026-07-09T03:05:55.272870Z","title":"Waver: Wave your way to lifelike video generation","venue":"cs.CV","work_id":"66ede766-4152-4561-898c-408ed2f76aed","year":2025},"citing_paper":{"arxiv_id":"2605.22344","last_updated":"2026-05-21T11:30:29Z","snapshot_observed_at":"2026-07-06T23:32:39.761431Z","submitted_at":"2026-05-21T11:30:29Z","title":"Bernini: Latent Semantic Planning for Video Diffusion","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-22T06:39:47.124605Z"},"links":{"cited_paper":"/paper/2508.15761","citing_paper":"/paper/2605.22344"},"observation_digest":"sha256:be4b54b5e936aeab0590471024d0ecd2765acfb093826900772c6a146352ce43","observation_id":"7e63cd84-1de8-434d-a21a-23d8a9d49d03","resolution":{"observed_at":"2026-05-22T06:41:10.620741Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-05T17:45:13.859636Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"cited_work":{"arxiv_id":"2508.15761","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.15761","snapshot_observed_at":"2026-07-09T03:05:55.272870Z","title":"Waver: Wave your way to lifelike video generation","venue":"cs.CV","work_id":"66ede766-4152-4561-898c-408ed2f76aed","year":2025},"citing_paper":{"arxiv_id":"2605.25801","last_updated":"2026-05-25T12:50:49Z","snapshot_observed_at":"2026-08-04T22:07:46.519643Z","submitted_at":"2026-05-25T12:50:49Z","title":"PixelWizard: Towards Efficient High-Fidelity Video Generation at Ultra-Large Spatial Resolution","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T22:24:50.679950Z"},"links":{"cited_paper":"/paper/2508.15761","citing_paper":"/paper/2605.25801"},"observation_digest":"sha256:44d411cd76721430fa05920ea9fbb1469dc69cdebc1b2c6dca9a0be3e4c785ed","observation_id":"6d74e465-049d-4443-9d18-b245d4c3d6aa","resolution":{"observed_at":"2026-06-29T22:34:02.328146Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-05T17:45:13.859636Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"cited_work":{"arxiv_id":"2508.15761","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.15761","snapshot_observed_at":"2026-07-09T03:05:55.272870Z","title":"Waver: Wave your way to lifelike video generation","venue":"cs.CV","work_id":"66ede766-4152-4561-898c-408ed2f76aed","year":2025},"citing_paper":{"arxiv_id":"2606.09150","last_updated":"2026-06-08T07:45:03Z","snapshot_observed_at":"2026-08-02T23:32:24.283446Z","submitted_at":"2026-06-08T07:45:03Z","title":"Ultra Flash: Scaling Real-Time Streaming Video Generation to High Resolutions","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-06-27T17:07:57.743780Z"},"links":{"cited_paper":"/paper/2508.15761","citing_paper":"/paper/2606.09150"},"observation_digest":"sha256:55e32dd49c5720f53ee892d2f415824c2dc7a7efe2aa5aebaf8290f092ea4abf","observation_id":"bda1453a-9189-450d-9437-068066c8be79","resolution":{"observed_at":"2026-07-03T00:37:29.790989Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-05T17:45:13.859636Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"cited_work":{"arxiv_id":"2508.15761","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.15761","snapshot_observed_at":"2026-07-09T03:05:55.272870Z","title":"Waver: Wave your way to lifelike video generation","venue":"cs.CV","work_id":"66ede766-4152-4561-898c-408ed2f76aed","year":2025},"citing_paper":{"arxiv_id":"2606.09803","last_updated":"2026-06-08T17:54:10Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:54:10Z","title":"Echo-Memory: A Controlled Study of Memory in Action World Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-27T16:58:37.552036Z"},"links":{"cited_paper":"/paper/2508.15761","citing_paper":"/paper/2606.09803"},"observation_digest":"sha256:d7667f8fe093150cb3cbeebe0a7a04a0878adc8ccf6f9e23bec5dc065919deaf","observation_id":"73db4c88-2445-4413-a343-7a9576d996a7","resolution":{"observed_at":"2026-07-03T00:57:29.723430Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-05T17:45:13.859636Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"cited_work":{"arxiv_id":"2508.15761","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.15761","snapshot_observed_at":"2026-07-09T03:05:55.272870Z","title":"Waver: Wave your way to lifelike video generation","venue":"cs.CV","work_id":"66ede766-4152-4561-898c-408ed2f76aed","year":2025},"citing_paper":{"arxiv_id":"2606.11969","last_updated":"2026-06-10T11:49:54Z","snapshot_observed_at":"2026-07-06T23:50:58.297354Z","submitted_at":"2026-06-10T11:49:54Z","title":"SpecLoR: Spectral Lookahead Rectification for Motion-Coherent Text-to-Video Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T10:00:35.608696Z"},"links":{"cited_paper":"/paper/2508.15761","citing_paper":"/paper/2606.11969"},"observation_digest":"sha256:e3b0f8cf57116f818c53b8d6592c487fd4bec8dec1bfbef641b590eddf0bd6ec","observation_id":"63a135e4-d96a-439a-bef6-39a275429530","resolution":{"observed_at":"2026-07-03T10:27:56.781123Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-05T17:45:13.859636Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"cited_work":{"arxiv_id":"2508.15761","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.15761","snapshot_observed_at":"2026-07-09T03:05:55.272870Z","title":"Waver: Wave your way to lifelike video generation","venue":"cs.CV","work_id":"66ede766-4152-4561-898c-408ed2f76aed","year":2025},"citing_paper":{"arxiv_id":"2607.02508","last_updated":"2026-07-02T17:59:25Z","snapshot_observed_at":"2026-07-07T00:07:56.573640Z","submitted_at":"2026-07-02T17:59:25Z","title":"From SRA to Self-Flow: Data Augmentation or Self-Supervision?","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-03T14:36:59.833888Z"},"links":{"cited_paper":"/paper/2508.15761","citing_paper":"/paper/2607.02508"},"observation_digest":"sha256:f7e2bd9f216391a1a588b458c188a0fe52dc9e3cb1e4cfb1452d7382646bc332","observation_id":"a8b6befd-1d55-4b6c-9bf4-1f6be096a925","resolution":{"observed_at":"2026-07-03T14:38:28.524304Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-05T17:45:13.859636Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"cited_work":{"arxiv_id":"2508.15761","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.15761","snapshot_observed_at":"2026-07-09T03:05:55.272870Z","title":"Waver: Wave your way to lifelike video generation","venue":"cs.CV","work_id":"66ede766-4152-4561-898c-408ed2f76aed","year":2025},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":126,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2508.15761","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:f15826df28d7a6efba9922c6f5669e52a94848dd1bf0ccf0ff44c7cf6d8737e6","observation_id":"f172601b-48aa-4ad6-b7bd-afa478460c50","resolution":{"observed_at":"2026-07-09T03:05:55.274339Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-05T17:45:13.859636Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.15761","snapshot_observed_at":"2026-08-02T00:50:15.025146Z","title":"Waver: Wave your way to lifelike video genera- tion.arXiv preprint arXiv:2508.15761, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14898","last_updated":"2026-07-16T12:16:12Z","snapshot_observed_at":"2026-08-05T01:57:13.746101Z","submitted_at":"2026-07-16T12:16:12Z","title":"FlashDecoder: Real-Time Latent-to-Pixel Streaming Decoder with Transformers","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-02T00:50:15.025146Z"},"links":{"cited_paper":"/paper/2508.15761","citing_paper":"/paper/2607.14898"},"observation_digest":"sha256:b46870fc59db13c06dcacf2f5d91e89e52a653eb69f26ae1ec9460f8a142b35a","observation_id":"33a20100-4cd2-4fee-b357-e81e9704422f","resolution":{"observed_at":"2026-08-02T00:50:15.025146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.15761/citation-record","integrity":"/paper/2508.15761/integrity","json":"/paper/2508.15761/citation-record.json","paper":"/paper/2508.15761"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T17:45:15.528428Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-05T17:45:13.859636Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:15.528428Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2508.15761"},"observation_digest":"sha256:e711f9cd119770bb8d5320e366be5f9891afe020fcb8d5d09bf2edd7942d4cae","observation_id":"226220b2-90e0-47c3-b698-94e527d40c43","resolution":{"observed_at":"2026-08-05T17:45:15.528428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-05T17:45:15.814084Z","title":"PySceneDetect Developers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-05T17:45:13.859636Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:15.814084Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2508.15761"},"observation_digest":"sha256:8f092456ed748f159b5b35e1259ecc913b646737964af3f4907b0d7767176115","observation_id":"29f60b2f-b7e1-4c2f-bdf4-70a7f90b8028","resolution":{"observed_at":"2026-08-05T17:45:15.814084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-02T11:56:15.393496Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-08-05T17:45:16.195972Z","title":"Emu video: Factorizing text-to-video generation by explicit image conditioning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-05T17:45:13.859636Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:16.195972Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2508.15761"},"observation_digest":"sha256:9a7adadfe511d3e2019ec873a8695b589874410cee8f0844d4badb41c6c558f7","observation_id":"aca4e05c-c417-4e7a-8288-279394392d66","resolution":{"observed_at":"2026-08-05T17:45:16.195972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T17:45:16.523471Z","title":"Hunyuanvideo: A systematic framework for large video generative models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-05T17:45:13.859636Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:16.523471Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2508.15761"},"observation_digest":"sha256:7f618272a19bf409a85bdfc640e44193d5a8078fcb0fa1a60baf3ff023f0e57f","observation_id":"9c3efc15-a793-4aea-914f-7e338b8d88e8","resolution":{"observed_at":"2026-08-05T17:45:16.523471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.02027","last_updated":"2022-10-05T20:14:52Z","snapshot_observed_at":"2026-08-06T06:13:52.132620Z","submitted_at":"2021-06-29T04:37:23Z","title":"Efficient Sequence Packing without Cross-contamination: Accelerating Large Language Models without Impacting Performance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.02027","snapshot_observed_at":"2026-08-05T17:45:16.689526Z","title":"Efficient sequence packing without cross-contamination: Accelerating large language models without impacting performance","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-05T17:45:13.859636Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:16.689526Z"},"links":{"cited_paper":"/paper/2107.02027","citing_paper":"/paper/2508.15761"},"observation_digest":"sha256:c031cbb0e9cbdd2a5db72c4d25c15b2741cfca71c1df95f2971aab686ac62104","observation_id":"48cf2f30-7492-45c9-9d93-73bd329978ad","resolution":{"observed_at":"2026-08-05T17:45:16.689526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19901","last_updated":"2025-06-03T07:32:50Z","snapshot_observed_at":"2026-07-06T21:30:37.657153Z","submitted_at":"2025-05-26T12:29:34Z","title":"Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19901","snapshot_observed_at":"2026-08-05T17:45:17.010883Z","title":"Dynamic-i2v: Exploring image-to-video generaion models via multimodal llm","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-05T17:45:13.859636Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:17.010883Z"},"links":{"cited_paper":"/paper/2505.19901","citing_paper":"/paper/2508.15761"},"observation_digest":"sha256:7a76a5c2125e02f3a431dab5869de53f5f651b3b52935ef316c1c888f77922fd","observation_id":"e30efa21-81b8-40a6-877a-7caca3d92cd3","resolution":{"observed_at":"2026-08-05T17:45:17.010883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-05T17:45:17.186768Z","title":"Step-video-t2v technical report: The practice, challenges, and future of video foundation model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-05T17:45:13.859636Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:17.186768Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2508.15761"},"observation_digest":"sha256:74fa0d4ad32c92ac06bd093d8bc08039ea8b64a2c633317d272649c8cda472b8","observation_id":"8802044d-ba60-45f8-967f-f8ae9eaab0df","resolution":{"observed_at":"2026-08-05T17:45:17.186768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:45:19.515047Z","title":"Hailuo ai","venue":null,"work_id":"f4d9fef2-3b17-4e32-b531-3e3d16e1c73e","year":2024},"citing_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-05T17:45:13.859636Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:17.285746Z"},"links":{"citing_paper":"/paper/2508.15761"},"observation_digest":"sha256:30c5341182ba52cb6ed4008e5ac4a269e18ee6d055f205e2fbe53e742a20d782","observation_id":"79c87ae4-084b-41f5-bd5e-b9b8a3c5c147","resolution":{"observed_at":"2026-08-05T17:45:19.626763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-05T17:45:17.413925Z","title":"30 Maxime Oquab, Timoth ´ee Darcet, Th ´eo Moutakanni, Huy V o, Marc Szafraniec, Vasil Khalidov, Pierre Fernandez, Daniel Haziza, Francisco Massa, Alaaeldin El-Nouby, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-05T17:45:13.859636Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:17.413925Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2508.15761"},"observation_digest":"sha256:30127dbdd2e3b6516beb610a4fc2923a0ad4658b2c397830d5f45c615dd757c7","observation_id":"1ea84731-27d7-4cd0-801d-bd71dc483a8a","resolution":{"observed_at":"2026-08-05T17:45:17.413925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13228","last_updated":"2024-07-03T13:46:33Z","snapshot_observed_at":"2026-07-31T05:05:41.080329Z","submitted_at":"2024-02-20T18:42:34Z","title":"Smaug: Fixing Failure Modes of Preference Optimisation with DPO-Positive","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13228","snapshot_observed_at":"2026-08-05T17:45:17.535213Z","title":"Smaug: Fixing failure modes of preference optimisation with dpo-positive","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-05T17:45:13.859636Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:17.535213Z"},"links":{"cited_paper":"/paper/2402.13228","citing_paper":"/paper/2508.15761"},"observation_digest":"sha256:db7253be1efd12248b795813576364300a98db81f5a3c59cebb72b547e692561","observation_id":"f2145317-0aed-439a-9cf4-e6695c4a1e6b","resolution":{"observed_at":"2026-08-05T17:45:17.535213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T17:45:17.695941Z","title":"Sampson, Shikai Li, Simone Parmeggiani, Steve Fine, Tara Fowler, Vladan Petrovic, and Yuming Du","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-05T17:45:13.859636Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:17.695941Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2508.15761"},"observation_digest":"sha256:c920d5bc75dd2a503c1c6a85284864cdd47d1fe58a0bbb38b90020c7b4cebd3a","observation_id":"48bb1691-4b6f-40c7-be7f-ab8867cea4cc","resolution":{"observed_at":"2026-08-05T17:45:17.695941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-05T17:45:17.827192Z","title":"github.io/blog/qwen2.5/","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-05T17:45:13.859636Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:17.827192Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2508.15761"},"observation_digest":"sha256:90080576f708284b20e187cec31e7a7438981fb6e9576a5d674225b59c20f75d","observation_id":"0bff7d6b-331b-4f6f-bbfb-7a86c7208d8b","resolution":{"observed_at":"2026-08-05T17:45:17.827192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08685","last_updated":"2025-05-05T03:31:30Z","snapshot_observed_at":"2026-07-06T21:08:01.403325Z","submitted_at":"2025-04-11T16:46:20Z","title":"Seaweed-7B: Cost-Effective Training of Video Generation Foundation Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08685","snapshot_observed_at":"2026-08-05T17:45:17.936676Z","title":"Seaweed-7b: Cost-effective training of video generation foundation model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-05T17:45:13.859636Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:17.936676Z"},"links":{"cited_paper":"/paper/2504.08685","citing_paper":"/paper/2508.15761"},"observation_digest":"sha256:4a7eac3347f9c236611652a81ef62b9cfd9c4cf878b1d209ccd27a37779e50b2","observation_id":"791f305a-286a-49ef-9a59-252815a6f1cc","resolution":{"observed_at":"2026-08-05T17:45:17.936676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-05T17:45:18.066481Z","title":"Make-a-video: Text-to-video generation without text-video data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-05T17:45:13.859636Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:18.066481Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2508.15761"},"observation_digest":"sha256:f557f0b94929da64c49d9a1e972b733193561ac4547cba4f4b54d361829632ff","observation_id":"0423f17c-b210-4268-8714-307b2a5d542a","resolution":{"observed_at":"2026-08-05T17:45:18.066481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-05T17:45:18.253935Z","title":"Wan: Open and advanced large-scale video generative models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-05T17:45:13.859636Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:18.253935Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2508.15761"},"observation_digest":"sha256:72f9ab97cd7661d5bd3a7e9a80cc56e80557516a5a17b2eb6dcccddbbdc99d9e","observation_id":"9397843b-5d02-4af3-aca3-cdf744ffc7d5","resolution":{"observed_at":"2026-08-05T17:45:18.253935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01776","last_updated":"2025-04-27T00:10:11Z","snapshot_observed_at":"2026-08-06T01:54:01.546928Z","submitted_at":"2025-02-03T19:29:16Z","title":"Sparse VideoGen: Accelerating Video Diffusion Transformers with Spatial-Temporal Sparsity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01776","snapshot_observed_at":"2026-08-05T17:45:18.378641Z","title":"Sparse videogen: Accelerating video diffusion transformers with spatial-temporal sparsity","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-05T17:45:13.859636Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:18.378641Z"},"links":{"cited_paper":"/paper/2502.01776","citing_paper":"/paper/2508.15761"},"observation_digest":"sha256:3f0835dceea579579f86a6da7499f42dabdd1d0088717f133fc657014fc1daad","observation_id":"12b00058-715c-45e1-8ef1-64774960aa2a","resolution":{"observed_at":"2026-08-05T17:45:18.378641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06940","last_updated":"2025-06-18T04:35:42Z","snapshot_observed_at":"2026-07-06T19:30:26.233621Z","submitted_at":"2024-10-09T14:34:53Z","title":"Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06940","snapshot_observed_at":"2026-08-05T17:45:18.483329Z","title":"Representation alignment for generation: Training diffusion transformers is easier than you think","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-05T17:45:13.859636Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:18.483329Z"},"links":{"cited_paper":"/paper/2410.06940","citing_paper":"/paper/2508.15761"},"observation_digest":"sha256:f5519a50c274e9f80477f96018160d443048e7bb7b33c5871a5261ad495b0d82","observation_id":"ba3ff05f-ba9c-4f32-8382-bb3f97fe32d5","resolution":{"observed_at":"2026-08-05T17:45:18.483329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11089","last_updated":"2025-02-27T09:01:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-16T11:53:44Z","title":"Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11089","snapshot_observed_at":"2026-08-05T17:45:18.593714Z","title":"Native sparse attention: Hardware-aligned and natively trainable sparse attention","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-05T17:45:13.859636Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:18.593714Z"},"links":{"cited_paper":"/paper/2502.11089","citing_paper":"/paper/2508.15761"},"observation_digest":"sha256:a8c2590b9ca8da90e7b08ad153c5e3941ea88f515b753e633093ca811010c097","observation_id":"2c1423fe-0f48-4d68-a5a3-2235c768027d","resolution":{"observed_at":"2026-08-05T17:45:18.593714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:45:18.804726Z","title":"Flashvideo: Flowing fidelity to detail for efficient high-resolution video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-05T17:45:13.859636Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:18.804726Z"},"links":{"citing_paper":"/paper/2508.15761"},"observation_digest":"sha256:f76ef0998656e54372da761d35997e34d994bb120deb2d02d021bb61befb7c35","observation_id":"d469f362-5453-4e52-a8a0-cbbd57fde73c","resolution":{"observed_at":"2026-08-05T17:45:18.804726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-07-06T21:25:37.773959Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12082","snapshot_observed_at":"2026-08-05T17:45:16.870761Z","title":"Kling ai","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-05T17:45:13.859636Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:16.870761Z"},"links":{"cited_paper":"/paper/2505.12082","citing_paper":"/paper/2508.15761"},"observation_digest":"sha256:c549246a5e73dce9861edba8bd58c28c6bb2fb0c1f177dfe0b9da1a76f83abb4","observation_id":"a7a559c1-04ee-4264-b5dd-27d1d9222cd3","resolution":{"observed_at":"2026-08-05T17:45:16.870761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-05T17:45:18.719721Z","title":"Videollama 3: Frontier multimodal foundation models for image and video understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-05T17:45:13.859636Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:18.719721Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2508.15761"},"observation_digest":"sha256:c8f24d06986e44aedbe8bb02fed70ebadef558e1a7f126a5a24955dbe96224b5","observation_id":"4079c802-1bfc-48cb-a090-f15b58496c65","resolution":{"observed_at":"2026-08-05T17:45:18.719721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14509","last_updated":"2023-10-04T16:51:13Z","snapshot_observed_at":"2026-08-04T19:27:31.715261Z","submitted_at":"2023-09-25T20:15:57Z","title":"DeepSpeed Ulysses: System Optimizations for Enabling Training of Extreme Long Sequence Transformer Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14509","snapshot_observed_at":"2026-08-05T17:45:16.350493Z","title":"Deepspeed ulysses: System optimizations for enabling training of extreme long sequence transformer models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-05T17:45:13.859636Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:16.350493Z"},"links":{"cited_paper":"/paper/2309.14509","citing_paper":"/paper/2508.15761"},"observation_digest":"sha256:0acb33b10d965e7f117f90a76abd388fe57c24a8412bc1e6c38bd1b563e62473","observation_id":"8e5e46f2-c9c1-468c-a94c-b0bd202b0d52","resolution":{"observed_at":"2026-08-05T17:45:16.350493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09113","last_updated":"2025-06-28T11:58:23Z","snapshot_observed_at":"2026-08-01T16:09:18.068564Z","submitted_at":"2025-06-10T17:56:11Z","title":"Seedance 1.0: Exploring the Boundaries of Video Generation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09113","snapshot_observed_at":"2026-08-05T17:45:15.982889Z","title":"Seedance 1.0: Exploring the boundaries of video generation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-05T17:45:13.859636Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:15.982889Z"},"links":{"cited_paper":"/paper/2506.09113","citing_paper":"/paper/2508.15761"},"observation_digest":"sha256:a6a0adc0d723e26ce4a7f628921376a302603b00c1b00b5799455a5c96c20b16","observation_id":"b7f756f0-ecec-4166-a009-15f843b2d8bf","resolution":{"observed_at":"2026-08-05T17:45:15.982889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T17:45:15.674581Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-05T17:45:13.859636Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:15.674581Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2508.15761"},"observation_digest":"sha256:4e113ec9b66c460ce3a1f7c20abb72c91350b4b2eb80f8cef12af9950869d7a9","observation_id":"310ae5f6-3c4a-4377-ba74-47e45b4d10fb","resolution":{"observed_at":"2026-08-05T17:45:15.674581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-05T17:45:13.859636Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 29 inbound Pith citation observations for arXiv:2508.15761."}