{"as_of":"2026-08-02T14:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f3c1248009f094953cca951b739285d1db62c11ba0b17bb57cb0fe7614061aac","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-07T16:54:23.108142Z","state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-02T06:30:47.504484+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T17:08:12.280455Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.25819","snapshot_observed_at":"2026-07-31T17:08:12.280455Z","title":"arXiv preprint arXiv:2604.25819 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-07-31T17:08:09.777649Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:12.280455Z"},"links":{"cited_paper":"/paper/2604.25819","citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:279ef435cd74fb9003cb59396d1b08d3e40a1b7f09497bc0109aff1e55983101","observation_id":"c5b24e07-50b4-45b5-83b0-022cd6e8aa5b","resolution":{"observed_at":"2026-07-31T17:08:12.280455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2604.25819/citation-record","integrity":"/paper/2604.25819/integrity","json":"/paper/2604.25819/citation-record.json","paper":"/paper/2604.25819"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.22554","last_updated":"2025-07-01T01:02:44Z","snapshot_observed_at":"2026-07-06T21:48:54.170606Z","submitted_at":"2025-06-27T18:09:49Z","title":"Seamless Interaction: Dyadic Audiovisual Motion Modeling and Large-Scale Dataset","version":2},"cited_work":{"arxiv_id":"2506.22554","doi":"10.48550/arxiv.2506.22554","metadata_source":"pith","pith_arxiv_id":"2506.22554","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Seam- less interaction: Dyadic audiovisual motion modeling and large-scale dataset","venue":"cs.CV","work_id":"bd72e66a-91a8-4a2d-a45c-b91cc08c2ab3","year":2025},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"cited_paper":"/paper/2506.22554","citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:c039883a7c887dfb101b775e0df2ab01b09c669cfda3b2918933603e20272ca4","observation_id":"9483e7d1-ecde-4a64-9a8d-a154ed9e87c4","resolution":{"observed_at":"2026-05-11T23:31:14.745066Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04051","last_updated":"2024-07-11T02:08:35Z","snapshot_observed_at":"2026-07-06T18:41:40.732196Z","submitted_at":"2024-07-04T16:49:02Z","title":"FunAudioLLM: Voice Understanding and Generation Foundation Models for Natural Interaction Between Humans and LLMs","version":3},"cited_work":{"arxiv_id":"2407.04051","doi":"10.48550/arxiv.2407.04051","metadata_source":"pith","pith_arxiv_id":"2407.04051","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Funaudiollm: Voice understanding and generation foundation models for natural interaction between humans and llms.arXiv preprint arXiv:2407.04051","venue":"cs.SD","work_id":"7cd6d289-dca2-414f-99e0-809f37c065fa","year":2024},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"cited_paper":"/paper/2407.04051","citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:3be42eeef5df7f0165972f9cc5257a4b64e5029ff170e425436d10812de9f58b","observation_id":"e4937179-044e-4778-9299-34a27c131827","resolution":{"observed_at":"2026-05-11T23:31:14.621422Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:52.218158+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:52.218158+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1080/10494820.2024.2414152","metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:27:53.392513Z","title":"Genie: Generative interactive environments","venue":"Interactive Learning Environments","work_id":"6c633c28-756b-4f8a-b31e-d5ac37197f04","year":2024},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:43de28286e1b1458621dc135bb557fc75049c51d97c5c7a5b6fb980054fac1bb","observation_id":"63ea7ca0-06c5-4fa6-afe1-46caed50243d","resolution":{"observed_at":"2026-05-27T01:38:40.451204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffusion forcing: Next-token prediction meets full-sequence diffusion.Advances in Neural Information Processing Systems, 37:24081–24125","venue":null,"work_id":"344378a4-d441-4437-90cf-8faa8f536cff","year":2024},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:4849283b3fefc27efdeb93f24145477632a423f2cd6873f708236088d3f33adf","observation_id":"11183744-dcdc-4caf-8842-9add4b4aa067","resolution":{"observed_at":"2026-05-27T01:38:40.426402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13074","last_updated":"2025-04-21T10:34:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-17T16:37:27Z","title":"SkyReels-V2: Infinite-length Film Generative Model","version":3},"cited_work":{"arxiv_id":"2504.13074","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.13074","snapshot_observed_at":"2026-07-10T01:46:41.058772Z","title":"SkyReels-V2: Infinite-length Film Generative Model","venue":"cs.CV","work_id":"2ce11350-273e-4f0d-ae78-292aa3151060","year":2025},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"cited_paper":"/paper/2504.13074","citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:bde00351aa5d438304cf6dd166a03b8a396158e402c9152160319bb000007efc","observation_id":"5608cb4f-9f2c-4b1f-a238-2a3e90616bda","resolution":{"observed_at":"2026-05-14T20:23:04.486750Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Panda-70m: Captioning 70m videos with multiple cross- modality teachers","venue":null,"work_id":"5a12fbec-c63a-4720-a55f-b404f8a924d3","year":2024},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:8b45cf6d263c2cc54778f5045e2940af8ed9ca0388e65b4c3a0acddd2fc056b0","observation_id":"f10ab449-5950-4997-aa66-81ecd43ccdc3","resolution":{"observed_at":"2026-05-27T01:38:39.903640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Out of time: automated lip sync in the wild","venue":null,"work_id":"25cf9179-5fe9-4e6c-ba83-b0c1678a003d","year":2016},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:ddcd75186e4bf8b9869df63b32835f79a498135262d1da4e8409a779f6f529b4","observation_id":"06ccb3b0-3007-403b-b9e3-ccaca911d14d","resolution":{"observed_at":"2026-05-27T01:38:39.907186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.02283","last_updated":"2025-10-02T17:55:42Z","snapshot_observed_at":"2026-08-02T07:40:05.046770Z","submitted_at":"2025-10-02T17:55:42Z","title":"Self-Forcing++: Towards Minute-Scale High-Quality Video Generation","version":1},"cited_work":{"arxiv_id":"2510.02283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.02283","snapshot_observed_at":"2026-07-08T13:14:53.231711Z","title":"Self-Forcing++: Towards Minute-Scale High-Quality Video Generation","venue":"cs.CV","work_id":"3b83d5f5-6929-46ae-9de2-7c32af3c7346","year":2025},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"cited_paper":"/paper/2510.02283","citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:f9b55ed5fd59bee7fb539df83d74b1df3c5ae6cac6e555a002053704672dc720","observation_id":"238f6a01-a0a2-4728-9bd7-0a7495a9d4c7","resolution":{"observed_at":"2026-05-15T22:39:54.578381Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stable audio open","venue":null,"work_id":"4d727099-d2f6-4961-bf4d-3efcb7695539","year":2025},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:3fd9d29d883ccdc8c7f9d4cb6e72ad2a26db15c43b3fcf8686be9c11e708daee","observation_id":"6c39ea89-43a9-4031-a060-bd2288889756","resolution":{"observed_at":"2026-05-27T01:38:39.887095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.27684","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T01:07:45.294136Z","title":"Phased dmd: Few-step distribution matching distillation via score matching within subintervals.arXiv preprint arXiv:2510.27684","venue":null,"work_id":"438b7a67-4d0f-48fe-aa35-debbef88f1f7","year":2025},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:25b97653ad82106dae895a1d12445fc544eabf19a09a1bf37ec0dcb9748477ae","observation_id":"6b29502d-9a96-4714-a627-086ad4d3fd45","resolution":{"observed_at":"2026-05-11T23:31:14.730777Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12557","last_updated":"2025-06-23T14:26:35Z","snapshot_observed_at":"2026-07-06T19:34:32.629776Z","submitted_at":"2024-10-16T13:34:40Z","title":"One Step Diffusion via Shortcut Models","version":3},"cited_work":{"arxiv_id":"2410.12557","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.12557","snapshot_observed_at":"2026-07-04T17:09:58.784233Z","title":"One Step Diffusion via Shortcut Models","venue":"cs.LG","work_id":"4017f821-b436-40dd-a38d-0b3bb52f7d99","year":2024},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"cited_paper":"/paper/2410.12557","citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:f0dc18dde1b8305717a5957f807b8198675880dc6b1aed0cfe5ceb3916a4cdb1","observation_id":"ca8f6667-f31d-48c6-ab2b-35604bb8e0b5","resolution":{"observed_at":"2026-05-15T06:40:55.602339Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18866","last_updated":"2025-06-23T17:33:03Z","snapshot_observed_at":"2026-07-06T21:46:30.250293Z","submitted_at":"2025-06-23T17:33:03Z","title":"OmniAvatar: Efficient Audio-Driven Avatar Video Generation with Adaptive Body Animation","version":1},"cited_work":{"arxiv_id":"2506.18866","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18866","snapshot_observed_at":"2026-07-05T12:41:04.353072Z","title":"Jianzhu Guo, Dingyun Zhang, Xiaoqiang Liu, Zhizhou Zhong, Yuan Zhang, Pengfei Wan, and Di Zhang","venue":"cs.CV","work_id":"39a3b79f-ec88-448d-a078-0ca1e7f561bc","year":2025},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"cited_paper":"/paper/2506.18866","citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:16776ea1d6221068f585509b246b0ca5d1daa905d6b86b74f515c46667e6d1a6","observation_id":"5eed8259-7bb5-4bd3-8c7d-6fdfe4dc5f2e","resolution":{"observed_at":"2026-05-11T23:31:15.014324Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-07-06T22:18:40.868747Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":"2508.18621","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-07-03T14:48:32.703864Z","title":"Wan-s2v: Audio-driven cinematic video generation","venue":null,"work_id":"8c249dee-f8a5-4481-b937-c63159956885","year":2025},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:80d67765177ad31ad28cad578d80a39bafde4cad53eca3f11c4ed9400bfb6fbf","observation_id":"3ea3c7b8-d52c-47e6-9c48-0973c96485da","resolution":{"observed_at":"2026-05-11T23:31:14.635424Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Long video generation with time-agnostic vqgan and time-sensitive transformer","venue":null,"work_id":"df9ea3ce-386f-4f89-a66b-959ecca941ae","year":2022},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:0aaf870b7fed489d366fa2e76c90d33eb4d2de84eb180fcabc6ac6e3a3bd1afd","observation_id":"d93638e7-fb24-462a-87de-b99b513f5f56","resolution":{"observed_at":"2026-05-27T01:38:39.893390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sparsectrl: Adding sparse controls to text-to-video diffusion models","venue":null,"work_id":"613b0c97-4909-40eb-a653-69625655b4d5","year":2024},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:3cc1c28be149317a69b6f6686b8a35a61318c34b9318ee183a4e9674f26e07b2","observation_id":"e4dc32b5-e10e-4ded-bf6f-f373898f5324","resolution":{"observed_at":"2026-05-27T01:38:40.415545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-07-06T15:52:13.602170Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":"2307.04725","doi":"10.48550/arxiv.2307.04725","metadata_source":"pith","pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","venue":"cs.CV","work_id":"1f9d1d3b-a6d6-45a9-9f13-51393c03be8a","year":2023},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:af0d458aaaf63fc651d6c8a5f010b5a6f77ce65bf361a1d279b5974547555b68","observation_id":"0520f6c2-adbd-4266-a494-89d44b5f757e","resolution":{"observed_at":"2026-05-11T23:31:14.843543Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Av-link: Temporally-aligned diffusion features for cross-modal audio-video generation","venue":null,"work_id":"01ecb47e-bf0c-4124-86ef-1090f3a531e5","year":2025},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:d102150605a032fce90f11d24e7dd9edf3f9acc3634d2a0aafe7eef3036d25a9","observation_id":"83c3caef-ab5c-4c84-b7f1-2c300b24aaf0","resolution":{"observed_at":"2026-05-27T01:38:40.422504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Emilia: An extensive, multilingual, and diverse speech dataset for large-scale speech generation","venue":null,"work_id":"35a20702-69ca-4ac3-91fd-9122007c56ec","year":2024},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:f253598858b9c0dfdf11adcd798ac3940a21990b49d376a0a2fd3aea775cf45c","observation_id":"98a472dd-2c41-4323-a75e-24c8481337a1","resolution":{"observed_at":"2026-05-27T01:38:40.430814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":"2211.13221","doi":"10.48550/arxiv.2211.13221","metadata_source":"pith","pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","venue":"cs.CV","work_id":"23338b3d-620a-4954-904f-bab6a577b8a5","year":2022},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:ba4dce13b6e9ce726120e253d0e0ccf902a51ebb01b775e5e3b56dae639afd7a","observation_id":"a4343819-02f6-4907-845f-a29e5d72e5b8","resolution":{"observed_at":"2026-05-15T04:27:43.523852Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2210.02303","doi":"10.48550/arxiv.2210.02303","metadata_source":"pith","pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","venue":"cs.CV","work_id":"bb20d241-dc6f-4b0a-b071-fd43a2cbd57f","year":2022},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:708806c37fa31f1532962db9993d0b524b35707980d85fea911c9d25646c3fe0","observation_id":"f8a3f2c4-b729-4546-a552-dfb9175342ed","resolution":{"observed_at":"2026-05-11T23:31:14.865612Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:59.676131+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:59.676131+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.828784Z","title":"Video diffusion models.Advances in neural information processing systems, 35:8633–8646","venue":null,"work_id":"1f8f79e2-ab6d-4144-b8df-c93b5880020a","year":2022},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:b164126d88ae602975c07b8632427b85a16b14954521766e466eb852131bcce4","observation_id":"964cdf16-eae7-473d-a1b3-ab24aa52dba7","resolution":{"observed_at":"2026-05-27T01:38:40.437542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15868","last_updated":"2022-05-29T19:02:15Z","snapshot_observed_at":"2026-07-06T13:15:58.303738Z","submitted_at":"2022-05-29T19:02:15Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","version":1},"cited_work":{"arxiv_id":"2205.15868","doi":"10.48550/arxiv.2205.15868","metadata_source":"pith","pith_arxiv_id":"2205.15868","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","venue":"cs.CV","work_id":"2dbd6bcd-fc98-4fbf-b586-f6d94fe1abd2","year":2022},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"cited_paper":"/paper/2205.15868","citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:6c5816562ca095e8ee9702902450056367a53a2cf55860ffb03935d72e28a590","observation_id":"1e418354-9b7f-4dcd-9b70-a4514e318eb1","resolution":{"observed_at":"2026-05-11T23:31:14.770777Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08009","last_updated":"2025-11-10T04:36:27Z","snapshot_observed_at":"2026-08-02T00:07:53.851104Z","submitted_at":"2025-06-09T17:59:55Z","title":"Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion","version":2},"cited_work":{"arxiv_id":"2506.08009","doi":"10.48550/arxiv.2506.08009","metadata_source":"pith","pith_arxiv_id":"2506.08009","snapshot_observed_at":"2026-07-11T01:07:45.231019Z","title":"Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion","venue":"cs.CV","work_id":"53e58ef9-7932-4b83-b757-34ac14db3e0f","year":2025},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"cited_paper":"/paper/2506.08009","citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:5f507747962fcaf4a463bc4de11bbb78b06842a8792e8b6eaa006bdf0b0cdac1","observation_id":"ee8c4a9c-1b08-4428-9553-2b28688cab89","resolution":{"observed_at":"2026-05-11T23:31:14.874434Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.13677","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T12:41:04.375376Z","title":"Jova: Unified multimodal learning for joint video-audio generation","venue":null,"work_id":"db4a0fa0-6496-4b05-893b-51006ad3ac59","year":2025},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:1442622977780196cc5bff7f864517c2c24fcde82fe00ac21ff3c81aae49a628","observation_id":"19ec8ee7-9b08-4f8c-8865-d6376b661e51","resolution":{"observed_at":"2026-05-11T23:31:14.838308Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T01:07:50.611559Z","title":"Vbench: Comprehensive benchmark suite for video generative models","venue":null,"work_id":"2383dbc4-0e5d-40ed-a102-5aac37332eae","year":2024},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:72eafce6d57b9ee62e38bdcb918a32a77abe88a8ba07b8b2a0dc84c2dafb277c","observation_id":"eaa8a407-2381-4b19-b068-3a413431877b","resolution":{"observed_at":"2026-05-27T01:38:40.440887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A simple but strong baseline for sounding video generation: Effective adaptation of audio and video diffusion models for joint generation","venue":null,"work_id":"f89c1972-35f6-4466-b98f-a0ee84ba14fe","year":2025},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:eb1896be445c6d8693fac5e1a2614a5de43b83a8beec3dc9e869497d5786264a","observation_id":"760f805d-15ad-4f8a-b7cf-a5bd941f6441","resolution":{"observed_at":"2026-05-27T01:38:39.900309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2410.05954","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T00:07:43.037042Z","title":"Pyramidal flow matching for efficient video generative modeling.arXiv preprint arXiv:2410.05954","venue":null,"work_id":"86ba3b09-fc7d-4d26-acce-10677e0b5d69","year":2024},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:8c4e4f2b4b5b3552f2124cc01ff2c1f6e8b1b7c065fdd0f2046fd5d9254008b8","observation_id":"c957a1f6-3084-485a-93d8-fca6671176dc","resolution":{"observed_at":"2026-05-11T23:31:14.778880Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-07-11T01:07:45.135143Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:47d148a508727b4dd2cf9840750b8c16c21c1c583dfa49e82832a42cf883afbf","observation_id":"09789276-601d-42c6-8be1-c492bd2449e0","resolution":{"observed_at":"2026-05-11T23:31:14.899882Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.23377","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T12:41:04.381869Z","title":"JavisDiT: Joint audio-video diffusion transformer with hierarchical spatio-temporal prior synchronization","venue":null,"work_id":"3b03d007-725f-4692-9648-a2785e1e2398","year":2025},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:54a8f83f3c36ce1b06935bf011e9dd96f2f2d26ecc9e88425bdda503623da1ca","observation_id":"7bc17ca6-66cc-4c87-90ca-818a8bd4a5c6","resolution":{"observed_at":"2026-05-11T23:31:14.798344Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.01284","last_updated":"2025-09-30T21:03:50Z","snapshot_observed_at":"2026-07-06T22:31:24.978726Z","submitted_at":"2025-09-30T21:03:50Z","title":"Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation","version":1},"cited_work":{"arxiv_id":"2510.01284","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.01284","snapshot_observed_at":"2026-07-05T12:41:04.361399Z","title":"Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation","venue":"cs.MM","work_id":"4ea3b1fc-d272-47f2-88a8-36cbeaa92448","year":2025},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"cited_paper":"/paper/2510.01284","citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:cdfcec9140d393190bf821e7814c97306aff3a3e2547f80c7b038ed3d75fb37f","observation_id":"b055e0a9-b452-43ce-81c5-d471e19ec570","resolution":{"observed_at":"2026-05-17T01:03:15.294735Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Follow your pose: Pose- guided text-to-video generation using pose-free videos","venue":null,"work_id":"6c735dbd-d2ad-4e0e-9ddd-33c6142da81f","year":2024},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:2636bec8f303308776293e0df043a85768d4a49ce6c0af2ad0f9eccde290e5e4","observation_id":"573c70d1-a835-40ff-8d43-0df409fe0d2a","resolution":{"observed_at":"2026-05-27T01:38:40.457324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mofa-video: Controllable image animation via generative motion field adaptions in frozen image-to-video diffusion model","venue":null,"work_id":"62a47aee-6ba8-4c3a-ad8e-c1c379aced98","year":2024},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:d4e2e66e006f147dc7df3a1c0b4caa3eeff10b9459c7f1e72feeb63be332c61e","observation_id":"9781c4f6-b08d-41ea-ac15-add02e3e05e8","resolution":{"observed_at":"2026-05-27T01:38:39.871011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video generation models as world simulators","venue":null,"work_id":"4ddb4925-ba7c-4c16-ade4-19044628d705","year":2024},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:9a96349b1dfa50240abc1199f1bbb2254c90d8a912ae7c803b0109bcb77d3e14","observation_id":"612cc8b5-273e-4308-b256-4a82a96e9a4f","resolution":{"observed_at":"2026-05-27T01:38:39.889097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":"2212.04356","doi":"10.48550/arxiv.2212.04356","metadata_source":"pith","pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-07-10T12:57:07.586760Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","venue":"eess.AS","work_id":"ed5fbefe-24bf-436f-98c1-68e9114360bf","year":2022},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:9146705029c327110e7602a843df33502bc0e00ef2f6582a5185487b8a349de4","observation_id":"a2386faf-cc56-4f20-9ee5-c983048e2f48","resolution":{"observed_at":"2026-05-11T23:31:14.647350Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-07-11T19:19:52.113971+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T19:19:52.113971+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04324","last_updated":"2024-07-01T03:57:55Z","snapshot_observed_at":"2026-07-06T17:26:27.288834Z","submitted_at":"2024-02-06T19:08:18Z","title":"ConsistI2V: Enhancing Visual Consistency for Image-to-Video Generation","version":2},"cited_work":{"arxiv_id":"2402.04324","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04324","snapshot_observed_at":"2026-07-02T12:26:56.718648Z","title":"ConsistI2V: Enhancing Vi- sual Consistency for Image-to-Video Generation","venue":null,"work_id":"19dbbe7f-675b-4f8d-a42e-59fde7969cf5","year":2024},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"cited_paper":"/paper/2402.04324","citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:609f2e2653d7c789f49dbc3b8cd24a53e4cd847bf0675447c69e72f7720a25a3","observation_id":"63b3ad56-8949-4c4a-b915-0d2cd404cc00","resolution":{"observed_at":"2026-05-11T23:31:14.829831Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"ba375125-dd63-4c68-913e-ef9687939c97","year":2022},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:bbe112e5d089be5f039f072733055e106c26c472961c6affa9ed4015f4e83b46","observation_id":"0119bd0b-973e-4771-8912-fa9104d7ff9d","resolution":{"observed_at":"2026-05-27T01:38:40.434167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mm-diffusion: Learning multi-modal diffusion models for joint audio and video generation","venue":null,"work_id":"dd4ae4ac-16f8-4466-92e2-b3d0a475132a","year":2023},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:7f4b9c036e46ebea4d8344687b0bb4130c30df4e8d9f9723e176b7b6a139f8b3","observation_id":"06cf7f12-db15-4046-8f60-20feb2c747b7","resolution":{"observed_at":"2026-05-27T01:38:39.882387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14189","last_updated":"2023-10-22T05:33:38Z","snapshot_observed_at":"2026-07-06T16:36:39.306005Z","submitted_at":"2023-10-22T05:33:38Z","title":"Improved Techniques for Training Consistency Models","version":1},"cited_work":{"arxiv_id":"2310.14189","doi":"10.48550/arxiv.2310.14189","metadata_source":"pith","pith_arxiv_id":"2310.14189","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Improved Techniques for Training Consistency Models","venue":"cs.LG","work_id":"f730a570-4b0e-4910-87bb-ed1ec909fbc6","year":2023},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"cited_paper":"/paper/2310.14189","citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:5a2f2649f9101da87a597674b574c642920b888989a02dd2ec65d822d5a7eca0","observation_id":"70be4f20-b11b-420a-bdcf-54e47d56337b","resolution":{"observed_at":"2026-05-21T05:04:10.684842Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-07-06T11:01:58.137141Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"cited_work":{"arxiv_id":"2104.09864","doi":"10.48550/arxiv.2104.09864","metadata_source":"pith","pith_arxiv_id":"2104.09864","snapshot_observed_at":"2026-07-11T01:27:45.562618Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","venue":"cs.CL","work_id":"4e5eee26-cd04-4c7a-988f-3e6d1a1f0eb9","year":2021},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"cited_paper":"/paper/2104.09864","citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:1e0c9dac56828230ab609d56a73b1a82fd841fe4c1c5420653ea4e29a1cb2fc8","observation_id":"491aa484-adbe-4ae4-9753-e32dd20ddc57","resolution":{"observed_at":"2026-05-11T23:31:14.708350Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:49:47.452101+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:49:47.452101+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13211","last_updated":"2025-05-19T14:58:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-19T14:58:50Z","title":"MAGI-1: Autoregressive Video Generation at Scale","version":1},"cited_work":{"arxiv_id":"2505.13211","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.13211","snapshot_observed_at":"2026-07-10T01:46:41.063877Z","title":"MAGI-1: Autoregressive Video Generation at Scale","venue":"cs.CV","work_id":"25e8bd3d-e51c-43ae-8126-4ea6ecdb3321","year":2025},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"cited_paper":"/paper/2505.13211","citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:5623200b2dfa93b42a83448d7efdd95fc879b2eadff69f2304e75ae579fd47bf","observation_id":"49efc2da-e127-4b97-8ca8-7b7eac439b59","resolution":{"observed_at":"2026-05-13T20:31:15.871842Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:34:42.280009Z","title":"Meta audiobox aesthetics: Unified automatic quality assessment for speech, music, and sound","venue":null,"work_id":"8950a9fa-d9a0-4d3c-b4b8-fbd073cac859","year":2025},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:963b49bda42d6652ba71abe5b015f5c68b87cbb59bda133531189c41f0044a77","observation_id":"b51213cc-ba48-4d17-b898-6bb0878f3b66","resolution":{"observed_at":"2026-05-27T01:38:39.896690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generating the future with adversarial transformers","venue":null,"work_id":"cad77806-ea6c-4a40-84b3-20278e8f87f6","year":2017},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:88cda7090dd87affbeb6b9f6063ce845d134022b2e2a3b52e7c7381490743f79","observation_id":"8ae6c1b2-3d2c-43f0-afac-4ba7c2a26f30","resolution":{"observed_at":"2026-05-27T01:38:39.874789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":"2503.20314","doi":"10.1109/19.492748","metadata_source":"pith","pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":"cs.CV","work_id":"ad3ebc3b-4224-46c9-b61d-bcf135da0a7c","year":2025},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:71ef8ae22c54919ba0c193f3cb4a367cbc15712933cf6817e2eb746e887dd15a","observation_id":"0d5194b7-1cd7-4332-a767-34932e0d06d5","resolution":{"observed_at":"2026-05-11T23:31:14.887388Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06155","last_updated":"2025-09-07T17:55:03Z","snapshot_observed_at":"2026-08-02T14:08:24.750014Z","submitted_at":"2025-09-07T17:55:03Z","title":"UniVerse-1: Unified Audio-Video Generation via Stitching of Experts","version":1},"cited_work":{"arxiv_id":"2509.06155","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.06155","snapshot_observed_at":"2026-07-05T12:41:04.336871Z","title":"UniVerse-1: Unified audio-video generation via stitching of experts","venue":"cs.CV","work_id":"b460dec5-ca31-4982-8dc8-769dad75efb5","year":2025},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"cited_paper":"/paper/2509.06155","citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:dc7d79eb1846c0f74cd8a59d86bd57390698ad599103841934cf5d22af0656aa","observation_id":"408d256f-81e6-4aba-af42-0522fcafa1ac","resolution":{"observed_at":"2026-05-11T23:31:14.791158Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06571","last_updated":"2023-08-12T13:53:10Z","snapshot_observed_at":"2026-07-06T16:05:35.645037Z","submitted_at":"2023-08-12T13:53:10Z","title":"ModelScope Text-to-Video Technical Report","version":1},"cited_work":{"arxiv_id":"2308.06571","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.06571","snapshot_observed_at":"2026-07-11T01:57:50.025885Z","title":"ModelScope Text-to-Video Technical Report","venue":"cs.CV","work_id":"1b1baf78-58ec-44d0-b700-84dff57b2f1f","year":2023},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"cited_paper":"/paper/2308.06571","citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:14255af0bdf84a59f59d9ec231eaf1d789762a003a9bc04d347b66ee9e77b6be","observation_id":"ee1021be-e022-4597-b536-0894dab58480","resolution":{"observed_at":"2026-05-12T19:47:29.701736Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Av-dit: Taming image diffusion transformers for efficient joint audio and video generation","venue":null,"work_id":"7bc5a5fd-4e6d-47ca-bc99-2e5d09fd9145","year":2025},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:a840f650269455911f3f863450e6bbaa1104ceee16c46dd6b6b4f75e038d2a51","observation_id":"fccbb80b-9232-48b2-87ea-b302e0750ebe","resolution":{"observed_at":"2026-05-27T01:38:40.411736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fantasytalk- ing: Realistic talking portrait generation via coherent motion synthesis","venue":null,"work_id":"5d6af529-1a99-42ef-816a-7dc5cfef5cd0","year":2025},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:2e03f336e7a97e7eb41d93f72826bae6fdf98da852f5614a72968ad65d48a6bf","observation_id":"e2398dca-1a8a-4c2e-87bd-5b4b26d2db5d","resolution":{"observed_at":"2026-05-27T01:38:39.885831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":"2409.18869","doi":"10.48550/arxiv.2409.18869","metadata_source":"pith","pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-07-10T06:36:52.573462Z","title":"Emu3: Next-Token Prediction is All You Need","venue":"cs.CV","work_id":"720d288e-fac0-464c-9929-19efd9a52afc","year":2024},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:cc64616f037fc2511b5271820ad37d013257eae4d1284c6d849ac5df37070357","observation_id":"696ea226-a470-44a2-93e5-ff37edcbae03","resolution":{"observed_at":"2026-05-11T23:31:15.005455Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2307.06942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-04T06:39:37.513098Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"e0787102-2f18-46ad-9660-6bfe466e3bbf","year":2023},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:c3880a2a1e25f388fdf558e9163897c07b464dbfabc0c846c197825a87a32452","observation_id":"3f6d8964-8e9a-444a-af15-d1d4f59abbff","resolution":{"observed_at":"2026-05-15T06:30:22.925421Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-07-06T19:27:11.995338Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":"2410.02757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-07-04T08:59:42.133975Z","title":"LA VIE: High- quality video generation with cascaded latent diffusion models.International Journal of Computer Vision, 2024a","venue":null,"work_id":"457cd406-74c8-475f-8866-399412f2913b","year":2024},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:0a673263cc65828bcc00debca7436b0427d7610f9ca361e937e67a3c442c0625","observation_id":"abc3491d-9480-4f38-b430-594dc4f6170b","resolution":{"observed_at":"2026-05-11T23:31:14.905365Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation","venue":null,"work_id":"f0b03012-516e-49e4-ba25-b95cb1002281","year":2023},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:930bb0cd356103b537fa66dae496db9ff215f24c2694953e8e3a3a49e1a1e27a","observation_id":"8be701ff-7d51-4c2f-b2ad-f23c0915b662","resolution":{"observed_at":"2026-05-27T01:38:40.447676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T17:24:01.488835Z","title":"Magicanimate: Temporally consistent human image animation using diffusion model","venue":null,"work_id":"3b366cd7-5295-4e70-9003-8bc565f0e4ed","year":2024},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:fdf7769925d71190fffc4a8ab30166ba9c6f88b02ef31a6da90c1816dbe29110","observation_id":"ca8250ac-ccaa-4c88-b3e0-c958293f50c5","resolution":{"observed_at":"2026-05-27T01:38:40.418902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.07901","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stand-in: A lightweight and plug-and-play identity control for video generation","venue":null,"work_id":"48b1bc82-7a99-45cc-87ea-aa8470a57608","year":2025},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:af3977e8c89138273586d3e427aee0edc33c61d081495b7f55af3823d8a32c9d","observation_id":"74f02384-402b-4bf5-95ab-b4363f85e979","resolution":{"observed_at":"2026-05-11T23:31:14.824208Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.22622","last_updated":"2025-10-13T22:41:26Z","snapshot_observed_at":"2026-07-06T22:30:55.313733Z","submitted_at":"2025-09-26T17:48:24Z","title":"LongLive: Real-time Interactive Long Video Generation","version":2},"cited_work":{"arxiv_id":"2509.22622","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.22622","snapshot_observed_at":"2026-07-09T07:56:04.670863Z","title":"LongLive: Real-time Interactive Long Video Generation","venue":"cs.CV","work_id":"29ec6550-6ac1-4cc6-8aae-b4206f1d5b38","year":2025},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"cited_paper":"/paper/2509.22622","citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:fdadac7aeab9b812dd04275d3bbbe0e5de910ad4580cc73e8dcb3ee9f960de7f","observation_id":"ddc478f6-5966-456e-bf41-2a4c9617bcad","resolution":{"observed_at":"2026-05-15T03:52:59.837830Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":"2408.06072","doi":"10.48550/arxiv.2408.06072","metadata_source":"pith","pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-07-11T00:07:42.878250Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","venue":"cs.CV","work_id":"f38fc088-12aa-4bf4-9ecd-08d3e797ccb7","year":2024},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:eca331f0522f7bf36ed1fa00ba91ce13e86a5c5add7e2cadb6143f982d3009ab","observation_id":"de5d3010-744d-4255-99d4-d9d60b850901","resolution":{"observed_at":"2026-05-11T23:31:14.895425Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improved distribution matching distillation for fast image synthesis.Advances in neural information processing systems, 37:47455– 47487","venue":null,"work_id":"1288a442-33a8-40f4-9cbf-695bcd456208","year":2024},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:a514170d8a275a2f8ee8ebef5417025206355e463ea76e315b3c74e5bdb37738","observation_id":"6b1ccfaa-9ab3-4e21-9095-c5a33dcbcbb0","resolution":{"observed_at":"2026-05-27T01:38:40.454525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"From slow bidirectional to fast autoregressive video diffusion models","venue":null,"work_id":"6d9af638-c387-4e0c-8af7-99f9320e2f7e","year":2025},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:518876d2f73ef56bd1726e1ce9bb2849d5e2c71037a2830ba8d0d3d5b1c5b837","observation_id":"b76796d0-8582-4c25-8f6e-480186ddfdc0","resolution":{"observed_at":"2026-05-27T01:38:40.444157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.03334","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T12:41:04.312298Z","title":"arXiv preprint arXiv:2511.03334 (2025)","venue":null,"work_id":"de68a5e3-41de-4728-9038-0f1ed7b7039c","year":2025},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:d2676e5a86386feffb435d06863969375dc9dfc43ef10eef097075b87b3741b1","observation_id":"c0df8de2-616e-4987-820f-dbaaae88734c","resolution":{"observed_at":"2026-05-11T23:31:14.612127Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.09862","last_updated":"2025-07-14T02:22:47Z","snapshot_observed_at":"2026-07-06T21:56:35.665677Z","submitted_at":"2025-07-14T02:22:47Z","title":"SpeakerVid-5M: A Large-Scale High-Quality Dataset for Audio-Visual Dyadic Interactive Human Generation","version":1},"cited_work":{"arxiv_id":"2507.09862","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.09862","snapshot_observed_at":"2026-07-05T12:41:04.344983Z","title":"Speakervid-5m: A large-scale high-quality dataset for audio-visual dyadic interactive human generation","venue":"cs.CV","work_id":"688016ba-158b-407b-a0cf-8c4e05da5c25","year":2025},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"cited_paper":"/paper/2507.09862","citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:f0882a8bd6cf081398b1a337d59fe93cf5461fb0a9dd6470aeda55d4ad386311","observation_id":"dc282b02-29ad-4377-8da4-1c1574feff64","resolution":{"observed_at":"2026-05-11T23:31:14.592558Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08431","last_updated":"2026-05-06T15:49:52Z","snapshot_observed_at":"2026-07-06T22:32:13.055128Z","submitted_at":"2025-10-09T16:45:30Z","title":"Large Scale Diffusion Distillation via Score-Regularized Continuous-Time Consistency","version":3},"cited_work":{"arxiv_id":"2510.08431","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.08431","snapshot_observed_at":"2026-07-11T01:07:44.823334Z","title":"Large Scale Diffusion Distillation via Score-Regularized Continuous-Time Consistency","venue":"cs.CV","work_id":"c4d59581-ef40-441f-937a-e325bff802be","year":2025},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"cited_paper":"/paper/2510.08431","citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:2275e3a725d330b78f33a7c252b7a5448e8d9cb7e2c1df402de21add1b2caa05","observation_id":"dc8f86c8-0bc9-48c0-8db0-1b8db3b36212","resolution":{"observed_at":"2026-05-11T23:31:14.675668Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15458","last_updated":"2024-10-20T17:51:35Z","snapshot_observed_at":"2026-07-06T19:36:41.445591Z","submitted_at":"2024-10-20T17:51:35Z","title":"Allegro: Open the Black Box of Commercial-Level Video Generation Model","version":1},"cited_work":{"arxiv_id":"2410.15458","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.15458","snapshot_observed_at":"2026-07-03T23:59:06.234618Z","title":"Allegro: Open the black box of commercial-level video generation model","venue":null,"work_id":"2a9fb750-b69a-4cb3-bd82-2a77e49bd173","year":2024},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"cited_paper":"/paper/2410.15458","citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:27831cbb8d6013f50af0855f1d140d47c69ebe21c6568456e1c3c2b9c5a8816a","observation_id":"93bb69bc-7543-435c-a1b8-111094802603","resolution":{"observed_at":"2026-05-11T23:31:14.696999Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":35,"verified_fuzzy":25},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"thesis":"As of 2 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 1 inbound Pith citation observation for arXiv:2604.25819."}