{"as_of":"2026-08-08T04:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:624ef1fc5e4822fc575eae8f7b111d16b12573955c8a5e1807ca6e85bb30802d","coverage":[{"denominator":71,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":71,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:24:30.637501Z","state":"measured"},{"denominator":72,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":72,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T11:34:32.558440Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T11:38:14.727310Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"cited_work":{"arxiv_id":"2506.08003","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08003","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Jay Zhangjie Wu, Yixiao Ge, Xintao Wang, Stan Weixian Lei, Yuchao Gong, Yufei Shi, Mike Zheng Shou, David Junhao Yang, Ming-Hsuan Hsu, and Ying Shan","venue":null,"work_id":"3e6e4654-8723-4385-9c31-087e27ad2c12","year":2025},"citing_paper":{"arxiv_id":"2605.18467","last_updated":"2026-05-18T14:27:05Z","snapshot_observed_at":"2026-07-06T23:29:20.279470Z","submitted_at":"2026-05-18T14:27:05Z","title":"InstructAV2AV: Instruction-Guided Audio-Video Joint Editing","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-20T11:34:32.558440Z"},"links":{"cited_paper":"/paper/2506.08003","citing_paper":"/paper/2605.18467"},"observation_digest":"sha256:30a6aa0e8e48f0bd12655f881b936fc6d9d1626e87b325a734622d8dd5bca9fa","observation_id":"dea592b8-9aa9-4846-b81b-926220787e57","resolution":{"observed_at":"2026-05-20T11:38:14.728832Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.08003/citation-record","integrity":"/paper/2506.08003/integrity","json":"/paper/2506.08003/citation-record.json","paper":"/paper/2506.08003"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:24:31.819977Z","title":"Diverse and aligned audio-to- video generation via text-to-video model adaptation,","venue":null,"work_id":"02cd9ad2-691c-416e-ba78-868fe393f8b8","year":2024},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.255357Z"},"links":{"citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:8f5e14c1792389bba3c81a9d1fb7c342ed43504530938b23d08c566193214a3e","observation_id":"59ac458d-94e1-44f3-8a0d-867e9db24c5e","resolution":{"observed_at":"2026-08-07T05:24:31.824720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:24:31.803995Z","title":"Long video generation with time-agnostic vqgan and time-sensitive transformer,","venue":null,"work_id":"a3c86b17-2478-4d4f-b59b-04a8ab3a5dcd","year":2022},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.260509Z"},"links":{"citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:c07687818971a4eb150f54ed9a50ddb20fa909a0209f971eda16d2d8de932c4b","observation_id":"6e1fd37e-ec24-4972-92c5-1cf29c734613","resolution":{"observed_at":"2026-08-07T05:24:31.809045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:24:31.788856Z","title":"Seeing and hearing: Open-domain visual-audio generation with diffusion latent aligners,","venue":null,"work_id":"cf67c495-881b-4305-b325-bf0edfb9d350","year":2024},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.265481Z"},"links":{"citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:b306a5f0677311314c3a03981e6300418c39df09c7e805087935b442ab8fca69","observation_id":"6aa8241b-dfda-4759-b83b-3a53ba12a598","resolution":{"observed_at":"2026-08-07T05:24:31.793603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:24:31.774003Z","title":"Sound-guided semantic video generation,","venue":null,"work_id":"d20fcaf9-79be-4f69-95f0-9f31cbfeca21","year":2022},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.270005Z"},"links":{"citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:8a89c7d3d24390736321382042f82a4d1016955214d3f2e830ea9207aac55517","observation_id":"173c70ac-33a1-4244-a17b-a8251bd92aaa","resolution":{"observed_at":"2026-08-07T05:24:31.778883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:24:31.759291Z","title":"MM-Diffusion: Learning multi-modal diffusion models for joint audio and video generation,","venue":null,"work_id":"bf986b92-d242-4322-b2e0-91bdc7468aee","year":2023},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.274528Z"},"links":{"citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:9161d9801e0e9ed7d233977e39e56dac9ec7f62e2e2fe168988b86074498a522","observation_id":"104fdeee-48a2-4e1b-8463-d7fcf09cdd8f","resolution":{"observed_at":"2026-08-07T05:24:31.764037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:24:31.743632Z","title":"TA2V: Text-audio guided video generation,","venue":null,"work_id":"3d1ffba0-631a-49be-9b67-a7f5a6551a21","year":2024},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.279142Z"},"links":{"citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:9da9a0d19ab6fe947327579008e6689efcc27d569d7d0061943eeab71aca524c","observation_id":"eb9bff16-e028-4a01-bc6a-7395298b8204","resolution":{"observed_at":"2026-08-07T05:24:31.749032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:24:31.727055Z","title":"Hallo3: Highly dynamic and realistic portrait image animation with video diffusion transformer,","venue":null,"work_id":"54bd1351-e7ea-47ce-aeb1-d3a894baa850","year":2025},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.284477Z"},"links":{"citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:6382490c4f6ba3d805658f65ee84744651cfc2cc63a3bebb9af0340a2b482150","observation_id":"02f5e58b-3e74-41af-9b4c-8f011ee5de61","resolution":{"observed_at":"2026-08-07T05:24:31.732415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:24:31.711300Z","title":"Speech drives templates: Co-speech gesture synthesis with learned templates,","venue":null,"work_id":"89a514de-c0e4-405f-b44d-635996a5b48d","year":2021},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.289145Z"},"links":{"citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:19fdc5764e51e7ddb4cf48d307638d7a56005b9b39016e7ce50f62d44c5c2dca","observation_id":"5b0f35db-ba58-4d9d-ba5f-624f0791daca","resolution":{"observed_at":"2026-08-07T05:24:31.716351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:24:31.695853Z","title":"Visualize music using generative arts,","venue":null,"work_id":"0dc2c450-b6e4-498b-842f-07cedc2fbe93","year":2024},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.293448Z"},"links":{"citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:6d3b42fcf395fe2d8baf0da7c78ed83f4ac5ab2e3d1bc95633810ea163653e88","observation_id":"9db135e9-97a3-4b6e-9623-a31610f879cf","resolution":{"observed_at":"2026-08-07T05:24:31.700762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:24:31.679932Z","title":"CogVideox: Text-to-video diffusion models with an expert transformer,","venue":null,"work_id":"818e15e5-aa95-44b3-8102-41a2c167fcf6","year":2025},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.298059Z"},"links":{"citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:d7f319a039168aa4eee05747bf6ec22406e1e90573fd995a328d9c2534e5402e","observation_id":"b6fa7cb1-0213-4c01-84e5-2fb459e1f6a5","resolution":{"observed_at":"2026-08-07T05:24:31.684858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:24:31.664790Z","title":"Structure and content- guided video synthesis with diffusion models,","venue":null,"work_id":"9440b436-3bd4-47b3-bcd6-9dff9ef99026","year":2023},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.302949Z"},"links":{"citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:fd4f1db151fd57a29f7cf53ec2925b9a1d6375fa956cd122d125d4d2976ef037","observation_id":"53b57413-2458-448f-9c31-6ddfcba84fd7","resolution":{"observed_at":"2026-08-07T05:24:31.669493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T05:24:30.307892Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.307892Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:273199b9637623048e66b238451e632f0cd3ad5b6738ffc964d6669e919a28ba","observation_id":"44cb9eee-3cfe-4393-bca8-532eafaafac4","resolution":{"observed_at":"2026-08-07T05:24:30.307892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-08-07T05:24:30.313733Z","title":"Latent video diffusion models for high-fidelity long video generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.313733Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:9b7b273aabb2a8d3f2c8b754c69a1cd1a6b2c893679f06260878ad7fa50d501f","observation_id":"90957916-2290-4432-99d0-5096cb5e939f","resolution":{"observed_at":"2026-08-07T05:24:30.313733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:24:30.318712Z","title":"High-resolution image synthesis with latent diffusion models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.318712Z"},"links":{"citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:86f500c3981e995064d56c24a6de5c22874e48ccaf3c5fd54b816819c45ac450","observation_id":"e1db0a67-136b-46e0-98a4-1d8f3ddb1577","resolution":{"observed_at":"2026-08-07T05:24:30.318712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:24:31.636075Z","title":"Interpretable 3D human action analysis with temporal convolutional networks,","venue":null,"work_id":"05699121-a504-4f22-ba35-578b49591b53","year":2017},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.324986Z"},"links":{"citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:2db63b05bad89432511cdfd9b7b7beb1bed960ce67c93a8cdad83201c500b155","observation_id":"130049ee-dfac-44ae-9cf8-72b93248efbc","resolution":{"observed_at":"2026-08-07T05:24:31.641049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:24:31.620019Z","title":"Is space-time attention all you need for video understanding?,","venue":null,"work_id":"e39b6679-556e-4b1b-b45e-e9987aae182d","year":2021},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.330694Z"},"links":{"citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:c7d88cb4804d17e2c98aa8da67b441e3af1e031a9e24051c3d483fe92eeef18f","observation_id":"9fcda4e2-2151-4ea0-bb10-0a8fbb1ac67c","resolution":{"observed_at":"2026-08-07T05:24:31.625063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:24:31.600819Z","title":"U-Net: Convolutional networks for biomedical image segmentation,","venue":null,"work_id":"29b035da-7dea-4ffb-8733-54ffc3361353","year":2015},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.335384Z"},"links":{"citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:69d97d01248cdf30672d97e77b0fbf64b17a1f090eae441585d8ac4df4ebdd08","observation_id":"5086d922-64e6-440e-be42-6440bf04d4c8","resolution":{"observed_at":"2026-08-07T05:24:31.606277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17177","last_updated":"2024-04-17T18:41:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-27T03:30:58Z","title":"Sora: A Review on Background, Technology, Limitations, and Opportunities of Large Vision Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17177","snapshot_observed_at":"2026-08-07T05:24:30.341073Z","title":"Sora: A review on background, technology, limitations, and opportunities of large vision models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.341073Z"},"links":{"cited_paper":"/paper/2402.17177","citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:ac61157af0303cfc4f3bf8d85f7d8a101a8e9f26bbefc9155a345308a56c023c","observation_id":"af590379-9528-40cd-a146-62c41fa36b46","resolution":{"observed_at":"2026-08-07T05:24:30.341073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:24:30.349078Z","title":"Scalable diffusion models with transformers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.349078Z"},"links":{"citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:7c74b422edc2fd0e903ef867d95fc8d5dae63bfafc3bf63cd0591bb960900e4c","observation_id":"4cb69949-eeaa-4b83-976e-1315e82e3419","resolution":{"observed_at":"2026-08-07T05:24:30.349078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:24:31.574444Z","title":"Language model beats diffusion – tokenizer is key to visual generation,","venue":null,"work_id":"74e0c6a5-24b0-4610-9bd3-582c1788ee46","year":2024},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.354412Z"},"links":{"citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:c97962ed9237d80109e097094e0b75f016b8fd6803d9451933013426bfa8b21d","observation_id":"f185d2ab-9d88-4072-bcac-028ccd651926","resolution":{"observed_at":"2026-08-07T05:24:31.579163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-07T05:24:30.363858Z","title":"Wan: Open and advanced large-scale video generative models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.363858Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:8cc8ea7c02a4494dd02e7916bca9390145d7afa7c7f7e3f3b06de4d329d945f4","observation_id":"74cacca0-99d8-497b-a584-3fae50b1c88e","resolution":{"observed_at":"2026-08-07T05:24:30.363858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-07T05:24:30.370136Z","title":"Hunyuanvideo: A systematic framework for large video generative models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.370136Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:07eabb1f9e7dc528f42072584c040e783374a768f38af4cb6cd66e7710d51db8","observation_id":"c90e47a0-d7d3-4a13-b202-f45f984da477","resolution":{"observed_at":"2026-08-07T05:24:30.370136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-07T05:24:30.377023Z","title":"Step-Video-T2V technical report: The practice, challenges, and future of video foundation model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.377023Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:51b7a375544d7b33a161a5e8eb22e357f0bd7a567b52dd28a2cec0fb00b477ce","observation_id":"1c9c5c64-36ce-4a6d-9ade-88715a693c0a","resolution":{"observed_at":"2026-08-07T05:24:30.377023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:24:31.559400Z","title":"Sound2Sight: Generating visual dynamics from sound and context,","venue":null,"work_id":"4bdd69e1-309b-4d84-a4e9-c98d53129895","year":2020},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.382367Z"},"links":{"citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:4a5e510099ef96f9090569baf8cc82884434bfb8048c0d7adb4652e354587f73","observation_id":"9386c427-f05d-4b6c-9596-cf0abfce3c4f","resolution":{"observed_at":"2026-08-07T05:24:31.564156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:24:31.545209Z","title":"CCVS: Context-aware controllable video synthesis,","venue":null,"work_id":"eabc1253-2082-4a11-80f8-80db60a2abf3","year":2021},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.387065Z"},"links":{"citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:c2289c05932f95e0444688d5dead840aae5481a0026223823809d99f896353b6","observation_id":"482fc39c-24fe-4b38-896d-706d3e01cbd0","resolution":{"observed_at":"2026-08-07T05:24:31.549939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:24:31.530847Z","title":"The power of sound (TPoS): Audio reactive video generation with stable diffusion,","venue":null,"work_id":"2c584a29-f544-49db-af74-0d0c49b826e6","year":2023},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.392168Z"},"links":{"citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:221368187967438e7f61ad5b49dc2ecbec68aed98c84b2d719ffeb97da70197d","observation_id":"31c2da8d-43a4-4bf0-a56a-2187c03388e3","resolution":{"observed_at":"2026-08-07T05:24:31.535252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:24:31.515833Z","title":"Audio-synchronized visual animation,","venue":null,"work_id":"0383c3b5-c78d-4d9f-af30-b0e9a629b4f8","year":2024},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.397425Z"},"links":{"citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:30ab3da8cfbca2666755f0d5016e613a69c5511c67479af23a47ce8e18a66496","observation_id":"0da452e7-443d-444a-b16d-2020746276fd","resolution":{"observed_at":"2026-08-07T05:24:31.520802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:24:31.501203Z","title":"Loopy: Taming audio-driven portrait avatar with long-term motion dependency,","venue":null,"work_id":"7f8284c0-5aef-45bb-a4fa-f0e6401d585e","year":2025},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.402130Z"},"links":{"citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:d5f780b317aca9c15c715133b0ded5d0e82b6440c4ae4f51c25c287eeb3e251a","observation_id":"d141dff9-2d35-4719-a13c-b94753f9f633","resolution":{"observed_at":"2026-08-07T05:24:31.505797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-08-07T05:24:30.408110Z","title":"AniPortrait: Audio-driven synthesis of photorealistic portrait animation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.408110Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:c1ea5bee8aaa75ce63493d53e7ef4b32392931bfd0d2c7435436d5dff731f091","observation_id":"c3a1929b-d64c-4a7e-b2a7-33342cbf61a2","resolution":{"observed_at":"2026-08-07T05:24:30.408110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:24:31.471053Z","title":"CyberHost: A one-stage diffusion framework for audio-driven talking body generation,","venue":null,"work_id":"4032344c-ac34-4ba7-ba77-791b7e5bade4","year":2025},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.419495Z"},"links":{"citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:4c754b6ee12a0c0b5f3d068299aa5c20e9a2e929b8730cd844a0c5698f03fa32","observation_id":"7fe47a68-6801-4dd5-bcc5-7f8468080216","resolution":{"observed_at":"2026-08-07T05:24:31.476293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01061","last_updated":"2025-06-30T08:26:56Z","snapshot_observed_at":"2026-07-06T20:30:02.903743Z","submitted_at":"2025-02-03T05:17:32Z","title":"OmniHuman-1: Rethinking the Scaling-Up of One-Stage Conditioned Human Animation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01061","snapshot_observed_at":"2026-08-07T05:24:30.424440Z","title":"OmniHuman-1: Rethinking the scaling-up of one-stage conditioned human animation models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.424440Z"},"links":{"cited_paper":"/paper/2502.01061","citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:f707395408af9f6a5443b15bdd44c34e2a66b78b23b252c1b396f5dea2e025dc","observation_id":"03919a94-3a27-4efb-87cc-cd6bf72d9b33","resolution":{"observed_at":"2026-08-07T05:24:30.424440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:24:31.456370Z","title":"Dance any beat: Blending beats with visuals in dance video generation,","venue":null,"work_id":"cb888d6b-ec92-40cf-bbb6-3d3f169238ad","year":2025},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.429761Z"},"links":{"citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:d3878887a2334fca26ebe70dcb10a4988f6be35e720a0be6e010305fc66f7101","observation_id":"97c70973-2b49-4825-8c6e-fa7e72169ac0","resolution":{"observed_at":"2026-08-07T05:24:31.461031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17414","last_updated":"2025-07-11T17:58:23Z","snapshot_observed_at":"2026-08-07T17:52:21.972488Z","submitted_at":"2025-02-24T18:47:54Z","title":"X-Dancer: Expressive Music to Human Dance Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17414","snapshot_observed_at":"2026-08-07T05:24:30.435331Z","title":"X- dancer: Expressive music to human dance video generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.435331Z"},"links":{"cited_paper":"/paper/2502.17414","citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:b4d6e42f0c2130aa04c379277bed803cffb33aeead3eefbdb914a7fb1b9bf4ce","observation_id":"c4d9c21c-b91b-4105-94ef-c6ca6d463b0f","resolution":{"observed_at":"2026-08-07T05:24:30.435331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:24:31.439431Z","title":"Taming transformers for high-resolution image synthesis,","venue":null,"work_id":"6bfba208-a331-4b81-943e-554cee36b562","year":2021},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.442078Z"},"links":{"citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:fe9f5dba1f5bf9a69f1afc3cd1829bc877aa37995a705717342c812a1caf26b4","observation_id":"7a10a7d8-b6b4-48a6-9fbc-5f009fdd31da","resolution":{"observed_at":"2026-08-07T05:24:31.444999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:24:31.423886Z","title":"A style-based generator architecture for generative adversarial networks,","venue":null,"work_id":"d8ba651c-1185-40f5-b5fa-a62cfc378a46","year":2019},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.447252Z"},"links":{"citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:e5010314995aedff3fc694ae68a9273539bd5040262d7e513d81696ef5c10bf0","observation_id":"dd210d7b-cf20-478e-bc0d-459bbdea9649","resolution":{"observed_at":"2026-08-07T05:24:31.428879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.04680","last_updated":"2021-02-09T07:04:22Z","snapshot_observed_at":"2026-07-06T10:39:42.676631Z","submitted_at":"2021-02-09T07:04:22Z","title":"Tr\\\"aumerAI: Dreaming Music with StyleGAN","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.04680","snapshot_observed_at":"2026-08-07T05:24:30.452897Z","title":"Träumerai: Dreaming music with stylegan,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.452897Z"},"links":{"cited_paper":"/paper/2102.04680","citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:8d179a39e8e887a7f84db45628d6915733e835d36faabd36414aa99e0bc45b88","observation_id":"0292bced-28bf-4495-94c8-8a5709d65e6f","resolution":{"observed_at":"2026-08-07T05:24:30.452897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-07-06T03:01:10.229407Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-07T05:24:30.458514Z","title":"Ucf101: A dataset of 101 human actions classes from videos in the wild,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.458514Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:60b54cefc175e759c218e48945dd0c5aa3b33a4e2ee469461a84612c4833cb90","observation_id":"0a69a0f0-b5f1-4d9e-8971-7ff74ac49f2d","resolution":{"observed_at":"2026-08-07T05:24:30.458514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.06761","last_updated":"2017-09-01T14:08:06Z","snapshot_observed_at":"2026-08-02T07:33:08.432322Z","submitted_at":"2017-04-22T07:40:16Z","title":"Content-Based Video-Music Retrieval Using Soft Intra-Modal Structure Constraint","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.06761","snapshot_observed_at":"2026-08-07T05:24:30.463937Z","title":"Content-based video-music retrieval using soft intra-modal structure constraint,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.463937Z"},"links":{"cited_paper":"/paper/1704.06761","citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:6c49c9083536f70e7c82a1d52f63ad45c2aece7e9dc9675b8705b16fe60c7d4f","observation_id":"c80b6ac1-61f6-41c0-b13c-5c9b8137ce49","resolution":{"observed_at":"2026-08-07T05:24:30.463937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:24:31.408571Z","title":"AudioSet: An ontology and human-labeled dataset for audio events,","venue":null,"work_id":"99c2cbc4-feb7-4ab4-9862-db506e51e9d1","year":2017},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.469091Z"},"links":{"citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:572a88eaab4acf360453e99f877eb1d1af57b5cfef40a2a55fb5e1423fb3a204","observation_id":"a8e9d9d0-2234-436d-b21d-f7333d88753a","resolution":{"observed_at":"2026-08-07T05:24:31.413510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.05622","last_updated":"2018-06-27T01:49:17Z","snapshot_observed_at":"2026-08-08T04:36:13.309903Z","submitted_at":"2018-06-14T15:59:12Z","title":"VoxCeleb2: Deep Speaker Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.05622","snapshot_observed_at":"2026-08-07T05:24:30.474142Z","title":"V oxCeleb2: Deep speaker recognition,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.474142Z"},"links":{"cited_paper":"/paper/1806.05622","citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:d46c7bfac77e05dbf1b67e1c02b282dd66b6e5179f068f1dadf9790dad5eec8a","observation_id":"d1a3ecbc-0034-46f2-bdcb-4a9efbaef075","resolution":{"observed_at":"2026-08-07T05:24:30.474142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:24:31.389438Z","title":"VggSound: A large-scale audio-visual dataset,","venue":null,"work_id":"1145199b-ae8d-4b10-b89c-55b1f2bb941f","year":2020},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.479131Z"},"links":{"citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:b9f76983a2786a21661f04e0722e6ddf65b0a00c0658b5bf8afa899c4d8208e2","observation_id":"7b68e6ec-ae47-4859-815e-e0e7d579afca","resolution":{"observed_at":"2026-08-07T05:24:31.394335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:24:31.373406Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval,","venue":null,"work_id":"2d4304f0-114a-4be8-9aa3-867b903e43b3","year":2021},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.484063Z"},"links":{"citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:a860fd85a8b1d983b38e0b3edb1292b3b46f120841605c3120a159f5db5d645e","observation_id":"6bfa8e3d-ce63-4a43-983c-962631ef68ff","resolution":{"observed_at":"2026-08-07T05:24:31.378605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:24:31.356765Z","title":"InternVid: A large-scale video-text dataset for multimodal understanding and generation,","venue":null,"work_id":"b1559484-1d7b-4abe-9348-0ab8fc900139","year":2024},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.488419Z"},"links":{"citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:b5497e915d2bebe3b1cd1177e4ee16735837896256865487bcf892d8b5240f6f","observation_id":"32fdc992-0e22-406b-ab5b-a58d40724d58","resolution":{"observed_at":"2026-08-07T05:24:31.363011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:24:30.492770Z","title":"CelebV-HQ: A large-scale video facial attributes dataset,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.492770Z"},"links":{"citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:96923131a4fa5bfe3953e636faa519aebda9eff0c60164ee121316d47d663b14","observation_id":"a7f64bdf-cd4f-43d4-848f-6e33548caf24","resolution":{"observed_at":"2026-08-07T05:24:30.492770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15262","last_updated":"2025-03-31T02:52:56Z","snapshot_observed_at":"2026-07-06T19:55:46.467982Z","submitted_at":"2024-11-22T10:25:08Z","title":"MovieBench: A Hierarchical Movie Level Dataset for Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15262","snapshot_observed_at":"2026-08-07T05:24:30.497996Z","title":"MovieBench: A hierarchical movie level dataset for long video generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.497996Z"},"links":{"cited_paper":"/paper/2411.15262","citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:865e6bfaae288ddba000c7bc94ecb51e79c38a1ce0ee9b1dcdf3bddc927e6b34","observation_id":"02f33fb4-2f3b-4c8c-8b03-06a0ea14503c","resolution":{"observed_at":"2026-08-07T05:24:30.497996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:24:31.331052Z","title":"Condensed movies: Story based retrieval with contextual embeddings,","venue":null,"work_id":"c9d13e88-009f-4f68-9b86-f92efb84bfee","year":2020},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.503180Z"},"links":{"citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:568feae201b25bac289c732af123fffb3f22b70007f8095bfe62656a2b68d6bc","observation_id":"87cd5216-68e7-4058-b722-039abb8eaf52","resolution":{"observed_at":"2026-08-07T05:24:31.336609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10221","last_updated":"2025-01-10T10:36:58Z","snapshot_observed_at":"2026-07-06T18:31:08.584682Z","submitted_at":"2024-06-14T17:54:54Z","title":"Long Story Short: Story-level Video Understanding from 20K Short Films","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10221","snapshot_observed_at":"2026-08-07T05:24:30.507687Z","title":"Short film dataset (SFD): A benchmark for story-level video understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.507687Z"},"links":{"cited_paper":"/paper/2406.10221","citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:639660b6f61833b80c167631f8e57ddcd46d816b18221c2024739eeb4070420a","observation_id":"8e73c803-64ed-40bb-a691-b58d78a20ef3","resolution":{"observed_at":"2026-08-07T05:24:30.507687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:24:31.315180Z","title":"VideoCrafter2: Over- coming data limitations for high-quality video diffusion models,","venue":null,"work_id":"7c9adb67-cfae-4341-906b-3b2d5f1db044","year":2024},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.512852Z"},"links":{"citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:c673e36d908efd50a01a594e954f3f23c1f97f4779a49711f0c94fc61a0d2c57","observation_id":"dcc8e9f4-e5a2-46f9-8abb-7876849b57ea","resolution":{"observed_at":"2026-08-07T05:24:31.319998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:24:31.299707Z","title":"Video cut detection and analysis tool","venue":null,"work_id":"7840ab67-431c-4dcc-9adf-de68a81f1515","year":null},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.517286Z"},"links":{"citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:f226c32aaa1162191a9716506364ffa6487e31274dcc7a939066388dd6a414e7","observation_id":"d62e1bd4-120d-4c6d-9a71-f055e92dacbb","resolution":{"observed_at":"2026-08-07T05:24:31.304988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05139","last_updated":"2025-02-07T18:15:57Z","snapshot_observed_at":"2026-07-06T20:33:01.960703Z","submitted_at":"2025-02-07T18:15:57Z","title":"Meta Audiobox Aesthetics: Unified Automatic Quality Assessment for Speech, Music, and Sound","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05139","snapshot_observed_at":"2026-08-07T05:24:30.522443Z","title":"Meta audiobox aesthetics: Unified automatic quality assessment for speech, music, and sound,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.522443Z"},"links":{"cited_paper":"/paper/2502.05139","citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:846b8ef6a7da361cac1f77d8114ca80cc1fa3047ed80fcbcb1c859179cc56ab0","observation_id":"b8fdad6b-7583-4436-a9d0-30ad09f57a16","resolution":{"observed_at":"2026-08-07T05:24:30.522443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-07T05:24:30.527178Z","title":"Video instruction tuning with synthetic data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.527178Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:92fd442594017caa7bfe5cf1549043b9898e8e7139f6edca5ab72eb4abb20cdc","observation_id":"5a25c88f-a587-46d3-8cd0-b7f0467bacc4","resolution":{"observed_at":"2026-08-07T05:24:30.527178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:24:31.284694Z","title":"Cinematic sound demixing","venue":null,"work_id":"288f2313-943a-42df-a5b7-38473b4ce364","year":null},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.532116Z"},"links":{"citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:573f62e390a0a8a2af77d99c2c8394d0d60539798fbb74942a7868b50f7072fa","observation_id":"2fea16d8-7016-45c3-b221-8c19d508a5a2","resolution":{"observed_at":"2026-08-07T05:24:31.289568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:24:31.268168Z","title":"Spleeter: a fast and efficient music source separation tool with pre-trained models,","venue":null,"work_id":"201bbeb3-4014-4f61-86f6-a4aeaf6a69af","year":2020},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.536937Z"},"links":{"citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:37688bdd7016d12167a3d8b617d8b33885af43a64de9a8a134abfd8c1ac179a9","observation_id":"d017bcb6-ff74-45fb-8a8a-c1960fa909e5","resolution":{"observed_at":"2026-08-07T05:24:31.273725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:24:31.252577Z","title":"Ultralytics YOLO","venue":null,"work_id":"92598969-d8ef-421f-aa67-815cdb3ffe7b","year":null},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.541280Z"},"links":{"citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:df189641300a2f72d2c6c1f120117bbb257c7a5b5a57e1f21421b7a8d63b744b","observation_id":"11c5ce5e-efa2-41ea-8d26-e62ee7767c38","resolution":{"observed_at":"2026-08-07T05:24:31.257250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:24:31.236102Z","title":"Meet scribe","venue":null,"work_id":"8e3ba04f-6c7e-4993-9835-18244e4c4b60","year":null},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.546019Z"},"links":{"citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:e90eec694d79f9377b2e9510bad6261f0ab441fcf8f4de6063c10b17e626b190","observation_id":"fe301372-756c-4a2f-905c-8cc24c4c07ce","resolution":{"observed_at":"2026-08-07T05:24:31.242082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08189","last_updated":"2021-06-17T19:28:31Z","snapshot_observed_at":"2026-08-06T06:28:43.905562Z","submitted_at":"2021-04-16T15:58:46Z","title":"TalkNet 2: Non-Autoregressive Depth-Wise Separable Convolutional Model for Speech Synthesis with Explicit Pitch and Duration Prediction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08189","snapshot_observed_at":"2026-08-07T05:24:30.551203Z","title":"TalkNet 2: Non-autoregressive depth-wise separable convolu- tional model for speech synthesis with explicit pitch and duration prediction,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.551203Z"},"links":{"cited_paper":"/paper/2104.08189","citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:1c46821da63c8d2e59806b7849caa1a02721c26f947559c78c95d081a9247959","observation_id":"c24d23f4-aca3-4d3f-a2ef-5d519b718316","resolution":{"observed_at":"2026-08-07T05:24:30.551203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:24:31.219037Z","title":"wav2vec 2.0: a framework for self-supervised learning of speech representations,","venue":null,"work_id":"ad8cbf28-37e9-419d-bd03-7039d04cf229","year":2020},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.556119Z"},"links":{"citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:6464d3730e1d9dd91ebebc061df26329d7eafea6a07d0a6286e9a6e0a5fcbcfb","observation_id":"0505b90b-5a1f-4c55-9af1-34f06ae77fe3","resolution":{"observed_at":"2026-08-07T05:24:31.225434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T05:24:30.561313Z","title":"Adam: A method for stochastic optimization,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.561313Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:e49ae349140e300258cd89696a3b22543228f79aca3cb6316a6c6ee3d1803379","observation_id":"de1ebc8c-a82f-4075-9e3f-21ffa472914a","resolution":{"observed_at":"2026-08-07T05:24:30.561313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-07-06T07:19:11.957225Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-07T05:24:30.566199Z","title":"To- wards accurate generative models of video: A new metric & challenges,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.566199Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:2a119ecc5faa037f5ca570ac2a6a098b87b5c5f4fb1d434b3cb5e3f60c905fba","observation_id":"7d5800e6-a8a9-4933-8e39-85d99e5040c8","resolution":{"observed_at":"2026-08-07T05:24:30.566199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:24:31.202038Z","title":"Learning transferable visual models from natural language supervi- sion,","venue":null,"work_id":"421b34ed-967b-427d-bb0e-7b223a913e7f","year":2021},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.571380Z"},"links":{"citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:b21a14f502eddd4465a1ec418becb1c285447af2c34b4541446ca54f6c3055db","observation_id":"861757ed-d16a-4659-8865-6d48a251e24f","resolution":{"observed_at":"2026-08-07T05:24:31.207263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00741","last_updated":"2024-10-04T16:10:38Z","snapshot_observed_at":"2026-07-06T19:25:19.661028Z","submitted_at":"2024-10-01T14:33:22Z","title":"VideoCLIP-XL: Advancing Long Description Understanding for Video CLIP Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00741","snapshot_observed_at":"2026-08-07T05:24:30.577220Z","title":"VideoCLIP-XL: Advancing long description understanding for video clip models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.577220Z"},"links":{"cited_paper":"/paper/2410.00741","citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:f0418a11f16f387f6b4cc7b47c532388b5fe5ea3dab860ce7e9884b3bc4196ef","observation_id":"ccb49950-47e0-4796-a667-e079589500d6","resolution":{"observed_at":"2026-08-07T05:24:30.577220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:24:31.185802Z","title":"ImageBind: One embedding space to bind them all,","venue":null,"work_id":"d859795f-8fea-4b17-9139-f0c75b4c0742","year":2023},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.582083Z"},"links":{"citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:3212a3fc9bab450d98fdd7d3c08b1a82bcd2556d91e12dae7f1b3b9369e18199","observation_id":"fbd91222-ad01-4fd6-9b32-3c82239582fe","resolution":{"observed_at":"2026-08-07T05:24:31.190770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:24:31.169369Z","title":"Out of time: automated lip sync in the wild,","venue":null,"work_id":"4f839579-d86f-478c-944d-d56c31eaec7c","year":2017},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.587157Z"},"links":{"citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:141ca21c07be2729e7325204aceedef3c17c229f036b79c59fee6f728a502f32","observation_id":"646ecfe8-29ef-4aba-af15-a3ad89219233","resolution":{"observed_at":"2026-08-07T05:24:31.175016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18597","last_updated":"2025-03-26T09:05:41Z","snapshot_observed_at":"2026-08-05T17:03:47.891638Z","submitted_at":"2024-12-24T18:51:19Z","title":"DiTCtrl: Exploring Attention Control in Multi-Modal Diffusion Transformer for Tuning-Free Multi-Prompt Longer Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18597","snapshot_observed_at":"2026-08-07T05:24:30.598574Z","title":"DitCtrl: Exploring attention control in multi-modal diffusion transformer for tuning-free multi-prompt longer video generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.598574Z"},"links":{"cited_paper":"/paper/2412.18597","citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:8972c6f8c222ba04d1003960efba30d1eb6030e756a6765733f84e7f480980e2","observation_id":"b9b7134a-a243-48a1-95e5-66c7ac1cf334","resolution":{"observed_at":"2026-08-07T05:24:30.598574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:24:31.151759Z","title":"TA VGBench: Benchmarking text to audible-video generation,","venue":null,"work_id":"9bfe6e7d-7353-4c2b-be71-d1860b50edfd","year":2024},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.604212Z"},"links":{"citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:9a47d04d9ed326b8ef89830b8ed978189537ceeddd3e6c1e65c6b29ac9d2d6e6","observation_id":"2f578fe6-ae65-46dc-8359-c8063755c4de","resolution":{"observed_at":"2026-08-07T05:24:31.157131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:24:31.132606Z","title":"MMDisco: Multi-modal discriminator- guided cooperative diffusion for joint audio and video generation,","venue":null,"work_id":"0486f3f5-b06d-4bad-81da-8ccf93855686","year":2025},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.610563Z"},"links":{"citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:f97f52382857c556439d30246c4cbf2b1ef9a16e8cf60418c529274ae20a00d5","observation_id":"1e644474-6768-4be7-b191-5aef89235a09","resolution":{"observed_at":"2026-08-07T05:24:31.137563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07686","last_updated":"2024-06-11T20:05:58Z","snapshot_observed_at":"2026-08-07T10:32:51.835613Z","submitted_at":"2024-06-11T20:05:58Z","title":"AV-DiT: Efficient Audio-Visual Diffusion Transformer for Joint Audio and Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07686","snapshot_observed_at":"2026-08-07T05:24:30.615859Z","title":"A V-Dit: Efficient audio-visual diffusion transformer for joint audio and video generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.615859Z"},"links":{"cited_paper":"/paper/2406.07686","citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:11ef8661bb25ec67aea32175f4bd7d261711067111434ecde4dc45b6e947a007","observation_id":"d3aa9b78-8bee-4c6f-a667-ef4b871127dc","resolution":{"observed_at":"2026-08-07T05:24:30.615859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:24:30.621496Z","title":"Hallo2: Long-duration and high-resolution audio-driven portrait image animation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.621496Z"},"links":{"citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:60e07329ab88e77cf40b6adeee57f4d6eda8e9ec5046fb734b7ae66dd0d6ac9e","observation_id":"c59b8c40-6eb5-4122-870f-29532280bded","resolution":{"observed_at":"2026-08-07T05:24:30.621496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:24:31.485764Z","title":"SadTalker: Learning realistic 3d motion coefficients for stylized audio-driven single image talking face animation,","venue":null,"work_id":"544db69b-0ff4-4c71-990c-7fd541845efa","year":2023},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.626811Z"},"links":{"citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:4d2f63451e81aeb1c2a1675182694ddeaeebae0e90bd19177c02391cc1ab91cd","observation_id":"21c9b3e6-2ec4-4247-8fa4-8220abff7b6f","resolution":{"observed_at":"2026-08-07T05:24:31.490873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:24:31.099816Z","title":"Maximum filter vibrato suppression for onset detection,","venue":null,"work_id":"2140fe58-856b-4df5-acc9-af33f7445f92","year":null},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.632022Z"},"links":{"citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:62d946e910b9a1f5f28ee63c72ce5d5f7b649d0c8a6a63a38cb9ef97fdd3f898","observation_id":"e04b7e44-6576-4e27-a303-72d88c1d9e66","resolution":{"observed_at":"2026-08-07T05:24:31.108216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:24:31.081206Z","title":"Determining optical flow,","venue":null,"work_id":"b2d9b108-b720-429c-bf0c-dc09e616e7fc","year":1981},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.637501Z"},"links":{"citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:92cd2f2bbdc80113090c1a664b2c65d29dcab9d331d5ab156973f22241d3409a","observation_id":"533130be-c7b5-4938-a734-f57842d3dd34","resolution":{"observed_at":"2026-08-07T05:24:31.087789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control"},"reference_resolution":{"displayed":71,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":0,"verified_fuzzy":44},"total_outbound_references":71},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 71 of 71 outbound references and 1 inbound Pith citation observation for arXiv:2506.08003."}