{"as_of":"2026-08-07T20:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:17e1eca4e0fc97c544496087885bb0ffc4f1595d92f55895dad1274b92d3fbe3","coverage":[{"denominator":80,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":80,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T18:00:39.556424Z","state":"measured"},{"denominator":81,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":81,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T13:41:47.011782Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.20183","snapshot_observed_at":"2026-08-01T13:41:47.011782Z","title":"Msavbench: Towards comprehensive and reliable evaluation of multi-shot audio-video generation.arXiv preprint arXiv:2605.20183, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19038","last_updated":"2026-07-21T12:28:58Z","snapshot_observed_at":"2026-08-04T20:43:12.839853Z","submitted_at":"2026-07-21T12:28:58Z","title":"FilmWorld: Agentic Novel-to-Film Generation through Dynamic Cinematic World Modeling","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T13:41:47.011782Z"},"links":{"cited_paper":"/paper/2605.20183","citing_paper":"/paper/2607.19038"},"observation_digest":"sha256:81e90fc7b5f7d6ccf90785756930cc9588b39508f9724f687baa98856a9eff4a","observation_id":"08202a3a-1b25-4bc4-b1b9-1b502ccb21f9","resolution":{"observed_at":"2026-08-01T13:41:47.011782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.20183/citation-record","integrity":"/paper/2605.20183/integrity","json":"/paper/2605.20183/citation-record.json","paper":"/paper/2605.20183"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:34:42.263818Z","title":null,"venue":null,"work_id":"596f1f4e-eea0-4a62-888d-50e5f8a3fba5","year":2025},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:600addec21818f8f3e8efb3860d50979f4f9e23d8f71f2ea6f9cbbafc07e0bdf","observation_id":"2b230e35-e930-4f43-b1b3-7e6da2703009","resolution":{"observed_at":"2026-07-08T06:34:42.264940Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:1ba34b4798e96621ed05029ed64a3f16063b7b4357497b0c7a9c01e70dfe213b","observation_id":"60dcb6f3-4bda-4109-8857-e13451b4e264","resolution":{"observed_at":"2026-06-30T18:04:58.097549Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.10204","last_updated":"2020-06-17T23:52:46Z","snapshot_observed_at":"2026-08-07T03:35:23.462173Z","submitted_at":"2020-06-17T23:52:46Z","title":"BlazePose: On-device Real-time Body Pose tracking","version":1},"cited_work":{"arxiv_id":"2006.10204","doi":"10.48550/arxiv.2006.10204","metadata_source":"pith","pith_arxiv_id":"2006.10204","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BlazePose: On-device Real-time Body Pose Tracking","venue":"cs.CV","work_id":"60d14a11-6c78-462f-aa3d-657af1c27909","year":2020},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"cited_paper":"/paper/2006.10204","citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:79eeaf765d76d6ea61400e5d423fdb17e9e807eea654167637394368f244c22b","observation_id":"dc38bd91-e344-4e39-9944-cf79927e1327","resolution":{"observed_at":"2026-06-30T18:04:58.095017Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:e08dd868020bbafa68e61660924b522f6dd0dc37fe7bdf5d4d415fe282060194","observation_id":"21f2cbdd-2c38-495f-a64d-ae57099572eb","resolution":{"observed_at":"2026-06-30T18:04:58.094505Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:34:42.290790Z","title":"Video generation models as world simulators","venue":null,"work_id":"6d25dc8f-02d4-4aab-84e4-1d87bf3567a6","year":2024},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:3ed2e2da840f786b737a9cdaab94ce75df7277071c99a0dbd457dcca90cd13bd","observation_id":"89bb3661-a6c0-4dc8-835d-be78492277c1","resolution":{"observed_at":"2026-07-08T06:34:42.291974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:34:42.285115Z","title":null,"venue":null,"work_id":"c0cebb51-5bf5-4ff7-96eb-afeb8a6dcdb4","year":2024},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:00011740f231a192b5d76cf465f087e0ef5c514b1940e9b389d23d0b1591066b","observation_id":"9b2e3eb9-681d-4a7f-9e8e-18b1b74b17a2","resolution":{"observed_at":"2026-07-08T06:34:42.286190Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.21094","last_updated":"2026-06-02T17:15:46Z","snapshot_observed_at":"2026-08-06T21:10:12.336800Z","submitted_at":"2025-12-24T10:30:35Z","title":"T2AV-Compass: Towards Unified Evaluation for Text-to-Audio-Video Generation","version":2},"cited_work":{"arxiv_id":"2512.21094","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.21094","snapshot_observed_at":"2026-07-02T22:17:26.093228Z","title":"T2av-compass: Towards unified evaluation for text-to-audio-video generation","venue":"cs.CV","work_id":"f4d29773-29d6-486a-8faa-73376b01dd55","year":2025},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"cited_paper":"/paper/2512.21094","citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:6d59b0183afd16ac41160938b33084d95be94951784d5942056db4f80a4540e3","observation_id":"754ea24a-d19d-4c7e-a89b-286438c28a05","resolution":{"observed_at":"2026-06-30T18:04:58.096846Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:24:43.222675Z","title":"Talkvid: A large-scale diversified dataset for audio-driven talking head synthesis","venue":null,"work_id":"3859053e-a676-4167-bfab-d7acf94dfe8c","year":2025},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:bea2f575f6da2783fee79f34a73205d16201d8d822b6fb793345721cff1e4be0","observation_id":"4a119891-80ba-4ef4-ab13-9580042d523f","resolution":{"observed_at":"2026-07-08T06:24:43.224310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:24:43.220882Z","title":"MMAudio: Taming Multimodal Joint Training for High-Quality Video-to-Audio Synthesis","venue":null,"work_id":"26b8ab94-3923-4baa-870a-b93b77782782","year":2025},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:c319f3d8eef41041c25e9c4ded9fde24baa60a42ea6ae7acb26d067d7f395d34","observation_id":"8df5aad2-007e-4e67-bacc-6409cb6c6e47","resolution":{"observed_at":"2026-07-08T06:24:43.222118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:24:43.224848Z","title":"W2v-bert: Combining contrastive learning and masked language modeling for self-supervised speech pre-training","venue":null,"work_id":"51da5847-e710-43c2-89fc-bbd20c023397","year":2021},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:e77a5fbdef52e8d419e99e8b0b72599ba2008db14aff3d64f172bbfdf6429b9b","observation_id":"16d5c764-e452-4aa6-8e7a-115151217502","resolution":{"observed_at":"2026-07-08T06:24:43.229203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:24:43.229752Z","title":"Paddleocr-vl-1.5: Towards a multi-task 0.9b vlm for robust in-the-wild document parsing","venue":null,"work_id":"f6f68e0a-aa5b-4816-a352-664e713cfa50","year":2026},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:949bb576e9d11bf3f70111b915380be1eb67520dc6c13dc7e8cac1353aab2619","observation_id":"971b4ae8-8f37-4219-99dc-e5715983224b","resolution":{"observed_at":"2026-07-08T06:24:43.230936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:34:42.265474Z","title":"PaddleOCR-VL: Boosting Multilingual Document Parsing via a 0.9B Ultra-Compact Vision-Language Model","venue":null,"work_id":"5d1c8875-bd79-475b-960d-3456449459ae","year":2025},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:4d09c63eb245936e0eec2d74fa7dd0cd3b18ea8314ef3afe5a8b8e4d368b5a62","observation_id":"6e9bb927-2ead-4ebf-902d-7b7cb53db59d","resolution":{"observed_at":"2026-07-08T06:34:42.266730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.01174","last_updated":"2019-09-03T13:41:56Z","snapshot_observed_at":"2026-08-06T05:36:51.264415Z","submitted_at":"2019-09-03T13:41:56Z","title":"Demucs: Deep Extractor for Music Sources with extra unlabeled data remixed","version":1},"cited_work":{"arxiv_id":"1909.01174","doi":null,"metadata_source":"pith","pith_arxiv_id":"1909.01174","snapshot_observed_at":"2026-07-05T12:41:04.369000Z","title":"Demucs: Deep extractor for music sources with extra unlabeled data remixed","venue":"cs.SD","work_id":"7b9c4858-ec37-4365-938e-afa0da25520a","year":2019},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"cited_paper":"/paper/1909.01174","citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:f4c5ecd12c55870f155deffff635ee7d6773c02c626c8680b1ee2fafb227cff2","observation_id":"9889eef2-f610-432c-ad4f-605c7549969a","resolution":{"observed_at":"2026-06-30T18:04:58.105130Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T17:35:10.817115Z","title":"Arcface: Additive angular margin loss for deep face recognition","venue":null,"work_id":"466a3f28-f5e8-456f-9a6a-a6b0fdb10a43","year":2019},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:3a327992aa0f377d5f12eae6374a4a2aae794f782a7ce0f0bf16a152c88509db","observation_id":"0bf5db51-6e5a-4452-8b96-e804ae2a2cab","resolution":{"observed_at":"2026-07-08T06:24:43.218628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T13:24:54.779001Z","title":"Scaling rectified flow trans- formers for high-resolution image synthesis","venue":null,"work_id":"3561a0ff-7939-4f07-9620-be9f8868052e","year":2024},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:a278d466c9137b6bce33c3f1d9119c73450cd800c62d1b89534ecb14a802e444","observation_id":"b428f046-a40d-422f-8123-17153205ff75","resolution":{"observed_at":"2026-07-08T06:24:43.220292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:34:42.286712Z","title":"Veo 3.1.https://deepmind.google/technologies/veo/","venue":null,"work_id":"c2139961-73b8-4a5c-8cee-30935e128072","year":2026},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:920e4349d372667da8f64c74410b76abead56330b8076ca3b774ca4a7b2c5d56","observation_id":"f146a850-2e1d-4f43-936c-a14f90ef8ade","resolution":{"observed_at":"2026-07-08T06:34:42.287904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:34:42.283416Z","title":"Audcast: Audio-driven human video generation by cascaded diffusion transformers","venue":null,"work_id":"46af1c39-d74c-4cce-9bb9-92217e284262","year":2025},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:0b7309dfbc0e62d65f27d9a14da44f9e191fe6015b6b04b2da8f25ba33540fe5","observation_id":"4d47b458-493a-4b3d-bd1a-a525431148f8","resolution":{"observed_at":"2026-07-08T06:34:42.284560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.12160","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T06:29:36.885838Z","title":"Dreamid-omni: Unified framework for controllable human-centric audio-video generation","venue":null,"work_id":"68a86102-576d-488e-8468-d7d87f76624f","year":2026},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:b703bfed6f92e9140a78dfd489176a60725d66d20969dbaeae2e46abc105c9a1","observation_id":"ce96b9b5-c5a2-493a-8a5a-dbaa67a6cb56","resolution":{"observed_at":"2026-06-30T18:04:58.102413Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00103","last_updated":"2024-12-30T19:00:25Z","snapshot_observed_at":"2026-07-06T20:14:54.297131Z","submitted_at":"2024-12-30T19:00:25Z","title":"LTX-Video: Realtime Video Latent Diffusion","version":1},"cited_work":{"arxiv_id":"2501.00103","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.00103","snapshot_observed_at":"2026-07-09T07:56:04.699528Z","title":"LTX-Video: Realtime Video Latent Diffusion","venue":"cs.CV","work_id":"cee5c521-3ce9-466e-a035-1e42f89254f4","year":2024},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"cited_paper":"/paper/2501.00103","citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:3d83abf6e6f30b5e7fae66ffabed801e46d941b11ddad9a0cba051984c01ee67","observation_id":"01c7872a-688d-4aa8-9813-101509c4654e","resolution":{"observed_at":"2026-06-30T18:04:58.052524Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:24:43.213996Z","title":"Video-bench: Human-aligned video generation benchmark","venue":null,"work_id":"53afc07f-f240-4533-adf6-304047280f56","year":2025},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:96edf530ae0e05844743396485bf83e562e6b732c179899511909499a2ae540d","observation_id":"f270e092-163c-4e0e-af13-1536d4b9654a","resolution":{"observed_at":"2026-07-08T06:24:43.215199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.28078","last_updated":"2026-04-30T16:24:07Z","snapshot_observed_at":"2026-07-06T23:13:24.960159Z","submitted_at":"2026-04-30T16:24:07Z","title":"AesRM: Improving Video Aesthetics with Expert-Level Feedback","version":1},"cited_work":{"arxiv_id":"2604.28078","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.28078","snapshot_observed_at":"2026-06-30T18:04:58.053921Z","title":"AesRM: Improving Video Aesthetics with Expert-Level Feedback","venue":"cs.CV","work_id":"f56f6b45-0c02-4e65-9ba2-b6c01aa15778","year":2026},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"cited_paper":"/paper/2604.28078","citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:2f7fff43d26a2a750cc3f568e9346f877c79153b8c4de5b26cbf254ae18cf4b7","observation_id":"073be41a-85d1-4974-833e-5255aec4d323","resolution":{"observed_at":"2026-06-30T18:04:58.055663Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:24:43.195493Z","title":"HappyHorse 1.0.https://www.happyhorse.cn/, 2026","venue":null,"work_id":"341b6464-605e-4faa-a9e0-199d69dc9271","year":2026},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:f65756c89efa980006245603b6bd933b2a0832838c95ebd1f5412c464b05d850","observation_id":"00575db7-25d9-44bf-a079-cf1226de5126","resolution":{"observed_at":"2026-07-08T06:24:43.196554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:37:16.225324Z","title":"Denoising diffusion probabilistic models.Advances in neural information processing systems, 33:6840–6851","venue":null,"work_id":"82ba805b-3e59-43c6-b37f-3aa1940eea68","year":2020},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:efdd8006f371ad3b55e2dbdef16c63ca5ec1c662ffc9ff7b929e26c303a7c029","observation_id":"041217ff-a865-4c75-8a70-aa976cc281bd","resolution":{"observed_at":"2026-07-08T06:24:43.198478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.828784Z","title":"Video diffusion models.Advances in neural information processing systems, 35:8633–8646","venue":null,"work_id":"1f8f79e2-ab6d-4144-b8df-c93b5880020a","year":2022},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:b319fc2c8494d84550f9afefde89fc97913f6ae590a069bcfc8eddbae0135d93","observation_id":"68606a4d-3a45-4662-bf95-c21fb80612ec","resolution":{"observed_at":"2026-07-08T06:24:43.206334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.09299","last_updated":"2026-04-06T13:16:33Z","snapshot_observed_at":"2026-07-06T22:38:35.387503Z","submitted_at":"2025-12-10T03:57:29Z","title":"VABench: A Comprehensive Benchmark for Audio-Video Generation","version":2},"cited_work":{"arxiv_id":"2512.09299","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.09299","snapshot_observed_at":"2026-07-05T12:41:04.378368Z","title":"VABench: A Comprehensive Benchmark for Audio-Video Generation","venue":"cs.CV","work_id":"0b1e3c4c-ed41-4a5d-aee8-471b82e5072a","year":2025},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"cited_paper":"/paper/2512.09299","citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:ecf0effef12ad42a01c830b6db8976893ae1985cbf5586382d0b1ba30640cc40","observation_id":"302a8e5a-5588-493b-b683-2bd3d6c299ae","resolution":{"observed_at":"2026-06-30T18:04:58.072872Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:24:43.215745Z","title":"Self forcing: Bridging the train-test gap in autoregressive video diffusion","venue":null,"work_id":"0355558d-4572-4214-83ad-cf0b19cdc95a","year":2025},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:282c6db29d1416ef2661f8c82199de12f910874017dec60bf0d1a643f26a580f","observation_id":"7708f7c2-1e8d-41ae-a40d-437e171f3f57","resolution":{"observed_at":"2026-07-08T06:24:43.216908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T01:07:50.611559Z","title":"Vbench: Comprehensive benchmark suite for video generative models","venue":null,"work_id":"2383dbc4-0e5d-40ed-a102-5aac37332eae","year":2024},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:bda1248cccded70f16a05d138f926a1343094a9bf020c9dda5a7e51910a7a351","observation_id":"114684d0-6017-4382-a988-593acce8256e","resolution":{"observed_at":"2026-07-08T06:34:42.290197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:24:43.188145Z","title":"Synchformer: Efficient synchronization from sparse cues","venue":null,"work_id":"6911af40-87eb-4e0f-b79e-63f4dae193b9","year":2024},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:960b165091421f191fa085e287872323796d0ac52f6404606953efb649581077","observation_id":"99a207e0-4c0a-4edc-ab6d-e306c3b7db01","resolution":{"observed_at":"2026-07-08T06:24:43.189397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:24:43.182708Z","title":"All-in-one metrical and functional structure analysis with neigh- borhood attentions on demixed audio","venue":null,"work_id":"61055690-1621-4786-8b0f-47acd18ba5fc","year":2023},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:fc0e5c49a781b48b48c2835870bf52df16a252d7a0c47c2b0dbf3ce7465e8cd8","observation_id":"56b8a1c1-72b1-41e0-bcc2-815b993890b6","resolution":{"observed_at":"2026-07-08T06:24:43.184046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:8508c2ce40a9f598698419393ddf9356bbf34852e5d82aed5ceb271b3a323cfa","observation_id":"c6e423b3-5615-4b58-90cf-2c9e8003cfed","resolution":{"observed_at":"2026-06-30T18:04:58.037994Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:24:43.190230Z","title":"Kling 3.0.https://klingai.com/global/","venue":null,"work_id":"04ec4d40-0091-44d6-8433-627f58eabed1","year":2026},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:e49bf2ee950b7d4f856007456da819fbd4d2b5225b5deb7138439457f9e79fd1","observation_id":"6dc58720-b1d5-463b-a9c7-54fdc3826dbd","resolution":{"observed_at":"2026-07-08T06:24:43.191440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-07-06T20:05:55.982214Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":"2412.09262","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-07-04T21:00:08.897097Z","title":"Latentsync: Taming audio-conditioned latent diffusion models for lip sync with syncnet supervision","venue":null,"work_id":"58bec219-b581-4884-a7c0-51325341150e","year":2024},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:17d44c6c1b336407de5ff29aa2755cc89f9d2b0cf81e9764ff91cd64cdb15aab","observation_id":"7405bc37-39ad-4398-a4d2-37075cefa508","resolution":{"observed_at":"2026-06-30T18:04:58.047082Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:24:43.172927Z","title":"Lr-asd: Lightweight and robust network for active speaker detection.International Journal of Computer Vision, 133(7):4749–4769","venue":null,"work_id":"28684ab4-4ae5-431b-86bb-011dd267fc61","year":2025},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:799a390c9ef65d4136f02e203ce97e8935bf95f68ffcdd2927b07d855128f048","observation_id":"3d8c1b93-4d58-4921-a35b-577ff1e5ab6f","resolution":{"observed_at":"2026-07-08T06:24:43.174275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.28068","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T18:04:58.019440Z","title":"Aibench: Evaluating visual-logical consistency in academic illustration generation","venue":null,"work_id":"ba8d9820-23dd-4769-966a-16689f50bcba","year":2026},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:044f51f373f1296b1f455ddd13f218b6a75e28a7cc3199bb6b139b5b4b63c6bf","observation_id":"0b81b2d1-7a63-4814-8ee0-07c2a7036a3e","resolution":{"observed_at":"2026-06-30T18:04:58.020908Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:24:43.191958Z","title":"Javisgpt: A unified multi-modal llm for sounding-video comprehension and generation","venue":null,"work_id":"abca195c-1916-4ca1-b055-8f8caa587440","year":2025},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:6a26deb0ef8324615701cdfc63cbb116cb4a94f6b6d0faf56c36bc622305359e","observation_id":"14eceddd-a168-40e3-88c8-ae6c26a3dfba","resolution":{"observed_at":"2026-07-08T06:24:43.193107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:34:42.281694Z","title":"Javisdit++: Unified modeling and optimization for joint audio-video generation","venue":null,"work_id":"a4520615-cde2-4345-aeea-4b2637c3df0b","year":2026},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:b115d02fe9195bfb6d6708a3b0bdfd257c4c7be98f3c3fa803c23cc76d0edcf5","observation_id":"d438a6e9-944c-41b6-a699-7f2960996f33","resolution":{"observed_at":"2026-07-08T06:34:42.282889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:26:52.337971Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":"98d774c8-2295-4dc2-82fb-624467a40d12","year":2024},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:733ab7533a81308d029a05158dd3ff344e529879f6880b3e1ba2d69e96d2507c","observation_id":"3780d891-86df-4711-9564-f762964e0800","resolution":{"observed_at":"2026-07-08T06:34:42.276184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11440","last_updated":"2024-03-23T04:58:50Z","snapshot_observed_at":"2026-08-04T15:31:22.733113Z","submitted_at":"2023-10-17T17:50:46Z","title":"EvalCrafter: Benchmarking and Evaluating Large Video Generation Models","version":3},"cited_work":{"arxiv_id":"2310.11440","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.11440","snapshot_observed_at":"2026-07-01T15:45:48.902358Z","title":"Evalcrafter: Benchmarking and evaluating large video generation models","venue":null,"work_id":"7e755299-7217-4af5-a711-0d29a31768fb","year":2024},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"cited_paper":"/paper/2310.11440","citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:c2954c79ecc60a67b349f145015ddd62be2cd636139a5741a11eb00046728073","observation_id":"f302f2bd-8f35-487b-a572-69bfce3f166f","resolution":{"observed_at":"2026-06-30T18:04:58.029339Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.25746","doi":"10.48550/arxiv.2603.25746","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Shotstream: Streaming multi-shot video generation for interactive storytelling","venue":"arXiv (Cornell University)","work_id":"eabcc1e0-ee6b-47bf-90fc-2e4fa7704243","year":2026},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:703402eea9ed8991c42cbe3734db877b5a54ae0dddd95a4bb2c3c18762e034d7","observation_id":"a1ab789a-e2ae-46d6-b0c7-840700e0d2e4","resolution":{"observed_at":"2026-06-30T18:04:58.046896Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-10T19:18:55.664338+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T19:18:55.664338+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.19858","last_updated":"2026-04-23T15:33:31Z","snapshot_observed_at":"2026-08-02T10:08:34.031243Z","submitted_at":"2026-04-21T17:58:58Z","title":"Wan-Image: Pushing the Boundaries of Generative Visual Intelligence","version":2},"cited_work":{"arxiv_id":"2604.19858","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.19858","snapshot_observed_at":"2026-07-04T13:29:51.521997Z","title":"Wan-Image: Pushing the Boundaries of Generative Visual Intelligence","venue":"cs.CV","work_id":"0ed651da-a08a-4379-8bdd-118ece0b8796","year":2026},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"cited_paper":"/paper/2604.19858","citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:646e23771fb6cd5e5b9f9d6e92ed96a747a00b90af48adb195218e904bd78aaa","observation_id":"9ec455b3-a782-443c-8102-1e1a1a4d1d7b","resolution":{"observed_at":"2026-06-30T18:04:58.049614Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:34:42.276747Z","title":null,"venue":null,"work_id":"d9ed6359-b4ae-4dfd-adca-ca46ce67279b","year":2026},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:419260b50a87b74b9a555a5f5b316b5d4fb7cb29f62261285ca7fca7cbcbb7d9","observation_id":"2bf79fd5-8cc2-43ae-bdf3-aaa027d17dcc","resolution":{"observed_at":"2026-07-08T06:34:42.277803Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:34:42.269000Z","title":"Sora 2.https://openai.com/index/sora-2/","venue":null,"work_id":"1f8c61ec-a32a-426b-95fb-1b6ce41ec71e","year":2025},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:766ea6dbca2691e8d77d6b76f0202d22694239fd59fcc556b48f5cf3dd627b22","observation_id":"f7f7f04c-81f1-4bf1-9c6f-a93cf7d3e0cb","resolution":{"observed_at":"2026-07-08T06:34:42.270291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:9d49187ac0679d72742c6da531e451c4518aada16c38ad556a1345a50c6d30de","observation_id":"742ea77e-45c9-4797-a1c0-64838549f617","resolution":{"observed_at":"2026-06-30T18:04:58.052844Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06656","last_updated":"2025-07-19T18:18:34Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:20:11Z","title":"Sortformer: A Novel Approach for Permutation-Resolved Speaker Supervision in Speech-to-Text Systems","version":3},"cited_work":{"arxiv_id":"2409.06656","doi":"10.48550/arxiv.2409.06656","metadata_source":"arxiv_reference","pith_arxiv_id":"2409.06656","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sortformer: A novel approach for permutation-resolved speaker supervision in speech-to-text systems","venue":"arXiv (Cornell University)","work_id":"76b062da-e86d-4202-9b1d-f73b5e226391","year":2024},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"cited_paper":"/paper/2409.06656","citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:e7b151f172ea4058d1f2be628a5ccf20c50fdc643f0be549192550836505dfac","observation_id":"14d97904-3a22-40ed-920a-980f82fd1886","resolution":{"observed_at":"2026-06-30T18:04:58.049750Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.13720","doi":"10.48550/arxiv.2410.13720","metadata_source":"pith","pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Movie Gen: A Cast of Media Foundation Models","venue":"cs.CV","work_id":"a6a118b0-002f-4b19-881f-7f1183e0d7d8","year":2024},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:0f2f81eace5cb52a54a4191ab7caf75de5a4e41add879e45231e56b57e56f02a","observation_id":"f210a310-e110-4dc4-a3aa-840a8afb0616","resolution":{"observed_at":"2026-06-30T18:04:58.110443Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T07:16:04.687562Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"ad3e05b3-af3a-4fa2-ab30-c45f9f403277","year":2021},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:c07b4b813abbeeaa5edaaaf1eee302d0521230e6ad2c6e9c9ce97834596f8f1d","observation_id":"2867909c-fb66-4747-ae02-c697c0be5be9","resolution":{"observed_at":"2026-07-08T06:34:42.274373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:34:42.267245Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":"df748bf8-90bc-4699-a0f5-ab532ce692e1","year":2023},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:88b0af6f0814bdb5a1f4d1be28bc56408eead9742d00d15a1dec3e0966e09c63","observation_id":"1e1629f0-25b1-47e7-af1f-c73969ca6cdd","resolution":{"observed_at":"2026-07-08T06:34:42.268466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.14148","last_updated":"2026-04-15T17:59:40Z","snapshot_observed_at":"2026-07-06T23:02:00.082783Z","submitted_at":"2026-04-15T17:59:40Z","title":"Seedance 2.0: Advancing Video Generation for World Complexity","version":1},"cited_work":{"arxiv_id":"2604.14148","doi":"10.48550/arxiv.2604.14148","metadata_source":"pith","pith_arxiv_id":"2604.14148","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Seedance 2.0: Advancing Video Generation for World Complexity","venue":"cs.CV","work_id":"ceac4ea4-1ca6-4fe9-8324-880c07aec27d","year":2026},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"cited_paper":"/paper/2604.14148","citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:5453a1c0bcda5289cca5cc4753f648703719ccf2d3fc3e92a59f87803aef5ec5","observation_id":"3cd957c4-9bb1-4c81-b13b-ce033e8ec2b7","resolution":{"observed_at":"2026-06-30T18:04:58.092032Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.183783+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.183783+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:34:42.271060Z","title":"Hunyuanvideo-foley: Multimodal diffusion with representation alignment for high- fidelity foley audio generation","venue":null,"work_id":"2351c7d2-95a1-4af3-bbde-4aaba8858aef","year":2025},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:d5afeec440863ef4cbdfd3042db0b2a399daed5b10315c23348af5e19cc4a601","observation_id":"3388e2cd-6615-4fff-89af-d755b1db3d19","resolution":{"observed_at":"2026-07-08T06:34:42.272452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.23969","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T21:18:58.068563Z","title":"Msvbench: Towards human-level evaluation of multi-shot video generation.arXiv preprint arXiv:2602.23969","venue":null,"work_id":"d36a8679-3b8b-43f5-aad5-e5a9e27a80af","year":2026},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:8e8049ad5386ca948568c538f02e2f35de07ac170fa893e1c4be1c8ef8f5bab2","observation_id":"ece795b4-93cc-4809-93a1-65ceb033aedd","resolution":{"observed_at":"2026-06-30T18:04:58.077935Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.21986","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T00:37:29.792063Z","title":"Speed by simplicity: A single-stream architecture for fast audio-video generative foundation model","venue":null,"work_id":"b20b430c-75db-48ea-9a8d-4bbdeb416467","year":2026},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:d0b51d716cf54e6829582f028d50d0391220659854332ffaa1f77be107bdaa5a","observation_id":"35c7c9bc-5571-4b3f-ae55-959150ffd0d4","resolution":{"observed_at":"2026-06-30T18:04:58.089417Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":"2209.14792","doi":"10.48550/arxiv.2209.14792","metadata_source":"pith","pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","venue":"cs.CV","work_id":"52a801fc-a707-45a1-a8cd-0d6702f124ab","year":2022},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:d035340a646b0fd677743439ef29806564ed9a6d79db4f04eaee33e60c951fb1","observation_id":"1d2fdd39-7e8f-49fa-9bfd-361a1638cc03","resolution":{"observed_at":"2026-06-30T18:04:58.075200Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01292","last_updated":"2024-04-01T17:58:30Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-04-01T17:58:30Z","title":"Measuring Style Similarity in Diffusion Models","version":1},"cited_work":{"arxiv_id":"2404.01292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.01292","snapshot_observed_at":"2026-07-04T19:50:10.486935Z","title":"Measuring style similarity in diffusion models","venue":null,"work_id":"485d434f-db28-411e-9f19-160574d535ae","year":2024},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"cited_paper":"/paper/2404.01292","citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:6cec3250be99239aae00b5f04996cf880f929398056cd0325ab25166cda97209","observation_id":"da56686f-a0d3-49ff-90bf-e3f0db9ab855","resolution":{"observed_at":"2026-06-30T18:04:58.067121Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2008.04838","last_updated":"2020-08-11T16:37:59Z","snapshot_observed_at":"2026-08-03T19:11:12.569454Z","submitted_at":"2020-08-11T16:37:59Z","title":"TransNet V2: An effective deep network architecture for fast shot transition detection","version":1},"cited_work":{"arxiv_id":"2008.04838","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2008.04838","snapshot_observed_at":"2026-07-04T06:29:36.931995Z","title":"arXiv preprint arXiv:2008.04838 (2020)","venue":null,"work_id":"16ef49be-5783-4e0a-a993-09cdb1ab77c3","year":2008},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"cited_paper":"/paper/2008.04838","citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:b0390d8c2453f562d128e343fd0b6589b55a0558cdd4bac224771f5250f353b6","observation_id":"c7e224ab-51cd-4045-93fd-879cbdf319d2","resolution":{"observed_at":"2026-06-30T18:04:58.064900Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:34:42.278323Z","title":"The proof and measurement of association between two things","venue":null,"work_id":"98ee694f-8400-403e-96bf-57eba0b9570b","year":1961},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:66922def5deef3bf06dd706dae89fbf044c0fc4526195f0060ce1c6917d365e8","observation_id":"a50ec9bc-5dd2-4d36-ae12-f4ffdfba8a6a","resolution":{"observed_at":"2026-07-08T06:34:42.279485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.08794","doi":"10.48550/arxiv.2602.08794","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mova: Towards scalable and synchronized video-audio generation","venue":"Open MIND","work_id":"1ec90ca8-482d-433a-94ad-2005f2c6fe8f","year":2026},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:d67f710287863d4bb62479560c5a2b1f77a9855e01235f5ad42e1441eb744892","observation_id":"46694b87-8d32-4140-bd1b-1406ecfa9b59","resolution":{"observed_at":"2026-06-30T18:04:58.075300Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:24:43.212088Z","title":"Qwen3.5: Accelerating productivity with native multimodal agents, February 2026","venue":null,"work_id":"b77fedc3-a912-4565-bc43-a99b23121099","year":2026},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:6b4b8ecf60ed7dbf26234dfa7da03944e6e479bb982c730792f7dbb9a1077087","observation_id":"ce04f98c-2084-4f73-ada9-4bab4c7bcf0e","resolution":{"observed_at":"2026-07-08T06:24:43.213330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:24:43.207141Z","title":"Silero V AD: pre-trained enterprise-grade V oice Activity Detector (V AD), Number Detector and Language Classifier.https://github.com/snakers4/silero-vad","venue":null,"work_id":"431fe244-7111-4491-bd67-54458c402bcd","year":2024},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:2518d0e70e9350eb67d3e61ea77af00c2ca1f69763238e0f0c5f1dd78454b846","observation_id":"74e7f370-1e20-407a-9f27-a28b0dc5915c","resolution":{"observed_at":"2026-07-08T06:24:43.209041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:24:43.210256Z","title":"Gemini 3.1 Pro","venue":null,"work_id":"86b1e0cd-1379-4958-89ad-92f166f98d8a","year":2026},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:c4c8eeabc9ae6d99cb0abfc530d4c3d8379cccb02f0aa189f9d068d3801f58a1","observation_id":"3078c1c7-a593-4f1d-98ac-12f0209e031e","resolution":{"observed_at":"2026-07-08T06:24:43.211458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:34:42.280009Z","title":"Meta audiobox aesthetics: Unified automatic quality assessment for speech, music, and sound","venue":null,"work_id":"8950a9fa-d9a0-4d3c-b4b8-fbd073cac859","year":2025},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:e43afff56dcee14db4d564b2f3dba1a62c182d8ef5937a9328562cf91606a7ac","observation_id":"5c007a96-4831-49d4-bb8e-426a4d97b69c","resolution":{"observed_at":"2026-07-08T06:34:42.281165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:24:43.181058Z","title":"Wan2.7.https://www.wan27.xyz/","venue":null,"work_id":"197df13c-aed2-4d28-a3e0-e3d46802c1d8","year":2026},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:b8cb3e42ec2b8bfb79b073c58157767a7faf5d31bb89848f6faaecb39c2ae386","observation_id":"e72f9e0c-6812-43c5-a960-c66bad685702","resolution":{"observed_at":"2026-07-08T06:24:43.182130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":"2503.20314","doi":"10.1109/19.492748","metadata_source":"pith","pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":"cs.CV","work_id":"ad3ebc3b-4224-46c9-b61d-bcf135da0a7c","year":2025},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:6a1c2ab404bcae3cd000100565d2a2efb3a7db0723670d12355e08e58fdfa7d7","observation_id":"ac3dff55-d9b9-469a-a60c-0822fef3f0ac","resolution":{"observed_at":"2026-06-30T18:04:58.077837Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07686","last_updated":"2024-06-11T20:05:58Z","snapshot_observed_at":"2026-08-07T10:32:51.835613Z","submitted_at":"2024-06-11T20:05:58Z","title":"AV-DiT: Efficient Audio-Visual Diffusion Transformer for Joint Audio and Video Generation","version":1},"cited_work":{"arxiv_id":"2406.07686","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.07686","snapshot_observed_at":"2026-07-05T12:41:04.339380Z","title":"Av-dit: Efficient audio-visual diffusion transformer for joint audio and video generation","venue":"cs.CV","work_id":"528a3648-2bbc-4d29-8c07-ee22d6cafddb","year":2024},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"cited_paper":"/paper/2406.07686","citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:d9a8f8224feb5f5122f36bcfd9bcc75650b6246c49e6149a5220803bbd4e1426","observation_id":"1a2363ae-3ee2-4dfb-828a-5af00680156e","resolution":{"observed_at":"2026-06-30T18:04:58.083504Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:24:43.174922Z","title":"Japanese Anime Scenes","venue":null,"work_id":"5d9abece-c7db-4509-b0c5-499ce906ff6b","year":2023},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:2abbb4900e588bf4919d155281a835c09f42a1f0ccffc52e7a453873c5c5698e","observation_id":"472ed063-ba2d-48f4-b396-c244c36ec198","resolution":{"observed_at":"2026-07-08T06:24:43.177959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.21835","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T20:57:23.172174Z","title":"Univbench: Towards unified evaluation for video foundation models","venue":null,"work_id":"cb106e3a-cbf8-4ff2-be52-94b449664aeb","year":2026},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:929b9a258226cace9208dee018bb4004f9d925575a179f36c47f58f9dafd544e","observation_id":"afa99c47-5b05-4a59-b007-1e072b72caf6","resolution":{"observed_at":"2026-06-30T18:04:58.067412Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.12257","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T18:04:58.090614Z","title":"Dreamvideo-omni: Omni-motion controlled multi-subject video customization with latent identity reinforcement learning","venue":null,"work_id":"e6928515-7709-4e34-9786-37bee904db46","year":2026},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:73141dc23fa692fc6f17416471b881c4b636ed204bd42f6575049b1bfde83800","observation_id":"ee84af24-707c-475f-ae99-ee32b5aa6994","resolution":{"observed_at":"2026-06-30T18:04:58.092124Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:24:43.178687Z","title":"Dreamvideo: Composing your dream videos with cus- tomized subject and motion","venue":null,"work_id":"e587844e-b761-4366-8876-ff8cdc91638d","year":2024},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:d9c7c52e66eaa5d5473e27e04dab9572d915f082502a331f1a0db092f8bb8489","observation_id":"34354b89-8371-4632-8e5d-f3cb87d41dee","resolution":{"observed_at":"2026-07-08T06:24:43.180505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:24:43.184579Z","title":"Dreamrelation: Relation-centric video customization","venue":null,"work_id":"de2b2a0c-ee6e-45bb-b8b4-ba7939d7544d","year":2025},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:a8a68eb9f473f7541369b2eb454dfecefade74c5f29d8fcddc2c25fc351eb564","observation_id":"d1197ce2-70e1-43b7-99e7-e586890d24e1","resolution":{"observed_at":"2026-07-08T06:24:43.185713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.24711","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T13:29:51.500682Z","title":"Routing matters in moe: Scaling diffusion transformers with explicit routing guidance","venue":null,"work_id":"06823292-8872-4968-95e4-fe2e50fdc4b3","year":2025},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:e789a7a8e005f158106d063a459dbcae5fb15f4c2234dfcbdf28ef9dd019a642","observation_id":"123c2115-1cb6-411f-8a16-b44a90d228ef","resolution":{"observed_at":"2026-06-30T18:04:58.024382Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13830","last_updated":"2024-10-17T17:52:57Z","snapshot_observed_at":"2026-08-04T21:33:12.208001Z","submitted_at":"2024-10-17T17:52:57Z","title":"DreamVideo-2: Zero-Shot Subject-Driven Video Customization with Precise Motion Control","version":1},"cited_work":{"arxiv_id":"2410.13830","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.13830","snapshot_observed_at":"2026-07-03T10:17:57.891560Z","title":"Dreamvideo-2: Zero-shot subject- driven video customization with precise motion control","venue":null,"work_id":"95b2be43-c521-45de-9dea-d6467491cb75","year":2024},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"cited_paper":"/paper/2410.13830","citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:183267e6db1cda8d97b22d2e0ec840b2fce5b1bd00e1fd84d3cd538e982c047c","observation_id":"c3c0cfa5-9fa3-436b-9ee4-b49b9ff17124","resolution":{"observed_at":"2026-06-30T18:04:58.029625Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.23994","last_updated":"2026-05-18T09:30:21Z","snapshot_observed_at":"2026-07-06T22:40:23.205898Z","submitted_at":"2025-12-30T05:22:31Z","title":"PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation","version":4},"cited_work":{"arxiv_id":"2512.23994","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.23994","snapshot_observed_at":"2026-07-05T12:41:04.333890Z","title":"PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation","venue":"cs.SD","work_id":"f195e204-6846-46de-9de8-8ed43724d874","year":2025},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"cited_paper":"/paper/2512.23994","citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:7a4b7acfbb6b17362462dbb7beb61e24a87e623aa7919d465d52193e0f5766fe","observation_id":"e1490f5b-e558-49c1-8ddb-242b9e46da01","resolution":{"observed_at":"2026-06-30T18:04:58.058543Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.10420","doi":"10.48550/arxiv.2603.10420","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fireredasr2s: A state-of-the-art industrial-grade all-in-one automatic speech recognition system","venue":"arXiv (Cornell University)","work_id":"0d0cfa0e-e07f-4678-a921-30ff90c5d87d","year":2026},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:a6b67c9265de744290c609c5b93c7945cb0308c7680fcedb9d927e28ef87ccdf","observation_id":"9aa60b83-0184-4f5d-ac46-5132970b36af","resolution":{"observed_at":"2026-06-30T18:04:58.069731Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:24:43.193692Z","title":"Longlive: Real-time interactive long video generation","venue":null,"work_id":"cd72d8c2-366e-49a8-8154-d1646557a476","year":2025},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:88194bd15e97d16b3190528d27f89a94c23932f4f4bb25523256836a5c5e1362","observation_id":"0792d1d1-4dde-499b-a7d9-ee380f321dcb","resolution":{"observed_at":"2026-07-08T06:24:43.194918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"cited_work":{"arxiv_id":"2505.20292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20292","snapshot_observed_at":"2026-07-04T21:10:09.694521Z","title":"Opens2v-nexus: A detailed benchmark and million-scale dataset for subject- to-video generation","venue":null,"work_id":"7fa68c33-70bd-475c-9329-2ac3075703bc","year":2025},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"cited_paper":"/paper/2505.20292","citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:aeb0371533a5a951b6041411de7635da9f2402a37f15a0775193aaf871fb9570","observation_id":"5717e354-4435-4328-84c4-ea7fe842b65e","resolution":{"observed_at":"2026-06-30T18:04:58.012646Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.04379","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T13:14:53.244905Z","title":"Improved distribution matching distillation for fast image synthesis.Advances in neural information processing systems, 37:47455–47487, 2024a","venue":null,"work_id":"005eb8db-424f-4973-a65a-d7f9c23eac02","year":2026},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:c12b736c49bff83c549c9a9f5e34c75318d26d798a76b044f49bb3bfccd4acaf","observation_id":"4528108d-60cc-4d8e-b4c6-64213e478887","resolution":{"observed_at":"2026-06-30T18:04:58.107900Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03897","last_updated":"2025-07-07T10:40:56Z","snapshot_observed_at":"2026-07-06T20:32:05.164336Z","submitted_at":"2025-02-06T09:18:30Z","title":"UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation","version":5},"cited_work":{"arxiv_id":"2502.03897","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.03897","snapshot_observed_at":"2026-07-02T05:56:40.900641Z","title":"Uniform: A unified multi-task diffusion transformer for audio- video generation","venue":null,"work_id":"9fe4b156-4eef-4382-8e4a-e908385c3f0e","year":2025},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"cited_paper":"/paper/2502.03897","citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:261ada6fca629fb46437e020eb40e7ed0fbe33aee8643d7e464074f8824d6591","observation_id":"38385add-b7cf-4a4e-ad03-983f4a143131","resolution":{"observed_at":"2026-06-30T18:04:58.099423Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.00607","last_updated":"2026-04-30T17:47:03Z","snapshot_observed_at":"2026-08-01T04:00:28.658425Z","submitted_at":"2026-01-31T08:50:32Z","title":"MTAVG-Bench: A Diagnostic Benchmark for Multi-Talker Dialogue-Centric Audio-Video Generation","version":2},"cited_work":{"arxiv_id":"2602.00607","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.00607","snapshot_observed_at":"2026-07-05T12:41:04.321729Z","title":"MTAVG-Bench: A Diagnostic Benchmark for Multi-Talker Dialogue-Centric Audio-Video Generation","venue":"cs.MM","work_id":"49070cfd-0fac-4569-84a2-5db63373e889","year":2026},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"cited_paper":"/paper/2602.00607","citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:724429de48fc0e3ede3df61c1a760a14d8518756d8af2d0ef8a58c80b4d6cf32","observation_id":"23c54114-88bb-4988-85a3-b94ce9e299b7","resolution":{"observed_at":"2026-06-30T18:04:58.009856Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.08540","last_updated":"2026-04-09T17:59:39Z","snapshot_observed_at":"2026-08-02T21:13:25.946486Z","submitted_at":"2026-04-09T17:59:39Z","title":"AVGen-Bench: A Task-Driven Benchmark for Multi-Granular Evaluation of Text-to-Audio-Video Generation","version":1},"cited_work":{"arxiv_id":"2604.08540","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.08540","snapshot_observed_at":"2026-07-03T00:07:28.033897Z","title":"AVGen-Bench: A Task-Driven Benchmark for Multi-Granular Evaluation of Text-to-Audio-Video Generation","venue":"cs.CV","work_id":"49aa4820-3ca7-4ee9-bac1-a9a8389e5c56","year":2026},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"cited_paper":"/paper/2604.08540","citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:1049def0a741be0eb04190c37e4b43f68ff3549e2745cab855d3c10cda6a6be2","observation_id":"b84a4872-0c4f-4c41-8d7e-56515dd02d73","resolution":{"observed_at":"2026-06-30T18:04:58.018320Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:24:43.186297Z","title":"Causal forcing: Autoregressive diffusion distillation done right for high-quality real-time interactive video generation","venue":null,"work_id":"ec2028d2-78cc-49f8-a805-5572fe1efc25","year":2026},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:d9533b966bb36b38fc3994f373972639d4468496f145f01582dfa11fd6c1c5bf","observation_id":"d12d440f-07e9-413a-80ad-ba5903af1720","resolution":{"observed_at":"2026-07-08T06:24:43.187597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.24862","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T21:18:58.065307Z","title":"Vistorybench: Comprehensive benchmark suite for story visualization","venue":null,"work_id":"16cd8be7-b677-4ba7-a409-153e6b17da78","year":2025},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:2e1e6581d5c49862503c52f101840ff7e5fecd7d84ac3247da357e53650a370c","observation_id":"a52a847a-960b-491c-b25d-5c06a0899540","resolution":{"observed_at":"2026-06-30T18:04:58.027103Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation"},"reference_resolution":{"displayed":80,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":3,"verified_exact":37,"verified_fuzzy":38},"total_outbound_references":80},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 80 of 80 outbound references and 1 inbound Pith citation observation for arXiv:2605.20183."}