{"as_of":"2026-08-23T05:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2fb3ccf5d0e05060c06b549f206b0cdc99fe61a2297a69eaa967440e275f443a","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T13:35:01.226818Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T00:17:53.910165Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-08T00:17:54.057786Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.24652","last_updated":"2026-05-23T16:42:39Z","snapshot_observed_at":"2026-08-14T17:33:33.384858Z","submitted_at":"2026-05-23T16:42:39Z","title":"AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.24652","snapshot_observed_at":"2026-08-02T03:12:37.865575Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14189","last_updated":"2026-07-15T16:02:45Z","snapshot_observed_at":"2026-08-19T13:27:35.472461Z","submitted_at":"2026-07-15T16:02:45Z","title":"MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T03:12:37.865575Z"},"links":{"cited_paper":"/paper/2605.24652","citing_paper":"/paper/2607.14189"},"observation_digest":"sha256:799cdddea52f377c91fa7b64a3a0c95fc332bea9042b899a61d62521e27633ee","observation_id":"cac83026-c1cb-4992-9284-e277ce7c22a2","resolution":{"observed_at":"2026-08-02T03:12:37.865575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.24652","last_updated":"2026-05-23T16:42:39Z","snapshot_observed_at":"2026-08-14T17:33:33.384858Z","submitted_at":"2026-05-23T16:42:39Z","title":"AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models","version":1},"cited_work":{"arxiv_id":"2605.24652","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.24652","snapshot_observed_at":"2026-08-08T00:17:54.057786Z","title":"AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models","venue":"cs.AI","work_id":"5dd0b5cf-d928-4d82-a610-1f1b7f4e0e35","year":2026},"citing_paper":{"arxiv_id":"2608.04224","last_updated":"2026-08-04T21:00:57Z","snapshot_observed_at":"2026-08-21T06:14:25.995085Z","submitted_at":"2026-08-04T21:00:57Z","title":"OmniVR: Joint Video-Audio Conditional Generation for Restoring Degraded Historical Films","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-08T00:17:53.910165Z"},"links":{"cited_paper":"/paper/2605.24652","citing_paper":"/paper/2608.04224"},"observation_digest":"sha256:585866e93d4155ef479974972955e335dabb778497dbcf29ee2324256491ec13","observation_id":"17b66798-4277-4afc-8754-d4da0fed1034","resolution":{"observed_at":"2026-08-08T00:17:54.065292Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2605.24652/citation-record","integrity":"/paper/2605.24652/integrity","json":"/paper/2605.24652/citation-record.json","paper":"/paper/2605.24652"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2512.21094","last_updated":"2026-06-02T17:15:46Z","snapshot_observed_at":"2026-08-06T21:10:12.336800Z","submitted_at":"2025-12-24T10:30:35Z","title":"T2AV-Compass: Towards Unified Evaluation for Text-to-Audio-Video Generation","version":2},"cited_work":{"arxiv_id":"2512.21094","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.21094","snapshot_observed_at":"2026-07-02T22:17:26.093228Z","title":"T2av-compass: Towards unified evaluation for text-to-audio-video generation","venue":"cs.CV","work_id":"f4d29773-29d6-486a-8faa-73376b01dd55","year":2025},"citing_paper":{"arxiv_id":"2605.24652","last_updated":"2026-05-23T16:42:39Z","snapshot_observed_at":"2026-08-14T17:33:33.384858Z","submitted_at":"2026-05-23T16:42:39Z","title":"AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T13:35:01.226818Z"},"links":{"cited_paper":"/paper/2512.21094","citing_paper":"/paper/2605.24652"},"observation_digest":"sha256:77a97375c48de4257bd6b2b7f26f3213c3f2b359722682f98f3ac25bfac44104","observation_id":"2e3e5160-e4fe-4abc-89a1-35dd252e9d24","resolution":{"observed_at":"2026-06-30T13:44:41.266655Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.12772","last_updated":"2026-05-14T12:25:09Z","snapshot_observed_at":"2026-08-06T09:56:14.530160Z","submitted_at":"2025-12-14T17:23:21Z","title":"JointAVBench: A Benchmark for Joint Audio-Visual Reasoning Evaluation","version":2},"cited_work":{"arxiv_id":"2512.12772","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.12772","snapshot_observed_at":"2026-07-04T16:49:57.276611Z","title":"Jointavbench: A benchmark for joint audio-visual reasoning evaluation","venue":"cs.MM","work_id":"833b8614-e4ac-4e27-a7aa-bd3e5658c88d","year":2025},"citing_paper":{"arxiv_id":"2605.24652","last_updated":"2026-05-23T16:42:39Z","snapshot_observed_at":"2026-08-14T17:33:33.384858Z","submitted_at":"2026-05-23T16:42:39Z","title":"AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T13:35:01.226818Z"},"links":{"cited_paper":"/paper/2512.12772","citing_paper":"/paper/2605.24652"},"observation_digest":"sha256:673ff1f3313f6831b9d06daa085b7bb7cc8fd6aaf7e1af2c1c11f55b6afea0c5","observation_id":"8996143b-dd65-46d4-8987-5f3bd63df3b3","resolution":{"observed_at":"2026-06-30T13:44:41.242904Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T01:35:54.183150Z","title":"In: 2025 IEEE 37th International Conference on Tools with Artificial Intelligence (ICTAI)","venue":null,"work_id":"cd3dfeb7-4eb4-4e72-830a-4dacd54f9aa8","year":2025},"citing_paper":{"arxiv_id":"2605.24652","last_updated":"2026-05-23T16:42:39Z","snapshot_observed_at":"2026-08-14T17:33:33.384858Z","submitted_at":"2026-05-23T16:42:39Z","title":"AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T13:35:01.226818Z"},"links":{"citing_paper":"/paper/2605.24652"},"observation_digest":"sha256:688df87cdc789f01a61a1944f857a41ed88da039af32cfbc6d2d7c5a2303849b","observation_id":"9c9f1201-4455-474a-99b1-53b841c23dbc","resolution":{"observed_at":"2026-07-09T01:35:54.184424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-15T10:29:24.587843Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"cited_work":{"arxiv_id":"2509.08519","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08519","snapshot_observed_at":"2026-07-04T21:10:09.676485Z","title":"Humo: Human-centric video generation via collaborative multi-modal conditioning","venue":null,"work_id":"313111a9-b492-44f5-bf1f-6b5c2c642abf","year":2025},"citing_paper":{"arxiv_id":"2605.24652","last_updated":"2026-05-23T16:42:39Z","snapshot_observed_at":"2026-08-14T17:33:33.384858Z","submitted_at":"2026-05-23T16:42:39Z","title":"AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T13:35:01.226818Z"},"links":{"cited_paper":"/paper/2509.08519","citing_paper":"/paper/2605.24652"},"observation_digest":"sha256:21c7af20456cfd4dbe2beeea311070f66eb286f3e1347c5d4e57812d46803b02","observation_id":"ecb2003d-3b8c-4c9f-bf19-2a13a20370de","resolution":{"observed_at":"2026-06-30T13:44:41.246048Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-08-14T01:27:16.843576Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":"2407.10759","doi":"10.48550/arxiv.2407.10759","metadata_source":"pith","pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2-Audio Technical Report","venue":"eess.AS","work_id":"c249e63c-cf40-408f-a4ff-fdf68e8cbeb8","year":2024},"citing_paper":{"arxiv_id":"2605.24652","last_updated":"2026-05-23T16:42:39Z","snapshot_observed_at":"2026-08-14T17:33:33.384858Z","submitted_at":"2026-05-23T16:42:39Z","title":"AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T13:35:01.226818Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2605.24652"},"observation_digest":"sha256:de6a651e00e5328fdc7e40266711370dec25102a3eba3ba995ebe23e22128726","observation_id":"59c1b992-f5dc-48b5-821b-75e6962f9b72","resolution":{"observed_at":"2026-06-30T13:44:41.240538Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T01:35:54.185115Z","title":"In: Work- shop on Multi-view Lip-reading, ACCV (2016)","venue":null,"work_id":"9e6d4914-23a4-4dd1-949c-fff1c8071dbc","year":2016},"citing_paper":{"arxiv_id":"2605.24652","last_updated":"2026-05-23T16:42:39Z","snapshot_observed_at":"2026-08-14T17:33:33.384858Z","submitted_at":"2026-05-23T16:42:39Z","title":"AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T13:35:01.226818Z"},"links":{"citing_paper":"/paper/2605.24652"},"observation_digest":"sha256:7c5cbd2e7e6e3b5eaf2b34b7a155193c8d6077f5096acbd650ab6f5ddcb7b269","observation_id":"f1b68f7e-bbba-447b-ad0c-550d348a1fab","resolution":{"observed_at":"2026-07-09T01:35:54.186423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2026.365249","doi":"10.1109/ojsp.2026.3652496","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"IEEE Open Journal of Signal Pro- cessing pp","venue":"IEEE Open Journal of Signal Processing","work_id":"cbaccc99-5c29-4fa3-97c9-df7ca21c76e1","year":2026},"citing_paper":{"arxiv_id":"2605.24652","last_updated":"2026-05-23T16:42:39Z","snapshot_observed_at":"2026-08-14T17:33:33.384858Z","submitted_at":"2026-05-23T16:42:39Z","title":"AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T13:35:01.226818Z"},"links":{"citing_paper":"/paper/2605.24652"},"observation_digest":"sha256:698eae02b16a0f5241e864df6a52530029b379197a11cf499af47e48728194f6","observation_id":"292d3d76-eead-4c21-884f-0d81ba4e4d7e","resolution":{"observed_at":"2026-06-30T13:44:40.491286Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T01:35:54.168121Z","title":"In: ICASSP 2023-2023 IEEE Interna- tional Conference on Acoustics, Speech and Signal Processing (ICASSP)","venue":null,"work_id":"e66ad646-1f23-49a9-ac62-8a430f906293","year":2023},"citing_paper":{"arxiv_id":"2605.24652","last_updated":"2026-05-23T16:42:39Z","snapshot_observed_at":"2026-08-14T17:33:33.384858Z","submitted_at":"2026-05-23T16:42:39Z","title":"AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T13:35:01.226818Z"},"links":{"citing_paper":"/paper/2605.24652"},"observation_digest":"sha256:b4fe5508199297b91632c90638f09ee19b94a88687876a7905532f6a102621e4","observation_id":"2abe84ea-869c-4b58-8472-f95b90ed5640","resolution":{"observed_at":"2026-07-09T01:35:54.169391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T01:35:54.188975Z","title":"In: CVPR (2023)","venue":null,"work_id":"447773ae-03a0-4a43-8d18-aa0aeee4a8f7","year":2023},"citing_paper":{"arxiv_id":"2605.24652","last_updated":"2026-05-23T16:42:39Z","snapshot_observed_at":"2026-08-14T17:33:33.384858Z","submitted_at":"2026-05-23T16:42:39Z","title":"AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T13:35:01.226818Z"},"links":{"citing_paper":"/paper/2605.24652"},"observation_digest":"sha256:c5d11938277a777d17fc7fb70be51dba627a2d4729faf22ae03ffd5d8bab2838","observation_id":"d24ba60d-a8cc-4542-8fff-df0f0b0b24fd","resolution":{"observed_at":"2026-07-09T01:35:54.190151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T01:35:54.181329Z","title":null,"venue":null,"work_id":"f187a348-fa46-4c44-9baa-d10ffa64d872","year":2025},"citing_paper":{"arxiv_id":"2605.24652","last_updated":"2026-05-23T16:42:39Z","snapshot_observed_at":"2026-08-14T17:33:33.384858Z","submitted_at":"2026-05-23T16:42:39Z","title":"AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T13:35:01.226818Z"},"links":{"citing_paper":"/paper/2605.24652"},"observation_digest":"sha256:8acb06d4978243d0fa6b74687e5a8d0e42188af6cd7a12c4a03c440d8d5be8aa","observation_id":"7241cfab-f5bf-4f66-9a12-9227d12dcf2f","resolution":{"observed_at":"2026-07-09T01:35:54.182453Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.12160","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T06:29:36.885838Z","title":"Dreamid-omni: Unified framework for controllable human-centric audio-video generation","venue":null,"work_id":"68a86102-576d-488e-8468-d7d87f76624f","year":2026},"citing_paper":{"arxiv_id":"2605.24652","last_updated":"2026-05-23T16:42:39Z","snapshot_observed_at":"2026-08-14T17:33:33.384858Z","submitted_at":"2026-05-23T16:42:39Z","title":"AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T13:35:01.226818Z"},"links":{"citing_paper":"/paper/2605.24652"},"observation_digest":"sha256:26cc27c5346576b88c62c2f0e3bed9965a1a1badcaf58413814003feb245e9ec","observation_id":"e4624a68-a529-4f14-9881-c38c50d3f1c5","resolution":{"observed_at":"2026-06-30T13:44:41.264384Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T01:35:54.166130Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":"9bacc9ec-d4ee-4f1f-aef9-522fe9846b91","year":2025},"citing_paper":{"arxiv_id":"2605.24652","last_updated":"2026-05-23T16:42:39Z","snapshot_observed_at":"2026-08-14T17:33:33.384858Z","submitted_at":"2026-05-23T16:42:39Z","title":"AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T13:35:01.226818Z"},"links":{"citing_paper":"/paper/2605.24652"},"observation_digest":"sha256:8e498c5efe51b512ae7b959edb9eaba5c7323709e553ac2e424a5fe7b9530406","observation_id":"f5fbe09d-327d-4aac-b3e9-0b40f1dd756f","resolution":{"observed_at":"2026-07-09T01:35:54.167474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17842","last_updated":"2025-02-25T09:34:26Z","snapshot_observed_at":"2026-08-16T13:48:46.813784Z","submitted_at":"2024-05-28T05:43:03Z","title":"MMDisCo: Multi-Modal Discriminator-Guided Cooperative Diffusion for Joint Audio and Video Generation","version":2},"cited_work":{"arxiv_id":"2405.17842","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.17842","snapshot_observed_at":"2026-06-30T13:44:41.231757Z","title":"Mmdisco: Multi-modal discriminator-guided co- operative diffusion for joint audio and video generation","venue":null,"work_id":"06e519c0-8cc7-4496-b4f0-73fd8ad19cec","year":2024},"citing_paper":{"arxiv_id":"2605.24652","last_updated":"2026-05-23T16:42:39Z","snapshot_observed_at":"2026-08-14T17:33:33.384858Z","submitted_at":"2026-05-23T16:42:39Z","title":"AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T13:35:01.226818Z"},"links":{"cited_paper":"/paper/2405.17842","citing_paper":"/paper/2605.24652"},"observation_digest":"sha256:f9368f105ec89a83e24992bc823695ee659ae9ca96d36737a7ca48ed44ceb2b6","observation_id":"3386859a-2bfe-4c4c-ab81-38d77215093d","resolution":{"observed_at":"2026-06-30T13:44:41.233058Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.09299","last_updated":"2026-04-06T13:16:33Z","snapshot_observed_at":"2026-08-18T03:03:12.839060Z","submitted_at":"2025-12-10T03:57:29Z","title":"VABench: A Comprehensive Benchmark for Audio-Video Generation","version":2},"cited_work":{"arxiv_id":"2512.09299","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.09299","snapshot_observed_at":"2026-07-05T12:41:04.378368Z","title":"VABench: A Comprehensive Benchmark for Audio-Video Generation","venue":"cs.CV","work_id":"0b1e3c4c-ed41-4a5d-aee8-471b82e5072a","year":2025},"citing_paper":{"arxiv_id":"2605.24652","last_updated":"2026-05-23T16:42:39Z","snapshot_observed_at":"2026-08-14T17:33:33.384858Z","submitted_at":"2026-05-23T16:42:39Z","title":"AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T13:35:01.226818Z"},"links":{"cited_paper":"/paper/2512.09299","citing_paper":"/paper/2605.24652"},"observation_digest":"sha256:db1f64b6c4f98ff8dd8418cc8d8818223c391c5cdb9ee39c394728243f3a9560","observation_id":"be1052fb-6d9a-4307-9cc8-bc1c562a24b3","resolution":{"observed_at":"2026-06-30T13:44:41.269079Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T01:35:54.177368Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (2024)","venue":null,"work_id":"8e10f5e6-f0dd-4c57-9e93-35bdb28a7002","year":2024},"citing_paper":{"arxiv_id":"2605.24652","last_updated":"2026-05-23T16:42:39Z","snapshot_observed_at":"2026-08-14T17:33:33.384858Z","submitted_at":"2026-05-23T16:42:39Z","title":"AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T13:35:01.226818Z"},"links":{"citing_paper":"/paper/2605.24652"},"observation_digest":"sha256:72ea02b806d532756b23ac14359b8593b9b5954f5760b001fa5001f580e87390","observation_id":"cc3bf316-8386-48a7-94cc-31e39530d1e3","resolution":{"observed_at":"2026-07-09T01:35:54.178651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.08791","last_updated":"2021-10-17T11:14:00Z","snapshot_observed_at":"2026-08-20T06:04:04.607964Z","submitted_at":"2021-10-17T11:14:00Z","title":"Taming Visually Guided Sound Generation","version":1},"cited_work":{"arxiv_id":"2110.08791","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2110.08791","snapshot_observed_at":"2026-07-01T20:26:12.488439Z","title":"InstructAV2AV: Instruction-Guided Audio-Video Joint Editing•13 Masato Ishii, Akio Hayakawa, Takashi Shibuya, and Yuki Mitsufuji","venue":null,"work_id":"b2f09379-f630-40a1-ada7-dbb6129aaebd","year":2021},"citing_paper":{"arxiv_id":"2605.24652","last_updated":"2026-05-23T16:42:39Z","snapshot_observed_at":"2026-08-14T17:33:33.384858Z","submitted_at":"2026-05-23T16:42:39Z","title":"AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T13:35:01.226818Z"},"links":{"cited_paper":"/paper/2110.08791","citing_paper":"/paper/2605.24652"},"observation_digest":"sha256:0fb96f03d9009c74ceac400b8618421bb18ee49ca66c5e10c7391520f678024e","observation_id":"ea6fbebe-35f3-49b4-a253-ef814f737230","resolution":{"observed_at":"2026-06-30T13:44:41.271841Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-08-16T20:23:00.161927Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":"2412.09262","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-07-04T21:00:08.897097Z","title":"Latentsync: Taming audio-conditioned latent diffusion models for lip sync with syncnet supervision","venue":null,"work_id":"58bec219-b581-4884-a7c0-51325341150e","year":2024},"citing_paper":{"arxiv_id":"2605.24652","last_updated":"2026-05-23T16:42:39Z","snapshot_observed_at":"2026-08-14T17:33:33.384858Z","submitted_at":"2026-05-23T16:42:39Z","title":"AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-30T13:35:01.226818Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2605.24652"},"observation_digest":"sha256:9a211bac418187de12979d0e585174e95b6b7907aaa77b5582bb4babdf71bdc1","observation_id":"b9fa4640-186b-4f4d-bf0e-6044e4b3a10b","resolution":{"observed_at":"2026-06-30T13:44:41.258619Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T01:35:54.190799Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":"0e6f3b8f-212f-431b-a92c-6392205cbc78","year":2025},"citing_paper":{"arxiv_id":"2605.24652","last_updated":"2026-05-23T16:42:39Z","snapshot_observed_at":"2026-08-14T17:33:33.384858Z","submitted_at":"2026-05-23T16:42:39Z","title":"AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T13:35:01.226818Z"},"links":{"citing_paper":"/paper/2605.24652"},"observation_digest":"sha256:380173576fd79bde3ed2fbd89efa5796490a2049527cfd3153c019b24ae390c8","observation_id":"6900eba7-bfd3-4bba-bd7e-28e4a01cfcee","resolution":{"observed_at":"2026-07-09T01:35:54.192078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T01:35:54.164174Z","title":"Proceed- ings of the International Conference on Machine Learning pp","venue":null,"work_id":"894287d2-de6d-4001-b8c5-42b62d63818c","year":2023},"citing_paper":{"arxiv_id":"2605.24652","last_updated":"2026-05-23T16:42:39Z","snapshot_observed_at":"2026-08-14T17:33:33.384858Z","submitted_at":"2026-05-23T16:42:39Z","title":"AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T13:35:01.226818Z"},"links":{"citing_paper":"/paper/2605.24652"},"observation_digest":"sha256:0fc635c86f94725b76e257f2c6c463c3f60ce25a797dbf5808f80f818dfa7e05","observation_id":"2113bfcd-1a7f-4f40-b01a-28e473799c9a","resolution":{"observed_at":"2026-07-09T01:35:54.165503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.01284","last_updated":"2025-09-30T21:03:50Z","snapshot_observed_at":"2026-08-13T04:37:51.305325Z","submitted_at":"2025-09-30T21:03:50Z","title":"Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation","version":1},"cited_work":{"arxiv_id":"2510.01284","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.01284","snapshot_observed_at":"2026-07-05T12:41:04.361399Z","title":"Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation","venue":"cs.MM","work_id":"4ea3b1fc-d272-47f2-88a8-36cbeaa92448","year":2025},"citing_paper":{"arxiv_id":"2605.24652","last_updated":"2026-05-23T16:42:39Z","snapshot_observed_at":"2026-08-14T17:33:33.384858Z","submitted_at":"2026-05-23T16:42:39Z","title":"AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-30T13:35:01.226818Z"},"links":{"cited_paper":"/paper/2510.01284","citing_paper":"/paper/2605.24652"},"observation_digest":"sha256:07e51fa08bd77cc6ec461d7fd7d696e73c1672461e8c5c55f43e20b3b8681ec0","observation_id":"eeac333f-e2bf-4d12-90f3-41074316eb55","resolution":{"observed_at":"2026-06-30T13:44:41.258595Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T01:35:54.170027Z","title":"In: Interspeech (2021),https://api.semanticscholar.org/CorpusID:233296150","venue":null,"work_id":"36983c2a-4947-46a5-baaa-cee060415766","year":2021},"citing_paper":{"arxiv_id":"2605.24652","last_updated":"2026-05-23T16:42:39Z","snapshot_observed_at":"2026-08-14T17:33:33.384858Z","submitted_at":"2026-05-23T16:42:39Z","title":"AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-30T13:35:01.226818Z"},"links":{"citing_paper":"/paper/2605.24652"},"observation_digest":"sha256:354c80e4916e00bfbea0d717b7b742533c81fa61aa2988466c195c1ea0b287e7","observation_id":"ebdac6ca-0c7a-4d93-9fec-e08f87560b26","resolution":{"observed_at":"2026-07-09T01:35:54.171271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T01:35:54.175403Z","title":null,"venue":null,"work_id":"c564238b-c584-42b0-a1ff-37798c89aa1e","year":2025},"citing_paper":{"arxiv_id":"2605.24652","last_updated":"2026-05-23T16:42:39Z","snapshot_observed_at":"2026-08-14T17:33:33.384858Z","submitted_at":"2026-05-23T16:42:39Z","title":"AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-30T13:35:01.226818Z"},"links":{"citing_paper":"/paper/2605.24652"},"observation_digest":"sha256:f04149f8540f3bd7b9e8fd8e07360abcfe1e924d76c69c67dd75d9f96fb5afc6","observation_id":"b4276ef5-ac85-495f-beaf-e8240d092c68","resolution":{"observed_at":"2026-07-09T01:35:54.176691Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T11:27:03.332077Z","title":null,"venue":null,"work_id":"1b7735a2-669d-484f-a863-738e74836eb0","year":2023},"citing_paper":{"arxiv_id":"2605.24652","last_updated":"2026-05-23T16:42:39Z","snapshot_observed_at":"2026-08-14T17:33:33.384858Z","submitted_at":"2026-05-23T16:42:39Z","title":"AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-30T13:35:01.226818Z"},"links":{"citing_paper":"/paper/2605.24652"},"observation_digest":"sha256:cbda438f9992782f1ea934c2a372359011dea6cf7cf2073434642ce4b3ac28bd","observation_id":"e8f4db8c-3b8a-47b4-89b0-3c1004835392","resolution":{"observed_at":"2026-07-09T01:35:54.173027Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T01:35:54.173605Z","title":"In: International conference on machine learning","venue":null,"work_id":"8a500967-a99c-4247-9292-984c10c46cfe","year":2023},"citing_paper":{"arxiv_id":"2605.24652","last_updated":"2026-05-23T16:42:39Z","snapshot_observed_at":"2026-08-14T17:33:33.384858Z","submitted_at":"2026-05-23T16:42:39Z","title":"AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-30T13:35:01.226818Z"},"links":{"citing_paper":"/paper/2605.24652"},"observation_digest":"sha256:017b4fa5ec5788a66b008dfac3986a5e78d1b18bcae20b16bfdc253fe32f4b37","observation_id":"3426f835-e79d-47a0-8e5c-1480ae042109","resolution":{"observed_at":"2026-07-09T01:35:54.174785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.08402","last_updated":"2022-10-16T00:08:18Z","snapshot_observed_at":"2026-08-13T17:36:16.794649Z","submitted_at":"2022-10-16T00:08:18Z","title":"LAION-5B: An open large-scale dataset for training next generation image-text models","version":1},"cited_work":{"arxiv_id":"2210.08402","doi":"10.48550/arxiv.2210.08402","metadata_source":"pith","pith_arxiv_id":"2210.08402","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LAION-5B: An open large-scale dataset for training next generation image-text models","venue":"cs.CV","work_id":"1d19deb4-3043-409d-b901-f047c51a323b","year":2022},"citing_paper":{"arxiv_id":"2605.24652","last_updated":"2026-05-23T16:42:39Z","snapshot_observed_at":"2026-08-14T17:33:33.384858Z","submitted_at":"2026-05-23T16:42:39Z","title":"AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-30T13:35:01.226818Z"},"links":{"cited_paper":"/paper/2210.08402","citing_paper":"/paper/2605.24652"},"observation_digest":"sha256:8e17991e90c8f8c0cab33b39df3f0786ccc021a857a5b3426e6a9832db28bba1","observation_id":"223e80ae-1f4e-4695-b610-02facb2c57f8","resolution":{"observed_at":"2026-06-30T13:44:41.253324Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-08-14T12:08:18.712691Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":"2512.13507","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-07-10T01:46:40.967365Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","venue":"cs.CV","work_id":"02efb197-4e2b-4141-8587-21b92ad92f08","year":2025},"citing_paper":{"arxiv_id":"2605.24652","last_updated":"2026-05-23T16:42:39Z","snapshot_observed_at":"2026-08-14T17:33:33.384858Z","submitted_at":"2026-05-23T16:42:39Z","title":"AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-30T13:35:01.226818Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2605.24652"},"observation_digest":"sha256:7bf46798c4b3c97a13163cd5c1f834b4100266e91f5cd9b7382c467841de7f55","observation_id":"82d8deff-88c0-487b-9608-c46a012b312e","resolution":{"observed_at":"2026-06-30T13:44:41.253589Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.16930","last_updated":"2025-08-23T07:30:18Z","snapshot_observed_at":"2026-08-20T19:15:50.195835Z","submitted_at":"2025-08-23T07:30:18Z","title":"HunyuanVideo-Foley: Multimodal Diffusion with Representation Alignment for High-Fidelity Foley Audio Generation","version":1},"cited_work":{"arxiv_id":"2508.16930","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.16930","snapshot_observed_at":"2026-07-02T04:56:39.439125Z","title":"Hunyuanvideo-foley: Multimodal diffusion with representation alignment for high-fidelity foley audio generation","venue":null,"work_id":"c52cc69a-842a-4c11-873a-e3d9aaaeb3de","year":2025},"citing_paper":{"arxiv_id":"2605.24652","last_updated":"2026-05-23T16:42:39Z","snapshot_observed_at":"2026-08-14T17:33:33.384858Z","submitted_at":"2026-05-23T16:42:39Z","title":"AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-30T13:35:01.226818Z"},"links":{"cited_paper":"/paper/2508.16930","citing_paper":"/paper/2605.24652"},"observation_digest":"sha256:9e34b2f907b0f3a262d00c65ab8c462c5106a6506bbc0d34b00d3bd499583810","observation_id":"51e221fe-c2db-4c46-acb7-4321c1340019","resolution":{"observed_at":"2026-06-30T13:44:41.250735Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":"2312.15821","doi":"10.48550/arxiv.2312.15821","metadata_source":"pith","pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":"cs.SD","work_id":"f7d2982e-a068-43ac-85f8-a5d3fb631fa2","year":2023},"citing_paper":{"arxiv_id":"2605.24652","last_updated":"2026-05-23T16:42:39Z","snapshot_observed_at":"2026-08-14T17:33:33.384858Z","submitted_at":"2026-05-23T16:42:39Z","title":"AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-30T13:35:01.226818Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2605.24652"},"observation_digest":"sha256:3d395adfb0ccd35b05e79b520d91afdae46444d1b45d1183708292fe9372297d","observation_id":"6c1d55db-e97a-4f06-b3ca-42f193b15c9e","resolution":{"observed_at":"2026-06-30T13:44:41.261751Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-08-12T22:34:51.361078Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":"2503.20314","doi":"10.1109/19.492748","metadata_source":"pith","pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":"cs.CV","work_id":"ad3ebc3b-4224-46c9-b61d-bcf135da0a7c","year":2025},"citing_paper":{"arxiv_id":"2605.24652","last_updated":"2026-05-23T16:42:39Z","snapshot_observed_at":"2026-08-14T17:33:33.384858Z","submitted_at":"2026-05-23T16:42:39Z","title":"AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-30T13:35:01.226818Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2605.24652"},"observation_digest":"sha256:0494a68d817c2e460259c6387b61508189e9ccdb5f27c2b8e4d10ec827209ff1","observation_id":"200f3fc9-e83f-4985-b3ea-918ae710aed9","resolution":{"observed_at":"2026-06-30T13:44:41.274161Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.04151","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T13:44:41.241509Z","title":"arXiv preprint arXiv:2601.04151 (2026)","venue":null,"work_id":"ad7e9e67-ef2a-445a-8634-05eb40d35d5a","year":2026},"citing_paper":{"arxiv_id":"2605.24652","last_updated":"2026-05-23T16:42:39Z","snapshot_observed_at":"2026-08-14T17:33:33.384858Z","submitted_at":"2026-05-23T16:42:39Z","title":"AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-30T13:35:01.226818Z"},"links":{"citing_paper":"/paper/2605.24652"},"observation_digest":"sha256:607fc12ff2fd8c68354e0bf2ea1351ce2cd3ff004cd7967b5e38a1ab49d8beb7","observation_id":"c6d103ef-583b-41b8-88a6-e5e711cd2edb","resolution":{"observed_at":"2026-06-30T13:44:41.242882Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2307.06942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-04T06:39:37.513098Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"e0787102-2f18-46ad-9660-6bfe466e3bbf","year":2023},"citing_paper":{"arxiv_id":"2605.24652","last_updated":"2026-05-23T16:42:39Z","snapshot_observed_at":"2026-08-14T17:33:33.384858Z","submitted_at":"2026-05-23T16:42:39Z","title":"AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-30T13:35:01.226818Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2605.24652"},"observation_digest":"sha256:31d4dd02b3788aea73775a70e105591185465d0edd258a45f804d80180e9e6d6","observation_id":"a34e84b6-6b7c-415e-a663-a463f083e867","resolution":{"observed_at":"2026-06-30T13:44:41.227663Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T01:35:54.187038Z","title":"In: Proceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":"eba81a08-e107-4a33-ae16-d6581cfff2ac","year":2023},"citing_paper":{"arxiv_id":"2605.24652","last_updated":"2026-05-23T16:42:39Z","snapshot_observed_at":"2026-08-14T17:33:33.384858Z","submitted_at":"2026-05-23T16:42:39Z","title":"AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-30T13:35:01.226818Z"},"links":{"citing_paper":"/paper/2605.24652"},"observation_digest":"sha256:c9c2fda1d8fab75a62ab40545c66ff43c694bc3855cc059435c4fe4fc39790b8","observation_id":"aa13d13b-664e-4639-9772-7c04aa43b297","resolution":{"observed_at":"2026-07-09T01:35:54.188343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":"2503.20215","doi":"10.48550/arxiv.2503.20215","metadata_source":"pith","pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-Omni Technical Report","venue":"cs.CL","work_id":"438f105c-fa9b-44aa-ad52-43acb8045cda","year":2025},"citing_paper":{"arxiv_id":"2605.24652","last_updated":"2026-05-23T16:42:39Z","snapshot_observed_at":"2026-08-14T17:33:33.384858Z","submitted_at":"2026-05-23T16:42:39Z","title":"AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-30T13:35:01.226818Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2605.24652"},"observation_digest":"sha256:675d197630121fec832c0dc9cd2902611730695ff6cf0e60d36c197ccab836a6","observation_id":"513fd16c-25df-4e8a-b300-b6af867d39a7","resolution":{"observed_at":"2026-06-30T13:44:41.232632Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-17T16:38:13.453678+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-17T16:38:13.453678+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.17765","last_updated":"2025-09-22T13:26:24Z","snapshot_observed_at":"2026-08-11T00:14:34.061687Z","submitted_at":"2025-09-22T13:26:24Z","title":"Qwen3-Omni Technical Report","version":1},"cited_work":{"arxiv_id":"2509.17765","doi":"10.48550/arxiv.2509.17765","metadata_source":"pith","pith_arxiv_id":"2509.17765","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-Omni Technical Report","venue":"cs.CL","work_id":"ae43e594-8bab-4471-b6af-92a300f6a048","year":2025},"citing_paper":{"arxiv_id":"2605.24652","last_updated":"2026-05-23T16:42:39Z","snapshot_observed_at":"2026-08-14T17:33:33.384858Z","submitted_at":"2026-05-23T16:42:39Z","title":"AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-30T13:35:01.226818Z"},"links":{"cited_paper":"/paper/2509.17765","citing_paper":"/paper/2605.24652"},"observation_digest":"sha256:88e31703b5cb59c48e93b5a032c5e2db9402262fce98ee31d3b1e89544499ca8","observation_id":"92e1a51d-d954-4a38-96c4-9afc9a0a6028","resolution":{"observed_at":"2026-06-30T13:44:41.234807Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-17T16:38:12.229447+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-17T16:38:12.229447+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2605.24652","last_updated":"2026-05-23T16:42:39Z","snapshot_observed_at":"2026-08-14T17:33:33.384858Z","submitted_at":"2026-05-23T16:42:39Z","title":"AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-30T13:35:01.226818Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2605.24652"},"observation_digest":"sha256:ee7be2576f5fc788bee14833975bd20a8b3203cefa89d82e63a040c989acfef2","observation_id":"639c7393-d3f3-4561-8a00-0cdaebfa3cce","resolution":{"observed_at":"2026-06-30T13:44:41.235165Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T01:35:54.192896Z","title":"MISMATCHED","venue":null,"work_id":"a82d1ea1-6f00-4833-8d96-cee3ca06642b","year":2026},"citing_paper":{"arxiv_id":"2605.24652","last_updated":"2026-05-23T16:42:39Z","snapshot_observed_at":"2026-08-14T17:33:33.384858Z","submitted_at":"2026-05-23T16:42:39Z","title":"AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-30T13:35:01.226818Z"},"links":{"citing_paper":"/paper/2605.24652"},"observation_digest":"sha256:ac030fda22f8909106a3be66c1eab514371f3eaedddd1ee088379a76110b9205","observation_id":"f171955d-ed2e-423f-be91-f16c0f96b876","resolution":{"observed_at":"2026-07-09T01:35:54.194052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T01:35:54.179286Z","title":"woman\" with","venue":null,"work_id":"94e8f2f5-803f-4a42-b0e5-7ef6098cd40f","year":null},"citing_paper":{"arxiv_id":"2605.24652","last_updated":"2026-05-23T16:42:39Z","snapshot_observed_at":"2026-08-14T17:33:33.384858Z","submitted_at":"2026-05-23T16:42:39Z","title":"AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-30T13:35:01.226818Z"},"links":{"citing_paper":"/paper/2605.24652"},"observation_digest":"sha256:beb66a5c1d0ecccdd0de4af9cdbed476835316a746fa7789e4b49b95da9aa6a6","observation_id":"6ce298de-ace0-48f5-948b-841b9cfeba1b","resolution":{"observed_at":"2026-07-09T01:35:54.180547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.24652","last_updated":"2026-05-23T16:42:39Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-14T17:33:33.384858Z","submitted_at":"2026-05-23T16:42:39Z","title":"AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":15,"parse_uncertain":0,"unresolved":3,"verified_exact":6,"verified_fuzzy":13},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 2 inbound Pith citation observations for arXiv:2605.24652."}