{"as_of":"2026-08-13T13:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:332929bfe34f425b37516590efb81ca341de58f656e59b431f7accc3728878dc","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T22:52:38.330851Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T03:12:35.604423Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.26244","last_updated":"2026-05-25T18:12:09Z","snapshot_observed_at":"2026-08-06T05:46:08.521756Z","submitted_at":"2026-05-25T18:12:09Z","title":"LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.26244","snapshot_observed_at":"2026-08-02T03:12:35.604423Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14189","last_updated":"2026-07-15T16:02:45Z","snapshot_observed_at":"2026-08-08T02:21:53.851123Z","submitted_at":"2026-07-15T16:02:45Z","title":"MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T03:12:35.604423Z"},"links":{"cited_paper":"/paper/2605.26244","citing_paper":"/paper/2607.14189"},"observation_digest":"sha256:79f6a282bd1d1be1d7c32ac4c7cc9327881744730ea4ffc586f4be270411ddd0","observation_id":"c05434a9-8c6c-41ec-8198-29c3db0dd505","resolution":{"observed_at":"2026-08-02T03:12:35.604423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.26244","last_updated":"2026-05-25T18:12:09Z","snapshot_observed_at":"2026-08-06T05:46:08.521756Z","submitted_at":"2026-05-25T18:12:09Z","title":"LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.26244","snapshot_observed_at":"2026-07-31T05:08:19.892043Z","title":"Longav-compass: Towards unified eval- uation of minute-scale audio-visual generation across t2av, i2av, and v2av.arXiv preprint arXiv:2605.26244, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28509","last_updated":"2026-07-30T16:48:28Z","snapshot_observed_at":"2026-08-09T21:08:35.257576Z","submitted_at":"2026-07-30T16:48:28Z","title":"RefCaptioner: Multi-Reference Image-Grounded Video Captioning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-31T05:08:19.892043Z"},"links":{"cited_paper":"/paper/2605.26244","citing_paper":"/paper/2607.28509"},"observation_digest":"sha256:6798e2afc780d215ac0cc103ee3058505a4bbef0a424bf9a859460b6afa2ce78","observation_id":"936c2fd8-3e98-48ca-8f67-3c4ceecf8b7c","resolution":{"observed_at":"2026-07-31T05:08:19.892043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.26244/citation-record","integrity":"/paper/2605.26244/integrity","json":"/paper/2605.26244/citation-record.json","paper":"/paper/2605.26244"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:52:38.330851Z","title":"Storybench: A multifaceted benchmark for continuous story visualization.Advances in Neural Information Processing Systems (NeurIPS), 36:78095– 78125, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.26244","last_updated":"2026-05-25T18:12:09Z","snapshot_observed_at":"2026-08-06T05:46:08.521756Z","submitted_at":"2026-05-25T18:12:09Z","title":"LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T22:52:38.330851Z"},"links":{"citing_paper":"/paper/2605.26244"},"observation_digest":"sha256:9f6efdcbe31e0f22b294d5f00a555ade9533f23311fee7f68ff135952a5d9fd0","observation_id":"f490e781-41f9-4dc7-a746-6c7eec0955cf","resolution":{"observed_at":"2026-06-29T22:52:38.330851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.21094","last_updated":"2026-06-02T17:15:46Z","snapshot_observed_at":"2026-08-06T21:10:12.336800Z","submitted_at":"2025-12-24T10:30:35Z","title":"T2AV-Compass: Towards Unified Evaluation for Text-to-Audio-Video Generation","version":2},"cited_work":{"arxiv_id":"2512.21094","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.21094","snapshot_observed_at":"2026-07-02T22:17:26.093228Z","title":"T2av-compass: Towards unified evaluation for text-to-audio-video generation","venue":"cs.CV","work_id":"f4d29773-29d6-486a-8faa-73376b01dd55","year":2025},"citing_paper":{"arxiv_id":"2605.26244","last_updated":"2026-05-25T18:12:09Z","snapshot_observed_at":"2026-08-06T05:46:08.521756Z","submitted_at":"2026-05-25T18:12:09Z","title":"LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T22:52:38.330851Z"},"links":{"cited_paper":"/paper/2512.21094","citing_paper":"/paper/2605.26244"},"observation_digest":"sha256:5b7efdea2efc3d5f3d81c2d6a40c0eb27d34346794c86d9bbbe64305fbe31ab3","observation_id":"d73f7c65-fd83-4176-ac0f-2422a712bb4a","resolution":{"observed_at":"2026-06-29T22:54:00.804439Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.21986","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T00:37:29.792063Z","title":"Speed by simplicity: A single-stream architecture for fast audio-video generative foundation model","venue":null,"work_id":"b20b430c-75db-48ea-9a8d-4bbdeb416467","year":2026},"citing_paper":{"arxiv_id":"2605.26244","last_updated":"2026-05-25T18:12:09Z","snapshot_observed_at":"2026-08-06T05:46:08.521756Z","submitted_at":"2026-05-25T18:12:09Z","title":"LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T22:52:38.330851Z"},"links":{"citing_paper":"/paper/2605.26244"},"observation_digest":"sha256:10e28afd6b28f50eb9cd1bdaec3dcc08c98ed868a7ba677b81089bacbe66fd44","observation_id":"8687e923-bbd8-4675-9cb2-d42bfb20eda7","resolution":{"observed_at":"2026-06-29T22:54:00.748755Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:52:38.330851Z","title":"Gemini 3.1 pro","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.26244","last_updated":"2026-05-25T18:12:09Z","snapshot_observed_at":"2026-08-06T05:46:08.521756Z","submitted_at":"2026-05-25T18:12:09Z","title":"LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T22:52:38.330851Z"},"links":{"citing_paper":"/paper/2605.26244"},"observation_digest":"sha256:dc58f7997c0d986317a252433faf895223996f435a18f403db03b97f528a60b3","observation_id":"87f7083b-dae6-422f-9168-f7bce445191c","resolution":{"observed_at":"2026-06-29T22:52:38.330851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08656","last_updated":"2024-06-12T21:41:32Z","snapshot_observed_at":"2026-08-12T23:44:07.499654Z","submitted_at":"2024-06-12T21:41:32Z","title":"TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":"2406.08656","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08656","snapshot_observed_at":"2026-07-04T03:49:31.003751Z","title":"arXiv preprint arXiv:2406.08656 (2024)","venue":null,"work_id":"50e0fb69-6381-494d-88d2-db24b71f4286","year":2024},"citing_paper":{"arxiv_id":"2605.26244","last_updated":"2026-05-25T18:12:09Z","snapshot_observed_at":"2026-08-06T05:46:08.521756Z","submitted_at":"2026-05-25T18:12:09Z","title":"LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T22:52:38.330851Z"},"links":{"cited_paper":"/paper/2406.08656","citing_paper":"/paper/2605.26244"},"observation_digest":"sha256:fa0d8de18b3f3d5017aec653fef8f25fa7d844e9dd7cf3977a5751f7ed75a8b2","observation_id":"42c44632-6e7c-4385-a01e-cb5d6b8075c6","resolution":{"observed_at":"2026-06-29T22:54:00.793852Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00103","last_updated":"2024-12-30T19:00:25Z","snapshot_observed_at":"2026-07-06T20:14:54.297131Z","submitted_at":"2024-12-30T19:00:25Z","title":"LTX-Video: Realtime Video Latent Diffusion","version":1},"cited_work":{"arxiv_id":"2501.00103","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.00103","snapshot_observed_at":"2026-07-09T07:56:04.699528Z","title":"LTX-Video: Realtime Video Latent Diffusion","venue":"cs.CV","work_id":"cee5c521-3ce9-466e-a035-1e42f89254f4","year":2024},"citing_paper":{"arxiv_id":"2605.26244","last_updated":"2026-05-25T18:12:09Z","snapshot_observed_at":"2026-08-06T05:46:08.521756Z","submitted_at":"2026-05-25T18:12:09Z","title":"LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T22:52:38.330851Z"},"links":{"cited_paper":"/paper/2501.00103","citing_paper":"/paper/2605.26244"},"observation_digest":"sha256:3a274e30ac0f9b2e838d63418e20bf44aaf76abc6d50205d7d28b7b9130eabec","observation_id":"69f071ff-67a2-43ba-90eb-f3efc9d0d1bb","resolution":{"observed_at":"2026-06-29T22:54:00.799124Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.09299","last_updated":"2026-04-06T13:16:33Z","snapshot_observed_at":"2026-08-13T01:36:53.690606Z","submitted_at":"2025-12-10T03:57:29Z","title":"VABench: A Comprehensive Benchmark for Audio-Video Generation","version":2},"cited_work":{"arxiv_id":"2512.09299","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.09299","snapshot_observed_at":"2026-07-05T12:41:04.378368Z","title":"VABench: A Comprehensive Benchmark for Audio-Video Generation","venue":"cs.CV","work_id":"0b1e3c4c-ed41-4a5d-aee8-471b82e5072a","year":2025},"citing_paper":{"arxiv_id":"2605.26244","last_updated":"2026-05-25T18:12:09Z","snapshot_observed_at":"2026-08-06T05:46:08.521756Z","submitted_at":"2026-05-25T18:12:09Z","title":"LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T22:52:38.330851Z"},"links":{"cited_paper":"/paper/2512.09299","citing_paper":"/paper/2605.26244"},"observation_digest":"sha256:47217b5e00e97070e514bbc905e782eb048822ea7c2b3bf4efda402c11270339","observation_id":"8218c732-fa33-4ef5-8855-ce3b9422fad2","resolution":{"observed_at":"2026-06-29T22:54:00.801597Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:52:38.330851Z","title":"Vbench: Comprehensive benchmark suite for video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26244","last_updated":"2026-05-25T18:12:09Z","snapshot_observed_at":"2026-08-06T05:46:08.521756Z","submitted_at":"2026-05-25T18:12:09Z","title":"LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T22:52:38.330851Z"},"links":{"citing_paper":"/paper/2605.26244"},"observation_digest":"sha256:3b23cdf6e35ff615290720c38f606d6094b5ee39da0cb8ae8d043af7e2e584d2","observation_id":"cbdbf675-a25d-4681-a621-d7e68349b1d4","resolution":{"observed_at":"2026-06-29T22:52:38.330851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:52:38.330851Z","title":"Vbench++: Comprehensive and versatile benchmark suite for video generative models.IEEE Transac- tions on Pattern Analysis and Machine Intelligence (TPAMI), 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.26244","last_updated":"2026-05-25T18:12:09Z","snapshot_observed_at":"2026-08-06T05:46:08.521756Z","submitted_at":"2026-05-25T18:12:09Z","title":"LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T22:52:38.330851Z"},"links":{"citing_paper":"/paper/2605.26244"},"observation_digest":"sha256:2c54386aa4c0468accdc20165e95f432e2242c9e5715d10f731e74b6ec9dba6a","observation_id":"0ce86b50-5230-4c76-8519-31f795070c06","resolution":{"observed_at":"2026-06-29T22:52:38.330851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-07-30T23:45:07.963944Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"cited_work":{"arxiv_id":"2312.14125","doi":"10.48550/arxiv.2312.14125","metadata_source":"pith","pith_arxiv_id":"2312.14125","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","venue":"cs.CV","work_id":"5cc3572d-7e2f-4431-ae42-d9282a42a800","year":2023},"citing_paper":{"arxiv_id":"2605.26244","last_updated":"2026-05-25T18:12:09Z","snapshot_observed_at":"2026-08-06T05:46:08.521756Z","submitted_at":"2026-05-25T18:12:09Z","title":"LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T22:52:38.330851Z"},"links":{"cited_paper":"/paper/2312.14125","citing_paper":"/paper/2605.26244"},"observation_digest":"sha256:c16e3cd2a2ef10a178dec1c6c67a3b3e1a1a42e6b2470acfe9e64d4b7e8c1077","observation_id":"d0af000d-86ca-487e-89e0-67a1c0ed6e89","resolution":{"observed_at":"2026-06-29T22:54:00.781386Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-05-23T03:24:43.956758+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T03:24:43.956758+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:52:38.330851Z","title":"Vintage: Joint video and text conditioning for holistic audio generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.26244","last_updated":"2026-05-25T18:12:09Z","snapshot_observed_at":"2026-08-06T05:46:08.521756Z","submitted_at":"2026-05-25T18:12:09Z","title":"LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T22:52:38.330851Z"},"links":{"citing_paper":"/paper/2605.26244"},"observation_digest":"sha256:c585c1aec52befbe7b4ac4803ef97677925fae3d7727b765e38fd5d3e6955464","observation_id":"0709691c-c970-4118-afff-46b019e45218","resolution":{"observed_at":"2026-06-29T22:52:38.330851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15091","last_updated":"2024-07-12T18:03:29Z","snapshot_observed_at":"2026-08-13T10:04:31.458943Z","submitted_at":"2023-09-26T17:36:26Z","title":"VideoDirectorGPT: Consistent Multi-scene Video Generation via LLM-Guided Planning","version":2},"cited_work":{"arxiv_id":"2309.15091","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.15091","snapshot_observed_at":"2026-07-04T14:59:55.973287Z","title":"Videodirectorgpt: Consistent multi-scene video generation via llm-guided planning","venue":null,"work_id":"386fe0af-d0c9-4b38-a690-55b83415dbe2","year":2023},"citing_paper":{"arxiv_id":"2605.26244","last_updated":"2026-05-25T18:12:09Z","snapshot_observed_at":"2026-08-06T05:46:08.521756Z","submitted_at":"2026-05-25T18:12:09Z","title":"LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T22:52:38.330851Z"},"links":{"cited_paper":"/paper/2309.15091","citing_paper":"/paper/2605.26244"},"observation_digest":"sha256:893612a0673f1033c6a01a5cffd4b4be2d52c0272703cddad193ccf97cfc9c24","observation_id":"181ade3d-c326-43be-8e74-941359de4e2f","resolution":{"observed_at":"2026-06-29T22:54:00.787750Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01813","last_updated":"2023-12-26T05:27:46Z","snapshot_observed_at":"2026-08-13T05:33:33.909075Z","submitted_at":"2023-11-03T09:46:05Z","title":"FETV: A Benchmark for Fine-Grained Evaluation of Open-Domain Text-to-Video Generation","version":3},"cited_work":{"arxiv_id":"2311.01813","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.01813","snapshot_observed_at":"2026-06-29T22:54:00.764516Z","title":"Fetv: A benchmark for fine-grained evaluation of open-domain text-to-video gen- eration.arXiv preprint arXiv:2311.01813, 2023","venue":null,"work_id":"71bdaf93-a344-465d-a42b-fb6a5008a527","year":2023},"citing_paper":{"arxiv_id":"2605.26244","last_updated":"2026-05-25T18:12:09Z","snapshot_observed_at":"2026-08-06T05:46:08.521756Z","submitted_at":"2026-05-25T18:12:09Z","title":"LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T22:52:38.330851Z"},"links":{"cited_paper":"/paper/2311.01813","citing_paper":"/paper/2605.26244"},"observation_digest":"sha256:53195987866165d3f34e6988a765c2f7898fe17c2f3998d8432a6167169c4df8","observation_id":"b2078459-455c-4a9a-b2c6-dff2f5ce1dbc","resolution":{"observed_at":"2026-06-29T22:54:00.766237Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:52:38.330851Z","title":"Evalcrafter: Benchmarking and eval- uating large video generation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26244","last_updated":"2026-05-25T18:12:09Z","snapshot_observed_at":"2026-08-06T05:46:08.521756Z","submitted_at":"2026-05-25T18:12:09Z","title":"LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T22:52:38.330851Z"},"links":{"citing_paper":"/paper/2605.26244"},"observation_digest":"sha256:7af253b7decbc515895389095ea01c3ab7ca7e3d05b85b187c5d1fd817c3827b","observation_id":"7e05a073-3c53-495e-b67b-ee53d58cb088","resolution":{"observed_at":"2026-06-29T22:52:38.330851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17203","last_updated":"2023-06-29T12:39:58Z","snapshot_observed_at":"2026-08-13T11:06:48.659936Z","submitted_at":"2023-06-29T12:39:58Z","title":"Diff-Foley: Synchronized Video-to-Audio Synthesis with Latent Diffusion Models","version":1},"cited_work":{"arxiv_id":"2306.17203","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.17203","snapshot_observed_at":"2026-06-29T22:54:00.755254Z","title":"Diff-foley: Synchronized video-to-audio synthesis with latent diffusion models.ArXiv, abs/2306.17203","venue":null,"work_id":"e70e40d7-cff5-45b8-ae9c-e18ac6403f78","year":2023},"citing_paper":{"arxiv_id":"2605.26244","last_updated":"2026-05-25T18:12:09Z","snapshot_observed_at":"2026-08-06T05:46:08.521756Z","submitted_at":"2026-05-25T18:12:09Z","title":"LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T22:52:38.330851Z"},"links":{"cited_paper":"/paper/2306.17203","citing_paper":"/paper/2605.26244"},"observation_digest":"sha256:3b88991028ace98dc375c9367d929389e4b104c30844605af576eb32cfbea781","observation_id":"30453bdc-0987-4da3-aec0-7c56b36f9d8f","resolution":{"observed_at":"2026-06-29T22:54:00.756767Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-13T11:35:08.107504Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.13720","doi":"10.48550/arxiv.2410.13720","metadata_source":"pith","pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Movie Gen: A Cast of Media Foundation Models","venue":"cs.CV","work_id":"a6a118b0-002f-4b19-881f-7f1183e0d7d8","year":2024},"citing_paper":{"arxiv_id":"2605.26244","last_updated":"2026-05-25T18:12:09Z","snapshot_observed_at":"2026-08-06T05:46:08.521756Z","submitted_at":"2026-05-25T18:12:09Z","title":"LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-29T22:52:38.330851Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2605.26244"},"observation_digest":"sha256:f598955279d61fd9707dcc8088793eb9e38ae28429462cc1168fa69db2c74b17","observation_id":"eff59dfd-bdd1-4fe7-b764-1315b3bb518e","resolution":{"observed_at":"2026-06-29T22:54:00.754175Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-11T10:12:11.384939Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2605.26244","last_updated":"2026-05-25T18:12:09Z","snapshot_observed_at":"2026-08-06T05:46:08.521756Z","submitted_at":"2026-05-25T18:12:09Z","title":"LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-29T22:52:38.330851Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2605.26244"},"observation_digest":"sha256:18b512ac08334f73b376dca298f5c129984007d6591e1814ae71d951ec84345b","observation_id":"8bf3f744-09d4-455c-8764-5dee6c3040f0","resolution":{"observed_at":"2026-06-29T22:54:00.763207Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:52:38.330851Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.26244","last_updated":"2026-05-25T18:12:09Z","snapshot_observed_at":"2026-08-06T05:46:08.521756Z","submitted_at":"2026-05-25T18:12:09Z","title":"LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-29T22:52:38.330851Z"},"links":{"citing_paper":"/paper/2605.26244"},"observation_digest":"sha256:573a52f627b032802395f3b6092589f742fcc75655824add2da5646dd65bb8de","observation_id":"eee77933-b34c-44be-9017-ffe122b67e2e","resolution":{"observed_at":"2026-06-29T22:52:38.330851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.08601","last_updated":"2025-03-24T04:00:01Z","snapshot_observed_at":"2026-08-12T22:45:43.619281Z","submitted_at":"2024-09-13T07:31:44Z","title":"STA-V2A: Video-to-Audio Generation with Semantic and Temporal Alignment","version":2},"cited_work":{"arxiv_id":"2409.08601","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.08601","snapshot_observed_at":"2026-06-29T22:54:00.771281Z","title":"Sta-v2a: Video-to-audio gen- eration with semantic and temporal alignment.arXiv preprint arXiv:2409.08601, 2024","venue":null,"work_id":"4ea441ba-30d1-4516-bb13-a916b1af2e2c","year":2024},"citing_paper":{"arxiv_id":"2605.26244","last_updated":"2026-05-25T18:12:09Z","snapshot_observed_at":"2026-08-06T05:46:08.521756Z","submitted_at":"2026-05-25T18:12:09Z","title":"LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T22:52:38.330851Z"},"links":{"cited_paper":"/paper/2409.08601","citing_paper":"/paper/2605.26244"},"observation_digest":"sha256:cd50b1c7b2bcdc47aeb53581a5db2ac28f72cb7a6fb2938f92a3d21dc7e96cbd","observation_id":"a6bfaaf5-79d6-459f-a589-8f22094298a1","resolution":{"observed_at":"2026-06-29T22:54:00.772785Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:52:38.330851Z","title":"Mm-diffusion: Learning multi-modal diffusion models for joint audio and video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.26244","last_updated":"2026-05-25T18:12:09Z","snapshot_observed_at":"2026-08-06T05:46:08.521756Z","submitted_at":"2026-05-25T18:12:09Z","title":"LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-29T22:52:38.330851Z"},"links":{"citing_paper":"/paper/2605.26244"},"observation_digest":"sha256:ea9c73984aebc5ee536759f78d2650ae5c4b3b9bc12280e938b80a4a6e26e9d6","observation_id":"99a9657a-9b32-4f2f-a2c3-836fe64ef56e","resolution":{"observed_at":"2026-06-29T22:52:38.330851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.14148","last_updated":"2026-04-15T17:59:40Z","snapshot_observed_at":"2026-08-12T10:49:35.463190Z","submitted_at":"2026-04-15T17:59:40Z","title":"Seedance 2.0: Advancing Video Generation for World Complexity","version":1},"cited_work":{"arxiv_id":"2604.14148","doi":"10.48550/arxiv.2604.14148","metadata_source":"pith","pith_arxiv_id":"2604.14148","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Seedance 2.0: Advancing Video Generation for World Complexity","venue":"cs.CV","work_id":"ceac4ea4-1ca6-4fe9-8324-880c07aec27d","year":2026},"citing_paper":{"arxiv_id":"2605.26244","last_updated":"2026-05-25T18:12:09Z","snapshot_observed_at":"2026-08-06T05:46:08.521756Z","submitted_at":"2026-05-25T18:12:09Z","title":"LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T22:52:38.330851Z"},"links":{"cited_paper":"/paper/2604.14148","citing_paper":"/paper/2605.26244"},"observation_digest":"sha256:24f9e67be552719f5348ab50faff30ff9cf9eef0db9c5ba608a635ba264cbcfc","observation_id":"8ff5089e-05d1-4b8f-bb2b-86c8bbd2f952","resolution":{"observed_at":"2026-06-29T22:54:00.775546Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.183783+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.183783+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.23969","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T21:18:58.068563Z","title":"Msvbench: Towards human-level evaluation of multi-shot video generation.arXiv preprint arXiv:2602.23969","venue":null,"work_id":"d36a8679-3b8b-43f5-aad5-e5a9e27a80af","year":2026},"citing_paper":{"arxiv_id":"2605.26244","last_updated":"2026-05-25T18:12:09Z","snapshot_observed_at":"2026-08-06T05:46:08.521756Z","submitted_at":"2026-05-25T18:12:09Z","title":"LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-29T22:52:38.330851Z"},"links":{"citing_paper":"/paper/2605.26244"},"observation_digest":"sha256:07e7410740fb128de2eed596cd8349e3eaec6d02e7b72ca299cdb2e4c2f4e329","observation_id":"9a342694-ccae-4f6a-bc6b-7de4416ffa17","resolution":{"observed_at":"2026-06-29T22:54:00.784623Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:52:38.330851Z","title":"Ve-bench: subjective-aligned benchmark suite for text-driven video editing quality assessment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.26244","last_updated":"2026-05-25T18:12:09Z","snapshot_observed_at":"2026-08-06T05:46:08.521756Z","submitted_at":"2026-05-25T18:12:09Z","title":"LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-29T22:52:38.330851Z"},"links":{"citing_paper":"/paper/2605.26244"},"observation_digest":"sha256:adba9fd00b2752a50afe03c162bd542cf05e32ab2df58f00882fe828d710fa1d","observation_id":"50291887-edac-4e67-8386-92bc0dfcee36","resolution":{"observed_at":"2026-06-29T22:52:38.330851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.16776","last_updated":"2025-12-18T17:08:12Z","snapshot_observed_at":"2026-08-13T09:50:32.293596Z","submitted_at":"2025-12-18T17:08:12Z","title":"Kling-Omni Technical Report","version":1},"cited_work":{"arxiv_id":"2512.16776","doi":"10.48550/arxiv.2512.16776","metadata_source":"pith","pith_arxiv_id":"2512.16776","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kling-Omni Technical Report","venue":"cs.CV","work_id":"52d502bd-9d8e-4944-9bf2-cfd097cfdb4e","year":2025},"citing_paper":{"arxiv_id":"2605.26244","last_updated":"2026-05-25T18:12:09Z","snapshot_observed_at":"2026-08-06T05:46:08.521756Z","submitted_at":"2026-05-25T18:12:09Z","title":"LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-29T22:52:38.330851Z"},"links":{"cited_paper":"/paper/2512.16776","citing_paper":"/paper/2605.26244"},"observation_digest":"sha256:e651b78937ee65e7db860770603b066e56bfaaeaf89c5f0f6a8980121fc44b3b","observation_id":"ceae481a-ac20-4eb0-9eb8-331b9415e472","resolution":{"observed_at":"2026-06-29T22:54:00.745998Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.73319+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.73319+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.22200","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T01:46:41.030379Z","title":"Longcat-video technical report.arXiv preprint arXiv:2510.22200","venue":null,"work_id":"b1a745e0-8d8e-4399-8d09-047d761f349d","year":2025},"citing_paper":{"arxiv_id":"2605.26244","last_updated":"2026-05-25T18:12:09Z","snapshot_observed_at":"2026-08-06T05:46:08.521756Z","submitted_at":"2026-05-25T18:12:09Z","title":"LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-29T22:52:38.330851Z"},"links":{"citing_paper":"/paper/2605.26244"},"observation_digest":"sha256:6fa40894505e4c3a915041182b561f48d02375ecf5e7376e8fa9aa65443f147a","observation_id":"8bd8e39f-7f08-47f2-9970-e733f1b2198a","resolution":{"observed_at":"2026-06-29T22:54:00.740181Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-08-12T22:34:51.361078Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":"2503.20314","doi":"10.1109/19.492748","metadata_source":"pith","pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":"cs.CV","work_id":"ad3ebc3b-4224-46c9-b61d-bcf135da0a7c","year":2025},"citing_paper":{"arxiv_id":"2605.26244","last_updated":"2026-05-25T18:12:09Z","snapshot_observed_at":"2026-08-06T05:46:08.521756Z","submitted_at":"2026-05-25T18:12:09Z","title":"LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-29T22:52:38.330851Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2605.26244"},"observation_digest":"sha256:b0110e65d984da114d773d9aeb072b659aa3eb7f2e0a9351470e567607ebd89e","observation_id":"b9c6b60b-d7e7-49f0-bf69-f8773d603199","resolution":{"observed_at":"2026-06-29T22:54:00.743443Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2605.26244","last_updated":"2026-05-25T18:12:09Z","snapshot_observed_at":"2026-08-06T05:46:08.521756Z","submitted_at":"2026-05-25T18:12:09Z","title":"LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-29T22:52:38.330851Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2605.26244"},"observation_digest":"sha256:640f208842a2f334cdec0c5346eb89ae8bdb6dc30299a86488c4b01fefaa68f9","observation_id":"9053dbd1-5cce-43c2-936a-35aa59f5743c","resolution":{"observed_at":"2026-06-29T22:54:00.770105Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.23994","last_updated":"2026-05-18T09:30:21Z","snapshot_observed_at":"2026-08-11T05:36:46.515417Z","submitted_at":"2025-12-30T05:22:31Z","title":"PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation","version":4},"cited_work":{"arxiv_id":"2512.23994","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.23994","snapshot_observed_at":"2026-07-05T12:41:04.333890Z","title":"PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation","venue":"cs.SD","work_id":"f195e204-6846-46de-9de8-8ed43724d874","year":2025},"citing_paper":{"arxiv_id":"2605.26244","last_updated":"2026-05-25T18:12:09Z","snapshot_observed_at":"2026-08-06T05:46:08.521756Z","submitted_at":"2026-05-25T18:12:09Z","title":"LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-29T22:52:38.330851Z"},"links":{"cited_paper":"/paper/2512.23994","citing_paper":"/paper/2605.26244"},"observation_digest":"sha256:3f682d64c3cea97dd2a8667b4942d8333d9fbac9b706406006dcb95edf5ea579","observation_id":"de4ce8d4-032f-4b08-86da-2b128ca30b4a","resolution":{"observed_at":"2026-06-29T22:54:00.760447Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.04379","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T13:14:53.244905Z","title":"Improved distribution matching distillation for fast image synthesis.Advances in neural information processing systems, 37:47455–47487, 2024a","venue":null,"work_id":"005eb8db-424f-4973-a65a-d7f9c23eac02","year":2026},"citing_paper":{"arxiv_id":"2605.26244","last_updated":"2026-05-25T18:12:09Z","snapshot_observed_at":"2026-08-06T05:46:08.521756Z","submitted_at":"2026-05-25T18:12:09Z","title":"LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-29T22:52:38.330851Z"},"links":{"citing_paper":"/paper/2605.26244"},"observation_digest":"sha256:d259da255924c582af352e8ebedd536e531bd8e7f09221542dc22816b2fed5ee","observation_id":"e14a9215-5553-4b05-a8f7-5c210adbf116","resolution":{"observed_at":"2026-06-29T22:54:00.778665Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01494","last_updated":"2024-07-01T17:35:56Z","snapshot_observed_at":"2026-08-12T23:31:04.494652Z","submitted_at":"2024-07-01T17:35:56Z","title":"FoleyCrafter: Bring Silent Videos to Life with Lifelike and Synchronized Sounds","version":1},"cited_work":{"arxiv_id":"2407.01494","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.01494","snapshot_observed_at":"2026-07-08T07:14:45.319897Z","title":"Foleycrafter: Bring silent videos to life with lifelike and synchronized sounds","venue":"cs.CV","work_id":"15978118-0cb9-48fb-8c66-d8f1ea7e79fc","year":2024},"citing_paper":{"arxiv_id":"2605.26244","last_updated":"2026-05-25T18:12:09Z","snapshot_observed_at":"2026-08-06T05:46:08.521756Z","submitted_at":"2026-05-25T18:12:09Z","title":"LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-29T22:52:38.330851Z"},"links":{"cited_paper":"/paper/2407.01494","citing_paper":"/paper/2605.26244"},"observation_digest":"sha256:a843c8081ad12ba5646303c3597272ca3eb8c8150117b865b0bc032beb3eabc6","observation_id":"c78bf827-1d7e-43b2-9537-4b9a10808678","resolution":{"observed_at":"2026-06-29T22:54:00.751695Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09642","last_updated":"2026-03-02T11:31:23Z","snapshot_observed_at":"2026-08-11T23:38:12.766811Z","submitted_at":"2025-03-12T05:00:07Z","title":"Open-Sora 2.0: Training a Commercial-Level Video Generation Model in $200k","version":3},"cited_work":{"arxiv_id":"2503.09642","doi":"10.48550/arxiv.2503.09642","metadata_source":"pith","pith_arxiv_id":"2503.09642","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open-Sora 2.0: Training a Commercial-Level Video Generation Model in $200k","venue":"cs.GR","work_id":"c22f9060-268c-4cc9-8018-dee486a23da1","year":2025},"citing_paper":{"arxiv_id":"2605.26244","last_updated":"2026-05-25T18:12:09Z","snapshot_observed_at":"2026-08-06T05:46:08.521756Z","submitted_at":"2026-05-25T18:12:09Z","title":"LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-29T22:52:38.330851Z"},"links":{"cited_paper":"/paper/2503.09642","citing_paper":"/paper/2605.26244"},"observation_digest":"sha256:4388d9ad16b1ec0f050a4fe7ff3cfd20b7df25d26ff8704274489def11078e7e","observation_id":"cb2d84a4-6724-4155-8a49-36619d0b34e0","resolution":{"observed_at":"2026-06-29T22:54:00.790687Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.08540","last_updated":"2026-04-09T17:59:39Z","snapshot_observed_at":"2026-08-11T13:18:00.738031Z","submitted_at":"2026-04-09T17:59:39Z","title":"AVGen-Bench: A Task-Driven Benchmark for Multi-Granular Evaluation of Text-to-Audio-Video Generation","version":1},"cited_work":{"arxiv_id":"2604.08540","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.08540","snapshot_observed_at":"2026-07-03T00:07:28.033897Z","title":"AVGen-Bench: A Task-Driven Benchmark for Multi-Granular Evaluation of Text-to-Audio-Video Generation","venue":"cs.CV","work_id":"49aa4820-3ca7-4ee9-bac1-a9a8389e5c56","year":2026},"citing_paper":{"arxiv_id":"2605.26244","last_updated":"2026-05-25T18:12:09Z","snapshot_observed_at":"2026-08-06T05:46:08.521756Z","submitted_at":"2026-05-25T18:12:09Z","title":"LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-29T22:52:38.330851Z"},"links":{"cited_paper":"/paper/2604.08540","citing_paper":"/paper/2605.26244"},"observation_digest":"sha256:32f0172d94f42a3ded83d2f28261247768e233265d4efab5ec4958be13c1fe09","observation_id":"d79a1bdf-ff4d-40bd-8840-ff993681a2cc","resolution":{"observed_at":"2026-06-29T22:54:00.796273Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:52:38.330851Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26244","last_updated":"2026-05-25T18:12:09Z","snapshot_observed_at":"2026-08-06T05:46:08.521756Z","submitted_at":"2026-05-25T18:12:09Z","title":"LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-29T22:52:38.330851Z"},"links":{"citing_paper":"/paper/2605.26244"},"observation_digest":"sha256:fad0c0766b2402bac7e5c5f98005fedcab20d633fb8f8e085823fe6e12046bfe","observation_id":"3fc38b35-6185-46e8-9dc3-6f55d41248a8","resolution":{"observed_at":"2026-06-29T22:52:38.330851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:52:38.330851Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26244","last_updated":"2026-05-25T18:12:09Z","snapshot_observed_at":"2026-08-06T05:46:08.521756Z","submitted_at":"2026-05-25T18:12:09Z","title":"LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-29T22:52:38.330851Z"},"links":{"citing_paper":"/paper/2605.26244"},"observation_digest":"sha256:0bc9c26aa1862c4e982a34830156bbc68d5248588a7cc2fda12c414df3056980","observation_id":"2ae3eccb-225a-4743-8930-ae17ec37a8d1","resolution":{"observed_at":"2026-06-29T22:52:38.330851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:52:38.330851Z","title":"Prompt template for T2A V LLM-template generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26244","last_updated":"2026-05-25T18:12:09Z","snapshot_observed_at":"2026-08-06T05:46:08.521756Z","submitted_at":"2026-05-25T18:12:09Z","title":"LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-29T22:52:38.330851Z"},"links":{"citing_paper":"/paper/2605.26244"},"observation_digest":"sha256:8dfcada7fbf1a98775c6877322b09450ffeb1110eb485e6722e1e9c7ca3ba41c","observation_id":"053a7140-7dc3-4b42-99f0-3c032b9f10a8","resolution":{"observed_at":"2026-06-29T22:52:38.330851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:52:38.330851Z","title":"image summary","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26244","last_updated":"2026-05-25T18:12:09Z","snapshot_observed_at":"2026-08-06T05:46:08.521756Z","submitted_at":"2026-05-25T18:12:09Z","title":"LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-29T22:52:38.330851Z"},"links":{"citing_paper":"/paper/2605.26244"},"observation_digest":"sha256:73a685c5efd321600245e26fd862822501494f2f3ad7172a6700fab856421a3e","observation_id":"c5d9b9de-c684-46d3-8ed6-048ba1aafaea","resolution":{"observed_at":"2026-06-29T22:52:38.330851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:52:38.330851Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26244","last_updated":"2026-05-25T18:12:09Z","snapshot_observed_at":"2026-08-06T05:46:08.521756Z","submitted_at":"2026-05-25T18:12:09Z","title":"LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-29T22:52:38.330851Z"},"links":{"citing_paper":"/paper/2605.26244"},"observation_digest":"sha256:1f4a6439051fe659f062888459a17e324f583597ca27afb435e07b0824dffbcd","observation_id":"d8d12018-ea1f-40f6-a5a7-ca638a6a9655","resolution":{"observed_at":"2026-06-29T22:52:38.330851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:52:38.330851Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26244","last_updated":"2026-05-25T18:12:09Z","snapshot_observed_at":"2026-08-06T05:46:08.521756Z","submitted_at":"2026-05-25T18:12:09Z","title":"LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-29T22:52:38.330851Z"},"links":{"citing_paper":"/paper/2605.26244"},"observation_digest":"sha256:4a7a5f2b0db9b32d5f5547dd9686caec6f9b2eb470dfc462c065b94038f36780","observation_id":"d1a24af9-00f5-45d8-a5d5-b1346e3a930c","resolution":{"observed_at":"2026-06-29T22:52:38.330851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:52:38.330851Z","title":"water-burst","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26244","last_updated":"2026-05-25T18:12:09Z","snapshot_observed_at":"2026-08-06T05:46:08.521756Z","submitted_at":"2026-05-25T18:12:09Z","title":"LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-29T22:52:38.330851Z"},"links":{"citing_paper":"/paper/2605.26244"},"observation_digest":"sha256:de239544d66074530dc57f6264af8eea3c369528ee929c84554922022c7660b1","observation_id":"f5195eef-34b7-4b05-b9fa-bb58ec5cb568","resolution":{"observed_at":"2026-06-29T22:52:38.330851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:52:38.330851Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26244","last_updated":"2026-05-25T18:12:09Z","snapshot_observed_at":"2026-08-06T05:46:08.521756Z","submitted_at":"2026-05-25T18:12:09Z","title":"LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-29T22:52:38.330851Z"},"links":{"citing_paper":"/paper/2605.26244"},"observation_digest":"sha256:b0c27d24d5e68f39421b399e0fbc2fbea93f5139bda830267eecf4cf1a72cdf3","observation_id":"5d4b139a-5e1b-4b7c-aace-671d02e9c373","resolution":{"observed_at":"2026-06-29T22:52:38.330851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:52:38.330851Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26244","last_updated":"2026-05-25T18:12:09Z","snapshot_observed_at":"2026-08-06T05:46:08.521756Z","submitted_at":"2026-05-25T18:12:09Z","title":"LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-29T22:52:38.330851Z"},"links":{"citing_paper":"/paper/2605.26244"},"observation_digest":"sha256:e0adef302f997fb98b8711da4923aa97c7c80c834edfc4d89e90e28e96551604","observation_id":"b9cf5ecc-d96c-4a45-803b-901aa695f2f8","resolution":{"observed_at":"2026-06-29T22:52:38.330851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:52:38.330851Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26244","last_updated":"2026-05-25T18:12:09Z","snapshot_observed_at":"2026-08-06T05:46:08.521756Z","submitted_at":"2026-05-25T18:12:09Z","title":"LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-29T22:52:38.330851Z"},"links":{"citing_paper":"/paper/2605.26244"},"observation_digest":"sha256:19b8aa4ef73966f780b9ef4050c0c75c8772dae9b582561a731e0793f70c54af","observation_id":"dfc492ea-7365-49e5-a74f-7291366e98d9","resolution":{"observed_at":"2026-06-29T22:52:38.330851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:52:38.330851Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26244","last_updated":"2026-05-25T18:12:09Z","snapshot_observed_at":"2026-08-06T05:46:08.521756Z","submitted_at":"2026-05-25T18:12:09Z","title":"LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-29T22:52:38.330851Z"},"links":{"citing_paper":"/paper/2605.26244"},"observation_digest":"sha256:8b32422a065cf256154317d841f8397863075fbef3894306382a4f0292a7ddda","observation_id":"743d7529-2ed3-4f82-8536-46e4db54c23c","resolution":{"observed_at":"2026-06-29T22:52:38.330851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:52:38.330851Z","title":"After the reference video, the scene continues with: {event2.visual description}; {event3.visual description}","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26244","last_updated":"2026-05-25T18:12:09Z","snapshot_observed_at":"2026-08-06T05:46:08.521756Z","submitted_at":"2026-05-25T18:12:09Z","title":"LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-29T22:52:38.330851Z"},"links":{"citing_paper":"/paper/2605.26244"},"observation_digest":"sha256:19d66d11c7abbc7cc9d4274693110f940dd312f0ffcdb9655da9b1dc9a447664","observation_id":"ec82a2cd-aace-4f93-b0eb-f0295d1365d3","resolution":{"observed_at":"2026-06-29T22:52:38.330851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:52:38.330851Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26244","last_updated":"2026-05-25T18:12:09Z","snapshot_observed_at":"2026-08-06T05:46:08.521756Z","submitted_at":"2026-05-25T18:12:09Z","title":"LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-29T22:52:38.330851Z"},"links":{"citing_paper":"/paper/2605.26244"},"observation_digest":"sha256:1b3138dd0cfb1b0b4bf70c86ef1abf6e5e83f4bb05664a6bda194fb60ffccfb1","observation_id":"1fdf7fc6-4ffd-49cb-a4dd-d1fb85264daf","resolution":{"observed_at":"2026-06-29T22:52:38.330851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:52:38.330851Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26244","last_updated":"2026-05-25T18:12:09Z","snapshot_observed_at":"2026-08-06T05:46:08.521756Z","submitted_at":"2026-05-25T18:12:09Z","title":"LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-29T22:52:38.330851Z"},"links":{"citing_paper":"/paper/2605.26244"},"observation_digest":"sha256:121530628080874d4ec03ccd18c1f9677b287a29db0949b5bf673e87a117332a","observation_id":"8239fe8d-6a53-41f9-bdba-ae767664a0e5","resolution":{"observed_at":"2026-06-29T22:52:38.330851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:52:38.330851Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26244","last_updated":"2026-05-25T18:12:09Z","snapshot_observed_at":"2026-08-06T05:46:08.521756Z","submitted_at":"2026-05-25T18:12:09Z","title":"LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-29T22:52:38.330851Z"},"links":{"citing_paper":"/paper/2605.26244"},"observation_digest":"sha256:ff5d23cdb16a4d236ec6063c76471e92ea6be2aa870c647264c92803b1448977","observation_id":"51e99185-bfb3-4b33-bd6d-b7e27bcca397","resolution":{"observed_at":"2026-06-29T22:52:38.330851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:52:38.330851Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26244","last_updated":"2026-05-25T18:12:09Z","snapshot_observed_at":"2026-08-06T05:46:08.521756Z","submitted_at":"2026-05-25T18:12:09Z","title":"LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-29T22:52:38.330851Z"},"links":{"citing_paper":"/paper/2605.26244"},"observation_digest":"sha256:47dbfebd361759323e90b0b44f73f90c761fed6e68b56ff9e27d3ff5834c5ac8","observation_id":"33c80e59-6fdf-4455-bcdc-1c172b51f1e7","resolution":{"observed_at":"2026-06-29T22:52:38.330851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2605.26244","last_updated":"2026-05-25T18:12:09Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T05:46:08.521756Z","submitted_at":"2026-05-25T18:12:09Z","title":"LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":25,"verified_exact":22,"verified_fuzzy":0},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 2 inbound Pith citation observations for arXiv:2605.26244."}