{"as_of":"2026-08-21T04:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7044997f05a36fac3f64e30137073b1abfed21e9dad7bd7f479f6de59231070b","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-02T14:42:23.038497Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T00:17:53.934343Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-02T14:47:03.157753Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.00726","last_updated":"2026-07-01T10:12:25Z","snapshot_observed_at":"2026-08-18T15:47:50.380615Z","submitted_at":"2026-07-01T10:12:25Z","title":"AV-SyncBench: Decoupled Benchmarking of Temporal and Semantic Audio-Visual Synchronization","version":1},"cited_work":{"arxiv_id":"2607.00726","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.00726","snapshot_observed_at":"2026-07-02T14:47:03.157753Z","title":"AV-SyncBench: Decoupled Benchmarking of Temporal and Semantic Audio-Visual Synchronization","venue":"cs.CV","work_id":"9d6f2fdf-e6a7-4f81-ab24-1d228e57f4bd","year":2026},"citing_paper":{"arxiv_id":"2607.00726","last_updated":"2026-07-01T10:12:25Z","snapshot_observed_at":"2026-08-18T15:47:50.380615Z","submitted_at":"2026-07-01T10:12:25Z","title":"AV-SyncBench: Decoupled Benchmarking of Temporal and Semantic Audio-Visual Synchronization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-02T14:42:23.038497Z"},"links":{"cited_paper":"/paper/2607.00726","citing_paper":"/paper/2607.00726"},"observation_digest":"sha256:eadb904380c128e97d8398c7257063a026b5377d6ca81ab9a3a47a9cd4884b58","observation_id":"b96bc9b3-2b1b-41c0-95d6-6ba4c5e5200e","resolution":{"observed_at":"2026-07-02T14:47:03.159103Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2607.00726","last_updated":"2026-07-01T10:12:25Z","snapshot_observed_at":"2026-08-18T15:47:50.380615Z","submitted_at":"2026-07-01T10:12:25Z","title":"AV-SyncBench: Decoupled Benchmarking of Temporal and Semantic Audio-Visual Synchronization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.00726","snapshot_observed_at":"2026-08-08T00:17:53.934343Z","title":"arXiv preprint arXiv:2607.00726 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04224","last_updated":"2026-08-04T21:00:57Z","snapshot_observed_at":"2026-08-14T17:15:41.358609Z","submitted_at":"2026-08-04T21:00:57Z","title":"OmniVR: Joint Video-Audio Conditional Generation for Restoring Degraded Historical Films","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-08T00:17:53.934343Z"},"links":{"cited_paper":"/paper/2607.00726","citing_paper":"/paper/2608.04224"},"observation_digest":"sha256:2de7875bea7394fd454c584bff0a3c836e422d9d40705e3923d59c0c3b5d69a9","observation_id":"27213d46-d234-409c-abef-b4577fd34cae","resolution":{"observed_at":"2026-08-08T00:17:53.934343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2607.00726/citation-record","integrity":"/paper/2607.00726/integrity","json":"/paper/2607.00726/citation-record.json","paper":"/paper/2607.00726"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.00726","last_updated":"2026-07-01T10:12:25Z","snapshot_observed_at":"2026-08-18T15:47:50.380615Z","submitted_at":"2026-07-01T10:12:25Z","title":"AV-SyncBench: Decoupled Benchmarking of Temporal and Semantic Audio-Visual Synchronization","version":1},"cited_work":{"arxiv_id":"2607.00726","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.00726","snapshot_observed_at":"2026-07-02T14:47:03.157753Z","title":"AV-SyncBench: Decoupled Benchmarking of Temporal and Semantic Audio-Visual Synchronization","venue":"cs.CV","work_id":"9d6f2fdf-e6a7-4f81-ab24-1d228e57f4bd","year":2026},"citing_paper":{"arxiv_id":"2607.00726","last_updated":"2026-07-01T10:12:25Z","snapshot_observed_at":"2026-08-18T15:47:50.380615Z","submitted_at":"2026-07-01T10:12:25Z","title":"AV-SyncBench: Decoupled Benchmarking of Temporal and Semantic Audio-Visual Synchronization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-02T14:42:23.038497Z"},"links":{"cited_paper":"/paper/2607.00726","citing_paper":"/paper/2607.00726"},"observation_digest":"sha256:eadb904380c128e97d8398c7257063a026b5377d6ca81ab9a3a47a9cd4884b58","observation_id":"b96bc9b3-2b1b-41c0-95d6-6ba4c5e5200e","resolution":{"observed_at":"2026-07-02T14:47:03.159103Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"4950.5180","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T14:47:03.165883Z","title":"The framework defines audio–visual synchroniza- tion performance along two key dimensions: temporal consis- tency perception and semantic consistency perception","venue":null,"work_id":"a7ecfabd-9214-429f-a9ae-6081c6a87db0","year":2000},"citing_paper":{"arxiv_id":"2607.00726","last_updated":"2026-07-01T10:12:25Z","snapshot_observed_at":"2026-08-18T15:47:50.380615Z","submitted_at":"2026-07-01T10:12:25Z","title":"AV-SyncBench: Decoupled Benchmarking of Temporal and Semantic Audio-Visual Synchronization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-02T14:42:23.038497Z"},"links":{"citing_paper":"/paper/2607.00726"},"observation_digest":"sha256:e781a67e423eafdd758c6ab41abdee097f6213cfbd23422bba3c7ffc4cbceb03","observation_id":"00d0b861-d2ea-4287-8bf9-fb913f143414","resolution":{"observed_at":"2026-07-02T14:47:03.167535Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"6170.6620","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T14:47:03.171642Z","title":"Setup All experiments are conducted on two NVIDIA H20 GPUs, with each job allocated 4 vCPUs (Intel Xeon Platinum 8469C)","venue":null,"work_id":"20b66820-0e19-4216-aded-e236666ffd6b","year":null},"citing_paper":{"arxiv_id":"2607.00726","last_updated":"2026-07-01T10:12:25Z","snapshot_observed_at":"2026-08-18T15:47:50.380615Z","submitted_at":"2026-07-01T10:12:25Z","title":"AV-SyncBench: Decoupled Benchmarking of Temporal and Semantic Audio-Visual Synchronization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-02T14:42:23.038497Z"},"links":{"citing_paper":"/paper/2607.00726"},"observation_digest":"sha256:e770a142e855df0ba3d05b8a2cdbd98f7f527b078c99c27520bbaf1590aaedba","observation_id":"3a69b4b3-1634-4920-a985-fd45696be4fb","resolution":{"observed_at":"2026-07-02T14:47:03.173478Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T00:11:39.955118Z","title":"First, the semantic editing tasks rely on gener- ative methods such as DDSP and OpenV oice V2","venue":null,"work_id":"8edffc13-b58e-4521-97a8-ed2213f2c995","year":null},"citing_paper":{"arxiv_id":"2607.00726","last_updated":"2026-07-01T10:12:25Z","snapshot_observed_at":"2026-08-18T15:47:50.380615Z","submitted_at":"2026-07-01T10:12:25Z","title":"AV-SyncBench: Decoupled Benchmarking of Temporal and Semantic Audio-Visual Synchronization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-02T14:42:23.038497Z"},"links":{"citing_paper":"/paper/2607.00726"},"observation_digest":"sha256:209d733d3c21f9b3ec8183f51925683ceb0abedaca4c919adb44c7487770bb4b","observation_id":"8d44d570-26fb-4d81-961e-ba08dbab8dfb","resolution":{"observed_at":"2026-07-06T00:11:39.956528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T00:11:39.959513Z","title":null,"venue":null,"work_id":"57774d65-5441-44b4-bff1-2df980d94cb3","year":null},"citing_paper":{"arxiv_id":"2607.00726","last_updated":"2026-07-01T10:12:25Z","snapshot_observed_at":"2026-08-18T15:47:50.380615Z","submitted_at":"2026-07-01T10:12:25Z","title":"AV-SyncBench: Decoupled Benchmarking of Temporal and Semantic Audio-Visual Synchronization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-02T14:42:23.038497Z"},"links":{"citing_paper":"/paper/2607.00726"},"observation_digest":"sha256:17caed3d2398b179db86b6aed108a1d74f01c1c37e4948b9fef8fbedd2ba6dd2","observation_id":"7c8dc27b-dd10-44c8-b960-bf10d554a38f","resolution":{"observed_at":"2026-07-06T00:11:39.960685Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T00:11:39.919212Z","title":"These tools did not contribute to the creation of any sci- entific content, data, or conclusions","venue":null,"work_id":"16e43687-7c2e-4b27-951d-c9db32a88201","year":null},"citing_paper":{"arxiv_id":"2607.00726","last_updated":"2026-07-01T10:12:25Z","snapshot_observed_at":"2026-08-18T15:47:50.380615Z","submitted_at":"2026-07-01T10:12:25Z","title":"AV-SyncBench: Decoupled Benchmarking of Temporal and Semantic Audio-Visual Synchronization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-02T14:42:23.038497Z"},"links":{"citing_paper":"/paper/2607.00726"},"observation_digest":"sha256:8af694d3d92f58ede1ef4adaa30de4aa1d45f5bf86e7dc7404cd723fa8aed3e4","observation_id":"abffc545-e574-4a8e-935d-edc9b3a35bab","resolution":{"observed_at":"2026-07-06T00:11:39.920655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T00:11:39.945356Z","title":"Look, listen and learn,","venue":null,"work_id":"0ca1d5ba-581f-4ef4-8c7b-5101f36cafe4","year":2017},"citing_paper":{"arxiv_id":"2607.00726","last_updated":"2026-07-01T10:12:25Z","snapshot_observed_at":"2026-08-18T15:47:50.380615Z","submitted_at":"2026-07-01T10:12:25Z","title":"AV-SyncBench: Decoupled Benchmarking of Temporal and Semantic Audio-Visual Synchronization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-02T14:42:23.038497Z"},"links":{"citing_paper":"/paper/2607.00726"},"observation_digest":"sha256:2b8094430e54bb5df42193c35088e298657e1beea3d9af53a8ca09a3773aac29","observation_id":"0dfc2863-2403-4a50-a467-25835e2f291a","resolution":{"observed_at":"2026-07-06T00:11:39.946485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T00:11:39.947088Z","title":"Audio-visual scene analysis with self-supervised multisensory features,","venue":null,"work_id":"68f2c713-ec65-4599-b82f-f15390bfb31f","year":2018},"citing_paper":{"arxiv_id":"2607.00726","last_updated":"2026-07-01T10:12:25Z","snapshot_observed_at":"2026-08-18T15:47:50.380615Z","submitted_at":"2026-07-01T10:12:25Z","title":"AV-SyncBench: Decoupled Benchmarking of Temporal and Semantic Audio-Visual Synchronization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-02T14:42:23.038497Z"},"links":{"citing_paper":"/paper/2607.00726"},"observation_digest":"sha256:4cc4cc45807d729c3fa1d60267d7932d00c41decc31181004e3fb080670d1f21","observation_id":"8c2ae7eb-f2a5-4ef8-8dfe-1f81eb112b12","resolution":{"observed_at":"2026-07-06T00:11:39.948681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T00:11:39.949218Z","title":"Audio-visual event localization in unconstrained videos,","venue":null,"work_id":"82dfe432-7d48-4d5a-ab25-bc65ee58b899","year":2018},"citing_paper":{"arxiv_id":"2607.00726","last_updated":"2026-07-01T10:12:25Z","snapshot_observed_at":"2026-08-18T15:47:50.380615Z","submitted_at":"2026-07-01T10:12:25Z","title":"AV-SyncBench: Decoupled Benchmarking of Temporal and Semantic Audio-Visual Synchronization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-02T14:42:23.038497Z"},"links":{"citing_paper":"/paper/2607.00726"},"observation_digest":"sha256:2788cd24fe62bfb908628f1c8954a9c667848a9ece90bb6c00d7567b2e5a9e03","observation_id":"d1aca361-54fb-4a35-a8c4-86c0a801c501","resolution":{"observed_at":"2026-07-06T00:11:39.950693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T00:11:39.943458Z","title":"The sound of pixels,","venue":null,"work_id":"994e7746-0ecc-4eac-84c5-b95aa5086b41","year":2018},"citing_paper":{"arxiv_id":"2607.00726","last_updated":"2026-07-01T10:12:25Z","snapshot_observed_at":"2026-08-18T15:47:50.380615Z","submitted_at":"2026-07-01T10:12:25Z","title":"AV-SyncBench: Decoupled Benchmarking of Temporal and Semantic Audio-Visual Synchronization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-02T14:42:23.038497Z"},"links":{"citing_paper":"/paper/2607.00726"},"observation_digest":"sha256:0343602bb98f15f552109b2914dc4f5f34ab9bb2377196234324eafbd423327f","observation_id":"e5050b42-d424-47ff-b4d7-0163ff4e08ad","resolution":{"observed_at":"2026-07-06T00:11:39.944727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T00:11:39.941452Z","title":"Diff-foley: Synchronized video-to-audio synthesis with latent diffusion models,","venue":null,"work_id":"3d597c60-7eb5-467f-ba81-700e0093eee1","year":2023},"citing_paper":{"arxiv_id":"2607.00726","last_updated":"2026-07-01T10:12:25Z","snapshot_observed_at":"2026-08-18T15:47:50.380615Z","submitted_at":"2026-07-01T10:12:25Z","title":"AV-SyncBench: Decoupled Benchmarking of Temporal and Semantic Audio-Visual Synchronization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-02T14:42:23.038497Z"},"links":{"citing_paper":"/paper/2607.00726"},"observation_digest":"sha256:7a9473ca140fe732bc49e56702d0d61948341486f6af961c9e16d709f8056b50","observation_id":"ab648870-6c1e-4c68-8d60-9dd12ff4e6ba","resolution":{"observed_at":"2026-07-06T00:11:39.942884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T00:11:39.937514Z","title":"MMAudio: Taming multimodal joint training for high-quality video-to-audio synthesis,","venue":null,"work_id":"acf237fc-3f59-4db7-984b-5b2c968b6b59","year":2025},"citing_paper":{"arxiv_id":"2607.00726","last_updated":"2026-07-01T10:12:25Z","snapshot_observed_at":"2026-08-18T15:47:50.380615Z","submitted_at":"2026-07-01T10:12:25Z","title":"AV-SyncBench: Decoupled Benchmarking of Temporal and Semantic Audio-Visual Synchronization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-02T14:42:23.038497Z"},"links":{"citing_paper":"/paper/2607.00726"},"observation_digest":"sha256:6724bda8cd8e50e75dabeb8b070905365261ab330e7d68011cccf629cc74b1ab","observation_id":"38afd828-36e0-42ce-a6bd-3870e8bbedc7","resolution":{"observed_at":"2026-07-06T00:11:39.938805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T00:11:39.939386Z","title":"FreeAudio: Training-free timing planning for controllable long-form text-to- audio generation,","venue":null,"work_id":"6c08f699-9b01-461b-8ece-e6d3d1c11568","year":2025},"citing_paper":{"arxiv_id":"2607.00726","last_updated":"2026-07-01T10:12:25Z","snapshot_observed_at":"2026-08-18T15:47:50.380615Z","submitted_at":"2026-07-01T10:12:25Z","title":"AV-SyncBench: Decoupled Benchmarking of Temporal and Semantic Audio-Visual Synchronization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-02T14:42:23.038497Z"},"links":{"citing_paper":"/paper/2607.00726"},"observation_digest":"sha256:4e98eedf78d1c56ef2e751195b90d0823c9b837c94b77aa1e8b9f41400fc0373","observation_id":"f19e6ef5-3530-4536-839b-c0668901d07b","resolution":{"observed_at":"2026-07-06T00:11:39.940853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08878","last_updated":"2026-04-20T12:44:20Z","snapshot_observed_at":"2026-07-06T22:32:13.055128Z","submitted_at":"2025-10-10T00:19:41Z","title":"ControlAudio: Tackling Text-Guided, Timing-Indicated and Intelligible Audio Generation via Progressive Diffusion Modeling","version":3},"cited_work":{"arxiv_id":"2510.08878","doi":"10.48550/arxiv.2510.08878","metadata_source":"pith","pith_arxiv_id":"2510.08878","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"ControlAudio: Tackling Text-Guided, Timing-Indicated and Intelligible Audio Generation via Progressive Diffusion Modeling","venue":"cs.SD","work_id":"2a5d3490-3ce9-4410-9101-4a877e38761c","year":2025},"citing_paper":{"arxiv_id":"2607.00726","last_updated":"2026-07-01T10:12:25Z","snapshot_observed_at":"2026-08-18T15:47:50.380615Z","submitted_at":"2026-07-01T10:12:25Z","title":"AV-SyncBench: Decoupled Benchmarking of Temporal and Semantic Audio-Visual Synchronization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-02T14:42:23.038497Z"},"links":{"cited_paper":"/paper/2510.08878","citing_paper":"/paper/2607.00726"},"observation_digest":"sha256:fc10c833e5b57444fe145501faeea8f8968bc1b690289c6bf6bd8125701eaa79","observation_id":"ab8a855c-2e6f-48bb-8648-533d8ab41082","resolution":{"observed_at":"2026-07-02T14:47:03.176945Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T00:11:39.951282Z","title":"V ATT: Transformers for multimodal self- supervised learning from raw video, audio and text,","venue":null,"work_id":"b7d9c9cd-964a-41ce-8004-f95281bd2675","year":2021},"citing_paper":{"arxiv_id":"2607.00726","last_updated":"2026-07-01T10:12:25Z","snapshot_observed_at":"2026-08-18T15:47:50.380615Z","submitted_at":"2026-07-01T10:12:25Z","title":"AV-SyncBench: Decoupled Benchmarking of Temporal and Semantic Audio-Visual Synchronization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-02T14:42:23.038497Z"},"links":{"citing_paper":"/paper/2607.00726"},"observation_digest":"sha256:ee5ea7d3facdadef81ede38bc7eb3ec6dac7136998202f4260357a858ac97892","observation_id":"70cc7f8b-7691-43e7-ba35-78253d719dae","resolution":{"observed_at":"2026-07-06T00:11:39.952652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.17765","last_updated":"2025-09-22T13:26:24Z","snapshot_observed_at":"2026-08-11T00:14:34.061687Z","submitted_at":"2025-09-22T13:26:24Z","title":"Qwen3-Omni Technical Report","version":1},"cited_work":{"arxiv_id":"2509.17765","doi":"10.48550/arxiv.2509.17765","metadata_source":"pith","pith_arxiv_id":"2509.17765","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-Omni Technical Report","venue":"cs.CL","work_id":"ae43e594-8bab-4471-b6af-92a300f6a048","year":2025},"citing_paper":{"arxiv_id":"2607.00726","last_updated":"2026-07-01T10:12:25Z","snapshot_observed_at":"2026-08-18T15:47:50.380615Z","submitted_at":"2026-07-01T10:12:25Z","title":"AV-SyncBench: Decoupled Benchmarking of Temporal and Semantic Audio-Visual Synchronization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-02T14:42:23.038497Z"},"links":{"cited_paper":"/paper/2509.17765","citing_paper":"/paper/2607.00726"},"observation_digest":"sha256:9e2aed09eafe7dee8667e4a0a3feb0d56efb6cf55a9e6fdd43769e32f776b425","observation_id":"c613800e-aaa5-4da7-96b5-25a94636db3c","resolution":{"observed_at":"2026-07-02T14:47:03.174375Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-17T16:38:12.229447+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-17T16:38:12.229447+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T00:11:39.957253Z","title":"Kling-foley: Multimodal diffusion transformer for high-quality video-to-audio generation,","venue":null,"work_id":"2d9b5d95-dc94-4ffa-9b08-59329d2c6b52","year":null},"citing_paper":{"arxiv_id":"2607.00726","last_updated":"2026-07-01T10:12:25Z","snapshot_observed_at":"2026-08-18T15:47:50.380615Z","submitted_at":"2026-07-01T10:12:25Z","title":"AV-SyncBench: Decoupled Benchmarking of Temporal and Semantic Audio-Visual Synchronization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-02T14:42:23.038497Z"},"links":{"citing_paper":"/paper/2607.00726"},"observation_digest":"sha256:5d625b25b5ac9d2bf4f49d577e85f61aaa5cca52c4caa6525595e2df692ed00f","observation_id":"5f2eef17-dc85-47ed-91de-8f40910f7232","resolution":{"observed_at":"2026-07-06T00:11:39.958922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.19774","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T14:47:03.168926Z","title":"V2a-mapper: A lightweight solution for vision-to-audio generation by connecting foundation models","venue":null,"work_id":"709d7ef2-3738-4756-a913-5a769f47acde","year":2025},"citing_paper":{"arxiv_id":"2607.00726","last_updated":"2026-07-01T10:12:25Z","snapshot_observed_at":"2026-08-18T15:47:50.380615Z","submitted_at":"2026-07-01T10:12:25Z","title":"AV-SyncBench: Decoupled Benchmarking of Temporal and Semantic Audio-Visual Synchronization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-02T14:42:23.038497Z"},"links":{"citing_paper":"/paper/2607.00726"},"observation_digest":"sha256:cb8af0a5ceddfdf070c113976275a35b2146ba4972f0f1c6fe75a3ddaf35653b","observation_id":"f59c7858-f8f8-4982-879b-4af53c945390","resolution":{"observed_at":"2026-07-02T14:47:03.170542Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04432","last_updated":"2021-12-08T17:50:26Z","snapshot_observed_at":"2026-08-19T17:16:54.787969Z","submitted_at":"2021-12-08T17:50:26Z","title":"Audio-Visual Synchronisation in the wild","version":1},"cited_work":{"arxiv_id":"2112.04432","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2112.04432","snapshot_observed_at":"2026-07-02T14:47:03.164110Z","title":"Audio-visual synchronisation in the wild,","venue":null,"work_id":"129d457a-63a4-46dc-b15c-6a75cf1f9a33","year":2021},"citing_paper":{"arxiv_id":"2607.00726","last_updated":"2026-07-01T10:12:25Z","snapshot_observed_at":"2026-08-18T15:47:50.380615Z","submitted_at":"2026-07-01T10:12:25Z","title":"AV-SyncBench: Decoupled Benchmarking of Temporal and Semantic Audio-Visual Synchronization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-02T14:42:23.038497Z"},"links":{"cited_paper":"/paper/2112.04432","citing_paper":"/paper/2607.00726"},"observation_digest":"sha256:154969b8c9014820e1137ba384658179ecc2db337f3cb7be5ee727bd0d0c3307","observation_id":"ddf727fa-1b29-447d-9dc5-311031373b2d","resolution":{"observed_at":"2026-07-02T14:47:03.165821Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04769","last_updated":"2022-06-09T21:16:10Z","snapshot_observed_at":"2026-08-16T16:54:03.233760Z","submitted_at":"2022-06-09T21:16:10Z","title":"CLAP: Learning Audio Concepts From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":"2206.04769","doi":"10.48550/arxiv.2206.04769","metadata_source":"arxiv_reference","pith_arxiv_id":"2206.04769","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Clap: Learning audio concepts from natural language supervision","venue":"arXiv (Cornell University)","work_id":"983269ec-ba9c-4b46-92ae-314e1b52c693","year":2023},"citing_paper":{"arxiv_id":"2607.00726","last_updated":"2026-07-01T10:12:25Z","snapshot_observed_at":"2026-08-18T15:47:50.380615Z","submitted_at":"2026-07-01T10:12:25Z","title":"AV-SyncBench: Decoupled Benchmarking of Temporal and Semantic Audio-Visual Synchronization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-02T14:42:23.038497Z"},"links":{"cited_paper":"/paper/2206.04769","citing_paper":"/paper/2607.00726"},"observation_digest":"sha256:4302ab39f486626207c7e5e6b092a9d9b91775bf870b671aa871d141b3743149","observation_id":"b7077ea2-4d93-409e-90c3-4a86707f59b2","resolution":{"observed_at":"2026-07-02T14:47:03.176468Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T00:11:39.961282Z","title":"Imagebind: One embedding space to bind them all,","venue":null,"work_id":"dc4ae6c4-5a2c-4671-b2bc-fcfcd86be322","year":2023},"citing_paper":{"arxiv_id":"2607.00726","last_updated":"2026-07-01T10:12:25Z","snapshot_observed_at":"2026-08-18T15:47:50.380615Z","submitted_at":"2026-07-01T10:12:25Z","title":"AV-SyncBench: Decoupled Benchmarking of Temporal and Semantic Audio-Visual Synchronization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-02T14:42:23.038497Z"},"links":{"citing_paper":"/paper/2607.00726"},"observation_digest":"sha256:a1767d3b0f67d0359d8441987af72fd146c63833de99250804c11fae800b258b","observation_id":"2b846a7b-5816-4628-a9ed-e0627b39a5b4","resolution":{"observed_at":"2026-07-06T00:11:39.963662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T00:11:39.921165Z","title":"Contrastive audio-visual masked autoencoder,","venue":null,"work_id":"da2e03a2-5a16-4ed9-b714-8d186b00a2bf","year":2023},"citing_paper":{"arxiv_id":"2607.00726","last_updated":"2026-07-01T10:12:25Z","snapshot_observed_at":"2026-08-18T15:47:50.380615Z","submitted_at":"2026-07-01T10:12:25Z","title":"AV-SyncBench: Decoupled Benchmarking of Temporal and Semantic Audio-Visual Synchronization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-02T14:42:23.038497Z"},"links":{"citing_paper":"/paper/2607.00726"},"observation_digest":"sha256:1cbaaec0b2dee22c73c0a6c42bb3e5324d659f94463ba2535faaee0015bd14bb","observation_id":"3056c054-64e9-4ff7-878b-84f989c9470f","resolution":{"observed_at":"2026-07-06T00:11:39.922708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T00:11:39.929694Z","title":"Sparse in space and time: Audio-visual synchronisation with trainable selectors,","venue":null,"work_id":"699f6bb2-16c6-46f2-aea1-12aa9399528b","year":2022},"citing_paper":{"arxiv_id":"2607.00726","last_updated":"2026-07-01T10:12:25Z","snapshot_observed_at":"2026-08-18T15:47:50.380615Z","submitted_at":"2026-07-01T10:12:25Z","title":"AV-SyncBench: Decoupled Benchmarking of Temporal and Semantic Audio-Visual Synchronization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-02T14:42:23.038497Z"},"links":{"citing_paper":"/paper/2607.00726"},"observation_digest":"sha256:34f47c2239f68a567d645a450dfd591ca0e1b3c5a18088a97afa9859a50b5ca8","observation_id":"d1ef6c23-6694-4236-a69c-c20940ac0a91","resolution":{"observed_at":"2026-07-06T00:11:39.931007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T00:11:39.931603Z","title":"Synchformer: Efficient synchronization from sparse cues,","venue":null,"work_id":"8d3a11ba-db10-418c-8057-5f0d3d472ddb","year":2024},"citing_paper":{"arxiv_id":"2607.00726","last_updated":"2026-07-01T10:12:25Z","snapshot_observed_at":"2026-08-18T15:47:50.380615Z","submitted_at":"2026-07-01T10:12:25Z","title":"AV-SyncBench: Decoupled Benchmarking of Temporal and Semantic Audio-Visual Synchronization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-02T14:42:23.038497Z"},"links":{"citing_paper":"/paper/2607.00726"},"observation_digest":"sha256:f19b0dadee6ac941b88cec4f94b88c0c7e60d5409dfe650b2c67dd8ff9302059","observation_id":"d3404882-9cb8-489e-a8c1-0f880128c825","resolution":{"observed_at":"2026-07-06T00:11:39.932945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T00:11:39.935531Z","title":"DDSP: Differen- tiable digital signal processing,","venue":null,"work_id":"156eb09e-3873-4c4a-9c96-7c1da73d92dc","year":2020},"citing_paper":{"arxiv_id":"2607.00726","last_updated":"2026-07-01T10:12:25Z","snapshot_observed_at":"2026-08-18T15:47:50.380615Z","submitted_at":"2026-07-01T10:12:25Z","title":"AV-SyncBench: Decoupled Benchmarking of Temporal and Semantic Audio-Visual Synchronization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-02T14:42:23.038497Z"},"links":{"citing_paper":"/paper/2607.00726"},"observation_digest":"sha256:6b0ff80f5d00bb9c10e09e8195dba815277a8b58c15b90ad243f6eea19c15c6a","observation_id":"cf41efdb-72d0-45db-8434-ad33a2a3e5f6","resolution":{"observed_at":"2026-07-06T00:11:39.936929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T00:11:39.925266Z","title":"Audio set: An ontology and human-labeled dataset for audio events","venue":null,"work_id":"9f57d12f-9e3e-4979-989a-f332b460c4fc","year":2017},"citing_paper":{"arxiv_id":"2607.00726","last_updated":"2026-07-01T10:12:25Z","snapshot_observed_at":"2026-08-18T15:47:50.380615Z","submitted_at":"2026-07-01T10:12:25Z","title":"AV-SyncBench: Decoupled Benchmarking of Temporal and Semantic Audio-Visual Synchronization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-02T14:42:23.038497Z"},"links":{"citing_paper":"/paper/2607.00726"},"observation_digest":"sha256:42e4bd22bfbb551f16f5500353a62f4bfc847f1f9db21d8f500a9a23ba9f67b6","observation_id":"ef41d4c5-0a1f-491c-8b4c-1776e0b78ce9","resolution":{"observed_at":"2026-07-06T00:11:39.926725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T00:11:39.927302Z","title":"Vggsound: A large-scale audio-visual dataset,","venue":null,"work_id":"6ad6450b-2a83-45be-b499-1cbaa6ae8e51","year":2020},"citing_paper":{"arxiv_id":"2607.00726","last_updated":"2026-07-01T10:12:25Z","snapshot_observed_at":"2026-08-18T15:47:50.380615Z","submitted_at":"2026-07-01T10:12:25Z","title":"AV-SyncBench: Decoupled Benchmarking of Temporal and Semantic Audio-Visual Synchronization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-02T14:42:23.038497Z"},"links":{"citing_paper":"/paper/2607.00726"},"observation_digest":"sha256:75b7b4657b52f8415b3882dbd8a45aa9c5b23fd6b349241c294477e6cfd8559b","observation_id":"4fb5c988-c551-4201-b01b-d2aa47c65092","resolution":{"observed_at":"2026-07-06T00:11:39.929149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01479","last_updated":"2024-08-18T16:36:50Z","snapshot_observed_at":"2026-08-17T05:27:37.272553Z","submitted_at":"2023-12-03T18:41:54Z","title":"OpenVoice: Versatile Instant Voice Cloning","version":6},"cited_work":{"arxiv_id":"2312.01479","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.01479","snapshot_observed_at":"2026-07-04T07:39:38.688028Z","title":"Open- voice: Versatile instant voice cloning","venue":null,"work_id":"a48b6be3-dc96-49c7-b0eb-a8ce7f9ecd40","year":2023},"citing_paper":{"arxiv_id":"2607.00726","last_updated":"2026-07-01T10:12:25Z","snapshot_observed_at":"2026-08-18T15:47:50.380615Z","submitted_at":"2026-07-01T10:12:25Z","title":"AV-SyncBench: Decoupled Benchmarking of Temporal and Semantic Audio-Visual Synchronization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-02T14:42:23.038497Z"},"links":{"cited_paper":"/paper/2312.01479","citing_paper":"/paper/2607.00726"},"observation_digest":"sha256:b215168e68011c6dd4a5e09b23a5fa9d193c1ab4e5febd1f6950ceca5a2b3905","observation_id":"433f1be3-63b6-4695-a454-924ac0f43320","resolution":{"observed_at":"2026-07-02T14:47:03.159614Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T00:11:39.953191Z","title":"OpenV oiceV2 model card,","venue":null,"work_id":"41e3b929-a1bf-48d5-8db1-a043402deeba","year":2024},"citing_paper":{"arxiv_id":"2607.00726","last_updated":"2026-07-01T10:12:25Z","snapshot_observed_at":"2026-08-18T15:47:50.380615Z","submitted_at":"2026-07-01T10:12:25Z","title":"AV-SyncBench: Decoupled Benchmarking of Temporal and Semantic Audio-Visual Synchronization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-02T14:42:23.038497Z"},"links":{"citing_paper":"/paper/2607.00726"},"observation_digest":"sha256:ebd648e479965dc6b27db665afed91124834bed795a9a5fca8f1d9aabb7a5c90","observation_id":"43dd8e30-9ac5-41b3-a90d-ace7de62fd71","resolution":{"observed_at":"2026-07-06T00:11:39.954531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T00:11:39.923242Z","title":"Cav-mae sync: Improving contrastive audio-visual mask au- toencoders via fine-grained alignment,","venue":null,"work_id":"bdd660a3-9f79-4504-b436-d3bee7c27a36","year":2025},"citing_paper":{"arxiv_id":"2607.00726","last_updated":"2026-07-01T10:12:25Z","snapshot_observed_at":"2026-08-18T15:47:50.380615Z","submitted_at":"2026-07-01T10:12:25Z","title":"AV-SyncBench: Decoupled Benchmarking of Temporal and Semantic Audio-Visual Synchronization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-02T14:42:23.038497Z"},"links":{"citing_paper":"/paper/2607.00726"},"observation_digest":"sha256:5c59ffbea9912ab917c5615420e441069300150456a12831158f7586a5979afe","observation_id":"96a0de66-fe88-45c2-8657-9322d0017715","resolution":{"observed_at":"2026-07-06T00:11:39.924698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T00:11:39.933531Z","title":"Gemini 3 Flash: frontier intelligence built for speed,","venue":null,"work_id":"76e36651-8c54-4c46-bc43-3342d209bb6d","year":2025},"citing_paper":{"arxiv_id":"2607.00726","last_updated":"2026-07-01T10:12:25Z","snapshot_observed_at":"2026-08-18T15:47:50.380615Z","submitted_at":"2026-07-01T10:12:25Z","title":"AV-SyncBench: Decoupled Benchmarking of Temporal and Semantic Audio-Visual Synchronization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-02T14:42:23.038497Z"},"links":{"citing_paper":"/paper/2607.00726"},"observation_digest":"sha256:c9d2e27a93e2922ee19e0217b6f249242799e34e83f62cddc16ad0b225c589dd","observation_id":"66493f19-15a6-4695-bd8b-f4c0d5cd2318","resolution":{"observed_at":"2026-07-06T00:11:39.934978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.00726","last_updated":"2026-07-01T10:12:25Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T15:47:50.380615Z","submitted_at":"2026-07-01T10:12:25Z","title":"AV-SyncBench: Decoupled Benchmarking of Temporal and Semantic Audio-Visual Synchronization"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":1,"verified_exact":7,"verified_fuzzy":21},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 2 inbound Pith citation observations for arXiv:2607.00726."}