{"as_of":"2026-08-16T19:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f7e9e77ca234ece66c8b3df7c89a91136077754f3c9b6104f247667f78476784","coverage":[{"denominator":66,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":66,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:27:56.984255Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.11913/citation-record","integrity":"/paper/2608.11913/integrity","json":"/paper/2608.11913/citation-record.json","paper":"/paper/2608.11913"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-16T00:27:56.712678Z","title":"arXiv preprint arXiv:2209.15352 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.712678Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:86c427e69a409c6d5c725d596c43a1958bb9464f2195f0fe75ca7cd28675f95a","observation_id":"2e7819bb-46a5-4095-844b-9aa85c87df2c","resolution":{"observed_at":"2026-08-16T00:27:56.712678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.909103Z","title":"In: International Conference on Machine Learning, pp","venue":null,"work_id":"ab278869-714e-404a-aab1-3664d1bb7d76","year":2023},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.718048Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:1e867a54af11393083d32b6cbcd4651b8b2bacb2f840e42d91b74bb18736adfe","observation_id":"091b67d6-4056-4fb5-b0de-355b858815dc","resolution":{"observed_at":"2026-08-16T00:27:57.913775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-16T15:59:22.404915Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-16T00:27:56.722383Z","title":"arXiv preprint arXiv:2301.12503 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.722383Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:f983c0c7556deb8781e1f38a69f26f7b6e83cbc5d64bfa4edd644864583f7ef8","observation_id":"5f8384a3-22bf-42f0-bfa5-ca7b7925f6e5","resolution":{"observed_at":"2026-08-16T00:27:56.722383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.896178Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision, pp","venue":null,"work_id":"9ca7fcea-7497-4008-89af-ec630d4d76fb","year":2023},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.726676Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:2581eaf5bae08a4b54e4bb92795bf81eb769ea930122b1dfb7f44c510d0afb4f","observation_id":"732a2beb-af5e-4de3-ae60-8c4583503fb1","resolution":{"observed_at":"2026-08-16T00:27:57.900236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.883535Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision, pp","venue":null,"work_id":"0bba344b-517f-45ab-b3cb-66195775c64e","year":2023},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.731597Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:1585bc5cf68d4c0017b0afed5583bcd143d557b65bf87f3f042ba359f9850d0d","observation_id":"f2814413-27d7-4f0f-ad66-1b8ce175a5f4","resolution":{"observed_at":"2026-08-16T00:27:57.887526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01494","last_updated":"2024-07-01T17:35:56Z","snapshot_observed_at":"2026-08-16T13:38:02.108888Z","submitted_at":"2024-07-01T17:35:56Z","title":"FoleyCrafter: Bring Silent Videos to Life with Lifelike and Synchronized Sounds","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01494","snapshot_observed_at":"2026-08-16T00:27:56.735765Z","title":"arXiv preprint arXiv:2407.01494 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.735765Z"},"links":{"cited_paper":"/paper/2407.01494","citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:c017ffddfcc28e93570d3bc2397173d14b314ebe9aa14092bed27a023a6a2ca0","observation_id":"52ae80db-ecd6-4720-bd3e-77e755cb7060","resolution":{"observed_at":"2026-08-16T00:27:56.735765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.868994Z","title":"Advances in Neural Information Processing Systems36(2024)","venue":null,"work_id":"4b0bade3-2c9f-4fe0-872f-18cb4f74cd7a","year":2024},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.740329Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:5b09c2e278a79f96109aa29d6e97806cceb7dc7d72eda453ecc9b3babe3927c1","observation_id":"8252999e-aeb5-4a3c-bbc1-d58235d76c56","resolution":{"observed_at":"2026-08-16T00:27:57.873825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.854274Z","title":"In: 25 Proceedings of the AAAI Conference on Artificial Intelligence, vol","venue":null,"work_id":"dd9b4249-553c-406f-b5fc-0677dbefe123","year":2024},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.744066Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:f50b6cba967003c5b14df357893b33643ba4bc447f174dc7e83e53afdf0bda99","observation_id":"c7850795-4826-465d-92fa-e522197828a4","resolution":{"observed_at":"2026-08-16T00:27:57.858771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09732","last_updated":"2025-01-16T18:30:37Z","snapshot_observed_at":"2026-08-16T15:15:38.321253Z","submitted_at":"2025-01-16T18:30:37Z","title":"Inference-Time Scaling for Diffusion Models beyond Scaling Denoising Steps","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09732","snapshot_observed_at":"2026-08-16T00:27:56.747595Z","title":"arXiv preprint arXiv:2501.09732 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.747595Z"},"links":{"cited_paper":"/paper/2501.09732","citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:93bafa06a1c93b5eb4d20cf38d547c06afe25f4d64f91c750e4a2fdeeb7e0c4a","observation_id":"d56a2bbe-43c4-4577-8b00-6f5b14d534d2","resolution":{"observed_at":"2026-08-16T00:27:56.747595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00341","last_updated":"2020-04-30T09:02:45Z","snapshot_observed_at":"2026-08-16T07:26:47.621702Z","submitted_at":"2020-04-30T09:02:45Z","title":"Jukebox: A Generative Model for Music","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00341","snapshot_observed_at":"2026-08-16T00:27:56.752114Z","title":"arXiv preprint arXiv:2005.00341 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.752114Z"},"links":{"cited_paper":"/paper/2005.00341","citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:b2a2d487d0272f777f29baa8bee8c9066cd40c30661257f68cd97ccadc7abbf6","observation_id":"8c6298df-201d-4fae-a2c8-03a640fb03c0","resolution":{"observed_at":"2026-08-16T00:27:56.752114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.840159Z","title":"Advances in Neural Information Processing Systems36(2024)","venue":null,"work_id":"75cb5c41-946b-4d51-bd43-4bcc3ab011d0","year":2024},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.756554Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:c2ae0f8332ab5c74d0a7af066fbb1a1576ecc76c9de3567a5cefb41fd8b99504","observation_id":"a87b5197-e653-482e-b3a6-0de78d8b2111","resolution":{"observed_at":"2026-08-16T00:27:57.844657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.825696Z","title":"Advances in neural information processing systems36, 14005–14034 (2023)","venue":null,"work_id":"a4552fdb-fd16-4667-aca7-926bf24c88a1","year":2023},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.760900Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:257f53a8f50e102e0b90a74bf9ce701e0dc81d5917cf489ef06e498187749fd4","observation_id":"375c3569-f328-43d4-824d-aace6b6e536e","resolution":{"observed_at":"2026-08-16T00:27:57.830642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04577","last_updated":"2024-03-05T09:12:35Z","snapshot_observed_at":"2026-08-16T14:28:48.591931Z","submitted_at":"2024-01-09T14:29:39Z","title":"Masked Audio Generation using a Single Non-Autoregressive Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04577","snapshot_observed_at":"2026-08-16T00:27:56.764846Z","title":"arXiv preprint arXiv:2401.04577 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.764846Z"},"links":{"cited_paper":"/paper/2401.04577","citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:1fcd499d300f9c93006950459f3c8a6ac6e858e8cc54caaeacfdafd04f059070","observation_id":"99b3b07d-b06a-4258-8fc5-763fce20dff8","resolution":{"observed_at":"2026-08-16T00:27:56.764846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.811398Z","title":"In: NAACL-HLT (Findings) (2024)","venue":null,"work_id":"e0b93743-37a3-4aae-b881-7ec5e76d0df1","year":2024},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.769736Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:ebf0dd18f24808d7a572785854a24da4d17d60350dc895d745e41cdd3a0ad992","observation_id":"6323bf76-1628-4056-9d74-21c204b9d7ef","resolution":{"observed_at":"2026-08-16T00:27:57.816176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10634","last_updated":"2025-03-14T23:26:06Z","snapshot_observed_at":"2026-08-16T12:50:16.622650Z","submitted_at":"2025-03-13T17:59:55Z","title":"V2Edit: Versatile Video Diffusion Editor for Videos and 3D Scenes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10634","snapshot_observed_at":"2026-08-16T00:27:56.773970Z","title":"arXiv preprint arXiv:2503.10634 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.773970Z"},"links":{"cited_paper":"/paper/2503.10634","citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:71bc5478e87e46cd909d35fe4a6758f1a82d1a2348337b7ede92598660504572","observation_id":"cd8c9d4c-7258-4381-913b-ba42fc6b457d","resolution":{"observed_at":"2026-08-16T00:27:56.773970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.796941Z","title":"IEEE/ACM Transactions on Audio, Speech, and Language Processing31, 1720–1733 (2023)","venue":null,"work_id":"d2e63830-2089-4af0-8842-1cf57126fbb8","year":2023},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.778338Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:bd1dcc8d012964fcffc7ed2fef607da0b3abf8a6f37151dcff3b1ccb7b29dbdf","observation_id":"81112b9e-3a70-40e2-b223-891ac4bcf10d","resolution":{"observed_at":"2026-08-16T00:27:57.801617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.782075Z","title":"In: ICASSP 2023-2023 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp","venue":null,"work_id":"307994ee-c3d1-4038-be29-356ce58b3077","year":2023},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.782497Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:6865b94992f1024d1b34c1f27787fb8d664f9b0f5b4a582b5915b2f9e17e84f1","observation_id":"4a26f552-1407-462e-b59e-f41d73cb198d","resolution":{"observed_at":"2026-08-16T00:27:57.786691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.767385Z","title":"IEEE/ACM Transactions on Audio, Speech, and Language Processing (2024)","venue":null,"work_id":"048de954-cdfd-40ec-995d-badd157b9099","year":2024},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.786388Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:f595e4c153ec3ccecf011f6015400945f410cb86ae099979ae183d9f2fec5165","observation_id":"a5a43a36-4f0f-4c93-b81a-e3bc9e2bf2b8","resolution":{"observed_at":"2026-08-16T00:27:57.772134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.752509Z","title":"In: Forty-first International Conference on Machine Learning (2024) 26","venue":null,"work_id":"f1bd2309-9d06-4dd2-9332-97c396b6e003","year":2024},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.790367Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:a047bf41519cca0e0d3656504692d38d36eda8e9a71d76f3f0997a555cc05bc7","observation_id":"b15cb50b-ba18-4504-adfd-2d9bd3e953b6","resolution":{"observed_at":"2026-08-16T00:27:57.757133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.737587Z","title":"In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"385df9ec-cdb3-428d-b016-c2b2b96a5ad7","year":2016},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.794702Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:9d8e9bfb9e87fdde7fbaf23ee5ab23ee7092be34e189860a9268197f5f202605","observation_id":"d6e21cea-612a-485f-ab37-1bb8f76c625b","resolution":{"observed_at":"2026-08-16T00:27:57.742362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.722898Z","title":"In: British Machine Vision Conference (BMVC) (2021)","venue":null,"work_id":"8fded96e-db20-4f83-b7aa-3aa12d10e7a3","year":2021},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.799087Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:9ab1e6bfd78ef752cc2031f529f4aa264c0748ae90bd4929f91f765930f48ad0","observation_id":"65c58431-bd3e-4ba4-8909-31fb2fe49cbe","resolution":{"observed_at":"2026-08-16T00:27:57.727619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.707630Z","title":"In: European Conference on Computer Vision, pp","venue":null,"work_id":"5005f7c3-875c-4e1d-941e-496deb7c52c8","year":2020},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.803267Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:67a8281418a6b533e3bbfa4d2db9fb42f58b659f3c2d2d5886d4f1db056a2c27","observation_id":"80fbd0f6-4583-4055-90ef-a5eae7d5d9d6","resolution":{"observed_at":"2026-08-16T00:27:57.712813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06721","snapshot_observed_at":"2026-08-16T00:27:56.807382Z","title":"arXiv preprint arXiv:2308.06721 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.807382Z"},"links":{"cited_paper":"/paper/2308.06721","citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:30a5a7dab4934b481f705ada71a933ef63127e95bafff54b4a1f115c2b94de98","observation_id":"f0a71da5-dc07-4b08-8159-5abc0f61ece8","resolution":{"observed_at":"2026-08-16T00:27:56.807382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:56.812139Z","title":"Advances in Neural Information Processing Systems37, 128118–128138 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.812139Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:31e69bdaf3aed40c4d4875869d674027d2cef7a42d74a042a2b6832e40e0d8b2","observation_id":"bee83027-0efa-4327-a425-230eaa6c2862","resolution":{"observed_at":"2026-08-16T00:27:56.812139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.683583Z","title":"In: European Conference on Computer Vision, pp","venue":null,"work_id":"727fd66c-5c13-45af-b26d-52ce7e05ba51","year":2024},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.816312Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:9f0b5215aa1f069b1476bbecea5d6046c369496f57f22cf63a38489f0bfe61ad","observation_id":"10418fc3-bb32-4f0a-9106-8eb9122011e9","resolution":{"observed_at":"2026-08-16T00:27:57.688460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.669757Z","title":"In: ICASSP 2025-2025 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp","venue":null,"work_id":"96626f9f-7659-4464-8ca8-1478d1908ae5","year":2025},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.820327Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:7960a9c8af0a7ac2dcdb94197f9a41bb84eafe4629ee5f97e3bd3bd3ad6cbda5","observation_id":"463212b0-d45c-4c69-91d8-1a837e07dc4a","resolution":{"observed_at":"2026-08-16T00:27:57.674109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.655315Z","title":"Expert Systems with Applications249, 123640 (2024)","venue":null,"work_id":"c26b10f1-a9b0-4cd7-8ca0-c6b4de744d02","year":2024},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.824643Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:9b8349516031e20064ff47af18b16df984d63f7044d350b07f983b539d6fba9c","observation_id":"293e2e7d-31bd-492c-a703-3dc06404301a","resolution":{"observed_at":"2026-08-16T00:27:57.660151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.641499Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference, pp","venue":null,"work_id":"2951cb16-a5f1-4787-a7a8-2a7cdb994a54","year":2025},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.829173Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:4ed2a648d4a01fe096031c1a59a9fe3d2d54b6d85f68f2598ef6b83912f705b1","observation_id":"57fd110b-6e5c-4d40-a358-8c2ba84d2b09","resolution":{"observed_at":"2026-08-16T00:27:57.646119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.625676Z","title":"In: ICASSP 2023-2023 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp","venue":null,"work_id":"6f3ec460-03cc-4bc0-96bf-2e3bb714ad0b","year":2023},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.833475Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:f3d0b8db384161594a33def56ef8de5e0126ca2dab2b8edc30b7b67eaaa2d08e","observation_id":"1cd0ce97-2a41-4f14-b4d2-d1623e23a208","resolution":{"observed_at":"2026-08-16T00:27:57.630402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.611326Z","title":"In: Proceedings of the 32nd ACM International Conference on Multimedia, pp","venue":null,"work_id":"dfc8d4ce-42f3-4f20-b038-286dbc4887e3","year":2024},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.837480Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:58f8552fc332ef6be6a9b0a3bea5a28933a7eb563499f3665bc6314e55dc3725","observation_id":"b7d643b2-c701-4277-adfb-3cbfe477e85a","resolution":{"observed_at":"2026-08-16T00:27:57.616375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.596791Z","title":"In: Pro- ceedings of the AAAI Conference on Artificial Intelligence, vol","venue":null,"work_id":"36ef0fbb-9c72-40fc-886c-714cb7bc4a91","year":2025},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.841715Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:178739cda109a4cf48ee4a101d85eb23455ac776e809ef57837fad912f922174","observation_id":"f07b40b7-08f8-4344-aebf-3158027ea702","resolution":{"observed_at":"2026-08-16T00:27:57.601398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.583200Z","title":"In: Proceedings of the AAAI Conference on Artificial Intelligence, vol","venue":null,"work_id":"c1650f8c-8038-4b98-a303-3bc56d26c6a9","year":2025},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.845812Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:2386ebec56d13d15cb3fcbb3da3bfdc7e891d5268e02149c0291d30659859734","observation_id":"57d58cc0-26c3-4354-937f-d7c441c7c267","resolution":{"observed_at":"2026-08-16T00:27:57.587214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.569794Z","title":"In: ICASSP 2020-2020 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp","venue":null,"work_id":"0c4db2c9-0345-4eb8-9618-94ffa6f8a5f0","year":2020},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.850012Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:42e4ed7cb1b7a60f2cbda611b1dd5cf3d2b4208582426a7cb7264fd4c60cf19a","observation_id":"a1f59108-06d7-4902-80fb-7dab094bf2af","resolution":{"observed_at":"2026-08-16T00:27:57.573885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.552982Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"123ca293-a86c-41c2-aff5-e7742fdc8751","year":2022},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.854403Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:412437a3c13dc8bbda4a03c564a4e84c4bc1388565f81913bdf2969a048fb0aa","observation_id":"7dbec8da-ac2c-4f17-9efa-eb93f6857390","resolution":{"observed_at":"2026-08-16T00:27:57.559378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14272","last_updated":"2024-06-20T12:52:46Z","snapshot_observed_at":"2026-08-16T13:41:07.931634Z","submitted_at":"2024-06-20T12:52:46Z","title":"MultiTalk: Enhancing 3D Talking Head Generation Across Languages with Multilingual Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14272","snapshot_observed_at":"2026-08-16T00:27:56.858527Z","title":"arXiv preprint arXiv:2406.14272 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.858527Z"},"links":{"cited_paper":"/paper/2406.14272","citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:62b25d663fc17b32cfb5bb7bcc5caf9da8f62f87934520a3fccb0411d3d38640","observation_id":"06a8869e-afd8-497b-a31d-23ee28793e30","resolution":{"observed_at":"2026-08-16T00:27:56.858527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-16T04:02:50.118916Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18953","snapshot_observed_at":"2026-08-16T00:27:56.863037Z","title":"arXiv preprint arXiv:2411.18953 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.863037Z"},"links":{"cited_paper":"/paper/2411.18953","citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:501e8520bae93324c5b13a556aa1c52c025ccab2065ee41897fe5f27214c17e3","observation_id":"6a83718f-d1e1-417e-9475-4ce5a1ed377c","resolution":{"observed_at":"2026-08-16T00:27:56.863037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.538473Z","title":null,"venue":null,"work_id":"f2bb0455-bab3-4f4b-b16e-9aaeb57c5723","year":null},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.867299Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:2c496fa8e22bee005afc648de4195d298e7c849f8cd0dc6b3b1cc7cb8bcb64a1","observation_id":"394b22ae-1db9-415b-90bc-547dc7b013a3","resolution":{"observed_at":"2026-08-16T00:27:57.542854Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.523227Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"cf0c2329-90b9-4381-96c3-fcf7fc14182a","year":2022},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.871072Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:838bb8c44f79964bedae8501739720fc019664a0c09221b3eb0ec560c2b9cf1b","observation_id":"7d27d25d-af74-4969-8c6c-92baafdd4d82","resolution":{"observed_at":"2026-08-16T00:27:57.528185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:56.874666Z","title":"Advances in neural information processing systems30(2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.874666Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:9705b2f8f4bcdba5e5382cf0a08335172010ef91f35a5863f1aae693bc6f5670","observation_id":"509ca0ea-9b3f-4d54-bdc9-be1ffefaa7f0","resolution":{"observed_at":"2026-08-16T00:27:56.874666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.500168Z","title":"Advances in neural information processing systems33, 3008–3021 (2020)","venue":null,"work_id":"05120e7e-2734-4a78-bbe3-f58cbcd478b2","year":2020},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.878323Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:ecb6d9af82660641e5e791c275f50b94492020032cd7c57a16baf10e90a64eaf","observation_id":"b497b9f1-69dc-41ee-8ec8-eb70a53a3c0a","resolution":{"observed_at":"2026-08-16T00:27:57.504639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:56.881893Z","title":"Advances in neural information processing systems35, 27730–27744 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.881893Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:135f8a23a3867b966754a2976f22ac025e5f9d4366599e4aa7803083b007e83f","observation_id":"f88d134d-575b-42b4-ace0-cfe37d0431ee","resolution":{"observed_at":"2026-08-16T00:27:56.881893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.475436Z","title":"Advances in Neural Information Processing Systems36, 53728–53741 (2023)","venue":null,"work_id":"5df30b0e-292a-461f-abab-f3b1f480c3e6","year":2023},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.885400Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:b9ef9e0ff2d47a4700fccd8988306d38eff81c7e7cb04506d17d03c4b521f872","observation_id":"627e4055-c6d2-452d-b298-755be48300a0","resolution":{"observed_at":"2026-08-16T00:27:57.480657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06767","last_updated":"2023-12-01T14:28:06Z","snapshot_observed_at":"2026-08-07T04:02:54.504761Z","submitted_at":"2023-04-13T18:22:40Z","title":"RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06767","snapshot_observed_at":"2026-08-16T00:27:56.889364Z","title":"arXiv preprint arXiv:2304.06767 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.889364Z"},"links":{"cited_paper":"/paper/2304.06767","citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:1e8d6c3670de5bd68905ff054d27eacb09cae894d37712dd76772ec85912ba82","observation_id":"017b35da-32a1-4171-bc5a-c986da2b7c18","resolution":{"observed_at":"2026-08-16T00:27:56.889364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05302","last_updated":"2023-10-07T07:01:26Z","snapshot_observed_at":"2026-08-16T15:41:15.724777Z","submitted_at":"2023-04-11T15:53:40Z","title":"RRHF: Rank Responses to Align Language Models with Human Feedback without tears","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05302","snapshot_observed_at":"2026-08-16T00:27:56.893803Z","title":"arXiv preprint arXiv:2304.05302 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.893803Z"},"links":{"cited_paper":"/paper/2304.05302","citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:1184d367b3e8671b62803170e1b41bd13c14e41ea103955ed84de39a3372e845","observation_id":"fa21302e-f917-4716-a010-b2d2a414ddef","resolution":{"observed_at":"2026-08-16T00:27:56.893803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-16T03:49:00.703994Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-16T00:27:56.897942Z","title":"arXiv preprint arXiv:2212.08073 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.897942Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:2e341e13c5cd54be8b8b070be3ecf6b7f524d2bf9dd7a0e46233019574fed85c","observation_id":"c22c0a52-147b-49a1-94dd-c87ecf787fdb","resolution":{"observed_at":"2026-08-16T00:27:56.897942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:56.902231Z","title":"Advances in Neural Information Processing Systems36, 15903–15935 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.902231Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:617d6565a2163e26784475eb955d7b6609519f0723bc9d85459aeb849350c6e3","observation_id":"1c5d24ae-298d-4fa4-9ae8-de5340b82c53","resolution":{"observed_at":"2026-08-16T00:27:56.902231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.449746Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"a054fc09-ca17-4210-92f0-0b1d8af04481","year":2024},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.906308Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:be6ee54c257ba754d8a92b70f0347daf53edf0da4b617e927012d5f5766e663f","observation_id":"c8a9da8e-d582-4f0f-8579-e218e17ecd70","resolution":{"observed_at":"2026-08-16T00:27:57.453843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:56.910237Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.910237Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:d627cd24a5090f56ce5d719d534d896d26b60bbdc6805acdd81e09642f283707","observation_id":"31449035-8014-4085-8416-fb6394ee92f0","resolution":{"observed_at":"2026-08-16T00:27:56.910237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:56.914138Z","title":"Advances in neural information processing systems33, 6840–6851 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.914138Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:7f39bf249d93772c7acb40d01a9795bcc03721ce73c99c88344e00ff6dc6788c","observation_id":"b27ff933-b8de-4cb5-b04e-88ee0e7455fb","resolution":{"observed_at":"2026-08-16T00:27:56.914138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.416397Z","title":"In: Proceedings of the 32nd ACM International Conference on Multimedia, pp","venue":null,"work_id":"36604a15-232a-42b6-b96d-4fd68329f8ca","year":2024},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.918107Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:7dc923882d93ea9835ade57bddd6852f4a5f1b47cd13909309fbb0c83983fb31","observation_id":"c30dd17c-72f5-4c70-99ce-fb504e5ce0c1","resolution":{"observed_at":"2026-08-16T00:27:57.421466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-16T00:27:56.921927Z","title":"arXiv preprint arXiv:2307.06942 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.921927Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:d0384ed4873ff8d01403f42a6f649fcaf2e07738996374860ac8361ea9e6fd40","observation_id":"a3a0e9c7-dc9c-49e1-b335-482581e42b40","resolution":{"observed_at":"2026-08-16T00:27:56.921927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:56.927264Z","title":"Neurocomputing568, 127063 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.927264Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:f0742de5992bb1dc45a8810141cfb32b62d6221e009f0de17c5d69c7b3abd1ff","observation_id":"da1d74bb-9cb2-4016-be8b-872fd52240e2","resolution":{"observed_at":"2026-08-16T00:27:56.927264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.393013Z","title":"Journal of Machine Learning Research25(70), 1–53 (2024)","venue":null,"work_id":"3f16563b-f3b8-41d5-9230-76623e1a6fda","year":2024},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.931337Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:10ea87edb2cae163c349c21f227967f3f8fe898b3beece5014f4cd40a7fe9618","observation_id":"291410dc-31fd-44ac-8e07-8a66cb894816","resolution":{"observed_at":"2026-08-16T00:27:57.397921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02666","last_updated":"2024-08-08T17:09:58Z","snapshot_observed_at":"2026-08-16T13:28:23.560818Z","submitted_at":"2024-08-05T17:57:02Z","title":"Self-Taught Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02666","snapshot_observed_at":"2026-08-16T00:27:56.935166Z","title":"arXiv preprint arXiv:2408.02666 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.935166Z"},"links":{"cited_paper":"/paper/2408.02666","citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:2b5278e7c643def7dec453d231222045fe199a8bdfb09187c62eb61fa151c4b2","observation_id":"82135de5-b739-4df1-b12a-9d2478d93f9c","resolution":{"observed_at":"2026-08-16T00:27:56.935166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07839","last_updated":"2023-04-11T22:47:19Z","snapshot_observed_at":"2026-08-16T16:27:33.126113Z","submitted_at":"2022-10-02T07:29:57Z","title":"Contrastive Audio-Visual Masked Autoencoder","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07839","snapshot_observed_at":"2026-08-16T00:27:56.939307Z","title":"arXiv preprint arXiv:2210.07839 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.939307Z"},"links":{"cited_paper":"/paper/2210.07839","citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:272c2ae927af0aab40a821334c6323a95fffe6bb5e4d6ab43f634c623af3d85e","observation_id":"9a3c7be1-1c5c-46b4-a022-e8d7256a9cfa","resolution":{"observed_at":"2026-08-16T00:27:56.939307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05139","last_updated":"2025-02-07T18:15:57Z","snapshot_observed_at":"2026-08-14T10:00:02.244477Z","submitted_at":"2025-02-07T18:15:57Z","title":"Meta Audiobox Aesthetics: Unified Automatic Quality Assessment for Speech, Music, and Sound","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05139","snapshot_observed_at":"2026-08-16T00:27:56.943597Z","title":"arXiv preprint arXiv:2502.05139 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.943597Z"},"links":{"cited_paper":"/paper/2502.05139","citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:dc545d6a117b5770adf1a9d8d30aa90a12db26ad133f0db4e30c1681595a31f2","observation_id":"39b4b44d-c61a-4f15-a3e5-7edb5a2953c5","resolution":{"observed_at":"2026-08-16T00:27:56.943597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.379119Z","title":"In: ICASSP 2022-2022 IEEE International Con- ference on Acoustics, Speech and Signal Processing (ICASSP), pp","venue":null,"work_id":"c800a53e-ae08-4a83-b52c-f0a171f09542","year":2022},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.947797Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:9dd247192abf6ce721a4f5a328b72f036393c83052462ee2f21b681055c0730c","observation_id":"3c9305fc-45c0-4fd9-915c-d21bf107b95d","resolution":{"observed_at":"2026-08-16T00:27:57.383585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05659","last_updated":"2024-07-17T18:28:48Z","snapshot_observed_at":"2026-08-16T14:11:30.308535Z","submitted_at":"2024-03-08T20:17:34Z","title":"Audio-Synchronized Visual Animation","version":2},"cited_work":{"arxiv_id":"2403.05659","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.05659","snapshot_observed_at":"2026-08-16T00:27:57.049464Z","title":"Audio-Synchronized Visual Animation","venue":"cs.CV","work_id":"4557fca6-1d14-4ade-a8f3-191758d62bb8","year":2024},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.951652Z"},"links":{"cited_paper":"/paper/2403.05659","citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:98aaeddcfcdc611aa9e91a10fefddd29a4d63181c53ba39cdd52ec66d04c9172","observation_id":"2ef3e406-8604-47d4-8e3c-55c6c4367650","resolution":{"observed_at":"2026-08-16T00:27:57.056509Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:56.955809Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.955809Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:6dfd8b6a25659541a8a7312ba883ba6d0deeb8b88bbbb62052e04029d389008a","observation_id":"1e167d94-415c-4193-8688-668b854a9410","resolution":{"observed_at":"2026-08-16T00:27:56.955809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.08791","last_updated":"2021-10-17T11:14:00Z","snapshot_observed_at":"2026-08-16T17:48:41.711685Z","submitted_at":"2021-10-17T11:14:00Z","title":"Taming Visually Guided Sound Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.08791","snapshot_observed_at":"2026-08-16T00:27:56.960058Z","title":"arXiv preprint arXiv:2110.08791 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.960058Z"},"links":{"cited_paper":"/paper/2110.08791","citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:ce6a91d6daf7ab4107da58d13c80afb28a6914a7cb20ef7f4402a1597cb3ce51","observation_id":"c67033e6-21a6-441d-a757-4f5aacc88296","resolution":{"observed_at":"2026-08-16T00:27:56.960058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:56.964446Z","title":"Advances in neural information processing systems30(2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.964446Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:551e89c134c046ff4701ce62bc317dc7a3bc24009f62f978a998bdaf71a0c713","observation_id":"8e8120bc-b658-4ade-81b8-d6507c21881d","resolution":{"observed_at":"2026-08-16T00:27:56.964446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.08466","last_updated":"2019-01-17T16:12:43Z","snapshot_observed_at":"2026-08-15T08:25:11.276003Z","submitted_at":"2018-12-20T10:28:00Z","title":"Fr\\'echet Audio Distance: A Metric for Evaluating Music Enhancement Algorithms","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.08466","snapshot_observed_at":"2026-08-16T00:27:56.968322Z","title":"arXiv preprint arXiv:1812.08466 (2018)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.968322Z"},"links":{"cited_paper":"/paper/1812.08466","citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:a46bd7e96b78f3b4b3a0803f175a346b753e2b8e508ebee0909598ca99524379","observation_id":"8e43efb9-e006-433e-a0df-087fe1b17fc8","resolution":{"observed_at":"2026-08-16T00:27:56.968322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.347529Z","title":"In: 2017 Ieee International Conference on Acoustics, Speech and Signal Processing (icassp), pp","venue":null,"work_id":"d2e69ee1-28b6-486d-8925-627929389daa","year":2017},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.972384Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:92eb746b1ddce9c8e21ea4f1a437d53c17b8fc9ab60a5721b299535ff3ec93a3","observation_id":"f85598bf-480d-45c5-bd31-b50260cd735e","resolution":{"observed_at":"2026-08-16T00:27:57.352105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.334021Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"02c468ff-b235-43bb-bb5e-09eba106c022","year":2024},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.976488Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:32e75eec76c3a3ec7f95d690df9d3928a136c7645fed4e0637db5368c7212d12","observation_id":"75138c27-91a7-4047-8f9c-bab2aa7b1110","resolution":{"observed_at":"2026-08-16T00:27:57.338428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.319943Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"9ae0bd28-a188-47d3-9c3f-5b33534673fd","year":2024},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.980300Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:8afc16d4d7a98172e4db0eded52d7cfc399e192d7ed58cf6f1a6f6c6cc224566","observation_id":"4d3be700-3182-49c0-9d76-244937e34b80","resolution":{"observed_at":"2026-08-16T00:27:57.324496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:27:57.306050Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"e5a43952-f24f-4822-a04e-4ccbfa9328dc","year":2023},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.984255Z"},"links":{"citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:dcf3823e91c6bda8c24dd2900b931645e1ca59ef5ea53e3b6f3d1cccf7c05982","observation_id":"33e1ab7a-c8cb-4dfa-af12-52064fc4aeb7","resolution":{"observed_at":"2026-08-16T00:27:57.310492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T00:20:12.565446Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion"},"reference_resolution":{"displayed":66,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":36},"total_outbound_references":66},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 0 inbound Pith citation observations for arXiv:2608.11913."}