{"as_of":"2026-08-20T16:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:807897eba69dc891f0667bd521304e4b5f0c880df4f1dc885838b018d638b8ac","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T05:01:38.747896Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.18157/citation-record","integrity":"/paper/2412.18157/integrity","json":"/paper/2412.18157/citation-record.json","paper":"/paper/2412.18157"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:01:39.311369Z","title":"Generating visually aligned sound from videos,","venue":null,"work_id":"50d34295-bbf8-4901-b6db-aa0e32d7085b","year":2020},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.603327Z"},"links":{"citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:42a77cc2ebf6b50308ff02ffa5f15092aa3c84c2f991dc676e60bf3854a05b22","observation_id":"5dfb7121-e594-4dc0-93c3-7e824b842549","resolution":{"observed_at":"2026-08-11T05:01:39.315954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:01:39.296527Z","title":"Taming visually guided sound generation,","venue":null,"work_id":"eb5e248d-6507-423b-87d3-6040ece3b19f","year":2021},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.608027Z"},"links":{"citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:d81a5ca76d80a5079a41d40cf1057e96fa15efacf551ab323d79433794076ebd","observation_id":"7f37af99-e3dc-4270-8fd2-c3016a9657a5","resolution":{"observed_at":"2026-08-11T05:01:39.301234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:01:38.612589Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.612589Z"},"links":{"citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:c77fd444a41b8dd1ac85d251a36172f1f9417647c97a82be13797e2382e16306","observation_id":"c4581f99-f988-4b81-9220-c5044e0f6b6a","resolution":{"observed_at":"2026-08-11T05:01:38.612589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:01:38.618248Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.618248Z"},"links":{"citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:a695178949ff52212fe4fda69b5bf85aba6f73bf432e29b3451e4b79e8d0630c","observation_id":"46a1da61-e450-446f-8cfc-a394399df2be","resolution":{"observed_at":"2026-08-11T05:01:38.618248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:01:38.623065Z","title":"Imagebind: One embedding space to bind them all,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.623065Z"},"links":{"citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:f793983b19f74b679cc4f06d5819d88db91c3aae053f691c1006975328bda39a","observation_id":"a744e841-2c08-404c-8b66-45e555bc176e","resolution":{"observed_at":"2026-08-11T05:01:38.623065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:01:38.628058Z","title":"Denoising diffusion probabilistic models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.628058Z"},"links":{"citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:8434e03c75a24a3128a482f8f3dfeee2994a7ab0d3182b186f3ce310e4703526","observation_id":"c8e4a828-487c-4ba8-a2c2-779ae22072e6","resolution":{"observed_at":"2026-08-11T05:01:38.628058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:01:39.245072Z","title":"Conditional generation of audio from video via foley analogies,","venue":null,"work_id":"e6595e8d-62db-412f-a5e1-7bbf003db4c8","year":2023},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.633488Z"},"links":{"citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:aa0d68e2924f6bd2d16267926d52885ebeae5bb2f925a176743c3d5bc154fdf9","observation_id":"f99302b1-5d3d-4c06-ab10-26ca27acd214","resolution":{"observed_at":"2026-08-11T05:01:39.249712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:01:39.231062Z","title":"Varietysound: Timbre-controllable video to sound generation via unsupervised information disentanglement,","venue":null,"work_id":"19827b53-4623-453d-baba-b4232feb149e","year":2023},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.637922Z"},"links":{"citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:3225f57528ea1fab815fec416297d855c895d9eef2df993e484b3a74513b23f6","observation_id":"0de05aa5-1667-4472-bad8-014d5c258bf7","resolution":{"observed_at":"2026-08-11T05:01:39.235676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:01:39.216167Z","title":"Diff-foley: Synchronized video- to-audio synthesis with latent diffusion models,","venue":null,"work_id":"9b33e0fc-4f9e-4521-ac6a-c2212eb5a359","year":2024},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.642369Z"},"links":{"citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:36a0af1b01dd1708d5dbdaae191c80d0f1b5d420f5d65f393d6f75f876f410e4","observation_id":"bb71c8fd-1a60-497d-bd44-2f50c84b26e6","resolution":{"observed_at":"2026-08-11T05:01:39.221071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:01:39.202050Z","title":"I hear your true colors: Image guided audio generation,","venue":null,"work_id":"7cce3207-0fb4-4a73-9c0c-f2aa28bd7018","year":2023},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.647528Z"},"links":{"citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:2999c38a914d4a764672ef6fdf6225b1a3ceb5383eeca25678dbeda377bd69a5","observation_id":"b0baf4ea-d77a-4717-8936-db8d6dda74ef","resolution":{"observed_at":"2026-08-11T05:01:39.206553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01494","last_updated":"2024-07-01T17:35:56Z","snapshot_observed_at":"2026-08-19T13:11:56.801120Z","submitted_at":"2024-07-01T17:35:56Z","title":"FoleyCrafter: Bring Silent Videos to Life with Lifelike and Synchronized Sounds","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01494","snapshot_observed_at":"2026-08-11T05:01:38.651937Z","title":"Foleycrafter: Bring silent videos to life with lifelike and synchronized sounds,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.651937Z"},"links":{"cited_paper":"/paper/2407.01494","citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:bb9136cca914c2ceac54b138d78ae3477081f08b03fe53d78b8022b3cfc71d97","observation_id":"82f2665c-0c2a-40d2-aeef-9889bc041184","resolution":{"observed_at":"2026-08-11T05:01:38.651937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01044","last_updated":"2024-01-02T05:42:14Z","snapshot_observed_at":"2026-08-18T04:36:40.182437Z","submitted_at":"2024-01-02T05:42:14Z","title":"Auffusion: Leveraging the Power of Diffusion and Large Language Models for Text-to-Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01044","snapshot_observed_at":"2026-08-11T05:01:38.656647Z","title":"Auffusion: Leveraging the power of diffusion and large language models for text-to-audio generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.656647Z"},"links":{"cited_paper":"/paper/2401.01044","citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:28f3ee910077254c96e8011a1668197bf4d546e57f833b68628830b1e3535c63","observation_id":"5b036e71-af05-4ca9-8827-5dfeebc4e2ea","resolution":{"observed_at":"2026-08-11T05:01:38.656647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06721","snapshot_observed_at":"2026-08-11T05:01:38.661167Z","title":"Ip-adapter: Text compatible image prompt adapter for text-to-image diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.661167Z"},"links":{"cited_paper":"/paper/2308.06721","citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:1de548bc6d451c8e4f7f2314acbc1c45ab3d84bdfec0201121541fd5eb0de03f","observation_id":"ebc93496-4ccc-4660-8eb4-33adb2f3926e","resolution":{"observed_at":"2026-08-11T05:01:38.661167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:01:38.667045Z","title":"Pseudo-label: The simple and efficient semi-supervised learning method for deep neural networks,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.667045Z"},"links":{"citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:fa2d493deb0e7542457e95c3241c8fd3759c258afc87fa15a6b9a8ed259d636b","observation_id":"66576f66-c5e7-4e9b-ae71-754e911cb725","resolution":{"observed_at":"2026-08-11T05:01:38.667045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:01:39.178665Z","title":"Predicting deep zero-shot con- volutional neural networks using textual descriptions,","venue":null,"work_id":"eec097b1-6aba-4dd1-8074-86eb21593da2","year":2015},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.671276Z"},"links":{"citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:a9ea0c24a68797959aaaf48eb14993a3e8ed1503cf2a892e52a503fbbff5a721","observation_id":"dc1c3c51-5603-4238-89e0-28dd1de65d9c","resolution":{"observed_at":"2026-08-11T05:01:39.183592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:01:39.164135Z","title":"Integrating language guidance into vision-based deep metric learning,","venue":null,"work_id":"441ab3e0-feb0-4184-800c-587a578da0d5","year":2022},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.675614Z"},"links":{"citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:270919d0649a76a8d7e1ecd148229e6964ea877652eadc699bde8f6b040f6838","observation_id":"7f9402c1-e700-4568-98b8-c32d1ff27321","resolution":{"observed_at":"2026-08-11T05:01:39.168740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-16T15:59:22.404915Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-11T05:01:38.679692Z","title":"Audioldm: Text-to-audio generation with latent diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.679692Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:c8e77c9cd71360bd5f1e0ebdfd5ecfbbfe0005af276e09a4b3e2fb28de080258","observation_id":"9f53574b-4bc0-45cc-9953-91bb9bf5360b","resolution":{"observed_at":"2026-08-11T05:01:38.679692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:01:38.684397Z","title":"Adding conditional control to text-to-image diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.684397Z"},"links":{"citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:48cfc49362315c6bd9f55f798477145fbbea815dad8d75f9d38697ba57f90593","observation_id":"ec336e35-c0ad-496c-ac41-f1363c5c8ddb","resolution":{"observed_at":"2026-08-11T05:01:38.684397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:01:39.140666Z","title":"The benefit of temporally-strong labels in audio event classification,","venue":null,"work_id":"1b18b426-2bd0-46d6-85b1-37918382bba8","year":2021},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.688822Z"},"links":{"citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:e4e0500f5527a009950bf183b1c940e4656413f60b8e67de55985d0c7c03d917","observation_id":"5c52080e-0a92-40c9-9e0b-7bfaf9c2c1e2","resolution":{"observed_at":"2026-08-11T05:01:39.145445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:01:39.125924Z","title":"Vggsound: A large- scale audio-visual dataset,","venue":null,"work_id":"b066e9a9-8925-4f6a-a349-378cb4dac161","year":2020},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.693180Z"},"links":{"citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:4edc188bed78fba7bd55e2e26ecb910c7a1bea670694eea1ee6688cce88354ca","observation_id":"828f7af1-5619-4181-8f10-f5d78f21b61c","resolution":{"observed_at":"2026-08-11T05:01:39.130794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:01:39.111499Z","title":"Text-to-audio grounding: Build- ing correspondence between captions and sound events,","venue":null,"work_id":"17e504ef-bfba-4c96-8dc2-0cdf578b3a8d","year":2021},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.697764Z"},"links":{"citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:1bbf26918c0aee3338901fecf8d238000b80497205d11be0298cd3c02f76e045","observation_id":"daa08241-334d-499d-8abf-6c34faf50bf4","resolution":{"observed_at":"2026-08-11T05:01:39.116072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02584","last_updated":"2024-07-17T06:11:43Z","snapshot_observed_at":"2026-08-16T14:29:43.611773Z","submitted_at":"2024-01-05T00:27:32Z","title":"Towards Weakly Supervised Text-to-Audio Grounding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02584","snapshot_observed_at":"2026-08-11T05:01:38.702238Z","title":"Towards weakly supervised text-to- audio grounding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.702238Z"},"links":{"cited_paper":"/paper/2401.02584","citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:50a51c966dbb40a28cfeb1bf8d4d6ad7e3abdacf93010f20ec4d004c1ba21790","observation_id":"7d0daffe-6166-48ba-a9fb-836f29a9d52f","resolution":{"observed_at":"2026-08-11T05:01:38.702238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.08466","last_updated":"2019-01-17T16:12:43Z","snapshot_observed_at":"2026-08-15T08:25:11.276003Z","submitted_at":"2018-12-20T10:28:00Z","title":"Fr\\'echet Audio Distance: A Metric for Evaluating Music Enhancement Algorithms","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.08466","snapshot_observed_at":"2026-08-11T05:01:38.707509Z","title":"Fr \\’echet audio distance: A metric for evaluating music enhancement algorithms,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.707509Z"},"links":{"cited_paper":"/paper/1812.08466","citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:6576e3e4cc5720db1f0c16f835391f6ece5211b1093e4629bdc811300fd67053","observation_id":"a8e132c8-e7ce-42df-8f5e-1e48c1b3d1a3","resolution":{"observed_at":"2026-08-11T05:01:38.707509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17508","last_updated":"2024-03-26T09:09:59Z","snapshot_observed_at":"2026-08-16T14:06:21.799685Z","submitted_at":"2024-03-26T09:09:59Z","title":"Correlation of Fr\\'echet Audio Distance With Human Perception of Environmental Audio Is Embedding Dependant","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17508","snapshot_observed_at":"2026-08-11T05:01:38.712224Z","title":"Correlation of fr \\’echet audio distance with human perception of environmental audio is embedding dependant,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.712224Z"},"links":{"cited_paper":"/paper/2403.17508","citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:a069c0ed351e7115935eb95f44995e9dc9a3066de44899b7c03562a674f4a0e4","observation_id":"52cf62e5-1d30-42d6-8671-3b9ea584e164","resolution":{"observed_at":"2026-08-11T05:01:38.712224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:01:38.716900Z","title":"Panns: Large-scale pretrained audio neural networks for audio pattern recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.716900Z"},"links":{"citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:d2e6d00ca5625ecf24e8734c7652cd3fcb53ffea31d3622e502adc17571049ef","observation_id":"51b0d9ab-a0c1-456f-aa1c-75de199c2702","resolution":{"observed_at":"2026-08-11T05:01:38.716900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:01:39.086332Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation,","venue":null,"work_id":"d1b3d260-1b33-4401-a2f9-20ede06055d5","year":2023},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.721295Z"},"links":{"citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:b54082ad7d526a6dfc3205c5f59dc8c1ff0e7451549cf2fcfad25f2c505f871d","observation_id":"dd755cc4-22e3-4c89-81ff-0e3ab5c6b53d","resolution":{"observed_at":"2026-08-11T05:01:39.091317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:01:39.071477Z","title":"Cnn architectures for large-scale audio classification,","venue":null,"work_id":"7fae705f-a42f-4bc5-99e5-ba63d2c96732","year":2017},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.725435Z"},"links":{"citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:0124917a35494f7fc16992105e00211d818694de23abf3c27eeb655e6593e4aa","observation_id":"1e89bd65-4bed-4f43-b4ec-6e44e35a5939","resolution":{"observed_at":"2026-08-11T05:01:39.076628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:01:39.057057Z","title":"V2a-mapper: A lightweight solution for vision-to-audio generation by connecting foundation models,","venue":null,"work_id":"14e76012-c7b3-4326-acca-8df2e4b6313c","year":2024},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.729633Z"},"links":{"citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:3fb05a051b8170165fb731dc848c409627c35ebf6876814bb6153018e9ea4c05","observation_id":"13e56c13-8629-482d-85ad-4487522ced56","resolution":{"observed_at":"2026-08-11T05:01:39.061764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00320","last_updated":"2025-01-04T18:12:07Z","snapshot_observed_at":"2026-08-19T20:13:28.395800Z","submitted_at":"2024-06-01T06:40:22Z","title":"Frieren: Efficient Video-to-Audio Generation Network with Rectified Flow Matching","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00320","snapshot_observed_at":"2026-08-11T05:01:38.734637Z","title":"Frieren: Efficient video-to-audio generation with rectified flow matching,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.734637Z"},"links":{"cited_paper":"/paper/2406.00320","citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:b798595fa51acca9e0a5b8782f352933b3616881da0e5c4eeb93244432853fa7","observation_id":"abc35f88-6c8d-4329-ac81-183c089e950c","resolution":{"observed_at":"2026-08-11T05:01:38.734637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:01:38.739388Z","title":"Video-foley: Two-stage video-to- sound generation via temporal event condition for foley sound,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.739388Z"},"links":{"citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:08f6f1508af776ce9a380234c814fafa6cb1fd4eef295189a75170ff4111e977","observation_id":"4df78d47-57ae-4bef-acd9-d64e21b250ed","resolution":{"observed_at":"2026-08-11T05:01:38.739388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:01:39.042378Z","title":"Wav2clip: Learning robust audio representations from clip,","venue":null,"work_id":"b6fa339d-0c52-403e-bad4-b2927bbcc879","year":2022},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.743732Z"},"links":{"citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:a7739658ff0b82c6f36c57fc7b63f4daa07880cc1d2cb91f4fc0c7baa4312455","observation_id":"78d8003f-9395-4bc1-90d8-f339f896c700","resolution":{"observed_at":"2026-08-11T05:01:39.047018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:01:39.025085Z","title":"Fr ´echet audio distance: A reference-free metric for evaluating music enhancement algorithms,","venue":null,"work_id":"4d4b9052-96e4-4156-a72f-6e881c11301e","year":2019},"citing_paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:38.747896Z"},"links":{"citing_paper":"/paper/2412.18157"},"observation_digest":"sha256:7150315c034c1218df541599663071b9af42b22e70fad024fb7be3a7654d69aa","observation_id":"fb97627d-ccf9-465d-8054-401f6636873f","resolution":{"observed_at":"2026-08-11T05:01:39.031776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.18157","last_updated":"2024-12-24T04:29:46Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-19T11:45:47.754463Z","submitted_at":"2024-12-24T04:29:46Z","title":"Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":0,"verified_fuzzy":16},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 0 inbound Pith citation observations for arXiv:2412.18157."}