{"as_of":"2026-07-27T13:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c74cd6968c4e56d69482b5b81d3a5bdd9e7973e371beeac4fcb1836e17696963","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T18:57:21.434793Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-07-27T06:30:09.085275+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2604.05731/citation-record","integrity":"/paper/2604.05731/integrity","json":"/paper/2604.05731/citation-record.json","paper":"/paper/2604.05731"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Qwen2.5-vl technical report","venue":null,"work_id":"08a09c13-e2df-4f13-84de-75c25eb1852a","year":2025},"citing_paper":{"arxiv_id":"2604.05731","last_updated":"2026-04-07T11:34:04Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:34:04Z","title":"FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T18:57:21.434793Z"},"links":{"citing_paper":"/paper/2604.05731"},"observation_digest":"sha256:d95b5c28996a86466d9b25fbba65ac12d5209c4cfb467b32268aa8d0522aa928","observation_id":"e051faa1-c25e-473d-8d22-09ff1e4fbc43","resolution":{"observed_at":"2026-05-16T11:52:49.886971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An improved event- independent network for polyphonic sound event localiza- tion and detection","venue":null,"work_id":"41eb9da2-d4bd-4008-8690-e13e0dd452c5","year":2021},"citing_paper":{"arxiv_id":"2604.05731","last_updated":"2026-04-07T11:34:04Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:34:04Z","title":"FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T18:57:21.434793Z"},"links":{"citing_paper":"/paper/2604.05731"},"observation_digest":"sha256:1435ef54fb842354394dae1de01d2a4a4a2915424fc5b8465717d338b75a4fc9","observation_id":"2365880e-7537-46ec-b788-2c6f5a3be32f","resolution":{"observed_at":"2026-05-16T11:52:49.889152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video-guided foley sound generation with multimodal con- trols","venue":null,"work_id":"61dca9b8-dcf3-4020-ae4f-ed9ae2ab6ae6","year":2025},"citing_paper":{"arxiv_id":"2604.05731","last_updated":"2026-04-07T11:34:04Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:34:04Z","title":"FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T18:57:21.434793Z"},"links":{"citing_paper":"/paper/2604.05731"},"observation_digest":"sha256:96b0d772a577146ff65aea0f995c0df1a35a4c31ca9f846f2995035014eb538c","observation_id":"1b426b2e-7c5a-4b8c-891b-a1ee1aab87c6","resolution":{"observed_at":"2026-05-16T11:52:49.891118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15322","last_updated":"2025-04-07T18:00:00Z","snapshot_observed_at":"2026-07-06T20:10:29.099784Z","submitted_at":"2024-12-19T18:59:55Z","title":"MMAudio: Taming Multimodal Joint Training for High-Quality Video-to-Audio Synthesis","version":2},"cited_work":{"arxiv_id":"2412.15322","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15322","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Taming multimodal joint training for high-quality video-to- audio synthesis","venue":null,"work_id":"38dc8fa0-84a8-467d-a342-72197061588f","year":2024},"citing_paper":{"arxiv_id":"2604.05731","last_updated":"2026-04-07T11:34:04Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:34:04Z","title":"FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T18:57:21.434793Z"},"links":{"cited_paper":"/paper/2412.15322","citing_paper":"/paper/2604.05731"},"observation_digest":"sha256:c61b524e350212773a4a0f8a10b45320960b4768a8876861906b1f5ac2c858b3","observation_id":"7244bc48-d4f4-41f9-9ec9-caa3a12af7b1","resolution":{"observed_at":"2026-05-10T23:40:51.764241Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2604.05731","last_updated":"2026-04-07T11:34:04Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:34:04Z","title":"FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T18:57:21.434793Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2604.05731"},"observation_digest":"sha256:13dee2e82cf2caaf6b3fc69443c14705a3b0fc6e274b10920681b562e99ca0bf","observation_id":"c879398c-5410-45c8-b011-e0edb2ffcbaa","resolution":{"observed_at":"2026-05-12T18:57:28.886773Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sim- ple and controllable music generation.Advances in Neural Information Processing Systems, 36:47704–47720","venue":null,"work_id":"04e49905-4f82-41c7-9d73-91df8a15415a","year":2023},"citing_paper":{"arxiv_id":"2604.05731","last_updated":"2026-04-07T11:34:04Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:34:04Z","title":"FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T18:57:21.434793Z"},"links":{"citing_paper":"/paper/2604.05731"},"observation_digest":"sha256:7952bc99da2dc0b924ed4b4f34e1ee77da0e0aaedde72b8b485e9d02d6365f1a","observation_id":"43236040-cd06-4176-a8a2-1fe3de51d711","resolution":{"observed_at":"2026-05-16T11:52:49.897292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06612","last_updated":"2025-07-07T17:42:19Z","snapshot_observed_at":"2026-07-06T18:28:24.821865Z","submitted_at":"2024-06-06T22:55:01Z","title":"SEE-2-SOUND: Zero-Shot Spatial Environment-to-Spatial Sound","version":2},"cited_work":{"arxiv_id":"2406.06612","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.06612","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"See-2-sound: Zero-shot spatial environment-to-spatial sound","venue":null,"work_id":"3f99763e-5c3c-4a44-b468-edf889c3b79f","year":2024},"citing_paper":{"arxiv_id":"2604.05731","last_updated":"2026-04-07T11:34:04Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:34:04Z","title":"FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T18:57:21.434793Z"},"links":{"cited_paper":"/paper/2406.06612","citing_paper":"/paper/2604.05731"},"observation_digest":"sha256:0e5abd7596155d28511833f01f8baee8b0c8d7491a9a43882ee5cb5e28ab1a99","observation_id":"6860ccf8-c406-4958-b2d8-4a62c6da381a","resolution":{"observed_at":"2026-05-10T23:40:51.738420Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"44a78e00-1072-42ad-99dc-d546ed8687ee","year":2020},"citing_paper":{"arxiv_id":"2604.05731","last_updated":"2026-04-07T11:34:04Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:34:04Z","title":"FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T18:57:21.434793Z"},"links":{"citing_paper":"/paper/2604.05731"},"observation_digest":"sha256:77f962e36a43c85912f325d6f87823167292fee469e80932c6e2176923700e9d","observation_id":"e90e8e0d-e00c-4417-aac6-b5f7b68ff54a","resolution":{"observed_at":"2026-05-16T11:52:49.895173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CLIPSonic: Text-to-audio synthesis with unlabeled videos and pretrained language- vision models","venue":null,"work_id":"19d2f928-6595-422f-b365-e2b28fe2a53a","year":2023},"citing_paper":{"arxiv_id":"2604.05731","last_updated":"2026-04-07T11:34:04Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:34:04Z","title":"FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T18:57:21.434793Z"},"links":{"citing_paper":"/paper/2604.05731"},"observation_digest":"sha256:e25231a46f959f241a333e97318aa8500a914e574d90cd2d35dfc711b39925ae","observation_id":"17149d09-7eb6-46c6-8ff7-6c8ca0a9c0b3","resolution":{"observed_at":"2026-05-16T11:52:49.893437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Conditional generation of audio from video via foley analogies","venue":null,"work_id":"aff2c98b-2c5d-409c-a0b4-47fa55eb1aed","year":2023},"citing_paper":{"arxiv_id":"2604.05731","last_updated":"2026-04-07T11:34:04Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:34:04Z","title":"FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T18:57:21.434793Z"},"links":{"citing_paper":"/paper/2604.05731"},"observation_digest":"sha256:e290a28c8da32dd18a5fb875658f0219bd4b2522eaa5e16f5516f291ccea13f8","observation_id":"16e52a92-bad3-4496-8d24-364ba2409bc1","resolution":{"observed_at":"2026-05-16T11:52:49.830044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stable audio open","venue":null,"work_id":"6941f111-381d-48b7-8b68-241f8d6aca21","year":2025},"citing_paper":{"arxiv_id":"2604.05731","last_updated":"2026-04-07T11:34:04Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:34:04Z","title":"FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T18:57:21.434793Z"},"links":{"citing_paper":"/paper/2604.05731"},"observation_digest":"sha256:fec61e02ef4ea7449962844122ac61f7212667cb320d56f92ed4947baba666c5","observation_id":"73787ab8-a8fb-43d0-b540-d0fadb9ef702","resolution":{"observed_at":"2026-05-16T11:52:49.836371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.10882","last_updated":"2021-11-21T19:26:45Z","snapshot_observed_at":"2026-07-06T12:10:39.369364Z","submitted_at":"2021-11-21T19:26:45Z","title":"Geometry-Aware Multi-Task Learning for Binaural Audio Generation from Video","version":1},"cited_work":{"arxiv_id":"2111.10882","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.10882","snapshot_observed_at":"2026-07-01T20:16:12.332848Z","title":"Geometry-aware multi-task learning for binaural audio gen- eration from video","venue":null,"work_id":"ccefd211-cfed-4c8c-a882-bc0638387292","year":2021},"citing_paper":{"arxiv_id":"2604.05731","last_updated":"2026-04-07T11:34:04Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:34:04Z","title":"FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T18:57:21.434793Z"},"links":{"cited_paper":"/paper/2111.10882","citing_paper":"/paper/2604.05731"},"observation_digest":"sha256:39c5151a73b17485c22824e93d53bee28c8435321046babdbe6f899055742684","observation_id":"2a1e3fa2-6d33-4fc3-a82c-d1331f3e74b5","resolution":{"observed_at":"2026-05-10T23:40:51.732710Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Imagebind one embedding space to bind them all","venue":null,"work_id":"f6b4c6a6-bc5b-4826-bed4-52e226c8facc","year":2023},"citing_paper":{"arxiv_id":"2604.05731","last_updated":"2026-04-07T11:34:04Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:34:04Z","title":"FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T18:57:21.434793Z"},"links":{"citing_paper":"/paper/2604.05731"},"observation_digest":"sha256:ce4b9617562a567ef66ede601669500c79b0636bf9a51be0c3763ef74d448958","observation_id":"1ac95da9-2deb-45d0-a547-ae5de59698b3","resolution":{"observed_at":"2026-05-16T11:52:49.840578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium","venue":null,"work_id":"d183e97d-f551-4f10-9382-b79fd23d5c56","year":2018},"citing_paper":{"arxiv_id":"2604.05731","last_updated":"2026-04-07T11:34:04Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:34:04Z","title":"FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T18:57:21.434793Z"},"links":{"citing_paper":"/paper/2604.05731"},"observation_digest":"sha256:0364a75545a16cff74a0631ebe3c3b9ef6ac4aede6b3ace72e1bbeb394c264b7","observation_id":"894cc288-cee6-42f5-a815-a84fb33e6dd0","resolution":{"observed_at":"2026-05-16T11:52:49.826310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Spotlight- ing partially visible cinematic language for video-to-audio generation via self-distillation","venue":null,"work_id":"d07aa6be-6228-4df4-b9b8-5ac895fe2778","year":2025},"citing_paper":{"arxiv_id":"2604.05731","last_updated":"2026-04-07T11:34:04Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:34:04Z","title":"FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T18:57:21.434793Z"},"links":{"citing_paper":"/paper/2604.05731"},"observation_digest":"sha256:63c57c4874a1dceb92a3f10d4f17317fb7c575653f6a3549d1b017d979f253b4","observation_id":"db0ac4a9-8b70-42ce-b06a-619205c133e6","resolution":{"observed_at":"2026-05-16T11:52:49.881310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18474","last_updated":"2023-05-29T10:41:28Z","snapshot_observed_at":"2026-07-06T15:34:59.457879Z","submitted_at":"2023-05-29T10:41:28Z","title":"Make-An-Audio 2: Temporal-Enhanced Text-to-Audio Generation","version":1},"cited_work":{"arxiv_id":"2305.18474","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.18474","snapshot_observed_at":"2026-07-08T00:04:22.531379Z","title":"Make-An-Audio 2: Temporal-enhanced text-to- audio generation","venue":"cs.SD","work_id":"860b091c-0421-40ba-b119-b64c00ee453d","year":2023},"citing_paper":{"arxiv_id":"2604.05731","last_updated":"2026-04-07T11:34:04Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:34:04Z","title":"FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T18:57:21.434793Z"},"links":{"cited_paper":"/paper/2305.18474","citing_paper":"/paper/2604.05731"},"observation_digest":"sha256:cfee209afdb422d15e43cee852bab96ae20ed1b2473dc2b574d903d67d2cd208","observation_id":"68f9d1ff-0d88-4dbb-9185-470e3099b7b9","resolution":{"observed_at":"2026-05-10T23:40:51.769570Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Synchformer: Efficient synchronization from sparse cues","venue":null,"work_id":"e4daeb2a-4d4b-40bc-9f76-c23675de26f8","year":2024},"citing_paper":{"arxiv_id":"2604.05731","last_updated":"2026-04-07T11:34:04Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:34:04Z","title":"FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T18:57:21.434793Z"},"links":{"citing_paper":"/paper/2604.05731"},"observation_digest":"sha256:405aa6da50d0b33f14296ecf21cea64a05c949cee084c7edb06c8939896f6f40","observation_id":"e479394d-c728-4728-b2af-db770be515b0","resolution":{"observed_at":"2026-05-16T11:52:49.862138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multichannel stereophonic sound system with and without accompanying picture","venue":null,"work_id":"c7dfcae2-ae2a-4676-8d88-81cb544da174","year":2012},"citing_paper":{"arxiv_id":"2604.05731","last_updated":"2026-04-07T11:34:04Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:34:04Z","title":"FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T18:57:21.434793Z"},"links":{"citing_paper":"/paper/2604.05731"},"observation_digest":"sha256:e41ad58d6b97011e019693aec8083d4f589d42a3c8214e97201a64d2c4f8a269","observation_id":"9fe76c6a-cfb7-4a13-97fe-35ab1e262f60","resolution":{"observed_at":"2026-05-16T11:52:49.824066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.08466","last_updated":"2019-01-17T16:12:43Z","snapshot_observed_at":"2026-07-06T07:22:29.205966Z","submitted_at":"2018-12-20T10:28:00Z","title":"Fr\\'echet Audio Distance: A Metric for Evaluating Music Enhancement Algorithms","version":4},"cited_work":{"arxiv_id":"1812.08466","doi":null,"metadata_source":"pith","pith_arxiv_id":"1812.08466","snapshot_observed_at":"2026-07-08T00:04:22.632355Z","title":"Fr\\'echet Audio Distance: A Metric for Evaluating Music Enhancement Algorithms","venue":"eess.AS","work_id":"64a43367-ac07-49b0-ab37-b8797c50e9d7","year":2018},"citing_paper":{"arxiv_id":"2604.05731","last_updated":"2026-04-07T11:34:04Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:34:04Z","title":"FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T18:57:21.434793Z"},"links":{"cited_paper":"/paper/1812.08466","citing_paper":"/paper/2604.05731"},"observation_digest":"sha256:1b5d6cadd2cb90e35019b10b2aea54c82be5531af42f60f2f49a0868344a1564","observation_id":"f8be0e67-d50e-4bd8-b547-4173cd2fb180","resolution":{"observed_at":"2026-05-10T23:40:51.749046Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-07-06T13:58:10.903203Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":"2209.15352","doi":"10.48550/arxiv.2209.15352","metadata_source":"pith","pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"& Adi, Y","venue":"cs.SD","work_id":"e838ca5f-9409-4856-8383-f7294f30436d","year":2022},"citing_paper":{"arxiv_id":"2604.05731","last_updated":"2026-04-07T11:34:04Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:34:04Z","title":"FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T18:57:21.434793Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2604.05731"},"observation_digest":"sha256:f9da5e0c12583dd71228aa7669658fe6b5cd5f846a9f9c35b74f1f1fdf3746b5","observation_id":"97460d33-4d3c-4005-8e54-fe74b6302896","resolution":{"observed_at":"2026-05-10T23:40:51.743617Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2408.11915","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video-Foley: Two-Stage Video-To-Sound generation via temporal event condition for foley sound","venue":null,"work_id":"7c93860e-6e61-4a2d-b116-8ff291d0b03e","year":2024},"citing_paper":{"arxiv_id":"2604.05731","last_updated":"2026-04-07T11:34:04Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:34:04Z","title":"FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T18:57:21.434793Z"},"links":{"citing_paper":"/paper/2604.05731"},"observation_digest":"sha256:cd5319ae6c8207db3cc8fbc397d3fb94bc363391425fbb12ca13a1b4a9ca2ecd","observation_id":"91232027-99fe-4d63-861a-8c7e23de9ed5","resolution":{"observed_at":"2026-05-10T23:40:51.780133Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-07-06T14:45:48.434072Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2604.05731","last_updated":"2026-04-07T11:34:04Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:34:04Z","title":"FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T18:57:21.434793Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2604.05731"},"observation_digest":"sha256:813cd86d4a837e82c92b0da43b5a3f7ae9577819c7eb98e7033394e27ce45d05","observation_id":"01351671-3543-4f01-a0f1-0ac538ec27e2","resolution":{"observed_at":"2026-05-10T23:40:51.725801Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Plumbley","venue":null,"work_id":"2ce63d7a-d05b-447e-b27d-a06d21b6d3da","year":2024},"citing_paper":{"arxiv_id":"2604.05731","last_updated":"2026-04-07T11:34:04Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:34:04Z","title":"FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T18:57:21.434793Z"},"links":{"citing_paper":"/paper/2604.05731"},"observation_digest":"sha256:9d1c35986cf8e935616a7dadfec045c746453a5bca7f81cda7264d5cd8ae3d07","observation_id":"62bbf88a-41c0-4175-8a65-ac6ae1c9b5a6","resolution":{"observed_at":"2026-05-16T11:52:49.828075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14906","last_updated":"2025-06-03T03:27:47Z","snapshot_observed_at":"2026-07-06T21:12:23.428174Z","submitted_at":"2025-04-21T07:21:28Z","title":"OmniAudio: Generating Spatial Audio from 360-Degree Video","version":3},"cited_work":{"arxiv_id":"2504.14906","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.14906","snapshot_observed_at":"2026-07-01T20:16:12.344723Z","title":"Omniaudio: Generating spatial audio from 360-degree video","venue":null,"work_id":"27e07ac1-ded0-41ef-8408-f777d9ea03ff","year":2025},"citing_paper":{"arxiv_id":"2604.05731","last_updated":"2026-04-07T11:34:04Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:34:04Z","title":"FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T18:57:21.434793Z"},"links":{"cited_paper":"/paper/2504.14906","citing_paper":"/paper/2604.05731"},"observation_digest":"sha256:e96dac1fb0714637a57610f655a238506aba00f7ac894116a27cd81139a2fcb7","observation_id":"76375638-67a5-4d7c-81d9-affa66357b59","resolution":{"observed_at":"2026-05-10T23:40:51.754194Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visu- ally guided binaural audio generation with cross-modal con- sistency","venue":null,"work_id":"a5d24568-56c6-4af3-a844-e041711537db","year":2024},"citing_paper":{"arxiv_id":"2604.05731","last_updated":"2026-04-07T11:34:04Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:34:04Z","title":"FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T18:57:21.434793Z"},"links":{"citing_paper":"/paper/2604.05731"},"observation_digest":"sha256:aa48f6d82edcd9070501bf15f8eb5060e6c0683345293f0a4155629c03aedc03","observation_id":"f2735f0f-4ef8-4111-a327-cfd62df93fb0","resolution":{"observed_at":"2026-05-16T11:52:49.822189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diff-Foley: Synchronized video-to-audio synthesis with la- tent diffusion models.Advances in Neural Information Pro- cessing Systems, 36:48855–48876","venue":null,"work_id":"6accc0b5-2dc2-4c3f-95de-93baf1873092","year":2023},"citing_paper":{"arxiv_id":"2604.05731","last_updated":"2026-04-07T11:34:04Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:34:04Z","title":"FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T18:57:21.434793Z"},"links":{"citing_paper":"/paper/2604.05731"},"observation_digest":"sha256:2ec3f2b661f49a49ed18f84523f05195feea4888732f4c3a0e871d60d0369871","observation_id":"061ae5d4-fbd9-4589-a7a8-5ee9da2c3f6f","resolution":{"observed_at":"2026-05-16T11:52:49.817932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tango 2: Aligning diffusion-based text-to-audio generations through direct preference optimization","venue":null,"work_id":"00be9ad2-af89-4015-8431-940a8c6ce16a","year":2024},"citing_paper":{"arxiv_id":"2604.05731","last_updated":"2026-04-07T11:34:04Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:34:04Z","title":"FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T18:57:21.434793Z"},"links":{"citing_paper":"/paper/2604.05731"},"observation_digest":"sha256:e2c3401955076a5b41148b186bf168138c21fe508627049761d9d9d3cfc61633","observation_id":"aa5850e8-aa30-416f-8631-5abe6785eb69","resolution":{"observed_at":"2026-05-16T11:52:49.820063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A probabilistic model for robust localization based on a binau- ral auditory front-end.IEEE Transactions on Audio, Speech, and Language Processing, 19(1):1–13","venue":null,"work_id":"0c8340da-ca1f-42a6-b0f7-bf265da354a1","year":2010},"citing_paper":{"arxiv_id":"2604.05731","last_updated":"2026-04-07T11:34:04Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:34:04Z","title":"FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T18:57:21.434793Z"},"links":{"citing_paper":"/paper/2604.05731"},"observation_digest":"sha256:c7f56fb5b4a2b4e58011aa1bba8a8e36ef9d94a9028a05faa2dc14d01445ddad","observation_id":"0c464d35-75b0-46d6-9661-2e6eb0cf9d09","resolution":{"observed_at":"2026-05-16T11:52:49.832581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Beyond mono to binaural: Generating binaural audio from mono audio with depth and cross modal atten- tion","venue":null,"work_id":"5315229b-e9cf-49c8-9c1e-79c04e64a95a","year":2022},"citing_paper":{"arxiv_id":"2604.05731","last_updated":"2026-04-07T11:34:04Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:34:04Z","title":"FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T18:57:21.434793Z"},"links":{"citing_paper":"/paper/2604.05731"},"observation_digest":"sha256:66e821771750be36ca0289db8fd5ff0d3f648a15090fa2e7d7dc77ed78273160","observation_id":"2536962a-1811-4e94-aaec-db161e8fdbd3","resolution":{"observed_at":"2026-05-16T11:52:49.838430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improved techniques for training gans","venue":null,"work_id":"6d64f87c-1599-4d33-88b0-cccfe3a848c1","year":2016},"citing_paper":{"arxiv_id":"2604.05731","last_updated":"2026-04-07T11:34:04Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:34:04Z","title":"FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T18:57:21.434793Z"},"links":{"citing_paper":"/paper/2604.05731"},"observation_digest":"sha256:665a27a97829f2d91bb5ff649cd7041d1157844e299ae0bc8751a30acc1d14e8","observation_id":"bef8906c-96b7-4835-8882-8b208eaec83c","resolution":{"observed_at":"2026-05-16T11:52:49.854007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"I hear your true colors: Image guided audio generation","venue":null,"work_id":"92a75826-d24a-463a-a798-eeac4e9c5416","year":2023},"citing_paper":{"arxiv_id":"2604.05731","last_updated":"2026-04-07T11:34:04Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:34:04Z","title":"FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T18:57:21.434793Z"},"links":{"citing_paper":"/paper/2604.05731"},"observation_digest":"sha256:63feb1472fdd40e4792cf5ade971bb1e08be4c23d540158c8a22169371f52456","observation_id":"6b22086f-cf6f-437d-8c6f-2c1d720cd267","resolution":{"observed_at":"2026-05-16T11:52:49.874976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10676","last_updated":"2025-02-25T15:42:31Z","snapshot_observed_at":"2026-07-06T19:33:12.610676Z","submitted_at":"2024-10-14T16:18:29Z","title":"Both Ears Wide Open: Towards Language-Driven Spatial Audio Generation","version":2},"cited_work":{"arxiv_id":"2410.10676","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10676","snapshot_observed_at":"2026-07-01T20:16:12.329267Z","title":"Both ears wide open: Towards language-driven spatial audio generation","venue":null,"work_id":"e46a7268-d79c-472a-b1a4-45d2d95f0e64","year":2024},"citing_paper":{"arxiv_id":"2604.05731","last_updated":"2026-04-07T11:34:04Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:34:04Z","title":"FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T18:57:21.434793Z"},"links":{"cited_paper":"/paper/2410.10676","citing_paper":"/paper/2604.05731"},"observation_digest":"sha256:2edfae027167256330d6da49ca89f3119d1734b8845eebef995233df070c313f","observation_id":"05ee09f0-d164-45c2-988a-941acd3d7775","resolution":{"observed_at":"2026-05-10T23:40:51.721552Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fourier features let networks learn high frequency functions in low dimen- sional domains.Advances in Neural Information Processing Systems, 33:7537–7547","venue":null,"work_id":"a606fccf-f1e2-4b03-bad7-c6b99b15b534","year":2020},"citing_paper":{"arxiv_id":"2604.05731","last_updated":"2026-04-07T11:34:04Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:34:04Z","title":"FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T18:57:21.434793Z"},"links":{"citing_paper":"/paper/2604.05731"},"observation_digest":"sha256:dad6d8a5258d65bdc951f5e9bd3f160e988cff5c405df767c3002e154a555da6","observation_id":"0561bca9-0b6a-43f1-870f-514ff56beb58","resolution":{"observed_at":"2026-05-16T11:52:49.883370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"V2a-mapper: A lightweight solution for vision-to-audio generation by connecting foun- dation models","venue":null,"work_id":"990610c0-1eae-4129-8346-d47d5f766f49","year":2024},"citing_paper":{"arxiv_id":"2604.05731","last_updated":"2026-04-07T11:34:04Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:34:04Z","title":"FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T18:57:21.434793Z"},"links":{"citing_paper":"/paper/2604.05731"},"observation_digest":"sha256:947f64afa3386c6cc1a20e446ebe7c6311b0235083adab1577309b2530d9580f","observation_id":"df1dadb4-0f33-4de7-8478-b12b5a56957b","resolution":{"observed_at":"2026-05-16T11:52:49.877076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Frieren: Efficient video-to-audio generation network with rectified flow matching.Advances in Neural Information Processing Systems, 37:128118–128138","venue":null,"work_id":"490cf559-a40f-4cba-867b-4fa14f7a362d","year":2024},"citing_paper":{"arxiv_id":"2604.05731","last_updated":"2026-04-07T11:34:04Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:34:04Z","title":"FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T18:57:21.434793Z"},"links":{"citing_paper":"/paper/2604.05731"},"observation_digest":"sha256:dcb6c171fd6681cb05dc990dfde4a3ca65cfabbe5d36beca4b94ac20d566fbc5","observation_id":"ef8591c0-f59d-4d71-8bf3-0b78a1861bdb","resolution":{"observed_at":"2026-05-16T11:52:49.860203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Large-scale con- trastive language-audio pretraining with feature fusion and keyword-to-caption augmentation","venue":null,"work_id":"a155a03c-2eeb-46b9-874b-7fa474c2c72d","year":2023},"citing_paper":{"arxiv_id":"2604.05731","last_updated":"2026-04-07T11:34:04Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:34:04Z","title":"FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T18:57:21.434793Z"},"links":{"citing_paper":"/paper/2604.05731"},"observation_digest":"sha256:2a293a8b50837b3c06c1848e6ccf939a379a1444c87f40a8c32f36b6fc3e6d18","observation_id":"76088393-10d0-4183-a976-54158d1db3e0","resolution":{"observed_at":"2026-05-16T11:52:49.866436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Son- icVisionLM: Playing sound with vision language models","venue":null,"work_id":"267d7e3c-5078-486e-989c-585c8399250a","year":2024},"citing_paper":{"arxiv_id":"2604.05731","last_updated":"2026-04-07T11:34:04Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:34:04Z","title":"FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T18:57:21.434793Z"},"links":{"citing_paper":"/paper/2604.05731"},"observation_digest":"sha256:c005add1c14fd13262dd0dd6b7c2816549cafdf0c2f45dbd7e1785b5c5e7c397","observation_id":"696d8ed2-5b2b-4b2c-9647-a23446dd455e","resolution":{"observed_at":"2026-05-16T11:52:49.834560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Depth any- thing v2.Advances in Neural Information Processing Sys- tems, 37:21875–21911","venue":null,"work_id":"3e6abd7e-c361-4713-9ecc-17e63168ef76","year":2024},"citing_paper":{"arxiv_id":"2604.05731","last_updated":"2026-04-07T11:34:04Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:34:04Z","title":"FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T18:57:21.434793Z"},"links":{"citing_paper":"/paper/2604.05731"},"observation_digest":"sha256:bec88f67b28d1a9b74211da4eca34ebb76547fc98789e341a2222890a7d62969","observation_id":"2e8e7252-e221-4ba9-9800-b51d1a5904f9","resolution":{"observed_at":"2026-05-16T11:52:49.868396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deepear: Sound local- ization with binaural microphones.IEEE Transactions on Mobile Computing, 23(1):359–375","venue":null,"work_id":"b1877098-82cb-4d22-80c8-db141652c7bc","year":2022},"citing_paper":{"arxiv_id":"2604.05731","last_updated":"2026-04-07T11:34:04Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:34:04Z","title":"FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T18:57:21.434793Z"},"links":{"citing_paper":"/paper/2604.05731"},"observation_digest":"sha256:580f166967b05398bc36c6166f5fc89875d833b2556e31fab013bbe6d0c2742d","observation_id":"84d6b5ee-bbdf-4b58-bf3f-a2f69a88a80b","resolution":{"observed_at":"2026-05-16T11:52:49.864370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Griffiths, Yuan Cao, and Karthik Narasimhan","venue":null,"work_id":"a4ee0c54-c737-4344-9537-4f79ac407797","year":2023},"citing_paper":{"arxiv_id":"2604.05731","last_updated":"2026-04-07T11:34:04Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:34:04Z","title":"FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T18:57:21.434793Z"},"links":{"citing_paper":"/paper/2604.05731"},"observation_digest":"sha256:a341cc96f0987b553af1338e9008f74299863100ce02febc1331692f6b5092b4","observation_id":"5d92dd1e-ece9-4584-91e9-dd33c5066dfd","resolution":{"observed_at":"2026-05-16T11:52:49.858035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01494","last_updated":"2024-07-01T17:35:56Z","snapshot_observed_at":"2026-07-06T18:39:43.472708Z","submitted_at":"2024-07-01T17:35:56Z","title":"FoleyCrafter: Bring Silent Videos to Life with Lifelike and Synchronized Sounds","version":1},"cited_work":{"arxiv_id":"2407.01494","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.01494","snapshot_observed_at":"2026-07-08T07:14:45.319897Z","title":"Foleycrafter: Bring silent videos to life with lifelike and synchronized sounds","venue":"cs.CV","work_id":"15978118-0cb9-48fb-8c66-d8f1ea7e79fc","year":2024},"citing_paper":{"arxiv_id":"2604.05731","last_updated":"2026-04-07T11:34:04Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:34:04Z","title":"FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T18:57:21.434793Z"},"links":{"cited_paper":"/paper/2407.01494","citing_paper":"/paper/2604.05731"},"observation_digest":"sha256:b7d5d0f7203bbb9a074ba3e9c525aede43bbd6b053301c77c2f12941b90a874b","observation_id":"dc06ec0a-a6f5-48ab-8001-6162eefc0fe6","resolution":{"observed_at":"2026-05-10T23:40:51.786766Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sep-stereo: Visually guided stereophonic audio generation by associating source separation","venue":null,"work_id":"9fe83e2d-1653-4db7-a2b5-3b04eca63dc2","year":2020},"citing_paper":{"arxiv_id":"2604.05731","last_updated":"2026-04-07T11:34:04Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:34:04Z","title":"FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T18:57:21.434793Z"},"links":{"citing_paper":"/paper/2604.05731"},"observation_digest":"sha256:106878224039414a81a5215bed305279b6957e71cc5454ddfb1730add70eb1c4","observation_id":"045f7a90-4c7f-44d2-8c42-055e5f461c16","resolution":{"observed_at":"2026-05-16T11:52:49.872972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"As summarized in Table 1, ex- isting datasets typically lack stereophonic recordings or pre- cise temporal annotations","venue":null,"work_id":"03f1c2bd-8800-4d05-8e55-1e3172142ece","year":null},"citing_paper":{"arxiv_id":"2604.05731","last_updated":"2026-04-07T11:34:04Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:34:04Z","title":"FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T18:57:21.434793Z"},"links":{"citing_paper":"/paper/2604.05731"},"observation_digest":"sha256:43771957deef8641f6ef7bf1edefc12e7f949cfc9338958baa1820d22ebcf509","observation_id":"c06f1e28-ad7c-43a3-8d95-0460b36dfddd","resolution":{"observed_at":"2026-05-16T11:52:49.879089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi-Agent Refinement The complete pseudocode for our multi-agent Foley refine- ment pipeline is presented in Algorithm 2","venue":null,"work_id":"6abd47ec-664e-4884-914b-182fd61b59fc","year":null},"citing_paper":{"arxiv_id":"2604.05731","last_updated":"2026-04-07T11:34:04Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:34:04Z","title":"FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T18:57:21.434793Z"},"links":{"citing_paper":"/paper/2604.05731"},"observation_digest":"sha256:a404c6436bf88885300b98801ab0616e6b54c617bcb2adddcbe811f741d768cc","observation_id":"059d1100-85e1-49aa-bf3b-f74fb41e0fe6","resolution":{"observed_at":"2026-05-16T11:52:49.842697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e185313e-617d-461c-9d24-0141b55d28ff","year":null},"citing_paper":{"arxiv_id":"2604.05731","last_updated":"2026-04-07T11:34:04Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:34:04Z","title":"FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T18:57:21.434793Z"},"links":{"citing_paper":"/paper/2604.05731"},"observation_digest":"sha256:0ec731f6fc42a7d1ef89133870f3787eb7eb286abebd8052ab87edba18d7c07a","observation_id":"440d6669-ab40-4ccd-be21-4b7f85304f6b","resolution":{"observed_at":"2026-05-16T11:52:49.885153Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b6a3fb76-24e8-4a55-9cc3-f36a2e658bf4","year":null},"citing_paper":{"arxiv_id":"2604.05731","last_updated":"2026-04-07T11:34:04Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:34:04Z","title":"FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T18:57:21.434793Z"},"links":{"citing_paper":"/paper/2604.05731"},"observation_digest":"sha256:8a7f24b3d334b0996cd21d6f97dbbdb211ece423da095faa534df09104fe5cc5","observation_id":"a47067db-d282-4a67-97e1-9e1883691d9b","resolution":{"observed_at":"2026-05-16T11:52:49.852072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"3be2346f-902f-4c41-8cbb-c137957cd278","year":null},"citing_paper":{"arxiv_id":"2604.05731","last_updated":"2026-04-07T11:34:04Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:34:04Z","title":"FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T18:57:21.434793Z"},"links":{"citing_paper":"/paper/2604.05731"},"observation_digest":"sha256:c3d6ededabbba3e7eb009083a41587d16298dd83fbad597ce325d16e7c7f0f63","observation_id":"161a1251-b443-44a5-8259-91961a4d2123","resolution":{"observed_at":"2026-05-16T11:52:49.855740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"End-to-End (∼5s)","venue":null,"work_id":"1cdd5b7e-da6b-47fb-89e3-019ebb4716ba","year":null},"citing_paper":{"arxiv_id":"2604.05731","last_updated":"2026-04-07T11:34:04Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:34:04Z","title":"FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T18:57:21.434793Z"},"links":{"citing_paper":"/paper/2604.05731"},"observation_digest":"sha256:cde2688e261d169b219568819046a78d90943454bf5e7f6caf2aae23b4cb0fbc","observation_id":"d9680298-a914-4ec6-9818-10b0e7e84e5c","resolution":{"observed_at":"2026-05-16T11:52:49.850361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9da83b85-6d43-419e-8c29-9de396cfdea3","year":null},"citing_paper":{"arxiv_id":"2604.05731","last_updated":"2026-04-07T11:34:04Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:34:04Z","title":"FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-10T18:57:21.434793Z"},"links":{"citing_paper":"/paper/2604.05731"},"observation_digest":"sha256:d48677a12e30755533c1997d698a54e5534623a9bc3cc3be1aaced7fd96b4ca8","observation_id":"e557e389-c95f-4b3b-8b58-19874800f15a","resolution":{"observed_at":"2026-05-16T11:52:49.846474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Experimental Setup Our user study was conducted through both offline and on- line evaluations to comprehensively assess the perceived quality of generated foley audio","venue":null,"work_id":"8ce1b932-df24-4dfe-be90-2683552823d8","year":null},"citing_paper":{"arxiv_id":"2604.05731","last_updated":"2026-04-07T11:34:04Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:34:04Z","title":"FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-10T18:57:21.434793Z"},"links":{"citing_paper":"/paper/2604.05731"},"observation_digest":"sha256:7cd5bc6db213d8e24ddf54136dd4445e768ccccf6f4f2058ae2b73c0f12ca9a3","observation_id":"0fd13472-f005-43f7-9dfb-14329caa78c0","resolution":{"observed_at":"2026-05-16T11:52:49.848488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0f91e443-f905-46ad-8179-207d28446a22","year":null},"citing_paper":{"arxiv_id":"2604.05731","last_updated":"2026-04-07T11:34:04Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:34:04Z","title":"FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T18:57:21.434793Z"},"links":{"citing_paper":"/paper/2604.05731"},"observation_digest":"sha256:052f06a343de79489d657c9c0da240451e2235dbe9c1e75264a880de10bf78b2","observation_id":"9ad3407c-c257-46e9-91fc-35a949f66d5c","resolution":{"observed_at":"2026-05-16T11:52:49.844457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.05731","last_updated":"2026-04-07T11:34:04Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:34:04Z","title":"FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":1,"unresolved":0,"verified_exact":11,"verified_fuzzy":38},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"thesis":"As of 27 July 2026, this Paper Citation Record lists 51 of 51 outbound references and 0 inbound Pith citation observations for arXiv:2604.05731."}