{"as_of":"2026-08-23T22:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3b80c9e834dafb23990da3d7476bdca0cca74f54c1e70086cd289d680278fb8c","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T10:26:24.304992Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2504.18283/citation-record","integrity":"/paper/2504.18283/integrity","json":"/paper/2504.18283/citation-record.json","paper":"/paper/2504.18283"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2405.00878","last_updated":"2024-05-01T21:43:57Z","snapshot_observed_at":"2026-08-17T03:31:45.335086Z","submitted_at":"2024-05-01T21:43:57Z","title":"SonicDiffusion: Audio-Driven Image Generation and Editing with Pretrained Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00878","snapshot_observed_at":"2026-08-16T10:26:24.017319Z","title":"Sonicdiffusion: Audio-driven image generation and editing with pretrained diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18283","last_updated":"2025-04-25T11:51:04Z","snapshot_observed_at":"2026-08-18T19:58:03.175883Z","submitted_at":"2025-04-25T11:51:04Z","title":"Seeing Soundscapes: Audio-Visual Generation and Separation from Soundscapes Using Audio-Visual Separator","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T10:26:24.017319Z"},"links":{"cited_paper":"/paper/2405.00878","citing_paper":"/paper/2504.18283"},"observation_digest":"sha256:7c452928657925c4bfe3393af69622779a2413fab4abdc1d0d6ea64a2f5147a0","observation_id":"bc21fbec-6b01-44d3-be32-959c5c05777f","resolution":{"observed_at":"2026-08-16T10:26:24.017319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.11096","last_updated":"2019-02-25T21:32:06Z","snapshot_observed_at":"2026-07-06T07:04:57.275371Z","submitted_at":"2018-09-28T15:38:49Z","title":"Large Scale GAN Training for High Fidelity Natural Image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.11096","snapshot_observed_at":"2026-08-16T10:26:24.023227Z","title":"Large scale gan training for high fidelity natural image synthesis","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.18283","last_updated":"2025-04-25T11:51:04Z","snapshot_observed_at":"2026-08-18T19:58:03.175883Z","submitted_at":"2025-04-25T11:51:04Z","title":"Seeing Soundscapes: Audio-Visual Generation and Separation from Soundscapes Using Audio-Visual Separator","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T10:26:24.023227Z"},"links":{"cited_paper":"/paper/1809.11096","citing_paper":"/paper/2504.18283"},"observation_digest":"sha256:6f07ad0ef0510e208d8e5240f58ae596254127d484133ea918d1fb4036b4be4d","observation_id":"ecf14d85-1541-4990-aba2-807c9435e3d6","resolution":{"observed_at":"2026-08-16T10:26:24.023227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:26:24.921612Z","title":"Instance- conditioned gan","venue":null,"work_id":"fb61493f-d965-4215-8b67-69cfbb39f797","year":2021},"citing_paper":{"arxiv_id":"2504.18283","last_updated":"2025-04-25T11:51:04Z","snapshot_observed_at":"2026-08-18T19:58:03.175883Z","submitted_at":"2025-04-25T11:51:04Z","title":"Seeing Soundscapes: Audio-Visual Generation and Separation from Soundscapes Using Audio-Visual Separator","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T10:26:24.027939Z"},"links":{"citing_paper":"/paper/2504.18283"},"observation_digest":"sha256:407a57247fb84261373ed8e33de1001747fed7a9434ef9ec64127bcdae7d4d22","observation_id":"f5854aee-204d-4d21-9f25-0414d5cf47e5","resolution":{"observed_at":"2026-08-16T10:26:24.926228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:26:24.907855Z","title":"Chatterjee and A","venue":null,"work_id":"2b2d82b6-beb0-4d55-ad10-ba2a19f24c1c","year":2020},"citing_paper":{"arxiv_id":"2504.18283","last_updated":"2025-04-25T11:51:04Z","snapshot_observed_at":"2026-08-18T19:58:03.175883Z","submitted_at":"2025-04-25T11:51:04Z","title":"Seeing Soundscapes: Audio-Visual Generation and Separation from Soundscapes Using Audio-Visual Separator","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T10:26:24.032500Z"},"links":{"citing_paper":"/paper/2504.18283"},"observation_digest":"sha256:f783c8a6a0ccc9c7da75d109e79d9aa071e215ecee577a0fe67e00437ee8ca3b","observation_id":"c0408464-2537-48ee-8351-d453a6e1bbe9","resolution":{"observed_at":"2026-08-16T10:26:24.912073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:26:24.892693Z","title":"Learning audio-visual dynamics using scene graphs for au- dio source separation","venue":null,"work_id":"b9c42782-d2d2-4853-ae97-e14807c774c9","year":2024},"citing_paper":{"arxiv_id":"2504.18283","last_updated":"2025-04-25T11:51:04Z","snapshot_observed_at":"2026-08-18T19:58:03.175883Z","submitted_at":"2025-04-25T11:51:04Z","title":"Seeing Soundscapes: Audio-Visual Generation and Separation from Soundscapes Using Audio-Visual Separator","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T10:26:24.037370Z"},"links":{"citing_paper":"/paper/2504.18283"},"observation_digest":"sha256:4ff512ad5c1c10eef869152b3ae2cce7752ba629bbc5b85b5e1a154b32d0c124","observation_id":"2060a7cd-45c8-4824-b31a-a4f7603ea2c5","resolution":{"observed_at":"2026-08-16T10:26:24.898062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:26:24.878208Z","title":"Vggsound: A large-scale audio-visual dataset","venue":null,"work_id":"a2b4d488-d48d-4535-a350-bce4f4cb5720","year":2020},"citing_paper":{"arxiv_id":"2504.18283","last_updated":"2025-04-25T11:51:04Z","snapshot_observed_at":"2026-08-18T19:58:03.175883Z","submitted_at":"2025-04-25T11:51:04Z","title":"Seeing Soundscapes: Audio-Visual Generation and Separation from Soundscapes Using Audio-Visual Separator","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T10:26:24.041920Z"},"links":{"citing_paper":"/paper/2504.18283"},"observation_digest":"sha256:a79aa05b7476d41e8dec2bad56166fe03e99708e415ed49c5e7bc27c27b3fa58","observation_id":"be0de70e-d633-40cc-8498-d13fd75ebcaf","resolution":{"observed_at":"2026-08-16T10:26:24.883128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:26:24.863666Z","title":"iquery: Instruments as queries for audio-visual sound separation","venue":null,"work_id":"4b40f278-ff4d-41ef-a258-7a885600eb2f","year":2023},"citing_paper":{"arxiv_id":"2504.18283","last_updated":"2025-04-25T11:51:04Z","snapshot_observed_at":"2026-08-18T19:58:03.175883Z","submitted_at":"2025-04-25T11:51:04Z","title":"Seeing Soundscapes: Audio-Visual Generation and Separation from Soundscapes Using Audio-Visual Separator","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T10:26:24.046970Z"},"links":{"citing_paper":"/paper/2504.18283"},"observation_digest":"sha256:b91cc4fd5176b31ab8fe58bd24296ae5ea139d862e6505ec6204e7e8f840c7f7","observation_id":"704b828e-f3ae-42f7-8b07-3f6bdd0ae1d5","resolution":{"observed_at":"2026-08-16T10:26:24.868260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:26:24.848579Z","title":"Deep cross-modal audio-visual generation","venue":null,"work_id":"8a527184-b29d-4c94-b280-3420fe149d77","year":null},"citing_paper":{"arxiv_id":"2504.18283","last_updated":"2025-04-25T11:51:04Z","snapshot_observed_at":"2026-08-18T19:58:03.175883Z","submitted_at":"2025-04-25T11:51:04Z","title":"Seeing Soundscapes: Audio-Visual Generation and Separation from Soundscapes Using Audio-Visual Separator","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T10:26:24.051337Z"},"links":{"citing_paper":"/paper/2504.18283"},"observation_digest":"sha256:addb45369e9637fd4b6087a5005a8c0cf1240b9691458c001d8b3698e5b2ddd1","observation_id":"727ada9c-f048-4e6f-be3d-92216ccaa392","resolution":{"observed_at":"2026-08-16T10:26:24.852993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:26:24.834207Z","title":"Filter-recovery network for multi-speaker audio- visual speech separation","venue":null,"work_id":"ac293e65-fb6c-4140-b0b6-e14e417481c5","year":2023},"citing_paper":{"arxiv_id":"2504.18283","last_updated":"2025-04-25T11:51:04Z","snapshot_observed_at":"2026-08-18T19:58:03.175883Z","submitted_at":"2025-04-25T11:51:04Z","title":"Seeing Soundscapes: Audio-Visual Generation and Separation from Soundscapes Using Audio-Visual Separator","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T10:26:24.055805Z"},"links":{"citing_paper":"/paper/2504.18283"},"observation_digest":"sha256:f41355cf688e1bed713dd99df05794f826f1003007c7ab70f2d5a135a3f54906","observation_id":"ec8de647-16ab-4574-9dae-fb878876d0fa","resolution":{"observed_at":"2026-08-16T10:26:24.838665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:26:24.819937Z","title":"Yolo-world: Real-time open- vocabulary object detection","venue":null,"work_id":"626752e8-6cc0-4b04-88cc-e7b7aa75bd45","year":2024},"citing_paper":{"arxiv_id":"2504.18283","last_updated":"2025-04-25T11:51:04Z","snapshot_observed_at":"2026-08-18T19:58:03.175883Z","submitted_at":"2025-04-25T11:51:04Z","title":"Seeing Soundscapes: Audio-Visual Generation and Separation from Soundscapes Using Audio-Visual Separator","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T10:26:24.060136Z"},"links":{"citing_paper":"/paper/2504.18283"},"observation_digest":"sha256:5433e7936e18ab09bd26ee33e51576d87414a8794e078f4fa24ed554e80f2e14","observation_id":"782db89a-8ebb-44d7-a75a-cb5c5670d26a","resolution":{"observed_at":"2026-08-16T10:26:24.824684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:26:24.805866Z","title":"Jha, Teddy Koker, Luca Di Liello, Daniel Stancl, Changsheng Quan, Maxim Grechkin, and William Falcon","venue":null,"work_id":"17178438-e3b6-484d-93bc-87e036a21b8d","year":2022},"citing_paper":{"arxiv_id":"2504.18283","last_updated":"2025-04-25T11:51:04Z","snapshot_observed_at":"2026-08-18T19:58:03.175883Z","submitted_at":"2025-04-25T11:51:04Z","title":"Seeing Soundscapes: Audio-Visual Generation and Separation from Soundscapes Using Audio-Visual Separator","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T10:26:24.064522Z"},"links":{"citing_paper":"/paper/2504.18283"},"observation_digest":"sha256:3435f3d323b0f4b014961ab8ec7bac07357a4d99a8d8706a108c1ac5d9e6d438","observation_id":"e8ef29eb-372f-4439-92b1-99afc54afd4d","resolution":{"observed_at":"2026-08-16T10:26:24.810383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:26:24.790797Z","title":null,"venue":null,"work_id":"dc63cb7f-5bef-41e6-b50e-f83283a87690","year":2021},"citing_paper":{"arxiv_id":"2504.18283","last_updated":"2025-04-25T11:51:04Z","snapshot_observed_at":"2026-08-18T19:58:03.175883Z","submitted_at":"2025-04-25T11:51:04Z","title":"Seeing Soundscapes: Audio-Visual Generation and Separation from Soundscapes Using Audio-Visual Separator","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T10:26:24.068932Z"},"links":{"citing_paper":"/paper/2504.18283"},"observation_digest":"sha256:db67d3518fef3cca260fe704563baed72ead57e5a4224b8525a54811ac541a80","observation_id":"df29c25e-1074-49b5-a4cb-592a1eee5879","resolution":{"observed_at":"2026-08-16T10:26:24.795653Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.01266","last_updated":"2022-03-09T16:49:14Z","snapshot_observed_at":"2026-08-16T18:20:12.693064Z","submitted_at":"2021-06-02T16:20:43Z","title":"Sound-to-Imagination: An Exploratory Study on Unsupervised Crossmodal Translation Using Diverse Audiovisual Data","version":2},"cited_work":{"arxiv_id":"2106.01266","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.01266","snapshot_observed_at":"2026-08-16T10:26:24.450568Z","title":"Sound-to-Imagination: An Exploratory Study on Unsupervised Crossmodal Translation Using Diverse Audiovisual Data","venue":"cs.SD","work_id":"2fbfd8af-9a5e-493a-b9c2-54fd0f4263af","year":2021},"citing_paper":{"arxiv_id":"2504.18283","last_updated":"2025-04-25T11:51:04Z","snapshot_observed_at":"2026-08-18T19:58:03.175883Z","submitted_at":"2025-04-25T11:51:04Z","title":"Seeing Soundscapes: Audio-Visual Generation and Separation from Soundscapes Using Audio-Visual Separator","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T10:26:24.073331Z"},"links":{"cited_paper":"/paper/2106.01266","citing_paper":"/paper/2504.18283"},"observation_digest":"sha256:ce1fd409d698b372464cdf8fc970114e43743b9f3e0879956db322cd87bc5aa4","observation_id":"58435090-7873-4152-8a09-81a155b05784","resolution":{"observed_at":"2026-08-16T10:26:24.455257Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:26:24.077677Z","title":"Generative adversarial nets","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2504.18283","last_updated":"2025-04-25T11:51:04Z","snapshot_observed_at":"2026-08-18T19:58:03.175883Z","submitted_at":"2025-04-25T11:51:04Z","title":"Seeing Soundscapes: Audio-Visual Generation and Separation from Soundscapes Using Audio-Visual Separator","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T10:26:24.077677Z"},"links":{"citing_paper":"/paper/2504.18283"},"observation_digest":"sha256:1e621964960cdf1745545c0d45b6bc9399c701bdb72d910bd2d577605a86e487","observation_id":"dc3310f9-8794-4549-b949-69ef54bf92d3","resolution":{"observed_at":"2026-08-16T10:26:24.077677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.08102","last_updated":"2017-12-09T04:01:40Z","snapshot_observed_at":"2026-07-06T06:10:41.384815Z","submitted_at":"2017-11-22T01:36:20Z","title":"CMCGAN: A Uniform Framework for Cross-Modal Visual-Audio Mutual Generation","version":2},"cited_work":{"arxiv_id":"1711.08102","doi":null,"metadata_source":"pith","pith_arxiv_id":"1711.08102","snapshot_observed_at":"2026-08-16T10:26:24.427834Z","title":"CMCGAN: A Uniform Framework for Cross-Modal Visual-Audio Mutual Generation","venue":"cs.CV","work_id":"afdbdedb-8628-4bfe-afa2-3129551fa930","year":2017},"citing_paper":{"arxiv_id":"2504.18283","last_updated":"2025-04-25T11:51:04Z","snapshot_observed_at":"2026-08-18T19:58:03.175883Z","submitted_at":"2025-04-25T11:51:04Z","title":"Seeing Soundscapes: Audio-Visual Generation and Separation from Soundscapes Using Audio-Visual Separator","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T10:26:24.081745Z"},"links":{"cited_paper":"/paper/1711.08102","citing_paper":"/paper/2504.18283"},"observation_digest":"sha256:7ebc7a2a14519b1a6584af652c8523aa50e4fba41ff03228cad3280eb670044f","observation_id":"c0a51a7a-e709-4692-82e6-b3a90a68c303","resolution":{"observed_at":"2026-08-16T10:26:24.434368Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:26:24.767312Z","title":"Zhang, Shaoqing Ren, and Jian Sun","venue":null,"work_id":"d1d3e26c-f0fb-4e62-838e-82ca021e26ab","year":2015},"citing_paper":{"arxiv_id":"2504.18283","last_updated":"2025-04-25T11:51:04Z","snapshot_observed_at":"2026-08-18T19:58:03.175883Z","submitted_at":"2025-04-25T11:51:04Z","title":"Seeing Soundscapes: Audio-Visual Generation and Separation from Soundscapes Using Audio-Visual Separator","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T10:26:24.086249Z"},"links":{"citing_paper":"/paper/2504.18283"},"observation_digest":"sha256:2ef8560a0a4ad5c7c8e81e41bb4246a8b14d3df06e7ffe9a5d7507b290dd6695","observation_id":"c6821b2f-a0e3-446d-b54a-ecac4050660d","resolution":{"observed_at":"2026-08-16T10:26:24.771448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:26:24.090490Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.18283","last_updated":"2025-04-25T11:51:04Z","snapshot_observed_at":"2026-08-18T19:58:03.175883Z","submitted_at":"2025-04-25T11:51:04Z","title":"Seeing Soundscapes: Audio-Visual Generation and Separation from Soundscapes Using Audio-Visual Separator","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T10:26:24.090490Z"},"links":{"citing_paper":"/paper/2504.18283"},"observation_digest":"sha256:78570c115757027bd114de679ba6b6c24f1d00e6a4b9ed5e572b250d067a011f","observation_id":"148d7fa7-f851-4afd-b670-f12b35ec57bb","resolution":{"observed_at":"2026-08-16T10:26:24.090490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:26:24.743741Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":"680f2cac-ae8b-4019-8746-4c62477996c9","year":2020},"citing_paper":{"arxiv_id":"2504.18283","last_updated":"2025-04-25T11:51:04Z","snapshot_observed_at":"2026-08-18T19:58:03.175883Z","submitted_at":"2025-04-25T11:51:04Z","title":"Seeing Soundscapes: Audio-Visual Generation and Separation from Soundscapes Using Audio-Visual Separator","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T10:26:24.094842Z"},"links":{"citing_paper":"/paper/2504.18283"},"observation_digest":"sha256:baee09fd985d0fbe346c20b013d57a09796c6f8808be1cfaf50a421e93e3e0d2","observation_id":"6237d19e-d9a0-4cec-af78-6099d1217ef1","resolution":{"observed_at":"2026-08-16T10:26:24.748123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:26:24.728599Z","title":"Ultralyt- ics yolo","venue":null,"work_id":"66765622-dff3-42fe-87d5-ad297217a034","year":2023},"citing_paper":{"arxiv_id":"2504.18283","last_updated":"2025-04-25T11:51:04Z","snapshot_observed_at":"2026-08-18T19:58:03.175883Z","submitted_at":"2025-04-25T11:51:04Z","title":"Seeing Soundscapes: Audio-Visual Generation and Separation from Soundscapes Using Audio-Visual Separator","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T10:26:24.098966Z"},"links":{"citing_paper":"/paper/2504.18283"},"observation_digest":"sha256:b52bba11895e9e7e9281529b908d50b048717378b359a05fe7acc040f6d6a320","observation_id":"fa104f01-d528-4202-b440-6090c24d74d8","resolution":{"observed_at":"2026-08-16T10:26:24.733269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:26:24.714356Z","title":"Sound to visual scene generation by audio-to-visual latent alignment","venue":null,"work_id":"c9395126-b749-457f-86af-315873315240","year":2023},"citing_paper":{"arxiv_id":"2504.18283","last_updated":"2025-04-25T11:51:04Z","snapshot_observed_at":"2026-08-18T19:58:03.175883Z","submitted_at":"2025-04-25T11:51:04Z","title":"Seeing Soundscapes: Audio-Visual Generation and Separation from Soundscapes Using Audio-Visual Separator","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T10:26:24.103273Z"},"links":{"citing_paper":"/paper/2504.18283"},"observation_digest":"sha256:e8fbc6114dea1af72829d6a04ecaea1b2b78f70997e70ee4f36cf3894632031b","observation_id":"f096559b-c155-4041-a315-af193c1bce61","resolution":{"observed_at":"2026-08-16T10:26:24.719015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:26:24.699750Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":"fc6cbbc0-938c-4f14-94f6-eb3085552a64","year":2015},"citing_paper":{"arxiv_id":"2504.18283","last_updated":"2025-04-25T11:51:04Z","snapshot_observed_at":"2026-08-18T19:58:03.175883Z","submitted_at":"2025-04-25T11:51:04Z","title":"Seeing Soundscapes: Audio-Visual Generation and Separation from Soundscapes Using Audio-Visual Separator","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T10:26:24.107934Z"},"links":{"citing_paper":"/paper/2504.18283"},"observation_digest":"sha256:74fb5b54b22696299436a764cd2cbda52b53f85cde5d569bcd0e23478fef6c63","observation_id":"f4f63d3d-6fd0-4207-b5e7-f59a97c32549","resolution":{"observed_at":"2026-08-16T10:26:24.704205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:26:24.685129Z","title":"King’s computational research, en- gineering and technology environment (create), 2022","venue":null,"work_id":"8b246a9e-9c8e-42cc-8a7b-8bcb4aca1ff9","year":2022},"citing_paper":{"arxiv_id":"2504.18283","last_updated":"2025-04-25T11:51:04Z","snapshot_observed_at":"2026-08-18T19:58:03.175883Z","submitted_at":"2025-04-25T11:51:04Z","title":"Seeing Soundscapes: Audio-Visual Generation and Separation from Soundscapes Using Audio-Visual Separator","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T10:26:24.112013Z"},"links":{"citing_paper":"/paper/2504.18283"},"observation_digest":"sha256:b4b9f6f9b20560b38acff8e3211c3c053f225f56abb8a26b596a0851508965d4","observation_id":"691dfd59-e469-42e2-8b30-1470a63998f1","resolution":{"observed_at":"2026-08-16T10:26:24.689563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:26:24.670276Z","title":"Montesinos, Venkatesh S","venue":null,"work_id":"86249ad8-5147-46a9-82ab-709d70e66ed8","year":2022},"citing_paper":{"arxiv_id":"2504.18283","last_updated":"2025-04-25T11:51:04Z","snapshot_observed_at":"2026-08-18T19:58:03.175883Z","submitted_at":"2025-04-25T11:51:04Z","title":"Seeing Soundscapes: Audio-Visual Generation and Separation from Soundscapes Using Audio-Visual Separator","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T10:26:24.116113Z"},"links":{"citing_paper":"/paper/2504.18283"},"observation_digest":"sha256:8be12b96a26a1a14e34c63fd8b27a2caaedc61effc395385f0ed91b66194b4ac","observation_id":"629946b5-7bde-45d8-9362-ac6fa9096d91","resolution":{"observed_at":"2026-08-16T10:26:24.674700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:26:24.655400Z","title":"Narasimhan, S","venue":null,"work_id":"96868a30-5517-4577-8d0b-3b4fcb4d4f68","year":2022},"citing_paper":{"arxiv_id":"2504.18283","last_updated":"2025-04-25T11:51:04Z","snapshot_observed_at":"2026-08-18T19:58:03.175883Z","submitted_at":"2025-04-25T11:51:04Z","title":"Seeing Soundscapes: Audio-Visual Generation and Separation from Soundscapes Using Audio-Visual Separator","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T10:26:24.120180Z"},"links":{"citing_paper":"/paper/2504.18283"},"observation_digest":"sha256:a382f0e60389c0104934a6d5bbed1aee5633be5d8043aa36af74ff34e6eb2218","observation_id":"01920d7e-6c56-460a-9f81-ac9dfc6527c9","resolution":{"observed_at":"2026-08-16T10:26:24.660361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:26:24.639565Z","title":"Freeman, Michael Rubinstein, and Wojciech Ma- tusik","venue":null,"work_id":"563c538f-ccf2-40f8-afa1-d6f53923e039","year":2019},"citing_paper":{"arxiv_id":"2504.18283","last_updated":"2025-04-25T11:51:04Z","snapshot_observed_at":"2026-08-18T19:58:03.175883Z","submitted_at":"2025-04-25T11:51:04Z","title":"Seeing Soundscapes: Audio-Visual Generation and Separation from Soundscapes Using Audio-Visual Separator","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T10:26:24.124356Z"},"links":{"citing_paper":"/paper/2504.18283"},"observation_digest":"sha256:1e99caac6963631468e429348ae643c467620ecbdee3cf3540242a0ff5abfeaa","observation_id":"24ab208b-b48f-40fd-a270-23a41d528195","resolution":{"observed_at":"2026-08-16T10:26:24.644555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.02337","last_updated":"2022-09-13T17:45:36Z","snapshot_observed_at":"2026-08-16T16:41:20.006581Z","submitted_at":"2022-08-03T20:47:11Z","title":"Estimating Visual Information From Audio Through Manifold Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.02337","snapshot_observed_at":"2026-08-16T10:26:24.128495Z","title":"Estimat- ing visual information from audio through manifold learn- ing","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.18283","last_updated":"2025-04-25T11:51:04Z","snapshot_observed_at":"2026-08-18T19:58:03.175883Z","submitted_at":"2025-04-25T11:51:04Z","title":"Seeing Soundscapes: Audio-Visual Generation and Separation from Soundscapes Using Audio-Visual Separator","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T10:26:24.128495Z"},"links":{"cited_paper":"/paper/2208.02337","citing_paper":"/paper/2504.18283"},"observation_digest":"sha256:7e3e90f5068cc9bf656e55a123dce21d75d786d0583ef52106d10ffbf7eb80d8","observation_id":"ceaf72b0-092e-4615-bc96-85a5c3980730","resolution":{"observed_at":"2026-08-16T10:26:24.128495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:26:24.624826Z","title":"Image generation associ- ated with music data","venue":null,"work_id":"f49edf0d-f85a-4a38-8193-9bf633772ad9","year":2018},"citing_paper":{"arxiv_id":"2504.18283","last_updated":"2025-04-25T11:51:04Z","snapshot_observed_at":"2026-08-18T19:58:03.175883Z","submitted_at":"2025-04-25T11:51:04Z","title":"Seeing Soundscapes: Audio-Visual Generation and Separation from Soundscapes Using Audio-Visual Separator","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T10:26:24.132917Z"},"links":{"citing_paper":"/paper/2504.18283"},"observation_digest":"sha256:15c38469124c7bfea8e12f68aaf4e2ff7497f3ede07a4cc075b295f6c9dcf48f","observation_id":"c8083618-4ce6-4009-87ad-9a530cc9ade4","resolution":{"observed_at":"2026-08-16T10:26:24.629380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:26:24.609684Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"c3c15040-71a9-4692-a22f-f5a77c8194d1","year":2021},"citing_paper":{"arxiv_id":"2504.18283","last_updated":"2025-04-25T11:51:04Z","snapshot_observed_at":"2026-08-18T19:58:03.175883Z","submitted_at":"2025-04-25T11:51:04Z","title":"Seeing Soundscapes: Audio-Visual Generation and Separation from Soundscapes Using Audio-Visual Separator","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T10:26:24.137106Z"},"links":{"citing_paper":"/paper/2504.18283"},"observation_digest":"sha256:cc4a12b6d0412ed30de221dad6c6e5f8121e915604863d4159ac5ff6dabb5088","observation_id":"98805cc5-96a7-4ec5-9964-f6f8b130d6e6","resolution":{"observed_at":"2026-08-16T10:26:24.614543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:26:24.594360Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":"cb519aa2-b663-4a60-aa26-eaefa5bda28b","year":2021},"citing_paper":{"arxiv_id":"2504.18283","last_updated":"2025-04-25T11:51:04Z","snapshot_observed_at":"2026-08-18T19:58:03.175883Z","submitted_at":"2025-04-25T11:51:04Z","title":"Seeing Soundscapes: Audio-Visual Generation and Separation from Soundscapes Using Audio-Visual Separator","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T10:26:24.251543Z"},"links":{"citing_paper":"/paper/2504.18283"},"observation_digest":"sha256:6ab700efab73bbb141e40f4232e11785533eb5e6d880666913f8a10e43c997e2","observation_id":"75ee66d8-d39d-41f1-995a-1c01f36db187","resolution":{"observed_at":"2026-08-16T10:26:24.599224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-08-15T12:50:58.405488Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-16T10:26:24.256533Z","title":"Hierarchical text-conditional image gen- eration with clip latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.18283","last_updated":"2025-04-25T11:51:04Z","snapshot_observed_at":"2026-08-18T19:58:03.175883Z","submitted_at":"2025-04-25T11:51:04Z","title":"Seeing Soundscapes: Audio-Visual Generation and Separation from Soundscapes Using Audio-Visual Separator","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T10:26:24.256533Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2504.18283"},"observation_digest":"sha256:983fdfa43d6ec4ff9def9fb9c5af02528e68db5f891b291a868ee638738898e1","observation_id":"8f8008ff-f97a-4bf1-907f-c144b471fa5c","resolution":{"observed_at":"2026-08-16T10:26:24.256533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10752","last_updated":"2022-04-13T11:38:44Z","snapshot_observed_at":"2026-07-06T12:20:47.369918Z","submitted_at":"2021-12-20T18:55:25Z","title":"High-Resolution Image Synthesis with Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10752","snapshot_observed_at":"2026-08-16T10:26:24.260999Z","title":"High-resolution im- age synthesis with latent diffusion models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.18283","last_updated":"2025-04-25T11:51:04Z","snapshot_observed_at":"2026-08-18T19:58:03.175883Z","submitted_at":"2025-04-25T11:51:04Z","title":"Seeing Soundscapes: Audio-Visual Generation and Separation from Soundscapes Using Audio-Visual Separator","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T10:26:24.260999Z"},"links":{"cited_paper":"/paper/2112.10752","citing_paper":"/paper/2504.18283"},"observation_digest":"sha256:264a73fba81eb5021a08c47773c0e164c5d0f55facdbc6847702fee3dbd60faa","observation_id":"43966105-013a-4814-82a3-ef83866748a8","resolution":{"observed_at":"2026-08-16T10:26:24.260999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.03498","last_updated":"2016-06-10T22:53:35Z","snapshot_observed_at":"2026-08-17T15:12:27.095073Z","submitted_at":"2016-06-10T22:53:35Z","title":"Improved Techniques for Training GANs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.03498","snapshot_observed_at":"2026-08-16T10:26:24.265861Z","title":"Goodfellow, Wojciech Zaremba, Vicki Cheung, Alec Radford, and Xi Chen","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2504.18283","last_updated":"2025-04-25T11:51:04Z","snapshot_observed_at":"2026-08-18T19:58:03.175883Z","submitted_at":"2025-04-25T11:51:04Z","title":"Seeing Soundscapes: Audio-Visual Generation and Separation from Soundscapes Using Audio-Visual Separator","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T10:26:24.265861Z"},"links":{"cited_paper":"/paper/1606.03498","citing_paper":"/paper/2504.18283"},"observation_digest":"sha256:145287eb3769d4228ff0e5fbaefaf31ef137d6664d50d72d0fbde425a295d88f","observation_id":"d6229f17-8dfa-4d4a-bae8-4e695f96cc97","resolution":{"observed_at":"2026-08-16T10:26:24.265861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:26:24.579959Z","title":"S2i- bird: Sound-to-image generation of bird species using gen- erative adversarial networks","venue":null,"work_id":"aa49443f-7a19-4aa5-9d6d-478da701cca3","year":2021},"citing_paper":{"arxiv_id":"2504.18283","last_updated":"2025-04-25T11:51:04Z","snapshot_observed_at":"2026-08-18T19:58:03.175883Z","submitted_at":"2025-04-25T11:51:04Z","title":"Seeing Soundscapes: Audio-Visual Generation and Separation from Soundscapes Using Audio-Visual Separator","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T10:26:24.270255Z"},"links":{"citing_paper":"/paper/2504.18283"},"observation_digest":"sha256:f95f48108bbd2df217dcc6ebe18a8d47d0888f803b38e968b36ea2e97ddf2e4a","observation_id":"1d1b9d2a-96e2-4b1f-87f7-ae0bff6433e6","resolution":{"observed_at":"2026-08-16T10:26:24.584546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:26:24.274378Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2504.18283","last_updated":"2025-04-25T11:51:04Z","snapshot_observed_at":"2026-08-18T19:58:03.175883Z","submitted_at":"2025-04-25T11:51:04Z","title":"Seeing Soundscapes: Audio-Visual Generation and Separation from Soundscapes Using Audio-Visual Separator","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T10:26:24.274378Z"},"links":{"citing_paper":"/paper/2504.18283"},"observation_digest":"sha256:d8105d2feb9928a3fbf205ce270610bf8de22e33ff23e08714df6991d1f27ef3","observation_id":"721e6166-0b31-4e03-b74d-b690a91d6a42","resolution":{"observed_at":"2026-08-16T10:26:24.274378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:26:24.555360Z","title":"Denois- ing diffusion implicit models","venue":null,"work_id":"21902b03-f2d1-4a25-a177-cb8374f8a280","year":2021},"citing_paper":{"arxiv_id":"2504.18283","last_updated":"2025-04-25T11:51:04Z","snapshot_observed_at":"2026-08-18T19:58:03.175883Z","submitted_at":"2025-04-25T11:51:04Z","title":"Seeing Soundscapes: Audio-Visual Generation and Separation from Soundscapes Using Audio-Visual Separator","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T10:26:24.278811Z"},"links":{"citing_paper":"/paper/2504.18283"},"observation_digest":"sha256:d3b5047ef0a08d39ccedfdc09f535d4dba51bd02ce0997e4c68822d544d9bf93","observation_id":"cb969ff3-506b-48f2-bca1-e97d76c91eb0","resolution":{"observed_at":"2026-08-16T10:26:24.559804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:26:24.540215Z","title":"Rethinking the in- ception architecture for computer vision","venue":null,"work_id":"9b4261d5-a619-49ea-b5a3-d4961b900bda","year":2016},"citing_paper":{"arxiv_id":"2504.18283","last_updated":"2025-04-25T11:51:04Z","snapshot_observed_at":"2026-08-18T19:58:03.175883Z","submitted_at":"2025-04-25T11:51:04Z","title":"Seeing Soundscapes: Audio-Visual Generation and Separation from Soundscapes Using Audio-Visual Separator","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T10:26:24.283039Z"},"links":{"citing_paper":"/paper/2504.18283"},"observation_digest":"sha256:d6948b74e9f414fb79748b594194dbe260e991be93099739fa14614561f53af8","observation_id":"a765976c-a214-4e89-8566-8f8c0b1f04c0","resolution":{"observed_at":"2026-08-16T10:26:24.544778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:26:24.524610Z","title":null,"venue":null,"work_id":"df18deb9-2bcf-4330-a240-0a299958131e","year":2023},"citing_paper":{"arxiv_id":"2504.18283","last_updated":"2025-04-25T11:51:04Z","snapshot_observed_at":"2026-08-18T19:58:03.175883Z","submitted_at":"2025-04-25T11:51:04Z","title":"Seeing Soundscapes: Audio-Visual Generation and Separation from Soundscapes Using Audio-Visual Separator","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T10:26:24.287745Z"},"links":{"citing_paper":"/paper/2504.18283"},"observation_digest":"sha256:243d256f0bfafebb6eba006da526b8f1dc29de7584d252c6dc2717c6e2e777af","observation_id":"e53f6702-f575-4170-9ea1-d187a0e611ef","resolution":{"observed_at":"2026-08-16T10:26:24.529347Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:26:24.509204Z","title":null,"venue":null,"work_id":"18ade8a3-c382-4bd6-bf7a-5baec92bec62","year":2022},"citing_paper":{"arxiv_id":"2504.18283","last_updated":"2025-04-25T11:51:04Z","snapshot_observed_at":"2026-08-18T19:58:03.175883Z","submitted_at":"2025-04-25T11:51:04Z","title":"Seeing Soundscapes: Audio-Visual Generation and Separation from Soundscapes Using Audio-Visual Separator","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T10:26:24.291806Z"},"links":{"citing_paper":"/paper/2504.18283"},"observation_digest":"sha256:26e42c6001be91b43c44937b7605293af2bc421b2f0dc472bd74ceec8087d269","observation_id":"5b2f8800-ef3b-4af5-a372-4f24d16f9a76","resolution":{"observed_at":"2026-08-16T10:26:24.513614Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:26:24.494292Z","title":"To- wards audio to scene image synthesis using generative adver- sarial network","venue":null,"work_id":"c12f7f6a-d7f5-44fa-8a82-8b01f9a79942","year":2018},"citing_paper":{"arxiv_id":"2504.18283","last_updated":"2025-04-25T11:51:04Z","snapshot_observed_at":"2026-08-18T19:58:03.175883Z","submitted_at":"2025-04-25T11:51:04Z","title":"Seeing Soundscapes: Audio-Visual Generation and Separation from Soundscapes Using Audio-Visual Separator","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T10:26:24.296227Z"},"links":{"citing_paper":"/paper/2504.18283"},"observation_digest":"sha256:3e9a3b3c3d6c9e98e117b083267a0896e8c0abab4b64d4ab5de784ee9f67a9bd","observation_id":"d0577edc-5976-4d4b-8293-e948ebc01d82","resolution":{"observed_at":"2026-08-16T10:26:24.498791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14598","last_updated":"2024-05-24T15:21:13Z","snapshot_observed_at":"2026-08-19T12:08:14.633146Z","submitted_at":"2024-05-23T14:13:16Z","title":"Visual Echoes: A Simple Unified Transformer for Audio-Visual Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14598","snapshot_observed_at":"2026-08-16T10:26:24.300525Z","title":"Visual echoes: A simple unified transformer for audio-visual gener- ation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18283","last_updated":"2025-04-25T11:51:04Z","snapshot_observed_at":"2026-08-18T19:58:03.175883Z","submitted_at":"2025-04-25T11:51:04Z","title":"Seeing Soundscapes: Audio-Visual Generation and Separation from Soundscapes Using Audio-Visual Separator","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T10:26:24.300525Z"},"links":{"cited_paper":"/paper/2405.14598","citing_paper":"/paper/2504.18283"},"observation_digest":"sha256:d56b0a8934021121117b0a4d715b7e3cf1e876a4579e29080538214ab5851411","observation_id":"71079888-b18f-47bf-8731-e62b8bedf847","resolution":{"observed_at":"2026-08-16T10:26:24.300525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13050","last_updated":"2023-05-22T14:02:44Z","snapshot_observed_at":"2026-08-16T15:31:05.369222Z","submitted_at":"2023-05-22T14:02:44Z","title":"AudioToken: Adaptation of Text-Conditioned Diffusion Models for Audio-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13050","snapshot_observed_at":"2026-08-16T10:26:24.304992Z","title":"Audiotoken: Adaptation of text-conditioned dif- fusion models for audio-to-image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18283","last_updated":"2025-04-25T11:51:04Z","snapshot_observed_at":"2026-08-18T19:58:03.175883Z","submitted_at":"2025-04-25T11:51:04Z","title":"Seeing Soundscapes: Audio-Visual Generation and Separation from Soundscapes Using Audio-Visual Separator","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T10:26:24.304992Z"},"links":{"cited_paper":"/paper/2305.13050","citing_paper":"/paper/2504.18283"},"observation_digest":"sha256:814d1d17e998e3f3f6b79dcfbdcac9a4e7b9596aec0b9764e43645517095cf01","observation_id":"a3a3c73f-2ed8-4e4f-8fbe-21e653122f19","resolution":{"observed_at":"2026-08-16T10:26:24.304992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.18283","last_updated":"2025-04-25T11:51:04Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T19:58:03.175883Z","submitted_at":"2025-04-25T11:51:04Z","title":"Seeing Soundscapes: Audio-Visual Generation and Separation from Soundscapes Using Audio-Visual Separator"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":14,"verified_exact":1,"verified_fuzzy":25},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2504.18283."}