{"as_of":"2026-08-08T06:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c1e19443128eccd0917669b4116f6b0820177168feeee4dda0964f357040785f","coverage":[{"denominator":204,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T22:54:55.095895Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T06:40:47.064894Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10924","snapshot_observed_at":"2026-07-13T06:40:47.064894Z","title":"ASAudio: A survey of advanced spatial audio research.arXiv preprint arXiv:2508.10924, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08800","last_updated":"2026-07-09T03:10:16Z","snapshot_observed_at":"2026-08-07T21:35:03.515361Z","submitted_at":"2026-07-09T03:10:16Z","title":"Dual-BEATs: Unlocking Zero-Shot Stereo Audio Perception in Audio Large Language Models via Dithering","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-13T06:40:47.064894Z"},"links":{"cited_paper":"/paper/2508.10924","citing_paper":"/paper/2607.08800"},"observation_digest":"sha256:9370db8d0f889e3adbb135374813faea48952072740b9607434261b7250461e5","observation_id":"2365060b-cabb-408f-9874-a1a9419f67b2","resolution":{"observed_at":"2026-07-13T06:40:47.064894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.10924/citation-record","integrity":"/paper/2508.10924/integrity","json":"/paper/2508.10924/citation-record.json","paper":"/paper/2508.10924"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.793353Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.793353Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:29ee1d75c4d18440f25c034f4d8031f5ab55441486e9614ef29b3b0571b025c9","observation_id":"731e284f-3816-4fd8-aec3-d61535dab873","resolution":{"observed_at":"2026-08-05T22:54:54.793353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T22:54:54.797641Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.797641Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:0cdc06cd98550ebe8e586546cee075c4ee0594931f4657a11da754d5ba3e2fd4","observation_id":"c37d59a3-4f3f-43bc-8a83-6713e485f981","resolution":{"observed_at":"2026-08-05T22:54:54.797641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.801238Z","title":"Sound event localization and detection of overlapping sources using convolutional recurrent neural networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.801238Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:4fea00e04852d09cc91fc8ec730f0031f1e2b9edd963aa66b6231b16ed60d801","observation_id":"340eb3e8-23f2-45ea-95f7-dbde9726aafe","resolution":{"observed_at":"2026-08-05T22:54:54.801238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.804358Z","title":"Direction of arrival estimation for multiple sound sources using convolutional recurrent neural network","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.804358Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:e94faee66b6a437045fc3b14f4d8a4da60347c89350c3ed710797f6b871ecba1","observation_id":"8ea59419-5f37-43cb-980f-709993c18bfb","resolution":{"observed_at":"2026-08-05T22:54:54.804358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1212.6080","last_updated":"2012-12-25T19:58:02Z","snapshot_observed_at":"2026-07-06T03:02:48.441952Z","submitted_at":"2012-12-25T19:58:02Z","title":"Beamforming Techniques for Multichannel audio Signal Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.6080","snapshot_observed_at":"2026-08-05T22:54:54.807832Z","title":"Beamforming techniques for multichannel audio signal separation","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.807832Z"},"links":{"cited_paper":"/paper/1212.6080","citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:6123dfc9f5ae744105082ad6598c9033df75f8057845dd895ced014ebc741543","observation_id":"a75fd770-d9fc-46bd-862c-d4348b0cc616","resolution":{"observed_at":"2026-08-05T22:54:54.807832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.04121","last_updated":"2018-06-19T17:51:32Z","snapshot_observed_at":"2026-08-07T16:58:15.126876Z","submitted_at":"2018-04-11T17:57:28Z","title":"The Conversation: Deep Audio-Visual Speech Enhancement","version":2},"cited_work":{"arxiv_id":"1804.04121","doi":null,"metadata_source":"pith","pith_arxiv_id":"1804.04121","snapshot_observed_at":"2026-08-05T22:54:56.220834Z","title":"The Conversation: Deep Audio-Visual Speech Enhancement","venue":"cs.CV","work_id":"7c8d94c5-21eb-4190-97b0-2883c290ae07","year":2018},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.811265Z"},"links":{"cited_paper":"/paper/1804.04121","citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:3f5dbad99e44f5286d05ff2b3d0747406df107f3a8da5e1f613e7944752fedca","observation_id":"16eb41df-4e87-45c0-9236-50e632c31bd7","resolution":{"observed_at":"2026-08-05T22:54:56.224414Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15130","last_updated":"2024-08-16T01:35:52Z","snapshot_observed_at":"2026-08-07T16:58:19.111790Z","submitted_at":"2023-10-23T17:34:31Z","title":"Novel-View Acoustic Synthesis from 3D Reconstructed Rooms","version":2},"cited_work":{"arxiv_id":"2310.15130","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.15130","snapshot_observed_at":"2026-08-05T22:54:56.207162Z","title":"Novel-View Acoustic Synthesis from 3D Reconstructed Rooms","venue":"cs.SD","work_id":"a42a39a3-0f02-4fcc-8955-78b86ae499f5","year":2023},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.816024Z"},"links":{"cited_paper":"/paper/2310.15130","citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:b19e2fe11f4573a0e4bb6e9449cd00fb28ef53e5c6b1529f019588e3373b4026","observation_id":"6e9c2040-c385-4bde-a991-e75956c30cc7","resolution":{"observed_at":"2026-08-05T22:54:56.210521Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.819470Z","title":"L., and Rafaely, B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.819470Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:53c938bd36b79e973108226cc04bcb0d24fdfdc5c2b525f5381fc53d692c757d","observation_id":"503590a4-a52d-4fc6-86ad-1833692ec56f","resolution":{"observed_at":"2026-08-05T22:54:54.819470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11805","last_updated":"2020-10-22T15:37:39Z","snapshot_observed_at":"2026-08-06T01:16:35.352575Z","submitted_at":"2020-10-22T15:37:39Z","title":"Urban Sound Classification : striving towards a fair comparison","version":1},"cited_work":{"arxiv_id":"2010.11805","doi":null,"metadata_source":"pith","pith_arxiv_id":"2010.11805","snapshot_observed_at":"2026-08-05T22:54:56.193703Z","title":"Urban Sound Classification : striving towards a fair comparison","venue":"cs.SD","work_id":"7574efd2-8332-431b-83b1-704e88c78352","year":2020},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.822214Z"},"links":{"cited_paper":"/paper/2010.11805","citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:6a6a56413bc870696bebd72d44379622b191a8c4bfd5669a27e8168a2476311d","observation_id":"f672948b-8f99-4fff-b394-32060d677d80","resolution":{"observed_at":"2026-08-05T22:54:56.197240Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.825704Z","title":"and Schechner, Y","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.825704Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:dc5143b798328d376a4909e5a89742f760bf39c2ac639e5b7389757b5e7fdde4","observation_id":"fba30600-b84c-4b00-8e4e-b12569fd4524","resolution":{"observed_at":"2026-08-05T22:54:54.825704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.828469Z","title":"A french corpus for distant-microphone speech processing in real homes","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.828469Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:24410d6c448754899ebd5c36a90a2469a614eceafd0d377ba7042d17d3b68a43","observation_id":"74168355-3ee3-4ce2-99f0-14c552ebefa5","resolution":{"observed_at":"2026-08-05T22:54:54.828469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.831316Z","title":"J., Gannot, S., and Gerstoft, P","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.831316Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:dad4f4d2a0f5aa144086ba7fc2e08a30bd899da28b77942da2987e2b799f3a84","observation_id":"9cecdb60-f301-4a76-b848-e812dd51458d","resolution":{"observed_at":"2026-08-05T22:54:54.831316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.834203Z","title":"J., Gannot, S., Fernandez-Grande, E., and Gerstoft, P","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.834203Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:3eb4455acdb3df28e2ac0fecdaebb393c37481c6fb5ee0d30a5356dbcb2121e7","observation_id":"6e83aae9-48c0-4a0c-b705-d3e2eccadf9f","resolution":{"observed_at":"2026-08-05T22:54:54.834203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.836815Z","title":"On the authenticity of individual dynamic binaural synthesis","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.836815Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:6735026ff1df4a83991a614034f265f129ae1fe0e14334f62e19a8827205dc08","observation_id":"3d9086c3-2254-4c0d-8e18-6f093600f175","resolution":{"observed_at":"2026-08-05T22:54:54.836815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.839746Z","title":"The importance of spatial audio in modern games and virtual environments","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.839746Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:86521ae2b66f99c7e235940c54a39a24c1b85b4066ba9fe83983fe841f142fed","observation_id":"14f6d5a4-0146-4c95-af78-d0b5e76b36b6","resolution":{"observed_at":"2026-08-05T22:54:54.839746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.842581Z","title":"Secl-umons database for sound event classification and localization","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.842581Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:5e2c018692492a29da40118ff1198f437692ac413b94618b6a552325f84b46ed","observation_id":"34719950-d22d-4793-8b93-9940b822f4fa","resolution":{"observed_at":"2026-08-05T22:54:54.842581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.845207Z","title":null,"venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.845207Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:2bc16a97ec94c605e970299450ac7c50afaab20026e7d6d21ed143b0134d6239","observation_id":"d7bc0dba-818b-4a35-b4d9-d18ed56f54d7","resolution":{"observed_at":"2026-08-05T22:54:54.845207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.848014Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.848014Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:e3c926c52faf7fdad0484e8e4696c0ab7d6def5eb5779eb41a43bebff1cf5e00","observation_id":"6353eb45-da09-444c-9194-ed03cf0d6be9","resolution":{"observed_at":"2026-08-05T22:54:54.848014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.00268","last_updated":"2019-11-05T10:18:18Z","snapshot_observed_at":"2026-08-06T21:46:50.069705Z","submitted_at":"2019-05-01T11:27:28Z","title":"Polyphonic Sound Event Detection and Localization using a Two-Stage Strategy","version":4},"cited_work":{"arxiv_id":"1905.00268","doi":null,"metadata_source":"pith","pith_arxiv_id":"1905.00268","snapshot_observed_at":"2026-08-05T22:54:56.179792Z","title":"Polyphonic Sound Event Detection and Localization using a Two-Stage Strategy","venue":"cs.SD","work_id":"2a71225f-ce7f-4cb6-bc0c-0c3ae6f241ae","year":2019},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.850775Z"},"links":{"cited_paper":"/paper/1905.00268","citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:aec221035deb7585f2cb47ecb31127b3dbfa3fc0ab5c21df701c71899fb09faa","observation_id":"2337e80c-5b09-40bb-9229-159ad234d37a","resolution":{"observed_at":"2026-08-05T22:54:56.183619Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.853868Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.853868Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:5fcedbe993546ceea5416b06c5bdaffb8a60195a34cfb6dbf82f5783733045eb","observation_id":"600b03f5-af8c-48d7-a8da-80065568267a","resolution":{"observed_at":"2026-08-05T22:54:54.853868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1709.06158","last_updated":"2017-09-18T20:34:48Z","snapshot_observed_at":"2026-08-02T16:47:23.623541Z","submitted_at":"2017-09-18T20:34:48Z","title":"Matterport3D: Learning from RGB-D Data in Indoor Environments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1709.06158","snapshot_observed_at":"2026-08-05T22:54:54.856698Z","title":"Matterport3d: Learning from rgb-d data in indoor environments","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.856698Z"},"links":{"cited_paper":"/paper/1709.06158","citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:1760e530d42414ed03b0ede72efe9e7d038ccb615eb0df9a7fcdfe64f3a5d0c4","observation_id":"56b21862-6f20-466c-b175-e1402f70df2f","resolution":{"observed_at":"2026-08-05T22:54:54.856698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.859814Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.859814Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:fc2c9b07162d9f4633746196d75ce483cf762c8554e80e6f58cd34ae4675a16b","observation_id":"3d72f939-35e4-4ae5-ab1e-c8a29aa38e50","resolution":{"observed_at":"2026-08-05T22:54:54.859814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.862866Z","title":"Visual acoustic matching","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.862866Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:d8e09f02a388e734210fffcc46e8ffdcc99af93faa594c04c069568ec29c09db","observation_id":"77cc9042-d549-4a49-87a9-efb89b617895","resolution":{"observed_at":"2026-08-05T22:54:54.862866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.865668Z","title":"Spatial video streaming on apple vision pro xr headset","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.865668Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:f63300a41c1d524ff834cfa9b339c0f3878c0d00f432407e811fd9f1a93b5516","observation_id":"38617bef-70cb-4ed5-81d8-5b501e5a2805","resolution":{"observed_at":"2026-08-05T22:54:54.865668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.868506Z","title":"Vggsound: A large-scale audio-visual dataset","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.868506Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:ed045589a5eb704f67a6e50cebd83cb7f7723e9a3733843e264441c2815b9a4e","observation_id":"e791db6c-b705-4392-8156-c324976e55ea","resolution":{"observed_at":"2026-08-05T22:54:54.868506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.871219Z","title":"iquery: Instruments as queries for audio-visual sound separation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.871219Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:b144c82a914625e141f4bce63a5a269a328a29872a2be6b6b46ae6aa45b7dd23","observation_id":"46d358f5-1d7d-404a-8020-598a8536c3b2","resolution":{"observed_at":"2026-08-05T22:54:54.871219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.874420Z","title":"and Shlizerman, E","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.874420Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:fdb46ebd6a4c90d93f22a23e6ab12984aae826649d5fba367e31a1340487dc25","observation_id":"5788b6a5-5fa3-472c-a639-c97bacb8da2a","resolution":{"observed_at":"2026-08-05T22:54:54.874420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.08290","last_updated":"2023-09-15T10:11:37Z","snapshot_observed_at":"2026-07-06T16:18:53.161201Z","submitted_at":"2023-09-15T10:11:37Z","title":"Head-Related Transfer Function Interpolation with a Spherical CNN","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.08290","snapshot_observed_at":"2026-08-05T22:54:54.877936Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.877936Z"},"links":{"cited_paper":"/paper/2309.08290","citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:b76bc71f445a3b7342d558a216f5db184ed1529076c8739c282b672cfed4ec9e","observation_id":"9562a13c-5020-4c7a-9d63-ece96822c3d1","resolution":{"observed_at":"2026-08-05T22:54:54.877936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.881118Z","title":"D., Richardt, C., Kumar, A., Laney, W., Owens, A., and Richard, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.881118Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:6859ef2b4332270816d4ed186c82c7532a54c751221b9117f96b510f1d353224","observation_id":"629c6370-c830-4fbe-af80-b8fecc995c5c","resolution":{"observed_at":"2026-08-05T22:54:54.881118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21269","last_updated":"2024-10-28T17:58:15Z","snapshot_observed_at":"2026-08-06T19:51:56.068511Z","submitted_at":"2024-10-28T17:58:15Z","title":"OmniSep: Unified Omni-Modality Sound Separation with Query-Mixup","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21269","snapshot_observed_at":"2026-08-05T22:54:54.883876Z","title":"Omnisep: Unified omni-modality sound separation with query-mixup","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.883876Z"},"links":{"cited_paper":"/paper/2410.21269","citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:76930a7f5e16abee728219afda7943247fa5ffab4359dedcf57cf06ef4e7fe60","observation_id":"d29a328b-f890-42be-b96a-87c822fe79bc","resolution":{"observed_at":"2026-08-05T22:54:54.883876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.887065Z","title":"Multi-channel mosra: Mean opinion score and room acoustics estimation using simulated data and a teacher model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.887065Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:592f41bdc81432a9f04a63ea4dfa3fe01ffc5b4057a9a33e8dd598c1c22f2a06","observation_id":"df4d5e4e-08b4-4b6a-8a91-42b1e16109cc","resolution":{"observed_at":"2026-08-05T22:54:54.887065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.889863Z","title":"Simple and controllable music generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.889863Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:346572d3316e0b220303a701674d692345eb9bb7d4967085d4a59465d1672e56","observation_id":"32022a98-d3e3-434d-ad4e-9a200dad759a","resolution":{"observed_at":"2026-08-05T22:54:54.889863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06612","last_updated":"2025-07-07T17:42:19Z","snapshot_observed_at":"2026-07-06T18:28:24.821865Z","submitted_at":"2024-06-06T22:55:01Z","title":"SEE-2-SOUND: Zero-Shot Spatial Environment-to-Spatial Sound","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06612","snapshot_observed_at":"2026-08-05T22:54:54.892832Z","title":"See-2-sound: Zero-shot spatial environment-to-spatial sound","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.892832Z"},"links":{"cited_paper":"/paper/2406.06612","citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:2a1b752abe95894038347cc0cc98efef4da0e17fedd6aa307223ffe23481afa1","observation_id":"43423162-7edc-4601-817e-3132bcde3197","resolution":{"observed_at":"2026-08-05T22:54:54.892832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1612.01840","last_updated":"2017-09-05T18:38:33Z","snapshot_observed_at":"2026-07-06T05:21:33.309016Z","submitted_at":"2016-12-06T14:58:59Z","title":"FMA: A Dataset For Music Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.01840","snapshot_observed_at":"2026-08-05T22:54:54.895720Z","title":"Fma: A dataset for music analysis","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.895720Z"},"links":{"cited_paper":"/paper/1612.01840","citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:1d74f8df6048d9e28c0c380f047b4f9cf599ae101e98c9d8b52e104183ff6d3f","observation_id":"b3f266ff-b6c0-487d-94c1-046df61f1605","resolution":{"observed_at":"2026-08-05T22:54:54.895720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.01174","last_updated":"2019-09-03T13:41:56Z","snapshot_observed_at":"2026-08-06T05:36:51.264415Z","submitted_at":"2019-09-03T13:41:56Z","title":"Demucs: Deep Extractor for Music Sources with extra unlabeled data remixed","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.01174","snapshot_observed_at":"2026-08-05T22:54:54.898960Z","title":"Demucs: Deep extractor for music sources with extra unlabeled data remixed","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.898960Z"},"links":{"cited_paper":"/paper/1909.01174","citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:2e266a564922bb02bb4a840c38ca96ed6d482a7966d4adf019012d4c8714f74e","observation_id":"8bca52d8-ec09-4372-add7-bca760b11d05","resolution":{"observed_at":"2026-08-05T22:54:54.898960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.902001Z","title":"and Horaud, R","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.902001Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:ffa11eb5d2dadd8b0aa707d498136d6d45af8d7fcecaa7a19fa8ddb70fe7ae3e","observation_id":"49fa6d91-7233-46a1-a132-74b32d7de4a1","resolution":{"observed_at":"2026-08-05T22:54:54.902001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.904887Z","title":"Learning spatially-aware language and audio embeddings","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.904887Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:b3fd2f774f58ddf719f956c996a92b783123c7a25488f9d0321abab5259428a4","observation_id":"77645958-9417-40a4-b455-84e576bba4ee","resolution":{"observed_at":"2026-08-05T22:54:54.904887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.13168","last_updated":"2021-04-27T13:23:56Z","snapshot_observed_at":"2026-07-06T11:04:03.972420Z","submitted_at":"2021-04-27T13:23:56Z","title":"dEchorate: a Calibrated Room Impulse Response Database for Echo-aware Signal Processing","version":1},"cited_work":{"arxiv_id":"2104.13168","doi":null,"metadata_source":"pith","pith_arxiv_id":"2104.13168","snapshot_observed_at":"2026-08-05T22:54:56.106146Z","title":"dEchorate: a Calibrated Room Impulse Response Database for Echo-aware Signal Processing","venue":"eess.AS","work_id":"7d35a178-65bb-4a97-9686-d955ae72d443","year":2021},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.907979Z"},"links":{"cited_paper":"/paper/2104.13168","citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:6659b9a9796bf920f069acdc0d64fbc632583b9e63cbba3f8ca0084e5aefc749","observation_id":"9da60d12-15f9-4f58-8183-aab58c8866df","resolution":{"observed_at":"2026-08-05T22:54:56.109782Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.04174","last_updated":"2021-10-18T22:37:53Z","snapshot_observed_at":"2026-07-06T11:27:31.181558Z","submitted_at":"2021-07-09T02:00:47Z","title":"EasyCom: An Augmented Reality Dataset to Support Algorithms for Easy Communication in Noisy Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.04174","snapshot_observed_at":"2026-08-05T22:54:54.911389Z","title":"K., and Mehra, R","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.911389Z"},"links":{"cited_paper":"/paper/2107.04174","citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:014717cfb423ee682b829a161923672ecbec6be7bc5f3e52eb28d22f08cb9bc7","observation_id":"e31c0ead-cff0-40ac-a556-dc630a2b20f1","resolution":{"observed_at":"2026-08-05T22:54:54.911389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.03619","last_updated":"2018-08-09T21:22:37Z","snapshot_observed_at":"2026-08-06T20:20:05.725909Z","submitted_at":"2018-04-10T16:28:59Z","title":"Looking to Listen at the Cocktail Party: A Speaker-Independent Audio-Visual Model for Speech Separation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.03619","snapshot_observed_at":"2026-08-05T22:54:54.914412Z","title":"T., and Rubinstein, M","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.914412Z"},"links":{"cited_paper":"/paper/1804.03619","citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:605144fb59f104d2b237c561be9d59e5a2634f464fab1b184c3500fa73853fc1","observation_id":"20105ac9-44ba-429a-b3c3-fdda802ecad4","resolution":{"observed_at":"2026-08-05T22:54:54.914412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.917463Z","title":"H., and Pons, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.917463Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:ae99fd1bd4a36de58257e0b923a8c081baae3dc2681cb41a8120f7fd37c8598b","observation_id":"c393cec3-2df4-40a1-8e47-42d0a2f39ecc","resolution":{"observed_at":"2026-08-05T22:54:54.917463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10301","last_updated":"2024-07-29T14:52:26Z","snapshot_observed_at":"2026-08-03T15:02:48.172783Z","submitted_at":"2024-04-16T06:09:33Z","title":"Long-form music generation with latent diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10301","snapshot_observed_at":"2026-08-05T22:54:54.920307Z","title":"D., Carr, C., Zukowski, Z., Taylor, J., and Pons, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.920307Z"},"links":{"cited_paper":"/paper/2404.10301","citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:e46685a3ad70089c1ead8f93d89f132d5ab1a1b251c877454ae99eb5835da3e8","observation_id":"10d9b764-8e6b-474f-819d-61db03b33a6b","resolution":{"observed_at":"2026-08-05T22:54:54.920307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.923178Z","title":"W., Darrell, T., Freeman, W., and Viola, P","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.923178Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:d4c84292c48d17d03dc007e61a290fa68d4dfc61f975737ceebfdbae5b4f87db","observation_id":"7932d811-4334-4a9d-8659-7e499591e74a","resolution":{"observed_at":"2026-08-05T22:54:54.923178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.925901Z","title":"Fsd50k: an open dataset of human-labeled sound events","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.925901Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:3137bc74b8dc6cb09a5b6db8fd8a70381b3950f7669f7f0eb8517f77cdb04547","observation_id":"e0849334-236f-4f13-8323-54df1c8fc1e1","resolution":{"observed_at":"2026-08-05T22:54:54.925901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.928853Z","title":"Freesound technical demo","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.928853Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:91c768ff3bc27b5a252c146a98c64e290de07609b77d1348b2c394a20878af50","observation_id":"e859816c-dd02-4493-88e6-4784d37fcc00","resolution":{"observed_at":"2026-08-05T22:54:54.928853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.931560Z","title":"and Scholz, M","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.931560Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:1afac70021e1a0c985c28065d969ac1af433d478e6e0e8150c3959dcabc2f1e9","observation_id":"c3fe9074-3f0b-4a71-bf55-b7150f12f571","resolution":{"observed_at":"2026-08-05T22:54:54.931560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.934717Z","title":"Self-supervised moving vehicle tracking with stereo sound","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.934717Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:29e2528da9cea48e3f772351a019d44f23df1b91d82d6f5cb526a26bfd1c4284","observation_id":"a275fc92-a570-46d7-a3d4-9b55155f4426","resolution":{"observed_at":"2026-08-05T22:54:54.934717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.937548Z","title":"and Grauman, K","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.937548Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:081a611df184d3d59a6fdef406d0671b021e5b7d731f448554af81ffda20f9b0","observation_id":"27dfe371-7ca3-4ae7-8d04-d0c4ac404420","resolution":{"observed_at":"2026-08-05T22:54:54.937548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.940293Z","title":"and Grauman, K","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.940293Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:9440fc859b2ee34f9f62dfeec4d235f2996f4e2747ce8c5e4053f491e2d1f40d","observation_id":"5466e4df-a1df-49e1-92e0-f212084f0058","resolution":{"observed_at":"2026-08-05T22:54:54.940293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.943091Z","title":"Learning to separate object sounds by watching unlabeled video","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.943091Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:1fb1058480921d003196631c252b85a3a3d7cd3f376ba5e0cdfbfb7697fa5ca5","observation_id":"688157ef-ea60-4427-b873-93bb85cacdb4","resolution":{"observed_at":"2026-08-05T22:54:54.943091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.946099Z","title":"A., Politis, A., Mesaros, A., Guti \\'e rrez-Arriola, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.946099Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:0bdddf76b413e5bc0270265aad039b61d28918d6ae39c8f8fb305d3cbeb1ba08","observation_id":"cfd8d176-1c5d-42b0-9cb2-be6ce818207f","resolution":{"observed_at":"2026-08-05T22:54:54.946099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.10882","last_updated":"2021-11-21T19:26:45Z","snapshot_observed_at":"2026-07-06T12:10:39.369364Z","submitted_at":"2021-11-21T19:26:45Z","title":"Geometry-Aware Multi-Task Learning for Binaural Audio Generation from Video","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.10882","snapshot_observed_at":"2026-08-05T22:54:54.949182Z","title":"Geometry-aware multi-task learning for binaural audio generation from video","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.949182Z"},"links":{"cited_paper":"/paper/2111.10882","citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:bd692a7317e46c651ab7fe5b081ca6c5a73148ad1b59333d1e6fad34310ce60b","observation_id":"2fe10395-c8fa-48a4-bef9-979cd38fef6f","resolution":{"observed_at":"2026-08-05T22:54:54.949182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.952499Z","title":"Visually-guided audio spatialization in video with geometry-aware multi-task learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.952499Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:4c8739d44f0ff9a4eeb1f854b9e752f79636c945d5b6e576f55e566778fb3b31","observation_id":"3dab6090-36b0-47b1-89cf-9b834063ccee","resolution":{"observed_at":"2026-08-05T22:54:54.952499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.09930","last_updated":"2020-10-19T23:55:48Z","snapshot_observed_at":"2026-08-06T05:20:01.786244Z","submitted_at":"2020-10-19T23:55:48Z","title":"BIRD: Big Impulse Response Dataset","version":1},"cited_work":{"arxiv_id":"2010.09930","doi":null,"metadata_source":"pith","pith_arxiv_id":"2010.09930","snapshot_observed_at":"2026-08-05T22:54:56.055137Z","title":"BIRD: Big Impulse Response Dataset","venue":"cs.SD","work_id":"6733641d-9923-4b6d-902c-07ab58ef1031","year":2020},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.955452Z"},"links":{"cited_paper":"/paper/2010.09930","citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:397bf4db61430ea341a3b8b6c8fe56b50f6eb50df5907e7e5608d0dcca90c94d","observation_id":"0e13cbb2-0284-4d59-9eb2-6175738099b0","resolution":{"observed_at":"2026-08-05T22:54:56.058387Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2003.06183","last_updated":"2020-03-13T10:13:17Z","snapshot_observed_at":"2026-07-06T09:04:29.300484Z","submitted_at":"2020-03-13T10:13:17Z","title":"HRTF Individualization: A Survey","version":1},"cited_work":{"arxiv_id":"2003.06183","doi":null,"metadata_source":"pith","pith_arxiv_id":"2003.06183","snapshot_observed_at":"2026-08-05T22:54:56.041622Z","title":"HRTF Individualization: A Survey","venue":"eess.AS","work_id":"8fde6dc9-08ac-4008-9cda-c56b01866985","year":2020},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.958933Z"},"links":{"cited_paper":"/paper/2003.06183","citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:38d11ee2bce490ff0680cb469b9afa52f17ee4a5f41189c15345a295ec5322ec","observation_id":"61daa74d-2386-4f01-98be-6ad4cca791f3","resolution":{"observed_at":"2026-08-05T22:54:56.044789Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.962053Z","title":"Psychoacoustic cues in room size perception","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.962053Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:79405badce45b42777a9c3c8d8029c618ec5b0679d14be1e32867a326a8539e2","observation_id":"72daa11b-eb06-492e-9d7b-0018cfa961ab","resolution":{"observed_at":"2026-08-05T22:54:54.962053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.965008Z","title":"Real-time binaural speech separation with preserved spatial cues","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.965008Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:991e3f71e9472a4b506dafacde8a2adc86a94609e949ba25b5cfbcc3e7b801da","observation_id":"7f9a587f-a8c3-45b3-b09f-982d2bd21609","resolution":{"observed_at":"2026-08-05T22:54:54.965008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.968292Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.968292Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:8fc3b51dd8f62d4dfffffbc68eab145a3e13a97f3c7c3b1e3ddd8a1fc68e3184","observation_id":"60a6290a-0572-421a-91f5-947baba5eddc","resolution":{"observed_at":"2026-08-05T22:54:54.968292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.971352Z","title":"Immersediffusion: A generative spatial audio latent diffusion model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.971352Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:e586f9cbd4641e0360324f89f24265ee49d05026a9ec8209efa5138d4745c437","observation_id":"a4d8dd83-f6f1-4bf2-abad-d7f2a4c060e4","resolution":{"observed_at":"2026-08-05T22:54:54.971352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.974390Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.974390Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:a905d4c70fb663414e5adae2f8e0a98d7f2e593076b2258a55f29097b22de607","observation_id":"fb9706a8-376e-48d9-8c19-67d76d3cb96b","resolution":{"observed_at":"2026-08-05T22:54:54.974390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.977600Z","title":"Classification of spatial audio location and content using convolutional neural networks","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.977600Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:94ad2572bdd9f4f1dcaf3f343ce61ca658a26bfcc2f318e37daff97824fa82d0","observation_id":"ffa78cb2-0b89-405d-a861-17af6c979ff5","resolution":{"observed_at":"2026-08-05T22:54:54.977600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.981235Z","title":"O., Jenkins, M., Liu, H., Squires, I., Cooper, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.981235Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:1368c25d6a7248969aca074c6f6310f57c310d8c4fba5e4b3baf7c5b9758d2ce","observation_id":"250e1681-c5f8-4ff6-82d9-dfa29224e2ab","resolution":{"observed_at":"2026-08-05T22:54:54.981235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.03697","last_updated":"2022-07-08T05:18:36Z","snapshot_observed_at":"2026-08-03T13:17:45.865593Z","submitted_at":"2022-07-08T05:18:36Z","title":"End-to-End Binaural Speech Synthesis","version":1},"cited_work":{"arxiv_id":"2207.03697","doi":null,"metadata_source":"pith","pith_arxiv_id":"2207.03697","snapshot_observed_at":"2026-08-05T22:54:56.027536Z","title":"End-to-End Binaural Speech Synthesis","venue":"cs.SD","work_id":"83267ddb-ce65-4c01-a3d8-f7cef132d2a8","year":2022},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.984907Z"},"links":{"cited_paper":"/paper/2207.03697","citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:b970ac3045322df09ea8df394492e99c15a15b6c7c4985b158c28c428d5f6156","observation_id":"1207cd67-93de-4441-9ef9-7d2254b59af6","resolution":{"observed_at":"2026-08-05T22:54:56.031062Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.988237Z","title":"A time-domain unsupervised learning based sound source localization method","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.988237Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:3cb9fce4bab660a4c2cd517c6d12507ebc78ace46837efc69cd539aa290e5295","observation_id":"f5c384b2-1df8-44d3-b05c-39c17ff0ed22","resolution":{"observed_at":"2026-08-05T22:54:54.988237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.991312Z","title":"acoustics—measurement of room acoustic parameters—part 1: Performance spaces,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.991312Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:e8b7a3eac0ef053cebd2d1b5d765e0e92158311e0e95f034ab3877666fcdd8db","observation_id":"1274e5d7-b8ef-4408-8e0a-64bc761fe551","resolution":{"observed_at":"2026-08-05T22:54:54.991312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.994626Z","title":"Head-related transfer function interpolation from spatially sparse measurements using autoencoder with source position conditioning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.994626Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:56b81b7d900329a55337588d1b3758db734784767663262e10351ecb066ceca3","observation_id":"1ec8f2e3-7336-4166-a138-142eeb1b8f06","resolution":{"observed_at":"2026-08-05T22:54:54.994626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.998068Z","title":"A binaural room impulse response database for the evaluation of dereverberation algorithms","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.998068Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:6c5b59f79c205c34781a32c8f8b5dd44a2f48b05b1ad3c62b668d85f40ea13d3","observation_id":"6ba53848-e3ed-4936-9e9f-74ff5b55ddf0","resolution":{"observed_at":"2026-08-05T22:54:54.998068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:55.001090Z","title":"Exploring audio-visual information fusion for sound event localization and detection in low-resource realistic scenarios","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.001090Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:fbcc1702144e6cde45e40053597cef78b051f59e623b71e90ae27a3ffe4ba1df","observation_id":"79c38e96-55c7-4351-b639-c9b6ed176abe","resolution":{"observed_at":"2026-08-05T22:54:55.001090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:55.004235Z","title":"Modeling individual head-related transfer functions from sparse measurements using a convolutional neural network","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.004235Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:d37259b599d67ed6c3e4b954336b0ad52a5af6438126ca9f494001cc883cbc1d","observation_id":"e51b317b-342b-46d5-a040-39a3465fa9d1","resolution":{"observed_at":"2026-08-05T22:54:55.004235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:55.007271Z","title":"L., Gan, W.-S., et al","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.007271Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:34c6219f1fd8d20053dfb7e5e15eb09a5f11fa78888fe6e9ee038b591837bbdf","observation_id":"86947315-bf7e-48e0-af3e-c5abb8724de0","resolution":{"observed_at":"2026-08-05T22:54:55.007271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:55.010388Z","title":"J., and Hilton, A","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.010388Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:529762fdb9e0e0db9c2f3d0703ae73b04d2680f367dfbfc1a1cc7c507e7ac4dd","observation_id":"ae989b1c-8fec-413f-9841-15374fc6a1d1","resolution":{"observed_at":"2026-08-05T22:54:55.010388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:55.013230Z","title":"Visage: Video-to-spatial audio generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.013230Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:57632da8faf9acb0394a760fe4409d0a4930ce2ceb0a68a17ec049c85a478df2","observation_id":"54c44478-db7e-4ea6-9fc3-507bf19bf5b4","resolution":{"observed_at":"2026-08-05T22:54:55.013230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:55.016162Z","title":"S., Park, H","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.016162Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:141a07bd2b3d8c7310eb010e4dfa1caff38132c04d371279fc517795f2438d5f","observation_id":"a75b32f1-9104-4064-a9d4-ab10d09e4d46","resolution":{"observed_at":"2026-08-05T22:54:55.016162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-05T22:54:55.019077Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.019077Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:f42ba2f795229c9bec7e95ed303b337f8b915d32963adfa51e30cd8ca7020f51","observation_id":"4a2f5d9c-726d-4bac-b2a9-808ea9070e1a","resolution":{"observed_at":"2026-08-05T22:54:55.019077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:55.022111Z","title":"Habets, E","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.022111Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:584631f38ecbc1c340d018abd855af467bff31f792ed8833021031f16b419d08","observation_id":"e34966ca-65af-4b46-b77e-c0d96b0089ca","resolution":{"observed_at":"2026-08-05T22:54:55.022111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:55.025159Z","title":"Panoptic segmentation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.025159Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:23a2b91291fb98db2541d4671f6bda9d51c8199c45b464b3f78be3bcd9c48641","observation_id":"6812aa59-dba9-4b9d-bfec-f75a9ce2ee45","resolution":{"observed_at":"2026-08-05T22:54:55.025159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.05069","last_updated":"2022-03-29T12:25:02Z","snapshot_observed_at":"2026-08-04T12:25:56.734801Z","submitted_at":"2021-10-11T08:07:50Z","title":"Efficient Training of Audio Transformers with Patchout","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.05069","snapshot_observed_at":"2026-08-05T22:54:55.028080Z","title":"Efficient training of audio transformers with patchout","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.028080Z"},"links":{"cited_paper":"/paper/2110.05069","citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:3dc75b9fc575e410cb6c673cd3bb6704b06a803b950680381f6635b9458afb0f","observation_id":"cc184448-28f0-4ecf-8a6c-d0a68be61084","resolution":{"observed_at":"2026-08-05T22:54:55.028080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:55.031180Z","title":"Meshrir: A dataset of room impulse responses on meshed grid points for evaluating sound field analysis and synthesis methods","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.031180Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:9c3ed23f299cc2eba445af322882f7f9e43e1816c7c73afa3de8962c41100d92","observation_id":"1769fbe0-ece4-4d95-88ee-0145adff4b9b","resolution":{"observed_at":"2026-08-05T22:54:55.031180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:55.034380Z","title":"A., Garc \\' a-Barrios, G., Politis, A., and Mesaros, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.034380Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:9072673f5a4ea6b49c9c95daac69b795befafb2dffe7027eb3364c8fd1647a24","observation_id":"cd9a41a5-0736-4110-bbdb-39961f659fdd","resolution":{"observed_at":"2026-08-05T22:54:55.034380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-07T16:54:38.689558Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-05T22:54:55.037230Z","title":"Audiogen: Textually guided audio generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.037230Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:fb580ad55b70f62007e6e7e4dc8d1e17231ca9e580c358ae90b6a89739eed77f","observation_id":"1d21322c-37df-411b-af3b-985273ffd8b9","resolution":{"observed_at":"2026-08-05T22:54:55.037230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.03927","last_updated":"2024-08-07T13:15:55Z","snapshot_observed_at":"2026-07-06T13:29:16.348440Z","submitted_at":"2022-07-08T14:27:52Z","title":"BAST: Binaural Audio Spectrogram Transformer for Binaural Sound Localization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.03927","snapshot_observed_at":"2026-08-05T22:54:55.040419Z","title":"Bast: Binaural audio spectrogram transformer for binaural sound localization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.040419Z"},"links":{"cited_paper":"/paper/2207.03927","citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:7d861e286fe54e6d8efabf7209e6816278e113141e8123996988168166c159ed","observation_id":"4a00a202-2e8c-4f76-b74c-c5e814bd9444","resolution":{"observed_at":"2026-08-05T22:54:55.040419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:55.043431Z","title":"S., Ma, J., Thomas, M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.043431Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:e705b7990aa02ee303d417f02d02e6e5dd97c25fae1622124e81d8840846fb07","observation_id":"96b82b60-e6ab-45ab-9d37-12215cc7a89c","resolution":{"observed_at":"2026-08-05T22:54:55.043431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:55.046198Z","title":"Sound event detection in synthetic audio: Analysis of the dcase 2016 task results","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.046198Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:20e71f7b7e66c77414ac69adb39a4ae08ebd90f8c5097fc9fbc7587d163237a2","observation_id":"19fd9aba-14fd-4d20-a6ed-3748e5406111","resolution":{"observed_at":"2026-08-05T22:54:55.046198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:55.049057Z","title":"Gradient-based learning applied to document recognition","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.049057Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:89c8da0b2ee4c7afb2bf7755cf91e6529af0b18ab3e773c86b9a5e2970136c9f","observation_id":"306ec36a-0fbb-445c-8edf-768f71412a5e","resolution":{"observed_at":"2026-08-05T22:54:55.049057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2022.0068","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:55.972211Z","title":"Context-based evaluation of the opus audio codec for spatial audio content in virtual reality","venue":null,"work_id":"999010e3-ec80-4d70-9078-e8ec746d978e","year":2023},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.051868Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:075ad5b47cc265b9ed942a49443c0b16eba1d4ee9d9133a8fe321ef0b71e2d42","observation_id":"9dc13d30-c6c4-4c5d-9856-118138bb88f7","resolution":{"observed_at":"2026-08-05T22:54:55.977882Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:55.054653Z","title":"Looking into your speech: Learning cross-modal affinity for audio-visual speech separation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.054653Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:9014437befe611166c52f09dea1f38034f5a36fd8cfef2ad7b0dd7c579920239","observation_id":"bfb6da14-fbdc-444e-8fd0-5593aecc91bb","resolution":{"observed_at":"2026-08-05T22:54:55.054653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:55.058011Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.058011Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:e25c6bf03bf45c09e20237bc5b21b4f6d2e576edf33f2ede1cb1b1ef9f3f5f61","observation_id":"80bcd70b-4243-48a9-8839-a074a78da518","resolution":{"observed_at":"2026-08-05T22:54:55.058011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:55.061066Z","title":"W., Lee, S., and Lee, K","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.061066Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:966aaa39591d77464977c262c63455a8cd1bbb2d1bcbf43a137177ba055792cc","observation_id":"d164dad8-c895-47bb-b4c6-f2d0ad17c29e","resolution":{"observed_at":"2026-08-05T22:54:55.061066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:55.064197Z","title":"Binauralgrad: A two-stage conditional diffusion probabilistic model for binaural audio synthesis","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.064197Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:8e1d48df8672a8e7602570f643ad413cf871559b8b8470d8ca7c6728bd5b3c83","observation_id":"26439711-d4df-459d-93c9-3d30f1ea68bc","resolution":{"observed_at":"2026-08-05T22:54:55.064197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:55.067111Z","title":"See and listen: Score-informed association of sound tracks to players in chamber music performance videos","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.067111Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:764e1c01dcc2b0a11b465446e2422c99f8cf45cb8dc5b5e4e1f558deab0e6285","observation_id":"c5011edc-b491-4fde-b9b3-0b02d6ca331e","resolution":{"observed_at":"2026-08-05T22:54:55.067111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01481","last_updated":"2025-03-06T04:11:26Z","snapshot_observed_at":"2026-07-06T19:25:56.114976Z","submitted_at":"2024-10-02T12:33:59Z","title":"SonicSim: A customizable simulation platform for speech processing in moving sound source scenarios","version":2},"cited_work":{"arxiv_id":"2410.01481","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.01481","snapshot_observed_at":"2026-08-05T22:54:55.894099Z","title":"SonicSim: A customizable simulation platform for speech processing in moving sound source scenarios","venue":"cs.SD","work_id":"d7d7e481-e8e9-45a1-973e-423ab10c1d4a","year":2024},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.070127Z"},"links":{"cited_paper":"/paper/2410.01481","citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:4b13425ac5b2c801e6f6263ee52c54b2b9ee9bdd003f36c8aedd2ca1a3a79425","observation_id":"5232f87d-f1cb-492a-bb37-a4163ad85988","resolution":{"observed_at":"2026-08-05T22:54:55.898028Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:55.073261Z","title":"Binaural audio generation via multi-task learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.073261Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:36534730a90eb55e8ff6836c86e500b614ab6a21aff3aa7105b84dd9e42fcdc7","observation_id":"5af43f6d-bf53-4e8a-bb87-ac2c6ba98131","resolution":{"observed_at":"2026-08-05T22:54:55.073261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:55.075990Z","title":"Binauralmusic: A diverse dataset for improving cross-modal binaural audio generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.075990Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:44451326bd24b36b3c81f8ec254add9348cae43ecf22df6b0bbabaae65a59b05","observation_id":"1aeaa763-2c5c-4602-b798-309913bb6973","resolution":{"observed_at":"2026-08-05T22:54:55.075990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:55.078726Z","title":"Cross-modal generative model for visual-guided binaural stereo generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.078726Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:8a52ff8680ed0330a3497b29785773461843b6db0503ba5f63c5b3d16752ba36","observation_id":"cb3a37cc-203b-4ae0-87e9-9fedb651b1ed","resolution":{"observed_at":"2026-08-05T22:54:55.078726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:55.081760Z","title":"Av-nerf: Learning neural fields for real-world audio-visual scene synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.081760Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:740b355119245a17e1ae627355dc26fcfbf019be108b73d1379d58a40bd3ef54","observation_id":"33d47c11-458c-463f-bfeb-910acc271e4e","resolution":{"observed_at":"2026-08-05T22:54:55.081760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:55.084649Z","title":"and Nam, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.084649Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:71591c084bdc593e7f52ab4354c52be3b99cb5af2443186af9c5fb8e9845f6c6","observation_id":"29e8cc89-22c5-4582-ba7e-d2bf8e496aad","resolution":{"observed_at":"2026-08-05T22:54:55.084649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:55.087332Z","title":"T., Ben-Hamu, H., Nickel, M., and Le, M","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.087332Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:25c0c1c891bc5575aed12f8d361ae680c9305426938d67627d44eb2a477d38ee","observation_id":"26b3dba4-491e-4ede-ba27-91be7ecda36d","resolution":{"observed_at":"2026-08-05T22:54:55.087332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-05T22:54:55.090118Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.090118Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:f167fe635b0dc15a235fe54e48348ff937150e7077f78c3f7e26add957e0f1dc","observation_id":"986d2272-7240-4034-913a-4c095f3bd0ca","resolution":{"observed_at":"2026-08-05T22:54:55.090118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14906","last_updated":"2025-06-03T03:27:47Z","snapshot_observed_at":"2026-08-07T16:00:40.489931Z","submitted_at":"2025-04-21T07:21:28Z","title":"OmniAudio: Generating Spatial Audio from 360-Degree Video","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14906","snapshot_observed_at":"2026-08-05T22:54:55.093055Z","title":"Omniaudio: Generating spatial audio from 360-degree video","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.093055Z"},"links":{"cited_paper":"/paper/2504.14906","citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:38114055b3fc2860edadd094c555c470297a91645875e68743b32e3e464044b5","observation_id":"35a49eb7-ace0-4491-98cd-092299126a7f","resolution":{"observed_at":"2026-08-05T22:54:55.093055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07000","last_updated":"2023-06-01T07:35:11Z","snapshot_observed_at":"2026-07-06T14:30:20.088413Z","submitted_at":"2022-12-14T03:18:21Z","title":"DopplerBAS: Binaural Audio Synthesis Addressing Doppler Effect","version":3},"cited_work":{"arxiv_id":"2212.07000","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.07000","snapshot_observed_at":"2026-08-05T22:54:55.863096Z","title":"DopplerBAS: Binaural Audio Synthesis Addressing Doppler Effect","venue":"eess.AS","work_id":"9d86c765-af71-453a-9773-0c631417bb66","year":2022},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.095895Z"},"links":{"cited_paper":"/paper/2212.07000","citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:a2d732bc18e1e775d5435ec68adea61cb4819299a31d4a9264af09cdb735fb19","observation_id":"0c60096d-7bf2-4fa9-b69b-f9cfbbb40632","resolution":{"observed_at":"2026-08-05T22:54:55.866351Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","latest_version":2,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":89,"verified_exact":9,"verified_fuzzy":0},"total_outbound_references":204},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 100 of 204 outbound references and 1 inbound Pith citation observation for arXiv:2508.10924."}