{"as_of":"2026-08-13T03:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7ac34019a0ebfab63c834e6f66d8ca2dd950639e4831d8e2b143b2f9b6638067","coverage":[{"denominator":202,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T14:04:00.598549Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.00049/citation-record","integrity":"/paper/2412.00049/integrity","json":"/paper/2412.00049/citation-record.json","paper":"/paper/2412.00049"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:00.182522Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.182522Z"},"links":{"citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:7d5d87a0acae7a3ffd2c4b67b171d10a50817af98439da0deb1845019ee7eb7a","observation_id":"d118fdb5-c20a-4fcb-bbc9-bedd23a5a84b","resolution":{"observed_at":"2026-08-12T14:04:00.182522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.06401","last_updated":"2022-07-09T18:20:19Z","snapshot_observed_at":"2026-07-06T10:59:15.676279Z","submitted_at":"2021-04-13T17:59:03Z","title":"Self-supervised object detection from audio-visual correspondence","version":2},"cited_work":{"arxiv_id":"2104.06401","doi":"10.48550/arxiv.2104.06401","metadata_source":"pith","pith_arxiv_id":"2104.06401","snapshot_observed_at":"2026-08-12T18:16:22.223912Z","title":"Self-supervised object detection from audio-visual correspondence","venue":"cs.CV","work_id":"0adcf352-fdbe-41d0-b66f-132c0cedcf71","year":2021},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.193091Z"},"links":{"cited_paper":"/paper/2104.06401","citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:31290097083075276940cf2235477c62259e0dabb60002da5d63352b16882086","observation_id":"fd360975-5b7c-4632-9ab9-bb4fcfe96709","resolution":{"observed_at":"2026-08-12T14:04:01.201599Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:00.197356Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.197356Z"},"links":{"citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:5d639fbd4a835e673d558a361f3866a7309d4787f88f92fed60aeb292399528f","observation_id":"51004655-f251-42bf-9b1a-43f7ed2a90dd","resolution":{"observed_at":"2026-08-12T14:04:00.197356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.11178","last_updated":"2021-12-07T04:01:25Z","snapshot_observed_at":"2026-07-06T11:02:49.722095Z","submitted_at":"2021-04-22T17:07:41Z","title":"VATT: Transformers for Multimodal Self-Supervised Learning from Raw Video, Audio and Text","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.11178","snapshot_observed_at":"2026-08-12T14:04:00.201477Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.201477Z"},"links":{"cited_paper":"/paper/2104.11178","citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:0017f4b841a2f94c7ab8d5906bb6cb0554b2b477fd80ed1ad2d0b2d977793f6b","observation_id":"30ff9c9d-6414-4d93-988b-20e0e663d99b","resolution":{"observed_at":"2026-08-12T14:04:00.201477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-12T14:04:00.205827Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.205827Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:78e7bc6493fd4a83cf6064c2d2fcb50a081ef5d4632bc46fb13cbae7d534a716","observation_id":"35f0c665-1bab-4cfd-9b93-a324a68271c7","resolution":{"observed_at":"2026-08-12T14:04:00.205827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:00.210061Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.210061Z"},"links":{"citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:c769bc0b84c2c61368ac7d3e2cd2db7df7a842e5fae3a34025ebeba3582c705b","observation_id":"135f8ca3-0542-483e-9727-b15d7e0241b9","resolution":{"observed_at":"2026-08-12T14:04:00.210061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.12667","last_updated":"2020-10-26T14:02:35Z","snapshot_observed_at":"2026-07-06T08:40:39.015024Z","submitted_at":"2019-11-28T12:17:36Z","title":"Self-Supervised Learning by Cross-Modal Audio-Video Clustering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.12667","snapshot_observed_at":"2026-08-12T14:04:00.213629Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.213629Z"},"links":{"cited_paper":"/paper/1911.12667","citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:5732a2327bb9d6b63080abe4fa8f37a083f84d2679cdf31c70c91e8366ab986f","observation_id":"0e8406f2-7cca-4aac-840c-332e34565c4c","resolution":{"observed_at":"2026-08-12T14:04:00.213629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:00.217753Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.217753Z"},"links":{"citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:99d0a67a51a110b5e64114bfaf269153026ffa1afbec6dbe593c630a3fde55d5","observation_id":"59e75663-ac0b-40a0-bfdb-2c1031ba6500","resolution":{"observed_at":"2026-08-12T14:04:00.217753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:00.221389Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.221389Z"},"links":{"citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:1dca9a5b8353c744e07916f6d2a74119bb9ac8be105c64ac5d3a46ec0b6b655f","observation_id":"6df34e52-d52e-4228-bf70-737075205974","resolution":{"observed_at":"2026-08-12T14:04:00.221389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:00.225289Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.225289Z"},"links":{"citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:8fdc39c472e8e9905fe2be2d4546d3bfb6834c4618e0eb69958baaa44b9eae2e","observation_id":"02f3dbdf-5792-49cf-8280-628e80a68a01","resolution":{"observed_at":"2026-08-12T14:04:00.225289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:00.228985Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.228985Z"},"links":{"citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:06a848dcbfaca4a7faf3b361af828c03ac52396ce36c98be3a61e86ed45f8ac4","observation_id":"bb8a3452-4989-4898-a681-2c52f12162b3","resolution":{"observed_at":"2026-08-12T14:04:00.228985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.09406","last_updated":"2017-08-01T17:39:39Z","snapshot_observed_at":"2026-08-12T19:11:32.698265Z","submitted_at":"2017-05-26T01:35:31Z","title":"Multimodal Machine Learning: A Survey and Taxonomy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.09406","snapshot_observed_at":"2026-08-12T14:04:00.233252Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.233252Z"},"links":{"cited_paper":"/paper/1705.09406","citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:708b739dd97bd7a44640b9b18cacaf7d110b05ddc444883b2f81b5abaff8bd20","observation_id":"36d99ab7-11af-4c8c-8447-e05c57c32fcb","resolution":{"observed_at":"2026-08-12T14:04:00.233252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.08254","last_updated":"2022-09-03T14:11:33Z","snapshot_observed_at":"2026-07-06T11:19:34.705520Z","submitted_at":"2021-06-15T16:02:37Z","title":"BEiT: BERT Pre-Training of Image Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.08254","snapshot_observed_at":"2026-08-12T14:04:00.238389Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.238389Z"},"links":{"cited_paper":"/paper/2106.08254","citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:9a06efd4c71eb783a64ee407cb523523ad74e537176e32c76a51efff8c5a16ca","observation_id":"d50aade1-798b-4757-8f8a-02deb236f0a6","resolution":{"observed_at":"2026-08-12T14:04:00.238389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:00.242366Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.242366Z"},"links":{"citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:da4672bd9cd543db1d0a2400cb4f6f4ab0a8a128e8a607ceee684103846eefd7","observation_id":"2bfe1d93-dae6-4ebd-913d-74463157a8c8","resolution":{"observed_at":"2026-08-12T14:04:00.242366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09882","last_updated":"2021-01-08T17:01:05Z","snapshot_observed_at":"2026-08-10T00:06:55.366902Z","submitted_at":"2020-06-17T14:00:42Z","title":"Unsupervised Learning of Visual Features by Contrasting Cluster Assignments","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.09882","snapshot_observed_at":"2026-08-12T14:04:00.246227Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.246227Z"},"links":{"cited_paper":"/paper/2006.09882","citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:443e7c18d84c2fffa68fdc0f1517be132bc38fa888d615f7720241b88c39ab8e","observation_id":"969a5b5f-872d-417e-a1e3-62c40051d690","resolution":{"observed_at":"2026-08-12T14:04:00.246227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:00.250259Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.250259Z"},"links":{"citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:0497a685840eea9b97ebede06b1bf67ce158aef75167a46f1c45507cd9ed3c97","observation_id":"de70a847-be45-4bb6-8fb0-0ad247ab6b94","resolution":{"observed_at":"2026-08-12T14:04:00.250259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:00.254159Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.254159Z"},"links":{"citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:f3e68d11d19607c7e4133222abcb1f6f51ed48d12ef97e142c2a3a9f68e80052","observation_id":"b6f906fc-19e0-4d19-9959-69a5e766fbc4","resolution":{"observed_at":"2026-08-12T14:04:00.254159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.00874","last_updated":"2022-02-02T04:49:14Z","snapshot_observed_at":"2026-08-07T00:04:27.412290Z","submitted_at":"2022-02-02T04:49:14Z","title":"HTS-AT: A Hierarchical Token-Semantic Audio Transformer for Sound Classification and Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.00874","snapshot_observed_at":"2026-08-12T14:04:00.258698Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.258698Z"},"links":{"cited_paper":"/paper/2202.00874","citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:dcf883f113ba1706a0db283d6dda51bd3903031d1ab4c5636eb523913e3adfad","observation_id":"30c948de-cb5b-44c9-928f-b142ce0a93a4","resolution":{"observed_at":"2026-08-12T14:04:00.258698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08345","last_updated":"2025-01-06T09:10:55Z","snapshot_observed_at":"2026-08-07T02:26:34.656486Z","submitted_at":"2023-04-17T15:08:15Z","title":"VALOR: Vision-Audio-Language Omni-Perception Pretraining Model and Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08345","snapshot_observed_at":"2026-08-12T14:04:00.263114Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.263114Z"},"links":{"cited_paper":"/paper/2304.08345","citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:cb2ec56e4ae58cf5d4dd3efedef5e0b4868c25721927f79ec724e62b62829571","observation_id":"13b7d0fa-6c59-4377-b747-2f2bf945303d","resolution":{"observed_at":"2026-08-12T14:04:00.263114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-12T14:04:00.267227Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.267227Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:f5f6540ab1118c73f47eaedf45a1d82e85208c81fb710bb78cc26e90e3c76f92","observation_id":"54cd0d13-dd9b-435f-bac3-40338c9c69be","resolution":{"observed_at":"2026-08-12T14:04:00.267227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:00.271476Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.271476Z"},"links":{"citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:3a71b8badac27f2561c8984c13e2b13954d6953d58335e7bc83af43af9f5dc3b","observation_id":"aa0089f3-0d11-4c4e-b89a-1b56dcfc41c2","resolution":{"observed_at":"2026-08-12T14:04:00.271476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05709","last_updated":"2020-07-01T00:09:08Z","snapshot_observed_at":"2026-08-02T19:54:26.138356Z","submitted_at":"2020-02-13T18:50:45Z","title":"A Simple Framework for Contrastive Learning of Visual Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05709","snapshot_observed_at":"2026-08-12T14:04:00.275251Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.275251Z"},"links":{"cited_paper":"/paper/2002.05709","citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:c9dab92ec317b5fb0027efbf0f8930aa8e71640b74f54435dbd7302cfb08e495","observation_id":"a9efab99-8f1a-46ce-bcfc-8a1e3b45554f","resolution":{"observed_at":"2026-08-12T14:04:00.275251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:00.278964Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.278964Z"},"links":{"citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:d1cc641e5f0a647f82af325715ba166f9b2a01e46e283678d26befca4d52cc83","observation_id":"d86d1cef-089c-4581-947e-8f35961ee819","resolution":{"observed_at":"2026-08-12T14:04:00.278964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:00.282212Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.282212Z"},"links":{"citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:6a34fb1f60c5b12131c109fc3733cbea87192944878d93023a7c442c36b49c73","observation_id":"e2085e99-f9b8-46ce-8978-b1fa03af1007","resolution":{"observed_at":"2026-08-12T14:04:00.282212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:00.285878Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.285878Z"},"links":{"citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:8068467d232e9a59ae351c706038ae74d8dea2af5c551b15f7cba054ba44100a","observation_id":"2daa08f2-ae87-40fb-a7a5-2c8e4dd4660e","resolution":{"observed_at":"2026-08-12T14:04:00.285878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:00.289745Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.289745Z"},"links":{"citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:cd1cc973e19ae5221104f02bee4484085a20cfe00183345ea728b23619923dca","observation_id":"4b88f506-4f36-45b7-a815-19f5d63c97df","resolution":{"observed_at":"2026-08-12T14:04:00.289745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:00.293256Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.293256Z"},"links":{"citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:2802db3f6743c8f8cbf7e1f4931ca563dc977debd94f3066916cd4d67095eae2","observation_id":"65c8f6e4-1672-43c0-a95b-48685ac80468","resolution":{"observed_at":"2026-08-12T14:04:00.293256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s00138-023-01444-9","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:01.171092Z","title":null,"venue":null,"work_id":"0c6014b2-4c28-4bd7-9a39-7d6bd934070a","year":2023},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.297336Z"},"links":{"citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:60269fb7b442aae44530d03fd6f88a6746fdfe4305d0fdd2055e433e8910b014","observation_id":"fd667844-061c-4c25-9192-ac7e2eaf4ebf","resolution":{"observed_at":"2026-08-12T14:04:01.175109Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-12T14:04:00.302382Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.302382Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:90fec2777a2936f22570582b617501c0d77f1ec380e2d0ae4273e006132fd04e","observation_id":"311a0d51-b897-47cb-88cf-1f2e5e6e3ab8","resolution":{"observed_at":"2026-08-12T14:04:00.302382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00341","last_updated":"2020-04-30T09:02:45Z","snapshot_observed_at":"2026-08-06T03:57:57.420510Z","submitted_at":"2020-04-30T09:02:45Z","title":"Jukebox: A Generative Model for Music","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00341","snapshot_observed_at":"2026-08-12T14:04:00.315506Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.315506Z"},"links":{"cited_paper":"/paper/2005.00341","citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:37ffe7007dd89fec6c88a2df7e0d851cf52b2160565710b2da7363a2523317ab","observation_id":"20ff595e-45b2-4376-8133-0392e9424ddd","resolution":{"observed_at":"2026-08-12T14:04:00.315506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:00.320036Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.320036Z"},"links":{"citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:15bbd4bd71d024206e2c641d3839dd4b71755071436adecac39301c8c48250c8","observation_id":"9929eef9-fc5a-4cf5-b48c-f13fa7315457","resolution":{"observed_at":"2026-08-12T14:04:00.320036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-030-58558-7_35","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:01.159529Z","title":null,"venue":null,"work_id":"aa7b169d-0e8a-4add-a8ac-d8de9e3a51d5","year":2020},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.323836Z"},"links":{"citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:95badac1234b8aa81661c943c34e6f57b5118e1c1cd98a6c47844dfdadf0a7c6","observation_id":"37053343-e1fd-47af-9850-a2894b687cc3","resolution":{"observed_at":"2026-08-12T14:04:01.163390Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T02:40:23.887636Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-12T14:04:00.327684Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.327684Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:ffec0dc9e52d18b54580c86abe44cd9ee7c42558c616fbe91a4431f79573419f","observation_id":"ae0596fb-69d9-4a06-9cdd-c92cc5c19d7c","resolution":{"observed_at":"2026-08-12T14:04:00.327684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:00.332145Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.332145Z"},"links":{"citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:0d9a9afbc9bf1190eed39508473a846af7fb8949e088ef2dcf17964dbfb4d98c","observation_id":"543c3f0b-2f7d-4d7f-a219-5a3e929ceec9","resolution":{"observed_at":"2026-08-12T14:04:00.332145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:00.336028Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.336028Z"},"links":{"citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:3afacdd712efed8f92cac4b717a3810b743e890227e3ec08361c72d8e4091756","observation_id":"785e953c-5ba6-4cab-a341-d8f8762e06b3","resolution":{"observed_at":"2026-08-12T14:04:00.336028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.01266","last_updated":"2022-03-09T16:49:14Z","snapshot_observed_at":"2026-08-12T00:51:55.382112Z","submitted_at":"2021-06-02T16:20:43Z","title":"Sound-to-Imagination: An Exploratory Study on Unsupervised Crossmodal Translation Using Diverse Audiovisual Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.01266","snapshot_observed_at":"2026-08-12T14:04:00.339500Z","title":"Fanzeres and Climent Nadeu","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.339500Z"},"links":{"cited_paper":"/paper/2106.01266","citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:c672cb003627c3fde8c13f616e46c552efd5270d8f03177f6f43f4011178903e","observation_id":"fa29b188-5b32-443a-a2e2-1c0b7f905572","resolution":{"observed_at":"2026-08-12T14:04:00.339500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:00.343756Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.343756Z"},"links":{"citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:60ce4b3907797159cfa44311265c061b2ad2852d6fd53e55ec052c129d8b850e","observation_id":"5129cee7-7009-4e42-aae4-d42210cc639d","resolution":{"observed_at":"2026-08-12T14:04:00.343756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:00.347316Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.347316Z"},"links":{"citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:7c6b14397574ab3911ddc769ea3570d59ac8b8bc92163114eef64ea693807cc6","observation_id":"3e61d401-2524-4ed2-bc7c-817053f313f7","resolution":{"observed_at":"2026-08-12T14:04:00.347316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:00.350942Z","title":"Tenenbaum, and Antonio Torralba","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.350942Z"},"links":{"citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:1d07453267d691b1586284780a833f956f6c99d551634102dfe6da1f93e87628","observation_id":"00d73e6b-052a-49cb-9619-6697243de976","resolution":{"observed_at":"2026-08-12T14:04:00.350942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:00.355323Z","title":"Tenenbaum, and Antonio Torralba","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.355323Z"},"links":{"citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:4df08b5323b4f34b94573719577fe5d99ea37b1e18b388cf4d6ffa0ecc02010b","observation_id":"88ebe87c-2dac-4e27-aed0-f237fe63f801","resolution":{"observed_at":"2026-08-12T14:04:00.355323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.01665","last_updated":"2018-07-26T04:46:24Z","snapshot_observed_at":"2026-08-12T07:45:54.776330Z","submitted_at":"2018-04-05T04:06:46Z","title":"Learning to Separate Object Sounds by Watching Unlabeled Video","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.01665","snapshot_observed_at":"2026-08-12T14:04:00.359940Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.359940Z"},"links":{"cited_paper":"/paper/1804.01665","citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:fe10001defeaa986ad3aabc0a9e2cd856aef9b9c11a5cda725287c91926e32ab","observation_id":"7428f39f-05e9-44ba-8c41-7834c30672fc","resolution":{"observed_at":"2026-08-12T14:04:00.359940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:00.364245Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.364245Z"},"links":{"citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:52aaf90fea34b9865e6b33b866d66a1f9dd61b542c699f35e03ab5a4e81f6c70","observation_id":"4570d2bc-bac7-4319-8247-df68613a08f8","resolution":{"observed_at":"2026-08-12T14:04:00.364245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:00.368860Z","title":"Gemmeke, Daniel P","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.368860Z"},"links":{"citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:a9830b0e601e8721c4c21d72355424426b9ae0efbf7cdcd02810f3dc0a728175","observation_id":"5aef0868-ae83-491f-99ac-ff25b3de0831","resolution":{"observed_at":"2026-08-12T14:04:00.368860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05922","last_updated":"2024-01-04T16:52:34Z","snapshot_observed_at":"2026-08-13T01:45:19.256987Z","submitted_at":"2022-12-09T17:34:53Z","title":"Audiovisual Masked Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.05922","snapshot_observed_at":"2026-08-12T14:04:00.373194Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.373194Z"},"links":{"cited_paper":"/paper/2212.05922","citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:ebafa3d0dac596e94a845053bb0be0d6ac5e8504a85dd0fef8b5e8b71c7e4c9f","observation_id":"6b5f00ce-1cb8-46ab-a71a-e506735b24c5","resolution":{"observed_at":"2026-08-12T14:04:00.373194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-12T14:04:00.377750Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.377750Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:319434e29f007b60d956c7c692bcdf234ce4ee28446e29a8b81d28a802ca32ec","observation_id":"2940b4f9-7bd8-4f18-baf6-ff82ce89cf58","resolution":{"observed_at":"2026-08-12T14:04:00.377750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:00.381632Z","title":"Liu, Andrew Rouditchenko, and James Glass","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.381632Z"},"links":{"citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:adc7d94ea5df4627de7a7d7e9789ebc275243b6bd57611657477dc1a71750f9f","observation_id":"19ac2e63-d0d0-465c-a0cd-2bd1f1a01246","resolution":{"observed_at":"2026-08-12T14:04:00.381632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07839","last_updated":"2023-04-11T22:47:19Z","snapshot_observed_at":"2026-08-10T17:21:19.608137Z","submitted_at":"2022-10-02T07:29:57Z","title":"Contrastive Audio-Visual Masked Autoencoder","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07839","snapshot_observed_at":"2026-08-12T14:04:00.385262Z","title":"Liu, David Harwath, Leonid Karlinsky, Hilde Kuehne, and James Glass","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.385262Z"},"links":{"cited_paper":"/paper/2210.07839","citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:93f164953af78a24dbf6ae8fc512ad301c9016ef671a40670ebe75e5d2960406","observation_id":"395dd764-c639-47b6-b6af-fccc845ea6ce","resolution":{"observed_at":"2026-08-12T14:04:00.385262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v35i2.16235","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:01.148304Z","title":null,"venue":null,"work_id":"f2362566-7994-41ce-83a9-c6fb4ac10e3d","year":2021},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.389264Z"},"links":{"citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:3920c616676c1d237cae040639e159b4396441e3b1c2dca35f49a333d1b87a00","observation_id":"e0130c71-6569-4c34-b633-4c04d2cbd8f6","resolution":{"observed_at":"2026-08-12T14:04:01.151568Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.07733","last_updated":"2020-09-10T09:46:02Z","snapshot_observed_at":"2026-08-10T15:20:54.561787Z","submitted_at":"2020-06-13T22:35:21Z","title":"Bootstrap your own latent: A new approach to self-supervised Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.07733","snapshot_observed_at":"2026-08-12T14:04:00.393434Z","title":"Richemond, Elena Buchatskaya, Carl Doersch, Bernardo Avila Pires, Zhaohan Daniel Guo, Mohammad Gheshlaghi Azar, Bilal Piot, Koray Kavukcuoglu, Rémi Munos, and Michal Valko","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.393434Z"},"links":{"cited_paper":"/paper/2006.07733","citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:8b5c0780c71f147d606436f60fd07044994f15ce95efcbf90c9783ff43856aac","observation_id":"22971be6-bab0-4d6c-a96c-394bba634ec1","resolution":{"observed_at":"2026-08-12T14:04:00.393434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:00.397584Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.397584Z"},"links":{"citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:f64609a21823b1c85c826d3df389611cb09d331e6349a9145311952b5d779b5d","observation_id":"d622961f-18c9-4d8d-8ca1-f78da2260c15","resolution":{"observed_at":"2026-08-12T14:04:00.397584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:00.401336Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.401336Z"},"links":{"citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:6f8988db48bb9c6a05b69c804455b660a4b8f4bdc45a0132416db96db222d46c","observation_id":"cb162968-a7e9-49d0-8b64-7dcf65ce5f22","resolution":{"observed_at":"2026-08-12T14:04:00.401336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.06377","last_updated":"2021-12-19T19:23:25Z","snapshot_observed_at":"2026-08-12T16:27:34.120981Z","submitted_at":"2021-11-11T18:46:40Z","title":"Masked Autoencoders Are Scalable Vision Learners","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.06377","snapshot_observed_at":"2026-08-12T14:04:00.406352Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.406352Z"},"links":{"cited_paper":"/paper/2111.06377","citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:554c86b1438d734ddb56efd77181ad9bd52330566aa7b55fdb2fa922dae45635","observation_id":"c3bb9651-0785-4cb6-9c5c-d217bf67f90e","resolution":{"observed_at":"2026-08-12T14:04:00.406352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:00.410432Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.410432Z"},"links":{"citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:7c86ae1fd724eed48717d49239728ad55b6c977eefa46fcef2d9363b8a8dfd2a","observation_id":"e22fea2b-17c3-44c8-a887-7744923693b2","resolution":{"observed_at":"2026-08-12T14:04:00.410432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:00.414200Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.414200Z"},"links":{"citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:a89d11c98d62542e3da43c2e27601e9750e4693ab258af4abdf1fc2c498a3efc","observation_id":"0d8f6bb5-7e2b-4286-92b0-e2e5e8511e50","resolution":{"observed_at":"2026-08-12T14:04:00.414200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.3390/s19061382","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:01.136482Z","title":null,"venue":null,"work_id":"ef6c36ef-bf15-460e-854c-c4a5decdc26d","year":2019},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.417929Z"},"links":{"citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:818ae516fa3beb9e59bbc8f9fb099cc3b42816f27dfe6a0e3c60cec59dd2256f","observation_id":"cf31375a-73da-47e0-9834-85812562794f","resolution":{"observed_at":"2026-08-12T14:04:01.140976Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:00.422360Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.422360Z"},"links":{"citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:fbb16500bc3ecc1e0a2401405b7b43c145fec5c07f29041cfca5f7c33a4f6e74","observation_id":"b631de48-bd78-4cd4-8398-11b25cd774d5","resolution":{"observed_at":"2026-08-12T14:04:00.422360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:00.425465Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.425465Z"},"links":{"citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:4bff7f1015034b252fb87bde40309aab92b9d1783d84dde251f1afe952bd5c5d","observation_id":"e2f84e8d-8527-4e3e-836c-aadff6beac69","resolution":{"observed_at":"2026-08-12T14:04:00.425465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.09414","last_updated":"2020-01-26T07:08:47Z","snapshot_observed_at":"2026-08-11T08:11:46.431434Z","submitted_at":"2020-01-26T07:08:47Z","title":"Curriculum Audiovisual Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.09414","snapshot_observed_at":"2026-08-12T14:04:00.428515Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.428515Z"},"links":{"cited_paper":"/paper/2001.09414","citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:3e2ae65d7d0d1846ecca026a20d3f0c08f55785ac073507722506ea9dde3fc60","observation_id":"2c1cf1ea-5741-4712-9722-a221041f65c2","resolution":{"observed_at":"2026-08-12T14:04:00.428515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:00.432533Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.432533Z"},"links":{"citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:52b0b226a151cebccf3e3fbb13779ace499977fd3ae4b94c52ede408c9fcd15a","observation_id":"473d82cb-831c-4edc-8fe2-49f03e3954d3","resolution":{"observed_at":"2026-08-12T14:04:00.432533Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.15058","last_updated":"2022-11-28T04:30:50Z","snapshot_observed_at":"2026-08-04T21:45:26.552729Z","submitted_at":"2022-11-28T04:30:50Z","title":"Mix and Localize: Localizing Sound Sources in Mixtures","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.15058","snapshot_observed_at":"2026-08-12T14:04:00.437324Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.437324Z"},"links":{"cited_paper":"/paper/2211.15058","citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:9aa6ebeab280ef595f778c12507f43fe14056e8600b81f6e61e5f59932347141","observation_id":"7a9c4009-007c-4ded-9938-e45891d9038b","resolution":{"observed_at":"2026-08-12T14:04:00.437324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.07885","last_updated":"2022-12-20T17:35:13Z","snapshot_observed_at":"2026-08-05T22:02:33.983899Z","submitted_at":"2022-07-16T09:38:52Z","title":"Clover: Towards A Unified Video-Language Alignment and Fusion Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.07885","snapshot_observed_at":"2026-08-12T14:04:00.442007Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.442007Z"},"links":{"cited_paper":"/paper/2207.07885","citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:3c781a97d6124abf296a2b26c4af7bb28c28b74aa2dcb84a5445bdbc5c9dda02","observation_id":"d654d65d-6e0d-4536-af19-35ed8db04f88","resolution":{"observed_at":"2026-08-12T14:04:00.442007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08071","last_updated":"2023-07-17T05:44:35Z","snapshot_observed_at":"2026-08-12T10:49:54.438077Z","submitted_at":"2022-12-15T18:59:59Z","title":"MAViL: Masked Audio-Video Learners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08071","snapshot_observed_at":"2026-08-12T14:04:00.447500Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.447500Z"},"links":{"cited_paper":"/paper/2212.08071","citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:7dbfd2e87b2b240cc1532f920242c933c243c1829a46231e5a0ad2831e849c6b","observation_id":"70a606e9-7757-4a92-9e9b-2cadad90134c","resolution":{"observed_at":"2026-08-12T14:04:00.447500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08782","last_updated":"2019-09-19T02:50:23Z","snapshot_observed_at":"2026-07-06T08:22:58.185275Z","submitted_at":"2019-09-19T02:50:23Z","title":"Large-scale representation learning from visually grounded untranscribed speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08782","snapshot_observed_at":"2026-08-12T14:04:00.452825Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.452825Z"},"links":{"cited_paper":"/paper/1909.08782","citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:f989e11a8b3d794a9faf56c333788a80b0779db23e9bf988948af6c1faa5f2a0","observation_id":"9db3643a-b657-4fe0-8353-787a4ec163e8","resolution":{"observed_at":"2026-08-12T14:04:00.452825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03206","last_updated":"2021-06-23T00:25:31Z","snapshot_observed_at":"2026-08-10T00:41:01.806631Z","submitted_at":"2021-03-04T18:20:50Z","title":"Perceiver: General Perception with Iterative Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03206","snapshot_observed_at":"2026-08-12T14:04:00.458077Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.458077Z"},"links":{"cited_paper":"/paper/2103.03206","citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:5850ab2d611e8f944b552e619109f2e5fab897cb6bcb315bc1371654a5c2b0f6","observation_id":"f1716107-c98f-4197-a73f-5e9ad449e975","resolution":{"observed_at":"2026-08-12T14:04:00.458077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:00.462677Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.462677Z"},"links":{"citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:9a67d2e2daff828fb2240b41b54ecd49759c9000a2cbfa48e28cf50c8b6890c7","observation_id":"90868dfe-6235-4b6b-b2d1-09925cfbef7c","resolution":{"observed_at":"2026-08-12T14:04:00.462677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:00.467184Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.467184Z"},"links":{"citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:34821df14e347c62b091dd12b5bcebb4739160249143bd04f5fc7a06be1426b4","observation_id":"e207d8d1-77ba-41aa-a7ab-d82f51aa4ec8","resolution":{"observed_at":"2026-08-12T14:04:00.467184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02560","last_updated":"2024-03-29T16:56:33Z","snapshot_observed_at":"2026-08-12T18:01:21.656697Z","submitted_at":"2023-04-05T16:30:36Z","title":"VicTR: Video-conditioned Text Representations for Activity Recognition","version":2},"cited_work":{"arxiv_id":"2304.02560","doi":null,"metadata_source":"pith","pith_arxiv_id":"2304.02560","snapshot_observed_at":"2026-08-12T14:04:04.429355Z","title":"VicTR: Video-conditioned Text Representations for Activity Recognition","venue":"cs.CV","work_id":"51cc1204-eaba-449c-a211-c9d840e30f01","year":2023},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.470622Z"},"links":{"cited_paper":"/paper/2304.02560","citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:b88336811f510d620c6285429b86855771db67cb3ee80e253f537ca3366247ac","observation_id":"b4aedebb-b76a-4019-9841-e1c1834ef237","resolution":{"observed_at":"2026-08-12T14:04:04.434377Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:00.475676Z","title":"Esat Kalfaoglu, Sinan Kalkan, and A","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.475676Z"},"links":{"citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:00f603af7387c62ae637f2c01c46b7c133f8d048e17059cec77b2fa8bfbfffae","observation_id":"0da6a586-1327-4c48-8fbc-f6f82607f08e","resolution":{"observed_at":"2026-08-12T14:04:00.475676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:00.479421Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.479421Z"},"links":{"citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:cfbb3329f1f1dd620df6dae4900e5b4d8260b5390b9af5bbc74ebf26209fe81b","observation_id":"d1b9fa0e-3a3a-436b-b897-a0220d09eacb","resolution":{"observed_at":"2026-08-12T14:04:00.479421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:00.482814Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.482814Z"},"links":{"citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:6de4a74176b49edbce607511f81b574eca98c94299c9442ec954fdd992b6e53f","observation_id":"ad5b7dec-af0d-4cdf-bc25-e04800f4656e","resolution":{"observed_at":"2026-08-12T14:04:00.482814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:00.486256Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.486256Z"},"links":{"citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:6356afec81d4e8ce3f2c95a6a95f2c4af301131f75dc1f8cd294b705b9a2734c","observation_id":"61e0c725-c83b-4266-8942-872caec3068c","resolution":{"observed_at":"2026-08-12T14:04:00.486256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:00.489899Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.489899Z"},"links":{"citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:c6c2fea2b35137722f611ba02750da542cd7b6b5399667c6ed55bf6f8d201b28","observation_id":"f1f49ea3-ae85-4361-bdbc-191b02330b82","resolution":{"observed_at":"2026-08-12T14:04:00.489899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:00.494152Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.494152Z"},"links":{"citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:ab1ca3f0e4aaeaf4a81dd0ed8a35bc420a9bdf4dfe74eebc942b5746b149c089","observation_id":"cf548734-b291-47ac-8ea0-9dbc8c69fc77","resolution":{"observed_at":"2026-08-12T14:04:00.494152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2015.74047","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:04.406156Z","title":null,"venue":null,"work_id":"6a5b978a-8480-4f30-b86e-8ceff08a64b8","year":2015},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.498602Z"},"links":{"citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:0fbfc5117cf669cedfe6610914a71abf7917e2a48aca3772f36030a30fea5d16","observation_id":"a0e0f6ed-9c1c-47a3-89bf-554bb1a0dbcb","resolution":{"observed_at":"2026-08-12T14:04:04.413525Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:00.502739Z","title":"Ross, and Angjoo Kanazawa","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.502739Z"},"links":{"citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:ea2f5f41a24de9f26c2c9df95eee4b5060f8b17958537f60891abeac28423f37","observation_id":"1290bff3-82df-4c75-8f78-02a6348fa3d3","resolution":{"observed_at":"2026-08-12T14:04:00.502739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:00.506640Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.506640Z"},"links":{"citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:a662bd4979ea98c976b45377139ab001b5119c663782382a78f7dbe5f73db053","observation_id":"ae3cd1c2-ad31-4913-a223-1f05bd14a6a0","resolution":{"observed_at":"2026-08-12T14:04:00.506640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:00.510293Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.510293Z"},"links":{"citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:664411bbadb518bdc120a3e07cacc6033bd2ed3cee177e5d4faf02e03fca0dca","observation_id":"ca90717d-8e4d-4001-bfd8-78638d1f5b57","resolution":{"observed_at":"2026-08-12T14:04:00.510293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.07221","last_updated":"2023-08-25T12:33:22Z","snapshot_observed_at":"2026-07-06T16:06:02.777393Z","submitted_at":"2023-08-14T15:47:25Z","title":"AudioFormer: Audio Transformer learns audio feature representations from discrete acoustic codes","version":6},"cited_work":{"arxiv_id":"2308.07221","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.07221","snapshot_observed_at":"2026-08-12T14:04:04.252708Z","title":"AudioFormer: Audio Transformer learns audio feature representations from discrete acoustic codes","venue":"cs.SD","work_id":"e75ee5e2-a3b1-47f4-b64e-23d1965c0fd5","year":2023},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.514565Z"},"links":{"cited_paper":"/paper/2308.07221","citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:7e4b637c574852804d4514f578d4b81b1e3b000055777e735e2295fba0de3703","observation_id":"7c62dbf7-ccbc-404c-a20d-8d1960e0998c","resolution":{"observed_at":"2026-08-12T14:04:04.256666Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03430","last_updated":"2023-02-20T09:19:30Z","snapshot_observed_at":"2026-08-09T08:26:35.480401Z","submitted_at":"2022-09-07T19:21:19Z","title":"Foundations and Trends in Multimodal Machine Learning: Principles, Challenges, and Open Questions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03430","snapshot_observed_at":"2026-08-12T14:04:00.518108Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.518108Z"},"links":{"cited_paper":"/paper/2209.03430","citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:6ff0a5751727a6c4c3f91af4d9111381d07a837a5bd381685ac809fe97cb56c0","observation_id":"9d4b873e-9cd3-4a61-96ff-5caffdedbacb","resolution":{"observed_at":"2026-08-12T14:04:00.518108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:00.521998Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.521998Z"},"links":{"citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:416a80c1975f51b5242dee56f26dd9f9f4a986190ca7ec329e04a2fe0369cd82","observation_id":"2d9010f7-9100-4d2d-8b80-940cfb874165","resolution":{"observed_at":"2026-08-12T14:04:00.521998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:00.525332Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.525332Z"},"links":{"citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:2b8d712ea440eb7aeae9cf758e768197111305b123143de3fbbc713741780227","observation_id":"dfe99e90-dd7e-4de7-beb8-f2d3d4712ea4","resolution":{"observed_at":"2026-08-12T14:04:00.525332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:00.532185Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.532185Z"},"links":{"citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:b6b07ffad8c19e4b65f5c19b1dc93caa5d9b82f70f5c5f4d386fa97cf0c6fbed","observation_id":"5e2a2d23-50b2-49f4-bf9c-02b6ee59c499","resolution":{"observed_at":"2026-08-12T14:04:00.532185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.00708","last_updated":"2021-05-03T09:34:11Z","snapshot_observed_at":"2026-08-01T15:43:56.880760Z","submitted_at":"2021-05-03T09:34:11Z","title":"Exploiting Audio-Visual Consistency with Partial Supervision for Spatial Audio Generation","version":1},"cited_work":{"arxiv_id":"2105.00708","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.00708","snapshot_observed_at":"2026-08-12T14:04:04.082891Z","title":"Exploiting Audio-Visual Consistency with Partial Supervision for Spatial Audio Generation","venue":"cs.SD","work_id":"977a679c-ab93-4904-b6c1-8023a3be12f6","year":2021},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.536444Z"},"links":{"cited_paper":"/paper/2105.00708","citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:1381e0c46951def7b05a8f4c110c8a10bd6091a781730557a67241f6aea5422d","observation_id":"b56bef7b-3d62-43ad-81f5-fa3d770db825","resolution":{"observed_at":"2026-08-12T14:04:04.087461Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-12T14:04:00.540799Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.540799Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:ea3699e1b0ff7c113a09ceed2721c34e53911e89ab9924aac3ee6119b546c134","observation_id":"82acf037-a84e-49a2-920b-4a1b8369081d","resolution":{"observed_at":"2026-08-12T14:04:00.540799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:00.544696Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.544696Z"},"links":{"citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:fa97d331371f4b15530730c5ad7debba6590d55602291f7b58491e5604e85d6d","observation_id":"fe2c8d20-e28f-4bb2-9dac-6d585b248c75","resolution":{"observed_at":"2026-08-12T14:04:00.544696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.00294","last_updated":"2020-01-02T02:15:24Z","snapshot_observed_at":"2026-08-03T17:45:33.093672Z","submitted_at":"2020-01-02T02:15:24Z","title":"Video Cloze Procedure for Self-Supervised Spatio-Temporal Learning","version":1},"cited_work":{"arxiv_id":"2001.00294","doi":null,"metadata_source":"pith","pith_arxiv_id":"2001.00294","snapshot_observed_at":"2026-08-12T14:04:03.755361Z","title":"Video Cloze Procedure for Self-Supervised Spatio-Temporal Learning","venue":"cs.CV","work_id":"762388d7-8d82-407a-baf5-38b9cc275591","year":2020},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.548525Z"},"links":{"cited_paper":"/paper/2001.00294","citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:bf581cee2f9e0e0af96891af087a163ff8a8af35511e8b7050e766d2673710f8","observation_id":"9d130509-e9e3-414a-a823-373762c344be","resolution":{"observed_at":"2026-08-12T14:04:03.760783Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:00.552712Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.552712Z"},"links":{"citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:32efdefb71fb532bed9cbee5f59fab7dd97e8d7648d127585753a242fcd5ec94","observation_id":"8769bb78-963e-40c1-bf90-322cc6ead66a","resolution":{"observed_at":"2026-08-12T14:04:00.552712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.09805","last_updated":"2021-04-16T22:16:18Z","snapshot_observed_at":"2026-08-10T18:45:29.726750Z","submitted_at":"2020-08-31T21:18:30Z","title":"Active Contrastive Learning of Audio-Visual Video Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.09805","snapshot_observed_at":"2026-08-12T14:04:00.556479Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.556479Z"},"links":{"cited_paper":"/paper/2009.09805","citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:10f7a3d8e01c845afeb3b204c3cffcf606653e700ce6ff07faa23479a1996c54","observation_id":"f2aea145-f39f-425c-8977-43b019664114","resolution":{"observed_at":"2026-08-12T14:04:00.556479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:00.560217Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.560217Z"},"links":{"citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:e41789bc52125033dc6687866c864665c8d50cd46572e93f867520dcb8227ce7","observation_id":"51b5fc22-a90c-4023-ad8c-b78be7708a64","resolution":{"observed_at":"2026-08-12T14:04:00.560217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.03795","last_updated":"2019-09-09T12:24:06Z","snapshot_observed_at":"2026-07-06T08:20:09.922228Z","submitted_at":"2019-09-09T12:24:06Z","title":"Language learning using Speech to Image retrieval","version":1},"cited_work":{"arxiv_id":"1909.03795","doi":null,"metadata_source":"pith","pith_arxiv_id":"1909.03795","snapshot_observed_at":"2026-08-12T14:04:03.519898Z","title":"Language learning using Speech to Image retrieval","venue":"cs.CL","work_id":"6c214b85-6bf1-438d-be7e-98cf40eafb56","year":2019},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.563204Z"},"links":{"cited_paper":"/paper/1909.03795","citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:40f7fb18a72abf5e5071db867edc77459dc4bfdaa104724d3a5e81de63498b95","observation_id":"a5cf2254-ea8f-4752-9e31-eb0e64482836","resolution":{"observed_at":"2026-08-12T14:04:03.523908Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06939","last_updated":"2021-06-13T07:41:15Z","snapshot_observed_at":"2026-08-11T15:36:31.702820Z","submitted_at":"2021-06-13T07:41:15Z","title":"Cross-Modal Attention Consistency for Video-Audio Unsupervised Learning","version":1},"cited_work":{"arxiv_id":"2106.06939","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.06939","snapshot_observed_at":"2026-08-12T14:04:03.502799Z","title":"Cross-Modal Attention Consistency for Video-Audio Unsupervised Learning","venue":"cs.CV","work_id":"1d3e61c1-27d4-485a-ab05-11f5afc62aec","year":2021},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.566673Z"},"links":{"cited_paper":"/paper/2106.06939","citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:7bc0e2eadf400384cb1f90ec6246612e988104c3c26f5a84d73c71ebcd4df26a","observation_id":"9f6bb235-fea6-4038-b03a-9446ab66c110","resolution":{"observed_at":"2026-08-12T14:04:03.507418Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:00.570098Z","title":"Schuller, and Maja Pantic","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.570098Z"},"links":{"citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:d03d04d08efe39b97b8622c4ac5097be0d71581dfa168b97bccdf699e5c44122","observation_id":"96c4f4f7-dccc-459d-9815-af3361beec48","resolution":{"observed_at":"2026-08-12T14:04:00.570098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:00.573206Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.573206Z"},"links":{"citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:b8277fccd52eab667f24a91bd6a7baa8075669afd778f3abed0c3e532fe38d24","observation_id":"9bfb2237-d0b0-4c6f-8fda-9c873b406698","resolution":{"observed_at":"2026-08-12T14:04:00.573206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01819","last_updated":"2020-11-03T16:20:04Z","snapshot_observed_at":"2026-08-08T00:21:51.889422Z","submitted_at":"2020-11-03T16:20:04Z","title":"Learning Representations from Audio-Visual Spatial Alignment","version":1},"cited_work":{"arxiv_id":"2011.01819","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.01819","snapshot_observed_at":"2026-08-12T14:04:03.420125Z","title":"Learning Representations from Audio-Visual Spatial Alignment","venue":"cs.CV","work_id":"7655c604-7f7d-4b69-90cb-e09526582343","year":2020},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.576223Z"},"links":{"cited_paper":"/paper/2011.01819","citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:bc935abf7a513e9c04104a9d2f4d28d11d8db20362d7053f3d3900f21b562823","observation_id":"5f9adce8-1998-4703-b853-e65898714d26","resolution":{"observed_at":"2026-08-12T14:04:03.424184Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.00135","last_updated":"2022-11-30T23:34:16Z","snapshot_observed_at":"2026-08-11T13:07:11.957580Z","submitted_at":"2021-06-30T22:44:12Z","title":"Attention Bottlenecks for Multimodal Fusion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.00135","snapshot_observed_at":"2026-08-12T14:04:00.579393Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.579393Z"},"links":{"cited_paper":"/paper/2107.00135","citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:fdab735fb6f55adc30f73d35828351e5d275a7b3efdc456d8be0eaa91dbe927e","observation_id":"5bf3b282-1971-4893-9948-bc30d4f329e7","resolution":{"observed_at":"2026-08-12T14:04:00.579393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:00.583178Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.583178Z"},"links":{"citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:b976674da4dfea137d070fe8b3b88e6e8a396f698ca36582fc38070e368a89d3","observation_id":"aa8ca9d9-a4fe-43c3-a654-a3310992add6","resolution":{"observed_at":"2026-08-12T14:04:00.583178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:00.586721Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.586721Z"},"links":{"citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:cf12bec302197d71d58643c6a053fa366fffecec4405a2b98ee5ce7532208eec","observation_id":"e7a2ef57-b4c4-4af0-90c5-8cd7041c63dc","resolution":{"observed_at":"2026-08-12T14:04:00.586721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:00.590125Z","title":"O., Melo Victor H","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.590125Z"},"links":{"citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:5fc4a8df2d2c3993b729a8059505314c9c2ff78c2f8c49faa3d70efb84b40e82","observation_id":"2db4cee0-8a3a-42b4-8445-8fa9c2825931","resolution":{"observed_at":"2026-08-12T14:04:00.590125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:00.594494Z","title":"Henriques, Geoffrey Zweig, and Andrea Vedaldi","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.594494Z"},"links":{"citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:f428276fd5eba89f3ff187c98cf23116d3d9e448178097a5a84e592a7391507f","observation_id":"0390425a-1f57-4d59-9008-1a708724bb21","resolution":{"observed_at":"2026-08-12T14:04:00.594494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3284750","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:01.108675Z","title":null,"venue":null,"work_id":"ec346608-f05f-4076-9ba0-b4d2422ca516","year":2019},"citing_paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:00.598549Z"},"links":{"citing_paper":"/paper/2412.00049"},"observation_digest":"sha256:516da9b0a53a87f502b757b960af3405f27c825ec73a860f0e5905f1d182083f","observation_id":"7390fd32-2f93-48b9-8fdc-88486ac63a18","resolution":{"observed_at":"2026-08-12T14:04:01.112551Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.00049","last_updated":"2024-11-24T03:26:34Z","latest_version":1,"primary_category":"cs.MM","snapshot_observed_at":"2026-08-12T13:58:16.254786Z","submitted_at":"2024-11-24T03:26:34Z","title":"A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":1,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":85,"verified_exact":11,"verified_fuzzy":0},"total_outbound_references":202},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 100 of 202 outbound references and 0 inbound Pith citation observations for arXiv:2412.00049."}