{"as_of":"2026-08-13T17:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fdab9320a70fcd5dee484d2acfd897c1964f1c88368c6ab47f7d94e10d7671fa","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T05:40:31.698202Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.17306/citation-record","integrity":"/paper/2412.17306/integrity","json":"/paper/2412.17306/citation-record.json","paper":"/paper/2412.17306"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.05767","last_updated":"2024-02-06T21:42:03Z","snapshot_observed_at":"2026-08-13T10:15:42.919200Z","submitted_at":"2023-09-11T18:50:21Z","title":"Natural Language Supervision for General-Purpose Audio Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05767","snapshot_observed_at":"2026-08-11T05:40:31.434228Z","title":"Natural language supervision for general-purpose audio representations,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17306","last_updated":"2024-12-23T05:53:52Z","snapshot_observed_at":"2026-08-11T05:34:11.538370Z","submitted_at":"2024-12-23T05:53:52Z","title":"Multiple Consistency-guided Test-Time Adaptation for Contrastive Audio-Language Models with Unlabeled Audio","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T05:40:31.434228Z"},"links":{"cited_paper":"/paper/2309.05767","citing_paper":"/paper/2412.17306"},"observation_digest":"sha256:6513edf4042c804e1b11fec08925ce59c9da00f3271b61585b6f8a1eeeb7b066","observation_id":"04e40ff3-35ce-45d5-b695-55f1dfd1d640","resolution":{"observed_at":"2026-08-11T05:40:31.434228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11834","last_updated":"2024-01-19T01:42:32Z","snapshot_observed_at":"2026-08-13T11:38:33.854224Z","submitted_at":"2023-05-19T17:20:56Z","title":"Pengi: An Audio Language Model for Audio Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11834","snapshot_observed_at":"2026-08-11T05:40:31.439659Z","title":"Pengi: An audio language model for audio tasks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17306","last_updated":"2024-12-23T05:53:52Z","snapshot_observed_at":"2026-08-11T05:34:11.538370Z","submitted_at":"2024-12-23T05:53:52Z","title":"Multiple Consistency-guided Test-Time Adaptation for Contrastive Audio-Language Models with Unlabeled Audio","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T05:40:31.439659Z"},"links":{"cited_paper":"/paper/2305.11834","citing_paper":"/paper/2412.17306"},"observation_digest":"sha256:52acf3c43ae07b3d90c37f4b79654367d1f5200f63aaa26565d9cba68fd2f869","observation_id":"2040c3a2-49fc-4f85-af43-1ab463a0f718","resolution":{"observed_at":"2026-08-11T05:40:31.439659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-13T11:39:40.594833Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-11T05:40:31.444333Z","title":"Listen, think, and understand,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17306","last_updated":"2024-12-23T05:53:52Z","snapshot_observed_at":"2026-08-11T05:34:11.538370Z","submitted_at":"2024-12-23T05:53:52Z","title":"Multiple Consistency-guided Test-Time Adaptation for Contrastive Audio-Language Models with Unlabeled Audio","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T05:40:31.444333Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2412.17306"},"observation_digest":"sha256:75e9697f470e98935702195456c0aea076d126d3342a9cd54a2aedec1987bdf4","observation_id":"e4cb841c-e23b-4f24-9b3a-8ebabbb7dd51","resolution":{"observed_at":"2026-08-11T05:40:31.444333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.06687","last_updated":"2024-03-21T21:35:04Z","snapshot_observed_at":"2026-08-13T13:44:09.982002Z","submitted_at":"2022-11-12T15:25:20Z","title":"Large-scale Contrastive Language-Audio Pretraining with Feature Fusion and Keyword-to-Caption Augmentation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.06687","snapshot_observed_at":"2026-08-11T05:40:31.449265Z","title":"Large-scale contrastive language- audio pretraining with feature fusion and keyword-to-caption augmentation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.17306","last_updated":"2024-12-23T05:53:52Z","snapshot_observed_at":"2026-08-11T05:34:11.538370Z","submitted_at":"2024-12-23T05:53:52Z","title":"Multiple Consistency-guided Test-Time Adaptation for Contrastive Audio-Language Models with Unlabeled Audio","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T05:40:31.449265Z"},"links":{"cited_paper":"/paper/2211.06687","citing_paper":"/paper/2412.17306"},"observation_digest":"sha256:0358fa5e4439c7e2e784759d2141d58b2634a653ab66d134e50a30c66fb3fe95","observation_id":"9681e8b6-9ed9-4f50-86a3-6805bbea8ee2","resolution":{"observed_at":"2026-08-11T05:40:31.449265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:40:32.242429Z","title":"Clap learning audio concepts from natural language supervision,","venue":null,"work_id":"2c59f320-72d8-4a53-92c7-f4f5e5520502","year":2023},"citing_paper":{"arxiv_id":"2412.17306","last_updated":"2024-12-23T05:53:52Z","snapshot_observed_at":"2026-08-11T05:34:11.538370Z","submitted_at":"2024-12-23T05:53:52Z","title":"Multiple Consistency-guided Test-Time Adaptation for Contrastive Audio-Language Models with Unlabeled Audio","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T05:40:31.453666Z"},"links":{"citing_paper":"/paper/2412.17306"},"observation_digest":"sha256:6e9ecd2f178601a58e356a721805250f344de30bb13d08c5671832b3ab34b2ab","observation_id":"cb4adb77-a324-45c8-9c67-89d11e27b840","resolution":{"observed_at":"2026-08-11T05:40:32.246547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.08357","last_updated":"2023-09-15T12:31:36Z","snapshot_observed_at":"2026-08-13T10:12:59.468217Z","submitted_at":"2023-09-15T12:31:36Z","title":"Audio-free Prompt Tuning for Language-Audio Models","version":1},"cited_work":{"arxiv_id":"2309.08357","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.08357","snapshot_observed_at":"2026-08-11T05:40:31.802531Z","title":"Audio-free Prompt Tuning for Language-Audio Models","venue":"eess.AS","work_id":"2df4f2c4-bf54-4bd5-8efc-2bacf3a21126","year":2023},"citing_paper":{"arxiv_id":"2412.17306","last_updated":"2024-12-23T05:53:52Z","snapshot_observed_at":"2026-08-11T05:34:11.538370Z","submitted_at":"2024-12-23T05:53:52Z","title":"Multiple Consistency-guided Test-Time Adaptation for Contrastive Audio-Language Models with Unlabeled Audio","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T05:40:31.458227Z"},"links":{"cited_paper":"/paper/2309.08357","citing_paper":"/paper/2412.17306"},"observation_digest":"sha256:4faf31c881b055f7024a8781c4db859b765f95e3221fdf3366a0c8039ae3b82d","observation_id":"b7158a8e-687d-4d01-8c30-0516c295d2d6","resolution":{"observed_at":"2026-08-11T05:40:31.810011Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17719","last_updated":"2023-05-28T13:17:10Z","snapshot_observed_at":"2026-08-13T11:30:51.578799Z","submitted_at":"2023-05-28T13:17:10Z","title":"Adapting Language-Audio Models as Few-Shot Audio Learners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17719","snapshot_observed_at":"2026-08-11T05:40:31.463118Z","title":"Adapting language-audio models as few-shot audio learners,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17306","last_updated":"2024-12-23T05:53:52Z","snapshot_observed_at":"2026-08-11T05:34:11.538370Z","submitted_at":"2024-12-23T05:53:52Z","title":"Multiple Consistency-guided Test-Time Adaptation for Contrastive Audio-Language Models with Unlabeled Audio","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T05:40:31.463118Z"},"links":{"cited_paper":"/paper/2305.17719","citing_paper":"/paper/2412.17306"},"observation_digest":"sha256:9db6ce4dd662d910bfbc56ae308d675b691eb7a9578ff6dce63d2104ac903147","observation_id":"669095e8-b088-47f5-9fe7-635653ee80eb","resolution":{"observed_at":"2026-08-11T05:40:31.463118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:40:32.229794Z","title":"Learning to prompt for vision-language models,","venue":null,"work_id":"54a4c13e-41e0-4f83-a82c-abee2db5f5ac","year":2022},"citing_paper":{"arxiv_id":"2412.17306","last_updated":"2024-12-23T05:53:52Z","snapshot_observed_at":"2026-08-11T05:34:11.538370Z","submitted_at":"2024-12-23T05:53:52Z","title":"Multiple Consistency-guided Test-Time Adaptation for Contrastive Audio-Language Models with Unlabeled Audio","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T05:40:31.467276Z"},"links":{"citing_paper":"/paper/2412.17306"},"observation_digest":"sha256:03ad8f44e74f8bc4676c9e9e02290d72ba6a810ba2e229fe56685523f8200b87","observation_id":"c0ffef81-b74f-4916-8b2a-072dc9c4b0f5","resolution":{"observed_at":"2026-08-11T05:40:32.234141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:40:32.217001Z","title":"Conditional prompt learning for vision-language models,","venue":null,"work_id":"4aa1a05c-fb1a-42c0-9118-a2d1645a6214","year":2022},"citing_paper":{"arxiv_id":"2412.17306","last_updated":"2024-12-23T05:53:52Z","snapshot_observed_at":"2026-08-11T05:34:11.538370Z","submitted_at":"2024-12-23T05:53:52Z","title":"Multiple Consistency-guided Test-Time Adaptation for Contrastive Audio-Language Models with Unlabeled Audio","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T05:40:31.471200Z"},"links":{"citing_paper":"/paper/2412.17306"},"observation_digest":"sha256:3e4945e1e1028ce0e3ea735d388cd174b7abd4658286683b9d1d5a0080e7cde2","observation_id":"18f01fdf-9dd3-4bda-af63-13270fbab00e","resolution":{"observed_at":"2026-08-11T05:40:32.221211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:40:32.204400Z","title":"Self-regulating prompts: Foundational model adaptation without forgetting,","venue":null,"work_id":"34549f55-9429-4b7a-8f45-4cae1ef2672d","year":2023},"citing_paper":{"arxiv_id":"2412.17306","last_updated":"2024-12-23T05:53:52Z","snapshot_observed_at":"2026-08-11T05:34:11.538370Z","submitted_at":"2024-12-23T05:53:52Z","title":"Multiple Consistency-guided Test-Time Adaptation for Contrastive Audio-Language Models with Unlabeled Audio","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T05:40:31.475117Z"},"links":{"citing_paper":"/paper/2412.17306"},"observation_digest":"sha256:dc445042296c25d0d66340ef9f3957cb7856005366ef4a131cd4ca697e343fbc","observation_id":"5e698f11-f4b9-4354-ab08-9ccf5b5230f3","resolution":{"observed_at":"2026-08-11T05:40:32.208754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:40:32.187172Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"d5896ef3-cd5b-4691-911e-c3668c83e041","year":2021},"citing_paper":{"arxiv_id":"2412.17306","last_updated":"2024-12-23T05:53:52Z","snapshot_observed_at":"2026-08-11T05:34:11.538370Z","submitted_at":"2024-12-23T05:53:52Z","title":"Multiple Consistency-guided Test-Time Adaptation for Contrastive Audio-Language Models with Unlabeled Audio","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T05:40:31.478943Z"},"links":{"citing_paper":"/paper/2412.17306"},"observation_digest":"sha256:64b7a32f84c13dec63018cc427d845427db93e99b477fed7167804243c10930a","observation_id":"89992154-a949-404f-8280-3d57fe622df2","resolution":{"observed_at":"2026-08-11T05:40:32.193156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01195","last_updated":"2024-08-03T18:48:43Z","snapshot_observed_at":"2026-08-13T11:26:47.468439Z","submitted_at":"2023-06-01T23:20:47Z","title":"Consistency-guided Prompt Learning for Vision-Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.01195","snapshot_observed_at":"2026-08-11T05:40:31.482602Z","title":"Consistency-guided prompt learning for vision-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17306","last_updated":"2024-12-23T05:53:52Z","snapshot_observed_at":"2026-08-11T05:34:11.538370Z","submitted_at":"2024-12-23T05:53:52Z","title":"Multiple Consistency-guided Test-Time Adaptation for Contrastive Audio-Language Models with Unlabeled Audio","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T05:40:31.482602Z"},"links":{"cited_paper":"/paper/2306.01195","citing_paper":"/paper/2412.17306"},"observation_digest":"sha256:1afefb66e72c9c20dc6ad9df2b98cb594e86df0d47e822e626ab86acb95b8a04","observation_id":"e36b19b4-483a-4722-bbe2-63444d7deed0","resolution":{"observed_at":"2026-08-11T05:40:31.482602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:40:32.168669Z","title":"Test-time training with self-supervision for generalization un- der distribution shifts,","venue":null,"work_id":"2ef11370-55d9-4108-ad26-f6d4302d7662","year":2020},"citing_paper":{"arxiv_id":"2412.17306","last_updated":"2024-12-23T05:53:52Z","snapshot_observed_at":"2026-08-11T05:34:11.538370Z","submitted_at":"2024-12-23T05:53:52Z","title":"Multiple Consistency-guided Test-Time Adaptation for Contrastive Audio-Language Models with Unlabeled Audio","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T05:40:31.486870Z"},"links":{"citing_paper":"/paper/2412.17306"},"observation_digest":"sha256:7f9799f1f7061c99658d4c5549859d81b55d7a548458398a32c46d44669965ee","observation_id":"223526c1-1c13-435f-95c6-d59c99ba487f","resolution":{"observed_at":"2026-08-11T05:40:32.177229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:40:32.153571Z","title":"Ttt++: When does self-supervised test-time training fail or thrive?","venue":null,"work_id":"924e8cbd-1760-46a2-9230-ee5cd2bf4122","year":2021},"citing_paper":{"arxiv_id":"2412.17306","last_updated":"2024-12-23T05:53:52Z","snapshot_observed_at":"2026-08-11T05:34:11.538370Z","submitted_at":"2024-12-23T05:53:52Z","title":"Multiple Consistency-guided Test-Time Adaptation for Contrastive Audio-Language Models with Unlabeled Audio","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T05:40:31.491186Z"},"links":{"citing_paper":"/paper/2412.17306"},"observation_digest":"sha256:a65de4583d135066a4cb6cf3784c5383a28a42e159386a2f711c43393ec163c0","observation_id":"fda7c0bb-4ac7-42c0-a225-90bda8560fc1","resolution":{"observed_at":"2026-08-11T05:40:32.159054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:40:31.495652Z","title":"Tent: Fully test-time adaptation by entropy minimization,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.17306","last_updated":"2024-12-23T05:53:52Z","snapshot_observed_at":"2026-08-11T05:34:11.538370Z","submitted_at":"2024-12-23T05:53:52Z","title":"Multiple Consistency-guided Test-Time Adaptation for Contrastive Audio-Language Models with Unlabeled Audio","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T05:40:31.495652Z"},"links":{"citing_paper":"/paper/2412.17306"},"observation_digest":"sha256:80b42852fbad457ec96cf481dd3755db69076ffc0bb1c87a9a6356cf7270aac3","observation_id":"8bf5a476-bc61-4e62-84a8-6fbe22926a1b","resolution":{"observed_at":"2026-08-11T05:40:31.495652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:40:32.121006Z","title":"Test- time training with masked autoencoders,","venue":null,"work_id":"653e1af5-3edd-45e3-886a-c7282c854bb4","year":2024},"citing_paper":{"arxiv_id":"2412.17306","last_updated":"2024-12-23T05:53:52Z","snapshot_observed_at":"2026-08-11T05:34:11.538370Z","submitted_at":"2024-12-23T05:53:52Z","title":"Multiple Consistency-guided Test-Time Adaptation for Contrastive Audio-Language Models with Unlabeled Audio","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T05:40:31.500256Z"},"links":{"citing_paper":"/paper/2412.17306"},"observation_digest":"sha256:815652d2617fd45aaa5388ba294d9bf26752a2d13caa1000a22be5a602d5afea","observation_id":"5e632284-9d3f-47de-87b5-6ec7a31fc034","resolution":{"observed_at":"2026-08-11T05:40:32.126196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:40:32.108205Z","title":"Memo: Test time robust- ness via adaptation and augmentation,","venue":null,"work_id":"87949433-647a-4974-bdd1-20cf65952f30","year":2022},"citing_paper":{"arxiv_id":"2412.17306","last_updated":"2024-12-23T05:53:52Z","snapshot_observed_at":"2026-08-11T05:34:11.538370Z","submitted_at":"2024-12-23T05:53:52Z","title":"Multiple Consistency-guided Test-Time Adaptation for Contrastive Audio-Language Models with Unlabeled Audio","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T05:40:31.504843Z"},"links":{"citing_paper":"/paper/2412.17306"},"observation_digest":"sha256:13f0ee4f6f144e2725942e72d078e0a9c9c99fdd6e2108c2babae54595abd065","observation_id":"f981c864-0053-4c83-b789-efe25db29a87","resolution":{"observed_at":"2026-08-11T05:40:32.112763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:40:32.089589Z","title":"Test-time prompt tuning for zero-shot gen- eralization in vision-language models,","venue":null,"work_id":"aa7b255c-580a-434a-ab36-b5334c6ad2b1","year":2022},"citing_paper":{"arxiv_id":"2412.17306","last_updated":"2024-12-23T05:53:52Z","snapshot_observed_at":"2026-08-11T05:34:11.538370Z","submitted_at":"2024-12-23T05:53:52Z","title":"Multiple Consistency-guided Test-Time Adaptation for Contrastive Audio-Language Models with Unlabeled Audio","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T05:40:31.508657Z"},"links":{"citing_paper":"/paper/2412.17306"},"observation_digest":"sha256:42735a4921575edb31f1941c807a9b6c81357859ebe784b9f4bcb8d0d77e58fd","observation_id":"cb459315-4630-44df-b0d9-9b9ec9ee9456","resolution":{"observed_at":"2026-08-11T05:40:32.096763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09585","last_updated":"2024-07-22T01:04:49Z","snapshot_observed_at":"2026-08-13T04:18:45.824755Z","submitted_at":"2024-02-14T21:25:06Z","title":"Domain Adaptation for Contrastive Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09585","snapshot_observed_at":"2026-08-11T05:40:31.512780Z","title":"Domain adapta- tion for contrastive audio-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17306","last_updated":"2024-12-23T05:53:52Z","snapshot_observed_at":"2026-08-11T05:34:11.538370Z","submitted_at":"2024-12-23T05:53:52Z","title":"Multiple Consistency-guided Test-Time Adaptation for Contrastive Audio-Language Models with Unlabeled Audio","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T05:40:31.512780Z"},"links":{"cited_paper":"/paper/2402.09585","citing_paper":"/paper/2412.17306"},"observation_digest":"sha256:810e8a1085be66ed66c6cf4dc4c6841f1b289a4d7d9b2f890b0f002663a5f009","observation_id":"06ae624c-63b4-4377-8460-6d8a653621b8","resolution":{"observed_at":"2026-08-11T05:40:31.512780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:40:32.072021Z","title":"Specaugment: A simple data augmenta- tion method for automatic speech recognition,","venue":null,"work_id":"f69d455d-ef50-4509-93eb-e2b573cf8477","year":2019},"citing_paper":{"arxiv_id":"2412.17306","last_updated":"2024-12-23T05:53:52Z","snapshot_observed_at":"2026-08-11T05:34:11.538370Z","submitted_at":"2024-12-23T05:53:52Z","title":"Multiple Consistency-guided Test-Time Adaptation for Contrastive Audio-Language Models with Unlabeled Audio","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T05:40:31.516733Z"},"links":{"citing_paper":"/paper/2412.17306"},"observation_digest":"sha256:98face614d2c6e682c0acfdc6d462c31cf445cab1eb50316b064ae5bfcb794c9","observation_id":"3ce1eac3-33e9-4134-a263-25622c34312d","resolution":{"observed_at":"2026-08-11T05:40:32.078210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:40:32.054759Z","title":"Mixstyle-based contrastive test- time adaptation: Pathway to domain generalization,","venue":null,"work_id":"e87a47cd-d3dd-490c-8525-730396d4b41d","year":2024},"citing_paper":{"arxiv_id":"2412.17306","last_updated":"2024-12-23T05:53:52Z","snapshot_observed_at":"2026-08-11T05:34:11.538370Z","submitted_at":"2024-12-23T05:53:52Z","title":"Multiple Consistency-guided Test-Time Adaptation for Contrastive Audio-Language Models with Unlabeled Audio","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T05:40:31.637777Z"},"links":{"citing_paper":"/paper/2412.17306"},"observation_digest":"sha256:3bb3889bddc41489a21bbe94bb6563b9730c181b8daee90cc268598fbd4f2c1a","observation_id":"55d91f44-20e3-4cdc-bfaa-cff60215624b","resolution":{"observed_at":"2026-08-11T05:40:32.060412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:40:32.039912Z","title":"Hts-at: A hierarchical token-semantic audio trans- former for sound classification and detection,","venue":null,"work_id":"0a27a551-84cb-42f3-8551-64967b0ae0b1","year":2022},"citing_paper":{"arxiv_id":"2412.17306","last_updated":"2024-12-23T05:53:52Z","snapshot_observed_at":"2026-08-11T05:34:11.538370Z","submitted_at":"2024-12-23T05:53:52Z","title":"Multiple Consistency-guided Test-Time Adaptation for Contrastive Audio-Language Models with Unlabeled Audio","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T05:40:31.641883Z"},"links":{"citing_paper":"/paper/2412.17306"},"observation_digest":"sha256:92ef639f9a3ccda31b8ff6cbe501f72cf52c0f4630ffe1ef93c14f9aff5db9bb","observation_id":"25af2e46-45d7-45a7-8ce3-bde4c3bdd708","resolution":{"observed_at":"2026-08-11T05:40:32.044591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07372","last_updated":"2023-09-14T01:16:02Z","snapshot_observed_at":"2026-08-13T10:14:04.174464Z","submitted_at":"2023-09-14T01:16:02Z","title":"Training Audio Captioning Models without Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07372","snapshot_observed_at":"2026-08-11T05:40:31.645719Z","title":"Training audio captioning models without au- dio,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17306","last_updated":"2024-12-23T05:53:52Z","snapshot_observed_at":"2026-08-11T05:34:11.538370Z","submitted_at":"2024-12-23T05:53:52Z","title":"Multiple Consistency-guided Test-Time Adaptation for Contrastive Audio-Language Models with Unlabeled Audio","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T05:40:31.645719Z"},"links":{"cited_paper":"/paper/2309.07372","citing_paper":"/paper/2412.17306"},"observation_digest":"sha256:221e5a1193d047bad1e5ae38ce67043a9e18616e7314035ac6df8cfabbd1e0ea","observation_id":"3758e241-d7ae-4b4b-99c3-4eb3b46656d2","resolution":{"observed_at":"2026-08-11T05:40:31.645719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:40:31.649650Z","title":"Language models are unsupervised multitask learners,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.17306","last_updated":"2024-12-23T05:53:52Z","snapshot_observed_at":"2026-08-11T05:34:11.538370Z","submitted_at":"2024-12-23T05:53:52Z","title":"Multiple Consistency-guided Test-Time Adaptation for Contrastive Audio-Language Models with Unlabeled Audio","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T05:40:31.649650Z"},"links":{"citing_paper":"/paper/2412.17306"},"observation_digest":"sha256:80674ba3cdfaa79c07417ab703fc2b071f3a3a9006da30d0459efee37de03a75","observation_id":"1ccfdcb9-1422-4bc2-bd7a-307e21e9e84d","resolution":{"observed_at":"2026-08-11T05:40:31.649650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:40:32.017216Z","title":"Decoupled weight decay regular- ization,","venue":null,"work_id":"da523ed1-ebdd-4070-be67-b0bb0a92f7ec","year":2017},"citing_paper":{"arxiv_id":"2412.17306","last_updated":"2024-12-23T05:53:52Z","snapshot_observed_at":"2026-08-11T05:34:11.538370Z","submitted_at":"2024-12-23T05:53:52Z","title":"Multiple Consistency-guided Test-Time Adaptation for Contrastive Audio-Language Models with Unlabeled Audio","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T05:40:31.653644Z"},"links":{"citing_paper":"/paper/2412.17306"},"observation_digest":"sha256:170dfc5fea94ba3620503a302f26c988b30267b30c1ff6c7fd926ecf376776b6","observation_id":"885a3bd7-6b6e-4e88-b0df-bacdb83e701a","resolution":{"observed_at":"2026-08-11T05:40:32.021960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03022","last_updated":"2022-05-29T17:51:53Z","snapshot_observed_at":"2026-08-13T16:28:41.684579Z","submitted_at":"2022-03-06T18:13:09Z","title":"HEAR: Holistic Evaluation of Audio Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03022","snapshot_observed_at":"2026-08-11T05:40:31.657406Z","title":"Hear: Holistic evaluation of audio representations,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.17306","last_updated":"2024-12-23T05:53:52Z","snapshot_observed_at":"2026-08-11T05:34:11.538370Z","submitted_at":"2024-12-23T05:53:52Z","title":"Multiple Consistency-guided Test-Time Adaptation for Contrastive Audio-Language Models with Unlabeled Audio","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T05:40:31.657406Z"},"links":{"cited_paper":"/paper/2203.03022","citing_paper":"/paper/2412.17306"},"observation_digest":"sha256:9a0cd4f84e02eb6374be64f8fdb85216d82d65a065646a0030392d3f5606bdb8","observation_id":"fd23fff8-6e7d-436e-9326-f8cccbdcbbd7","resolution":{"observed_at":"2026-08-11T05:40:31.657406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:40:31.998511Z","title":"Esc: Dataset for environmental sound classifica- tion,","venue":null,"work_id":"6ff59e12-1db9-4aaa-826a-bcd1595ba160","year":2015},"citing_paper":{"arxiv_id":"2412.17306","last_updated":"2024-12-23T05:53:52Z","snapshot_observed_at":"2026-08-11T05:34:11.538370Z","submitted_at":"2024-12-23T05:53:52Z","title":"Multiple Consistency-guided Test-Time Adaptation for Contrastive Audio-Language Models with Unlabeled Audio","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T05:40:31.661438Z"},"links":{"citing_paper":"/paper/2412.17306"},"observation_digest":"sha256:c60b320c0fd7a70c6fc6601e0ab428f2525e86de5d97d00451ecb8d5c21e0928","observation_id":"6d362f45-ce40-4112-88ed-7d5f785eb451","resolution":{"observed_at":"2026-08-11T05:40:32.005413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:40:31.980427Z","title":"A dataset and taxonomy for urban sound research,","venue":null,"work_id":"c2813dd6-842e-41ea-a9a9-4fd10c27a4ee","year":2014},"citing_paper":{"arxiv_id":"2412.17306","last_updated":"2024-12-23T05:53:52Z","snapshot_observed_at":"2026-08-11T05:34:11.538370Z","submitted_at":"2024-12-23T05:53:52Z","title":"Multiple Consistency-guided Test-Time Adaptation for Contrastive Audio-Language Models with Unlabeled Audio","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T05:40:31.665363Z"},"links":{"citing_paper":"/paper/2412.17306"},"observation_digest":"sha256:43d49b366a5407ad6c9b42c335ddccf7b98d702c440479f3441453b3e89f5d3f","observation_id":"7439398e-b35c-4314-a75e-3098098f1981","resolution":{"observed_at":"2026-08-11T05:40:31.986468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:40:31.951275Z","title":"DCASE 2017 challenge setup: tasks, datasets and baseline system,","venue":null,"work_id":"22b83e3c-596c-4dc1-9bea-b52101723166","year":2017},"citing_paper":{"arxiv_id":"2412.17306","last_updated":"2024-12-23T05:53:52Z","snapshot_observed_at":"2026-08-11T05:34:11.538370Z","submitted_at":"2024-12-23T05:53:52Z","title":"Multiple Consistency-guided Test-Time Adaptation for Contrastive Audio-Language Models with Unlabeled Audio","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T05:40:31.670211Z"},"links":{"citing_paper":"/paper/2412.17306"},"observation_digest":"sha256:94cecbd0bf2790fe7180a2dd34ef4fff592812760ba3c573463454c8fcd10f3b","observation_id":"fab91357-9260-43c9-816e-dfdffd299061","resolution":{"observed_at":"2026-08-11T05:40:31.960802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:40:31.936154Z","title":"Automatic musical genre classification of audio signals,","venue":null,"work_id":"63f1fa8e-efa7-4c78-b382-e095d5dd7e0f","year":2001},"citing_paper":{"arxiv_id":"2412.17306","last_updated":"2024-12-23T05:53:52Z","snapshot_observed_at":"2026-08-11T05:34:11.538370Z","submitted_at":"2024-12-23T05:53:52Z","title":"Multiple Consistency-guided Test-Time Adaptation for Contrastive Audio-Language Models with Unlabeled Audio","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T05:40:31.674535Z"},"links":{"citing_paper":"/paper/2412.17306"},"observation_digest":"sha256:3fde1c01ddc300a7ddfa2a4d4fff05c045f3f6859b65793a9c60512f5ce5638e","observation_id":"b209dba2-a00c-4ba3-b107-733d09a6c586","resolution":{"observed_at":"2026-08-11T05:40:31.940207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:40:31.679994Z","title":"Crema-d: Crowd-sourced emotional multimodal actors dataset,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.17306","last_updated":"2024-12-23T05:53:52Z","snapshot_observed_at":"2026-08-11T05:34:11.538370Z","submitted_at":"2024-12-23T05:53:52Z","title":"Multiple Consistency-guided Test-Time Adaptation for Contrastive Audio-Language Models with Unlabeled Audio","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T05:40:31.679994Z"},"links":{"citing_paper":"/paper/2412.17306"},"observation_digest":"sha256:fad9f4cf27f2d9ef5416f5954ef1ae1410e19ad99b0eda5a53c81f701bd91320","observation_id":"fcb18012-b845-4d2a-9d06-a363725828dd","resolution":{"observed_at":"2026-08-11T05:40:31.679994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:40:31.914956Z","title":"The ryerson audio-visual database of emotional speech and song (ravdess): A dynamic, multimodal set of facial and vocal expressions in north american english","venue":null,"work_id":"ecaa40ab-d82e-4e19-830b-f28de50b771f","year":2018},"citing_paper":{"arxiv_id":"2412.17306","last_updated":"2024-12-23T05:53:52Z","snapshot_observed_at":"2026-08-11T05:34:11.538370Z","submitted_at":"2024-12-23T05:53:52Z","title":"Multiple Consistency-guided Test-Time Adaptation for Contrastive Audio-Language Models with Unlabeled Audio","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T05:40:31.685675Z"},"links":{"citing_paper":"/paper/2412.17306"},"observation_digest":"sha256:89968bd04c26cc506432759c773355c23a21629b0f52d0c6e49a802e1f1f0b4c","observation_id":"6c73eea0-286a-4653-be60-5349df7dbda3","resolution":{"observed_at":"2026-08-11T05:40:31.919454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:40:31.901373Z","title":"V ocalsound: A dataset for improving human vocal sounds recognition,","venue":null,"work_id":"bc14314b-6689-4d57-a56d-b96c97bba755","year":2022},"citing_paper":{"arxiv_id":"2412.17306","last_updated":"2024-12-23T05:53:52Z","snapshot_observed_at":"2026-08-11T05:34:11.538370Z","submitted_at":"2024-12-23T05:53:52Z","title":"Multiple Consistency-guided Test-Time Adaptation for Contrastive Audio-Language Models with Unlabeled Audio","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T05:40:31.689526Z"},"links":{"citing_paper":"/paper/2412.17306"},"observation_digest":"sha256:b70ed95598e445c16c3d94dcefd5a343aa17a19ce159cfe5278a7d4cfd46f9de","observation_id":"0f3b915e-7d4e-4330-b00c-38dc6ae24e0e","resolution":{"observed_at":"2026-08-11T05:40:31.905460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:40:31.693787Z","title":"Sound events for surveillance applications,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.17306","last_updated":"2024-12-23T05:53:52Z","snapshot_observed_at":"2026-08-11T05:34:11.538370Z","submitted_at":"2024-12-23T05:53:52Z","title":"Multiple Consistency-guided Test-Time Adaptation for Contrastive Audio-Language Models with Unlabeled Audio","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T05:40:31.693787Z"},"links":{"citing_paper":"/paper/2412.17306"},"observation_digest":"sha256:fab96233ef8e333686d5b71177e2a08f7f2902b9643f326ba26ee96c2ff118f5","observation_id":"fe5de9aa-534f-463c-888e-2b32d79d636a","resolution":{"observed_at":"2026-08-11T05:40:31.693787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:40:31.877114Z","title":"Neural audio synthesis of musical notes with wavenet autoencoders,","venue":null,"work_id":"f078b224-a5aa-4931-be3e-6268d8c074ef","year":2017},"citing_paper":{"arxiv_id":"2412.17306","last_updated":"2024-12-23T05:53:52Z","snapshot_observed_at":"2026-08-11T05:34:11.538370Z","submitted_at":"2024-12-23T05:53:52Z","title":"Multiple Consistency-guided Test-Time Adaptation for Contrastive Audio-Language Models with Unlabeled Audio","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T05:40:31.698202Z"},"links":{"citing_paper":"/paper/2412.17306"},"observation_digest":"sha256:e483bd5b782623a1578fa5fd30c74727188facd3eefe517b714b5c1cbb6d03df","observation_id":"7ccc4677-0cbb-480c-894e-0f5201124052","resolution":{"observed_at":"2026-08-11T05:40:31.882388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.17306","last_updated":"2024-12-23T05:53:52Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-11T05:34:11.538370Z","submitted_at":"2024-12-23T05:53:52Z","title":"Multiple Consistency-guided Test-Time Adaptation for Contrastive Audio-Language Models with Unlabeled Audio"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":1,"verified_fuzzy":21},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2412.17306."}