{"as_of":"2026-08-14T08:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8e359ab132e5cc47b4bba08dd82520fdf21122cccd03e39093225e98b4055def","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:57:23.680640Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.00398/citation-record","integrity":"/paper/2501.00398/integrity","json":"/paper/2501.00398/citation-record.json","paper":"/paper/2501.00398"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:57:24.110001Z","title":"”A study of instrument-wise onset detection in Beijing opera percussion ensembles.” 2014 ieee international conference on acoustics, speech and signal processing (icassp)","venue":null,"work_id":"3cc5d0ba-46a6-4758-847d-34ed90229cb3","year":2014},"citing_paper":{"arxiv_id":"2501.00398","last_updated":"2025-04-03T01:09:23Z","snapshot_observed_at":"2026-08-14T03:25:53.634177Z","submitted_at":"2024-12-31T11:27:17Z","title":"TSPE: Task-Specific Prompt Ensemble for Improved Zero-Shot Audio Classification","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T22:57:23.558174Z"},"links":{"citing_paper":"/paper/2501.00398"},"observation_digest":"sha256:cfa855bf112511908f288e6171f3f3bcce29193cadfe9df7d0a52a9f9c23bb97","observation_id":"f3ff5e62-e4b9-4575-90fd-b83780ebab0c","resolution":{"observed_at":"2026-08-10T22:57:24.113914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:57:24.099437Z","title":null,"venue":null,"work_id":"ff890d05-4d8d-4e44-86b3-3b102efdd7f1","year":null},"citing_paper":{"arxiv_id":"2501.00398","last_updated":"2025-04-03T01:09:23Z","snapshot_observed_at":"2026-08-14T03:25:53.634177Z","submitted_at":"2024-12-31T11:27:17Z","title":"TSPE: Task-Specific Prompt Ensemble for Improved Zero-Shot Audio Classification","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T22:57:23.570304Z"},"links":{"citing_paper":"/paper/2501.00398"},"observation_digest":"sha256:1533ffd5dd25eb9972dbf2ef2d9016d572c9be51b9f6075d869ad9f9814fb7c0","observation_id":"59f6d812-2d95-4724-ae1c-b37be4f21720","resolution":{"observed_at":"2026-08-10T22:57:24.103039Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:57:24.088021Z","title":"2013 IEEE International Con- ference on Acoustics, Speech and Signal Processing, Vancouver, BC, Canada","venue":null,"work_id":"70ddfb6f-930a-459c-bf42-e821bd5d1be3","year":2013},"citing_paper":{"arxiv_id":"2501.00398","last_updated":"2025-04-03T01:09:23Z","snapshot_observed_at":"2026-08-14T03:25:53.634177Z","submitted_at":"2024-12-31T11:27:17Z","title":"TSPE: Task-Specific Prompt Ensemble for Improved Zero-Shot Audio Classification","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T22:57:23.573873Z"},"links":{"citing_paper":"/paper/2501.00398"},"observation_digest":"sha256:a1a9a7e5d96b8376d7f90ee559affa6e083ff4da36ac1e8160ef16d7b5f97892","observation_id":"14f174d0-0744-49b9-b135-a30925ddfed9","resolution":{"observed_at":"2026-08-10T22:57:24.092131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:57:24.067142Z","title":"”Musical genre classification of audio signals.” IEEE Transactions on speech and audio processing 10.5 (2002): 293-302","venue":null,"work_id":"fc243d26-810a-4638-995e-4ca7971cfc7c","year":2002},"citing_paper":{"arxiv_id":"2501.00398","last_updated":"2025-04-03T01:09:23Z","snapshot_observed_at":"2026-08-14T03:25:53.634177Z","submitted_at":"2024-12-31T11:27:17Z","title":"TSPE: Task-Specific Prompt Ensemble for Improved Zero-Shot Audio Classification","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T22:57:23.584436Z"},"links":{"citing_paper":"/paper/2501.00398"},"observation_digest":"sha256:5110729661067720100007bc29dc509504765eb2ae787be2c16e0ad73cf24ab3","observation_id":"a96608b0-10bc-4007-8bd2-3e01a3d2533f","resolution":{"observed_at":"2026-08-10T22:57:24.071044Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:57:24.078070Z","title":"”Neural audio synthesis of musical notes with wavenet autoencoders.” International Conference on Machine Learning","venue":null,"work_id":"4870d5ac-acb8-4e82-b8cd-ef8f528cdce9","year":2017},"citing_paper":{"arxiv_id":"2501.00398","last_updated":"2025-04-03T01:09:23Z","snapshot_observed_at":"2026-08-14T03:25:53.634177Z","submitted_at":"2024-12-31T11:27:17Z","title":"TSPE: Task-Specific Prompt Ensemble for Improved Zero-Shot Audio Classification","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T22:57:23.581063Z"},"links":{"citing_paper":"/paper/2501.00398"},"observation_digest":"sha256:7556738a039b43824dd47bbf8b332ff49457caeac796fdd0900591bf7e81a32f","observation_id":"c2462b01-279e-4de9-81ed-5d95ec954053","resolution":{"observed_at":"2026-08-10T22:57:24.081712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:57:24.045036Z","title":null,"venue":null,"work_id":"da762cd5-d34c-4999-b6fd-e15f9ec46db2","year":null},"citing_paper":{"arxiv_id":"2501.00398","last_updated":"2025-04-03T01:09:23Z","snapshot_observed_at":"2026-08-14T03:25:53.634177Z","submitted_at":"2024-12-31T11:27:17Z","title":"TSPE: Task-Specific Prompt Ensemble for Improved Zero-Shot Audio Classification","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T22:57:23.592778Z"},"links":{"citing_paper":"/paper/2501.00398"},"observation_digest":"sha256:86b93811384e25f6287295f89800755b6c1638250ea47ed22e4149eb00081d44","observation_id":"8d60bf92-6d2b-452f-8029-b58b6fddaba6","resolution":{"observed_at":"2026-08-10T22:57:24.049036Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:57:24.055980Z","title":"”CochlScene: Acquisition of acoustic scene data using crowdsourcing.” 2022 Asia-Pacific Signal and Information Processing Association Annual Summit and Conference (APSIPA ASC)","venue":null,"work_id":"cc3ac661-56d9-443a-bfac-7b1b481d22f5","year":2022},"citing_paper":{"arxiv_id":"2501.00398","last_updated":"2025-04-03T01:09:23Z","snapshot_observed_at":"2026-08-14T03:25:53.634177Z","submitted_at":"2024-12-31T11:27:17Z","title":"TSPE: Task-Specific Prompt Ensemble for Improved Zero-Shot Audio Classification","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T22:57:23.588616Z"},"links":{"citing_paper":"/paper/2501.00398"},"observation_digest":"sha256:670c8e4e591ebde921c08110a5863d780d2674adf50e7a4695d4eb876d993129","observation_id":"8f179eb2-69c5-4504-8b95-cf699af64461","resolution":{"observed_at":"2026-08-10T22:57:24.059954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:57:24.021119Z","title":"”A dataset and taxonomy for urban sound research.” Proceedings of the 22nd ACM international conference on Multimedia","venue":null,"work_id":"ac3947ee-394c-4160-85d4-a88a801931c8","year":2014},"citing_paper":{"arxiv_id":"2501.00398","last_updated":"2025-04-03T01:09:23Z","snapshot_observed_at":"2026-08-14T03:25:53.634177Z","submitted_at":"2024-12-31T11:27:17Z","title":"TSPE: Task-Specific Prompt Ensemble for Improved Zero-Shot Audio Classification","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T22:57:23.600842Z"},"links":{"citing_paper":"/paper/2501.00398"},"observation_digest":"sha256:4aa9333b935f4ceb4a5995e9e4e9d571a1cd3011073e96b73168b984c0bf6690","observation_id":"de48d8d0-0e8e-4ccd-99c4-1409c0a4ad5d","resolution":{"observed_at":"2026-08-10T22:57:24.025204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:57:24.032475Z","title":null,"venue":null,"work_id":"1b4b9b16-b4fa-44e7-ba37-b427d87792e6","year":2017},"citing_paper":{"arxiv_id":"2501.00398","last_updated":"2025-04-03T01:09:23Z","snapshot_observed_at":"2026-08-14T03:25:53.634177Z","submitted_at":"2024-12-31T11:27:17Z","title":"TSPE: Task-Specific Prompt Ensemble for Improved Zero-Shot Audio Classification","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T22:57:23.596860Z"},"links":{"citing_paper":"/paper/2501.00398"},"observation_digest":"sha256:c31580588e256416f196be7eb3fd67f9be3ef4862498f3e1feee978a2cf6a16d","observation_id":"cdc34476-76ff-463f-b945-672c9ca00a26","resolution":{"observed_at":"2026-08-10T22:57:24.036958Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:57:23.998656Z","title":"”V ocalsound: A dataset for improving human vocal sounds recognition.” ICASSP 2022-2022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","venue":null,"work_id":"379a6238-d6e9-4e2d-acfe-004fbacd634a","year":2022},"citing_paper":{"arxiv_id":"2501.00398","last_updated":"2025-04-03T01:09:23Z","snapshot_observed_at":"2026-08-14T03:25:53.634177Z","submitted_at":"2024-12-31T11:27:17Z","title":"TSPE: Task-Specific Prompt Ensemble for Improved Zero-Shot Audio Classification","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T22:57:23.608456Z"},"links":{"citing_paper":"/paper/2501.00398"},"observation_digest":"sha256:9b915a5fc61bced06c89fa2a37a648a02adf892c48e7a9353e4585d820dd0acb","observation_id":"4fe66c3b-1ff4-49f9-bd88-d220b363e587","resolution":{"observed_at":"2026-08-10T22:57:24.002755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:57:24.010274Z","title":null,"venue":null,"work_id":"fb6ce5e4-7368-4ed4-a585-c48228e213cc","year":2019},"citing_paper":{"arxiv_id":"2501.00398","last_updated":"2025-04-03T01:09:23Z","snapshot_observed_at":"2026-08-14T03:25:53.634177Z","submitted_at":"2024-12-31T11:27:17Z","title":"TSPE: Task-Specific Prompt Ensemble for Improved Zero-Shot Audio Classification","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T22:57:23.604749Z"},"links":{"citing_paper":"/paper/2501.00398"},"observation_digest":"sha256:2e546be4d01820a4cff846ff5612a6ddb939d355e6785f1f524332eb892605a9","observation_id":"7028d418-1b2a-4788-a39e-eb680ab0e745","resolution":{"observed_at":"2026-08-10T22:57:24.014200Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.08484","last_updated":"2022-03-15T01:52:38Z","snapshot_observed_at":"2026-08-10T02:40:19.998968Z","submitted_at":"2021-10-16T06:07:59Z","title":"A Good Prompt Is Worth Millions of Parameters: Low-resource Prompt-based Learning for Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.08484","snapshot_observed_at":"2026-08-10T22:57:23.615953Z","title":"”A good prompt is worth millions of parameters: Low-resource prompt-based learning for vision-language models.” arXiv preprint arXiv:2110.08484 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.00398","last_updated":"2025-04-03T01:09:23Z","snapshot_observed_at":"2026-08-14T03:25:53.634177Z","submitted_at":"2024-12-31T11:27:17Z","title":"TSPE: Task-Specific Prompt Ensemble for Improved Zero-Shot Audio Classification","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T22:57:23.615953Z"},"links":{"cited_paper":"/paper/2110.08484","citing_paper":"/paper/2501.00398"},"observation_digest":"sha256:3ad8e33502fc0fa2b7f7b3f15c590eaca1901bdca0ac068c7c2a086e154a9be8","observation_id":"80d9d2d7-ec0e-475e-95fc-0309d3c49a78","resolution":{"observed_at":"2026-08-10T22:57:23.615953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-10T22:57:23.612246Z","title":"”Gpt-4 technical report.” arXiv preprint arXiv:2303.08774 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00398","last_updated":"2025-04-03T01:09:23Z","snapshot_observed_at":"2026-08-14T03:25:53.634177Z","submitted_at":"2024-12-31T11:27:17Z","title":"TSPE: Task-Specific Prompt Ensemble for Improved Zero-Shot Audio Classification","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T22:57:23.612246Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2501.00398"},"observation_digest":"sha256:656fa31af3134179664227187d38a4b95bea64afc128a774f5d6f29354e0b3d7","observation_id":"f62f1d8d-0862-4ace-b748-8f52fc79df2b","resolution":{"observed_at":"2026-08-10T22:57:23.612246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:57:23.976407Z","title":"”Learning transferable visual models from natural language supervision.” International conference on machine learning","venue":null,"work_id":"94e080e6-21f1-4a93-bac8-b59eedb7f623","year":2021},"citing_paper":{"arxiv_id":"2501.00398","last_updated":"2025-04-03T01:09:23Z","snapshot_observed_at":"2026-08-14T03:25:53.634177Z","submitted_at":"2024-12-31T11:27:17Z","title":"TSPE: Task-Specific Prompt Ensemble for Improved Zero-Shot Audio Classification","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T22:57:23.623829Z"},"links":{"citing_paper":"/paper/2501.00398"},"observation_digest":"sha256:25367bd01af038d4eb801a3aa71fee7d5bd50861d2e60cb45fe4b9c80684640a","observation_id":"225d9c59-5dd9-45cd-b148-00b952c19f18","resolution":{"observed_at":"2026-08-10T22:57:23.980319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:57:23.987444Z","title":"”Learning to prompt for vision-language models.” International Journal of Computer Vision 130.9 (2022): 2337-2348","venue":null,"work_id":"f2b3b69d-b8cb-4b02-a3a4-b5b8f0deb11d","year":2022},"citing_paper":{"arxiv_id":"2501.00398","last_updated":"2025-04-03T01:09:23Z","snapshot_observed_at":"2026-08-14T03:25:53.634177Z","submitted_at":"2024-12-31T11:27:17Z","title":"TSPE: Task-Specific Prompt Ensemble for Improved Zero-Shot Audio Classification","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T22:57:23.620230Z"},"links":{"citing_paper":"/paper/2501.00398"},"observation_digest":"sha256:dbadb08babfd9e01f8c1e91a83c101eece86a096ca8bd29c552d9a689cc94fdf","observation_id":"7717f753-d9ef-4d6c-9588-99460779f6c2","resolution":{"observed_at":"2026-08-10T22:57:23.991427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:57:23.953285Z","title":"”Audioclip: Extending clip to image, text and au- dio.” ICASSP 2022-2022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","venue":null,"work_id":"f3c06839-34ac-4b06-96fa-f49b3cacb8ef","year":2022},"citing_paper":{"arxiv_id":"2501.00398","last_updated":"2025-04-03T01:09:23Z","snapshot_observed_at":"2026-08-14T03:25:53.634177Z","submitted_at":"2024-12-31T11:27:17Z","title":"TSPE: Task-Specific Prompt Ensemble for Improved Zero-Shot Audio Classification","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T22:57:23.631243Z"},"links":{"citing_paper":"/paper/2501.00398"},"observation_digest":"sha256:0e2f6cda4a42d0b6f280439166f86dd85d914231fa5f1ea05f3fb4e2ecb32dfd","observation_id":"6c73568e-5fa0-45fb-9416-4ab96c6eb591","resolution":{"observed_at":"2026-08-10T22:57:23.957421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:57:23.964513Z","title":"”Wav2clip: Learning robust audio representa- tions from clip.” ICASSP 2022-2022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","venue":null,"work_id":"5aacdea3-ccf0-434b-a478-22557b30ce6f","year":2022},"citing_paper":{"arxiv_id":"2501.00398","last_updated":"2025-04-03T01:09:23Z","snapshot_observed_at":"2026-08-14T03:25:53.634177Z","submitted_at":"2024-12-31T11:27:17Z","title":"TSPE: Task-Specific Prompt Ensemble for Improved Zero-Shot Audio Classification","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T22:57:23.627338Z"},"links":{"citing_paper":"/paper/2501.00398"},"observation_digest":"sha256:1dd69684606ee4f23c2e2eaf7202fa2935b26becefa43aa47cf2cfa81885d407","observation_id":"6bf72149-9438-413e-9fe5-a7cad5bc9d97","resolution":{"observed_at":"2026-08-10T22:57:23.968920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07927","last_updated":"2025-03-16T06:23:34Z","snapshot_observed_at":"2026-08-05T17:55:26.008016Z","submitted_at":"2024-02-05T19:49:13Z","title":"A Systematic Survey of Prompt Engineering in Large Language Models: Techniques and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07927","snapshot_observed_at":"2026-08-10T22:57:23.638165Z","title":"”A systematic survey of prompt engineering in large language models: Techniques and applications.” arXiv preprint arXiv:2402.07927 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00398","last_updated":"2025-04-03T01:09:23Z","snapshot_observed_at":"2026-08-14T03:25:53.634177Z","submitted_at":"2024-12-31T11:27:17Z","title":"TSPE: Task-Specific Prompt Ensemble for Improved Zero-Shot Audio Classification","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T22:57:23.638165Z"},"links":{"cited_paper":"/paper/2402.07927","citing_paper":"/paper/2501.00398"},"observation_digest":"sha256:22bb3ef1c0d0d49c64374eaca0530a9421f69fb83820d3017a752c9b44d1b861","observation_id":"fc8281e9-2d77-4a14-82f7-a70ae672c784","resolution":{"observed_at":"2026-08-10T22:57:23.638165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:57:23.940485Z","title":"”Clap learning audio concepts from natural language supervision.” ICASSP 2023-2023 IEEE International Confer- ence on Acoustics, Speech and Signal Processing (ICASSP)","venue":null,"work_id":"b5436173-ef22-418e-8912-44aa9322ef72","year":2023},"citing_paper":{"arxiv_id":"2501.00398","last_updated":"2025-04-03T01:09:23Z","snapshot_observed_at":"2026-08-14T03:25:53.634177Z","submitted_at":"2024-12-31T11:27:17Z","title":"TSPE: Task-Specific Prompt Ensemble for Improved Zero-Shot Audio Classification","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T22:57:23.634776Z"},"links":{"citing_paper":"/paper/2501.00398"},"observation_digest":"sha256:e8e8465433c47e8cf4d55d6041443c149b24ef6163bc01e9873723b51e94702c","observation_id":"854e330a-e655-4613-b919-27553f9e5fe0","resolution":{"observed_at":"2026-08-10T22:57:23.945615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:57:23.927480Z","title":"”Maple: Multi-modal prompt learn- ing.” Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"2fb38c36-0197-4af4-ae14-82ce577804ff","year":2023},"citing_paper":{"arxiv_id":"2501.00398","last_updated":"2025-04-03T01:09:23Z","snapshot_observed_at":"2026-08-14T03:25:53.634177Z","submitted_at":"2024-12-31T11:27:17Z","title":"TSPE: Task-Specific Prompt Ensemble for Improved Zero-Shot Audio Classification","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T22:57:23.646340Z"},"links":{"citing_paper":"/paper/2501.00398"},"observation_digest":"sha256:c4b30f3b014a43639e307e6c7789ea417d053867bd72f8257cc60518a686cbe0","observation_id":"5bdcc50c-219e-4801-b8fe-d411431c881b","resolution":{"observed_at":"2026-08-10T22:57:23.931765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08753","last_updated":"2024-07-30T18:58:01Z","snapshot_observed_at":"2026-08-13T05:50:14.114776Z","submitted_at":"2023-10-12T22:43:38Z","title":"CompA: Addressing the Gap in Compositional Reasoning in Audio-Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08753","snapshot_observed_at":"2026-08-10T22:57:23.642312Z","title":"”Compa: Addressing the gap in compositional reasoning in audio-language models.” arXiv preprint arXiv:2310.08753 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00398","last_updated":"2025-04-03T01:09:23Z","snapshot_observed_at":"2026-08-14T03:25:53.634177Z","submitted_at":"2024-12-31T11:27:17Z","title":"TSPE: Task-Specific Prompt Ensemble for Improved Zero-Shot Audio Classification","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T22:57:23.642312Z"},"links":{"cited_paper":"/paper/2310.08753","citing_paper":"/paper/2501.00398"},"observation_digest":"sha256:2868840ab8182ed418a9ff440b53bd68c4457e3a3a3eb7aeda82c451caa40c81","observation_id":"ab12a8f3-5809-46b3-a42c-439e1f7797b8","resolution":{"observed_at":"2026-08-10T22:57:23.642312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:57:23.901120Z","title":"”Hard prompts made easy: Gradient-based discrete optimization for prompt tuning and discovery.” Advances in Neural Information Processing Systems 36 (2024)","venue":null,"work_id":"0ada2761-d411-4837-a59c-73a351c99129","year":2024},"citing_paper":{"arxiv_id":"2501.00398","last_updated":"2025-04-03T01:09:23Z","snapshot_observed_at":"2026-08-14T03:25:53.634177Z","submitted_at":"2024-12-31T11:27:17Z","title":"TSPE: Task-Specific Prompt Ensemble for Improved Zero-Shot Audio Classification","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T22:57:23.653503Z"},"links":{"citing_paper":"/paper/2501.00398"},"observation_digest":"sha256:243021f56b1b1ec2e90fc059dbc85681950908cd3b8a2282523424005a5d40f7","observation_id":"74e3b013-9c6d-4c11-b848-c853725a3259","resolution":{"observed_at":"2026-08-10T22:57:23.905785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:57:23.914599Z","title":"”A survey of audio classification using deep learning.” IEEE Access (2023)","venue":null,"work_id":"4fba129c-d005-4e12-b0fb-2cfbd2344319","year":2023},"citing_paper":{"arxiv_id":"2501.00398","last_updated":"2025-04-03T01:09:23Z","snapshot_observed_at":"2026-08-14T03:25:53.634177Z","submitted_at":"2024-12-31T11:27:17Z","title":"TSPE: Task-Specific Prompt Ensemble for Improved Zero-Shot Audio Classification","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T22:57:23.649755Z"},"links":{"citing_paper":"/paper/2501.00398"},"observation_digest":"sha256:663110b585f046e2940f882a87facf63a14fc76f854a0c98db24876f2acc4b62","observation_id":"98dbaab5-52fb-4ae4-a9f7-b14c5fc28df3","resolution":{"observed_at":"2026-08-10T22:57:23.919081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17719","last_updated":"2023-05-28T13:17:10Z","snapshot_observed_at":"2026-08-13T11:30:51.578799Z","submitted_at":"2023-05-28T13:17:10Z","title":"Adapting Language-Audio Models as Few-Shot Audio Learners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17719","snapshot_observed_at":"2026-08-10T22:57:23.661121Z","title":"”Adapting language-audio models as few-shot audio learners.” arXiv preprint arXiv:2305.17719 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00398","last_updated":"2025-04-03T01:09:23Z","snapshot_observed_at":"2026-08-14T03:25:53.634177Z","submitted_at":"2024-12-31T11:27:17Z","title":"TSPE: Task-Specific Prompt Ensemble for Improved Zero-Shot Audio Classification","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T22:57:23.661121Z"},"links":{"cited_paper":"/paper/2305.17719","citing_paper":"/paper/2501.00398"},"observation_digest":"sha256:e7e8a1ecd08e33f44a1c038755a18d0618f3e2c8670ec7960f2448a0d2768435","observation_id":"606ae98f-7685-4978-8fdc-e0c19507394f","resolution":{"observed_at":"2026-08-10T22:57:23.661121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:57:23.887714Z","title":"”Audio-Free Prompt Tuning for Language-Audio Models.” ICASSP 2024-2024 IEEE In- ternational Conference on Acoustics, Speech and Signal Processing (ICASSP)","venue":null,"work_id":"2ae27b19-d3e0-48eb-a7b5-3c22ead9ff27","year":2024},"citing_paper":{"arxiv_id":"2501.00398","last_updated":"2025-04-03T01:09:23Z","snapshot_observed_at":"2026-08-14T03:25:53.634177Z","submitted_at":"2024-12-31T11:27:17Z","title":"TSPE: Task-Specific Prompt Ensemble for Improved Zero-Shot Audio Classification","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T22:57:23.657173Z"},"links":{"citing_paper":"/paper/2501.00398"},"observation_digest":"sha256:4cce7d79303aa052e77c3d8dca0b19fbca8b8d8b0c143aae11c66196fb617a25","observation_id":"3c9f63b6-f367-4d26-971c-175c8f69ad61","resolution":{"observed_at":"2026-08-10T22:57:23.892140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16640","last_updated":"2024-07-18T09:01:52Z","snapshot_observed_at":"2026-08-12T23:57:42.090430Z","submitted_at":"2024-05-26T17:31:21Z","title":"A Survey of Multimodal Large Language Model from A Data-centric Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16640","snapshot_observed_at":"2026-08-10T22:57:23.668961Z","title":"”A Survey of Multimodal Large Language Model from A Data-centric Perspective.” arXiv preprint arXiv:2405.16640 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00398","last_updated":"2025-04-03T01:09:23Z","snapshot_observed_at":"2026-08-14T03:25:53.634177Z","submitted_at":"2024-12-31T11:27:17Z","title":"TSPE: Task-Specific Prompt Ensemble for Improved Zero-Shot Audio Classification","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T22:57:23.668961Z"},"links":{"cited_paper":"/paper/2405.16640","citing_paper":"/paper/2501.00398"},"observation_digest":"sha256:eb93172b6328be518c71c751cc065b4cb5f7ef04dfaeb2e57920fdd675c4e171","observation_id":"4f502568-90fe-46f1-ab8c-ac0e1c6c6272","resolution":{"observed_at":"2026-08-10T22:57:23.668961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:57:23.875002Z","title":"”Multimodal large language models: A survey.” 2023 IEEE International Conference on Big Data (BigData)","venue":null,"work_id":"ef302a2e-dbb5-4b04-9c16-23705bc89b0d","year":2023},"citing_paper":{"arxiv_id":"2501.00398","last_updated":"2025-04-03T01:09:23Z","snapshot_observed_at":"2026-08-14T03:25:53.634177Z","submitted_at":"2024-12-31T11:27:17Z","title":"TSPE: Task-Specific Prompt Ensemble for Improved Zero-Shot Audio Classification","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T22:57:23.665175Z"},"links":{"citing_paper":"/paper/2501.00398"},"observation_digest":"sha256:6959d67dcdada26e4cc00bd79881e948bd7d96898ba192dd5dc29cf3db6708ff","observation_id":"c5175c41-0b58-4570-a3a1-fc17d45c4611","resolution":{"observed_at":"2026-08-10T22:57:23.879355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07904","last_updated":"2024-12-09T05:45:00Z","snapshot_observed_at":"2026-08-14T06:48:24.510311Z","submitted_at":"2024-06-12T06:12:04Z","title":"Grounding Multimodal Large Language Models in Actions","version":2},"cited_work":{"arxiv_id":"2406.07904","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.07904","snapshot_observed_at":"2026-08-10T22:57:23.723001Z","title":"Grounding Multimodal Large Language Models in Actions","venue":"cs.LG","work_id":"4fb49e51-65af-48b8-962d-1983c6041f8d","year":2024},"citing_paper":{"arxiv_id":"2501.00398","last_updated":"2025-04-03T01:09:23Z","snapshot_observed_at":"2026-08-14T03:25:53.634177Z","submitted_at":"2024-12-31T11:27:17Z","title":"TSPE: Task-Specific Prompt Ensemble for Improved Zero-Shot Audio Classification","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T22:57:23.676860Z"},"links":{"cited_paper":"/paper/2406.07904","citing_paper":"/paper/2501.00398"},"observation_digest":"sha256:c8665561a1bd1d17759c021aa744d9f734801b65a74c307ab1639abd67f1cdf0","observation_id":"806f129c-24c2-4a50-bb8f-8c3a2313824c","resolution":{"observed_at":"2026-08-10T22:57:23.729374Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:57:23.673281Z","title":"”Efficient multimodal large language models: A survey.” arXiv preprint arXiv:2405.10739 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00398","last_updated":"2025-04-03T01:09:23Z","snapshot_observed_at":"2026-08-14T03:25:53.634177Z","submitted_at":"2024-12-31T11:27:17Z","title":"TSPE: Task-Specific Prompt Ensemble for Improved Zero-Shot Audio Classification","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T22:57:23.673281Z"},"links":{"citing_paper":"/paper/2501.00398"},"observation_digest":"sha256:12b9e73022bf3447cdd5d3c9d6247bde640c03974a7229ad53e68139b5f45d7e","observation_id":"3fe66244-c858-49a3-90f3-a4f1b055d70c","resolution":{"observed_at":"2026-08-10T22:57:23.673281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01322","last_updated":"2024-03-28T15:53:45Z","snapshot_observed_at":"2026-08-14T02:28:36.490317Z","submitted_at":"2024-03-28T15:53:45Z","title":"A Review of Multi-Modal Large Language and Vision Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01322","snapshot_observed_at":"2026-08-10T22:57:23.680640Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00398","last_updated":"2025-04-03T01:09:23Z","snapshot_observed_at":"2026-08-14T03:25:53.634177Z","submitted_at":"2024-12-31T11:27:17Z","title":"TSPE: Task-Specific Prompt Ensemble for Improved Zero-Shot Audio Classification","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T22:57:23.680640Z"},"links":{"cited_paper":"/paper/2404.01322","citing_paper":"/paper/2501.00398"},"observation_digest":"sha256:abc739a2b16f1e691bedaeaa42154ebb2683b4ad4c478593d9eef04be704fd58","observation_id":"8e3ec007-f0cb-4712-9512-b4af9f4661a5","resolution":{"observed_at":"2026-08-10T22:57:23.680640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.00398","last_updated":"2025-04-03T01:09:23Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-14T03:25:53.634177Z","submitted_at":"2024-12-31T11:27:17Z","title":"TSPE: Task-Specific Prompt Ensemble for Improved Zero-Shot Audio Classification"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":1,"verified_fuzzy":16},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 0 inbound Pith citation observations for arXiv:2501.00398."}