{"as_of":"2026-08-06T21:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7d233cd3df56424e504880a00dd1bbbec7ad1060e838480ca64ee6ace70e30f7","coverage":[{"denominator":75,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":75,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T14:22:34.997009Z","state":"measured"},{"denominator":85,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":85,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T11:52:45.801592Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T13:59:52.874154Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2508.21376","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.21376","snapshot_observed_at":"2026-07-04T13:59:52.874154Z","title":"arXiv preprint arXiv:2508.21376 , year=","venue":null,"work_id":"a56c2721-5ed0-4324-8477-082878ecad65","year":2025},"citing_paper":{"arxiv_id":"2509.08031","last_updated":"2026-05-11T14:29:23Z","snapshot_observed_at":"2026-08-05T09:03:01.095551Z","submitted_at":"2025-09-09T15:30:40Z","title":"AU-Harness: An Open-Source Toolkit for Holistic Evaluation of Audio LLMs","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:01.257126Z"},"links":{"cited_paper":"/paper/2508.21376","citing_paper":"/paper/2509.08031"},"observation_digest":"sha256:bf051889914466dff08dec9915d7b20bedf64f56d8d56ed954d33d3004bf60fd","observation_id":"438bb6eb-afa4-4118-9e01-f38ceee8c266","resolution":{"observed_at":"2026-05-18T18:11:43.185900Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.21376","snapshot_observed_at":"2026-08-03T11:52:45.801592Z","title":"Christoph Leiter, Yuki M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.04946","last_updated":"2026-06-01T13:55:11Z","snapshot_observed_at":"2026-08-06T14:50:53.208202Z","submitted_at":"2026-01-08T13:49:14Z","title":"Prototypicality Bias Reveals Blindspots in Multimodal Evaluation Metrics","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T11:52:45.801592Z"},"links":{"cited_paper":"/paper/2508.21376","citing_paper":"/paper/2601.04946"},"observation_digest":"sha256:a819acf161e3419843232a7ba05a709a4746e3d18ee3cf58db02ca919053f10c","observation_id":"420de55c-2f6c-49e9-9414-845e6f2c69af","resolution":{"observed_at":"2026-08-03T11:52:45.801592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.21376","snapshot_observed_at":"2026-08-03T09:21:31.131370Z","title":"International Phonetic Association","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2601.14046","last_updated":"2026-07-13T00:34:38Z","snapshot_observed_at":"2026-08-06T04:00:15.265518Z","submitted_at":"2026-01-20T15:00:36Z","title":"PRiSM: Benchmarking Phone Realization in Speech Models","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T09:21:31.131370Z"},"links":{"cited_paper":"/paper/2508.21376","citing_paper":"/paper/2601.14046"},"observation_digest":"sha256:0f24d0330686e07a567da8e77c4c5997038ec9c418edfe0dee1b77cc78914e7e","observation_id":"b118258d-1bab-4c12-ba6a-d91a2b208abd","resolution":{"observed_at":"2026-08-03T09:21:31.131370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2508.21376","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.21376","snapshot_observed_at":"2026-07-04T13:59:52.874154Z","title":"arXiv preprint arXiv:2508.21376 , year=","venue":null,"work_id":"a56c2721-5ed0-4324-8477-082878ecad65","year":2025},"citing_paper":{"arxiv_id":"2604.14548","last_updated":"2026-04-20T07:51:45Z","snapshot_observed_at":"2026-07-06T23:02:18.425249Z","submitted_at":"2026-04-16T02:24:59Z","title":"VoxSafeBench: Not Just What Is Said, but Who, How, and Where","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T10:19:28.041282Z"},"links":{"cited_paper":"/paper/2508.21376","citing_paper":"/paper/2604.14548"},"observation_digest":"sha256:2a55f436f2254b303c37b0a5410bae8ce2ee543d8253dd3b66ce99a9f078a1d0","observation_id":"3af163d3-1a39-4b7a-8f15-d33576402f1d","resolution":{"observed_at":"2026-05-10T10:24:22.088783Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2508.21376","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.21376","snapshot_observed_at":"2026-07-04T13:59:52.874154Z","title":"arXiv preprint arXiv:2508.21376 , year=","venue":null,"work_id":"a56c2721-5ed0-4324-8477-082878ecad65","year":2025},"citing_paper":{"arxiv_id":"2604.17248","last_updated":"2026-07-03T19:14:23Z","snapshot_observed_at":"2026-08-04T09:23:59.836631Z","submitted_at":"2026-04-19T04:22:47Z","title":"VIBE: Voice-Induced open-ended Bias Evaluation for Large Audio-Language Models via Real-World Speech","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T05:46:50.923340Z"},"links":{"cited_paper":"/paper/2508.21376","citing_paper":"/paper/2604.17248"},"observation_digest":"sha256:0e4be75127714faf9f6d15b94ed1856129362f2ba9995029298fe4d4bd3aec2c","observation_id":"a2e3a273-2a73-4c70-9492-e80937080f18","resolution":{"observed_at":"2026-05-10T05:51:10.226416Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2508.21376","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.21376","snapshot_observed_at":"2026-07-04T13:59:52.874154Z","title":"arXiv preprint arXiv:2508.21376 , year=","venue":null,"work_id":"a56c2721-5ed0-4324-8477-082878ecad65","year":2025},"citing_paper":{"arxiv_id":"2605.01597","last_updated":"2026-05-02T20:11:12Z","snapshot_observed_at":"2026-08-03T00:52:48.762187Z","submitted_at":"2026-05-02T20:11:12Z","title":"Toward Fair Speech Technologies: A Comprehensive Survey of Bias and Fairness in Speech AI","version":1},"reference_index":227,"source":"pdf_text","source_observed_at":"2026-05-08T19:27:18.774649Z"},"links":{"cited_paper":"/paper/2508.21376","citing_paper":"/paper/2605.01597"},"observation_digest":"sha256:74d11a7d7a28815f472a98a4142f0c94d13b0bd91528e82798b2a418758a0c53","observation_id":"c7a02f6c-211f-4b94-ba6b-cd699f7bcfc5","resolution":{"observed_at":"2026-05-09T05:55:29.197360Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2508.21376","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.21376","snapshot_observed_at":"2026-07-04T13:59:52.874154Z","title":"arXiv preprint arXiv:2508.21376 , year=","venue":null,"work_id":"a56c2721-5ed0-4324-8477-082878ecad65","year":2025},"citing_paper":{"arxiv_id":"2605.14231","last_updated":"2026-05-14T00:56:51Z","snapshot_observed_at":"2026-08-01T16:03:09.685528Z","submitted_at":"2026-05-14T00:56:51Z","title":"AudioMosaic: Contrastive Masked Audio Representation Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-15T01:52:01.164694Z"},"links":{"cited_paper":"/paper/2508.21376","citing_paper":"/paper/2605.14231"},"observation_digest":"sha256:89454cf5e374a24e510bafd2f344c0527d4fbda0f871d48a61e06b01d9e42350","observation_id":"ec1072ce-d1cb-4a1e-97ae-f072a79f6845","resolution":{"observed_at":"2026-05-15T01:53:28.861492Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2508.21376","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.21376","snapshot_observed_at":"2026-07-04T13:59:52.874154Z","title":"arXiv preprint arXiv:2508.21376 , year=","venue":null,"work_id":"a56c2721-5ed0-4324-8477-082878ecad65","year":2025},"citing_paper":{"arxiv_id":"2605.17225","last_updated":"2026-05-17T02:13:58Z","snapshot_observed_at":"2026-07-06T23:28:16.927009Z","submitted_at":"2026-05-17T02:13:58Z","title":"Can Large Audio Language Models Ignore Multilingual Distractors? An Evaluation of Their Selective Auditory Attention Capabilities","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-19T23:17:08.124240Z"},"links":{"cited_paper":"/paper/2508.21376","citing_paper":"/paper/2605.17225"},"observation_digest":"sha256:7815ffc1e041c7fb7314e9798d77acaa05ce86f3b055995a6392d4717050c34b","observation_id":"6e1dc822-8c61-4464-b2ea-73165ac7f0a0","resolution":{"observed_at":"2026-05-19T23:17:57.430007Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2508.21376","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.21376","snapshot_observed_at":"2026-07-04T13:59:52.874154Z","title":"arXiv preprint arXiv:2508.21376 , year=","venue":null,"work_id":"a56c2721-5ed0-4324-8477-082878ecad65","year":2025},"citing_paper":{"arxiv_id":"2606.26968","last_updated":"2026-06-25T12:40:39Z","snapshot_observed_at":"2026-07-31T01:20:28.481331Z","submitted_at":"2026-06-25T12:40:39Z","title":"RedVox: Safety and Fairness Gaps in Speech Models Across Languages","version":1},"reference_index":122,"source":"arxiv_source","source_observed_at":"2026-06-26T04:37:00.399470Z"},"links":{"cited_paper":"/paper/2508.21376","citing_paper":"/paper/2606.26968"},"observation_digest":"sha256:45cde3dadb7117332e6d8feb7863f3f25aa5e75de95b593377bb57dc3a14e44b","observation_id":"0a7d2131-ece3-4fec-9428-112d78267f36","resolution":{"observed_at":"2026-07-04T13:59:52.875641Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.21376","snapshot_observed_at":"2026-08-02T00:57:37.780637Z","title":"AHELM: A holistic evaluation of audio-language models.arXiv preprint arXiv:2508.21376, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14846","last_updated":"2026-07-16T11:15:16Z","snapshot_observed_at":"2026-08-06T19:53:50.584777Z","submitted_at":"2026-07-16T11:15:16Z","title":"RW-Voice-EQ Bench: A Real World Benchmark for Evaluating Voice AI Systems","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T00:57:37.780637Z"},"links":{"cited_paper":"/paper/2508.21376","citing_paper":"/paper/2607.14846"},"observation_digest":"sha256:3ee7ea8e159dd627b957073b85280f633dbe445df73b506b86114bbfc35ca4b3","observation_id":"6d5d8abb-cfc8-46d0-a5f4-cc38b5f97d4c","resolution":{"observed_at":"2026-08-02T00:57:37.780637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.21376/citation-record","integrity":"/paper/2508.21376/integrity","json":"/paper/2508.21376/citation-record.json","paper":"/paper/2508.21376"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T14:22:33.697071Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:33.697071Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:6a4637a9257fee7b894859ae7133f337cd321c2a5c689a3b7059823f59021fe6","observation_id":"c9781f1e-d579-44da-aab7-1f362649c634","resolution":{"observed_at":"2026-08-05T14:22:33.697071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.736245Z","title":"The Claude 3 model family: Opus, Sonnet, Haiku, 2024","venue":null,"work_id":"0f96a7b0-16e8-4dbf-83ef-822c8a35f8bf","year":2024},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:33.778200Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:5bb398fd53eeb1f7e22b85cfbe2d37e0c35806dfeb0fd6b1ee92c30882b5eb59","observation_id":"51e0b0aa-3846-40c3-8ef3-af0dd4b33398","resolution":{"observed_at":"2026-08-05T14:22:35.739040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-05T11:17:11.092255Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-05T14:22:33.923565Z","title":"Common voice: A massively-multilingual speech corpus","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:33.923565Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:528f465c21c45bf5e3cf7f74ea9e87ff84a4b144e79ab072f0e2252053d46b1b","observation_id":"a2426604-3b6c-4168-a590-8cb736b79234","resolution":{"observed_at":"2026-08-05T14:22:33.923565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-05T14:22:34.102234Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.102234Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:b743de03b1f7f33e22be6b39e6c21691a04c2033abafad42f8c63144e3eeeb4d","observation_id":"2602b30f-96dd-4597-8e93-c1a7b37ea665","resolution":{"observed_at":"2026-08-05T14:22:34.102234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.728097Z","title":"Towards multimodal sarcasm detection (an _obviously_ perfect paper)","venue":null,"work_id":"6b7db93e-f137-4868-bd4a-dbd23fb7c8ed","year":2019},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.243183Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:9c72543cdb7843a4d0bc4463a745919b3f76e877452f035e2846096c45abecfc","observation_id":"6b69d948-705f-4460-9ef4-0a4967a3ff44","resolution":{"observed_at":"2026-08-05T14:22:35.731229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-05T14:22:34.352067Z","title":"Qwen2-audio technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.352067Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:5a211dc322d553b4c6287afcd73168387ca53b6d5092bf2b3694b06d1d3f946f","observation_id":"2b74c9ce-de68-4f7c-b1c5-70410f7cdd73","resolution":{"observed_at":"2026-08-05T14:22:34.352067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.05622","last_updated":"2018-06-27T01:49:17Z","snapshot_observed_at":"2026-08-04T08:09:48.365818Z","submitted_at":"2018-06-14T15:59:12Z","title":"VoxCeleb2: Deep Speaker Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.05622","snapshot_observed_at":"2026-08-05T14:22:34.385152Z","title":"V oxceleb2: Deep speaker recognition","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.385152Z"},"links":{"cited_paper":"/paper/1806.05622","citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:d4a667063b910680983725ef66b1e6ccf2d7a43c4c443dcf07db8bbfd14ae65f","observation_id":"41cacf6c-12bb-4b8c-a526-e4abebb8b96f","resolution":{"observed_at":"2026-08-05T14:22:34.385152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.720080Z","title":"Weighted kappa: Nominal scale agreement provision for scaled disagreement or partial credit","venue":null,"work_id":"1a0310c2-c209-496b-8354-0873585053ec","year":1968},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.540549Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:13b26c1b8d885afbdd163c4e02f5a56b2fd67ddb521ddd6dac6d4badc312b667","observation_id":"e4269de4-646a-4529-86dc-f4865d5969a2","resolution":{"observed_at":"2026-08-05T14:22:35.722887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.711808Z","title":"FLEURS: Few-shot learning evaluation of universal representations of speech","venue":null,"work_id":"388b3435-c5f8-4028-b5da-a72816644e9e","year":2022},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.635896Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:e1b3e3e9bec4c0f636e956e76fd2807e8a2112fb30a35e6b4ba1f7b3faa1f77e","observation_id":"38f7207c-cba3-4f5a-9765-493bc4c10f6b","resolution":{"observed_at":"2026-08-05T14:22:35.714660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05060","last_updated":"2024-06-27T16:05:35Z","snapshot_observed_at":"2026-07-06T17:13:38.033348Z","submitted_at":"2024-01-10T10:37:45Z","title":"MuTox: Universal MUltilingual Audio-based TOXicity Dataset and Zero-shot Detector","version":2},"cited_work":{"arxiv_id":"2401.05060","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.05060","snapshot_observed_at":"2026-08-05T14:22:35.195342Z","title":"MuTox: Universal MUltilingual Audio-based TOXicity Dataset and Zero-shot Detector","venue":"cs.SD","work_id":"ce3e001b-5ce9-4df8-8bb7-1bbb8da26565","year":2024},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.753589Z"},"links":{"cited_paper":"/paper/2401.05060","citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:e5bc63b227e05b3416ff406a55f714e2c8daab62ef37be167d34688d892a9792","observation_id":"c7aecf5c-9e8e-491b-8fa9-a0115a3c3be6","resolution":{"observed_at":"2026-08-05T14:22:35.199235Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.703018Z","title":"Speech-transformer: a no-recurrence sequence-to- sequence model for speech recognition","venue":null,"work_id":"ad6b49d4-332c-46c6-9641-ac6ee679b4d5","year":2018},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.775890Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:cdf583950037937cb0d6d03edc08988be9d7f762a12a342d5ac5ff5d8eeb2ee5","observation_id":"d728dde4-d52a-4a2f-b473-9ccde920fbd1","resolution":{"observed_at":"2026-08-05T14:22:35.706024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04475","last_updated":"2025-03-10T09:27:03Z","snapshot_observed_at":"2026-07-06T17:56:23.317089Z","submitted_at":"2024-04-06T02:29:02Z","title":"Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04475","snapshot_observed_at":"2026-08-05T14:22:34.779733Z","title":"Length-controlled alpacaeval: A simple way to debias automatic evaluators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.779733Z"},"links":{"cited_paper":"/paper/2404.04475","citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:55c44005e23711bcaaf14f583df5c9a4ae983fa226d125612590357b98f4dd1b","observation_id":"fe123ce9-b696-4805-9234-726bc74cbbe1","resolution":{"observed_at":"2026-08-05T14:22:34.779733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.694578Z","title":"Alpacafarm: A simulation framework for methods that learn from human feedback","venue":null,"work_id":"c9d4d5ff-08ab-4231-bfb4-97910ccf817b","year":2023},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.783925Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:1dad77f68b4ab605acf3e890658b57323282fa3ecb3e1a5fb299908010a42b65","observation_id":"9a8d9c12-d1d7-4781-8e23-3bd439c1ee47","resolution":{"observed_at":"2026-08-05T14:22:35.697626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.686000Z","title":"Clap learning audio concepts from natural language supervision","venue":null,"work_id":"9b1dd061-48ed-401a-8f71-ef2720efcbd4","year":2023},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.787398Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:531537e42a7d0cbf1f737854634a475bab49ad5b6a7ba43095506d6e083d9d02","observation_id":"02a1fa96-c5ad-42d8-b7c0-252adacb5815","resolution":{"observed_at":"2026-08-05T14:22:35.689202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05779","last_updated":"2024-02-08T16:11:23Z","snapshot_observed_at":"2026-08-06T17:26:13.649575Z","submitted_at":"2024-02-08T16:11:23Z","title":"Examining Gender and Racial Bias in Large Vision-Language Models Using a Novel Dataset of Parallel Images","version":1},"cited_work":{"arxiv_id":"2402.05779","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.05779","snapshot_observed_at":"2026-08-05T14:22:35.164290Z","title":"Examining Gender and Racial Bias in Large Vision-Language Models Using a Novel Dataset of Parallel Images","venue":"cs.CY","work_id":"c49cc320-4b01-4bdb-b759-367b6b4d9222","year":2024},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.790680Z"},"links":{"cited_paper":"/paper/2402.05779","citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:94032c93740bb386da0c3f36b63da7f0e0d5ddfd4f0671330e0619c934122591","observation_id":"6b2cf18e-ff38-4505-a3d2-fc3396052351","resolution":{"observed_at":"2026-08-05T14:22:35.170240Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.677541Z","title":"CSR-I (WSJ0) Complete","venue":null,"work_id":"ec19b6bd-402f-4485-be1e-283e87488f9e","year":2007},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.794039Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:68a6dee390a6cb99655a00aa76df12de32e0593779175c55c1223a77761becec","observation_id":"dd5a1352-ec15-4aed-98d6-51d73912d090","resolution":{"observed_at":"2026-08-05T14:22:35.680312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-05T14:22:34.797552Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.797552Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:53a37bab7e400725f5165fd0395637e023d24a304d17d7ae0c944e5a131139d0","observation_id":"a2cebc79-52ca-4f7e-bb5c-7b9e40df3c96","resolution":{"observed_at":"2026-08-05T14:22:34.797552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.666809Z","title":"Gama: A large audio-language model with advanced audio understanding and complex reasoning abilities","venue":null,"work_id":"adfd9987-662e-47f6-9bb4-6e343157306d","year":2024},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.801817Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:7985349bb05017f456eb972eee99561af3db87737eab5d9f8922f1610fd34812","observation_id":"80c80121-1169-4858-a503-2b0fc6c46247","resolution":{"observed_at":"2026-08-05T14:22:35.669917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.658592Z","title":"V ocalsound: A dataset for improving human vocal sounds recognition","venue":null,"work_id":"99b912fe-549a-4671-8ee6-1338667be76e","year":2022},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.805468Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:5ca089fb8c9613dfd536d22e696acc79a812c31e444a6f06dd4e4b6a68d93198","observation_id":"0afda4f7-ceff-44f8-9dc6-e6014bebf7d0","resolution":{"observed_at":"2026-08-05T14:22:35.661754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1211.3711","last_updated":"2012-11-14T19:25:21Z","snapshot_observed_at":"2026-07-06T02:59:58.238741Z","submitted_at":"2012-11-14T19:25:21Z","title":"Sequence Transduction with Recurrent Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1211.3711","snapshot_observed_at":"2026-08-05T14:22:34.808889Z","title":"Sequence transduction with recurrent neural networks","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.808889Z"},"links":{"cited_paper":"/paper/1211.3711","citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:bf4c450923936298f1b835da504a7512ca0156bb9e9c123d318d72d29a0783a8","observation_id":"93ad2fea-62ad-447d-84c6-01898825071b","resolution":{"observed_at":"2026-08-05T14:22:34.808889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.650451Z","title":"Connectionist temporal classification: labelling unsegmented sequence data with recurrent neural networks","venue":null,"work_id":"2bccc166-2455-4418-8845-5e89e89e2491","year":2006},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.812080Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:144d8dfd2e5209e4fe10418a0a7fba8d0d5b8b223202bd7aede3d145650843f2","observation_id":"71697c35-c355-43ba-b779-faeba1af1613","resolution":{"observed_at":"2026-08-05T14:22:35.653539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T14:22:34.815275Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.815275Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:3c566ecc8883382e2bbf76255b8ac9cea417c8aca347540844a3272e50755b9b","observation_id":"6641787a-fc0b-4f71-8245-0d829f09500b","resolution":{"observed_at":"2026-08-05T14:22:34.815275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.641883Z","title":"Design of a linguistic statistical decoder for the recognition of continuous speech","venue":null,"work_id":"976449da-3806-4bc5-a62b-e3308e8acdb3","year":1975},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.818670Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:5334db6cd46a569591a9595da0efab389d4d4d6f4e8b15dc0d4d38fffa31b44b","observation_id":"9668280e-98e8-4b15-88ba-4a84c824c22c","resolution":{"observed_at":"2026-08-05T14:22:35.645260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.633809Z","title":"Gemini 2.5: Our most intelligent AI model","venue":null,"work_id":"cb0b763f-e490-485e-a4ce-a36059ddc1f2","year":2025},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.821970Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:4f86c9226a76d3a92fc38cb526b0eda82572d8520ddee3c1a18d17ee42bb612c","observation_id":"366e1f1f-8735-45f1-bd81-92a809687cb2","resolution":{"observed_at":"2026-08-05T14:22:35.636480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.626089Z","title":"AudioCaps: Generat- ing captions for audios in the wild","venue":null,"work_id":"6db7259c-778e-47dc-9234-261b556aab7a","year":2019},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.825065Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:88c0aa15a967de8433a8377b152e19db238757078392badacfe5cc271c875fb3","observation_id":"13b680d9-4fd5-4b52-95f4-db89ba74f8ea","resolution":{"observed_at":"2026-08-05T14:22:35.628926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.617627Z","title":"Prometheus-vision: Vision-language model as a judge for fine-grained evaluation","venue":null,"work_id":"695270cb-cc83-4a51-b6f9-5c356aec7b62","year":2024},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.828327Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:d319ee3ff42edf1899166a94c7b0f18abfb5c7b1d454ae6f16a93a375ed2cd99","observation_id":"106c11c1-51a3-405e-9cb2-fed3cd7d70fc","resolution":{"observed_at":"2026-08-05T14:22:35.620586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.607683Z","title":"Vhelm: A holistic evaluation of vision language models","venue":null,"work_id":"dd75ef9d-d659-4dee-9e11-610089145bc0","year":2024},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.832092Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:6ab2ca156251f3a6034ab4a57b60cb29a5ec74f44d52aaf2be378d136e3fe1ce","observation_id":"7d73ef13-c850-4071-8564-9fe6da7cf9b3","resolution":{"observed_at":"2026-08-05T14:22:35.611540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.598010Z","title":"Holistic evaluation of text-to-image models","venue":null,"work_id":"b8056bc5-7251-495d-8b56-a87768e0dd2c","year":2024},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.835355Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:1a9766512665106d9fd9dce480aeea2b2e05acb98a3cf9555f08e3b74f00fb20","observation_id":"e85f6957-3677-45d6-8bd4-bf9d69372f0f","resolution":{"observed_at":"2026-08-05T14:22:35.601221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.588701Z","title":null,"venue":null,"work_id":"7f5aeb43-1103-4fa6-a8c9-047a69a655d8","year":2023},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.838505Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:b383c5ce585d4a11db45b0164da19bd10c3851b1463003407a406ca6639219e4","observation_id":"779edca4-f6cc-4ca8-a1b6-cf978c979b3e","resolution":{"observed_at":"2026-08-05T14:22:35.591876Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.578987Z","title":"The next chapter of the Gemini era for developers","venue":null,"work_id":"4ea7d429-55a7-49dc-8a31-b7f230522bcb","year":2024},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.842252Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:d1ca9bb19f600b8e1eaf143c5ba2859e00d6ea786311d72d13ed1f5585542d9e","observation_id":"e0df2478-580a-4889-a915-2f06b3634273","resolution":{"observed_at":"2026-08-05T14:22:35.582196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.569820Z","title":"Hello GPT-4o, 2024","venue":null,"work_id":"7924f257-5204-4acb-b328-3e659bfad862","year":2024},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.845109Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:b771c84b3d92b5aa79e7f4c3703df0f6ab637153cbe98ced76b70a2165d9ee6f","observation_id":"280baaad-fbf2-4893-88cf-f56237ef9faa","resolution":{"observed_at":"2026-08-05T14:22:35.572830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.559334Z","title":"Introducing our next-generation audio models, Mar 2025","venue":null,"work_id":"145e5065-ccdf-42d4-ae7c-dda663ad5dd8","year":2025},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.848693Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:93cd834df46585313c7ecf92713cad13ea7fead2ebc11fb0c3d25f716a2e1b16","observation_id":"0ed65fc5-1a08-49c4-95dc-657b8e8cfabb","resolution":{"observed_at":"2026-08-05T14:22:35.563178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.550611Z","title":"LibriSpeech: an ASR corpus based on public domain audio books","venue":null,"work_id":"96a1ef6b-a09c-4dd8-b7b9-44e57f571f64","year":2015},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.851608Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:0f10cf8f153c6317a104ab398df02ee34b74bbac5c9a0498eee739d87c48fadc","observation_id":"1d37ba2b-6924-4f40-bb80-fbaad1e10bbf","resolution":{"observed_at":"2026-08-05T14:22:35.553483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.542148Z","title":"MELD: A multimodal multi-party dataset for emotion recognition in conversa- tions","venue":null,"work_id":"85cf8e3c-c191-46c0-81a4-f78fb3914074","year":2019},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.855344Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:ccc7ff0942dc51bd4c97e66bac0b62493e83c3b4d4691d54ca885a349d2f305c","observation_id":"0a627daf-dfb1-40e9-82a3-149fe1217b18","resolution":{"observed_at":"2026-08-05T14:22:35.545031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.03411","last_updated":"2020-12-19T09:18:21Z","snapshot_observed_at":"2026-07-06T10:21:14.277598Z","submitted_at":"2020-12-07T01:53:45Z","title":"MLS: A Large-Scale Multilingual Dataset for Speech Research","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.03411","snapshot_observed_at":"2026-08-05T14:22:34.858777Z","title":"Mls: A large-scale multilingual dataset for speech research","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.858777Z"},"links":{"cited_paper":"/paper/2012.03411","citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:70e31b8224d8ec724376b4ea40d1174a5fc53c70c4441788dd64437b3ac6d3ac","observation_id":"4a345e82-50e5-47fb-8f4e-f8f82df64bad","resolution":{"observed_at":"2026-08-05T14:22:34.858777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:34.862427Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.862427Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:54b32b28f231db05cf0c38688b3feb17fbd8b55cf0a1bc4dbe71972902f13eaf","observation_id":"0c9017b8-63ac-46df-81f9-2c5038f0525e","resolution":{"observed_at":"2026-08-05T14:22:34.862427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07937","last_updated":"2024-12-09T13:43:15Z","snapshot_observed_at":"2026-08-06T09:05:54.257267Z","submitted_at":"2024-03-08T08:10:29Z","title":"Speech Robust Bench: A Robustness Benchmark For Speech Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07937","snapshot_observed_at":"2026-08-05T14:22:34.865850Z","title":"Speech robust bench: a robustness benchmark for speech recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.865850Z"},"links":{"cited_paper":"/paper/2403.07937","citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:951fe49aeed30d291be079c4c8d91dbc06e86af84d4e1ee0504342dad7bc92e1","observation_id":"20219ee9-5565-425d-80c8-3895efb66f6e","resolution":{"observed_at":"2026-08-05T14:22:34.865850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.527015Z","title":"V oice jailbreak attacks against GPT-4o, 2024","venue":null,"work_id":"6d0e500b-ac09-4302-b385-fe206cb0e917","year":2024},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.869568Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:dd1e1fc51f0a15602db80d6cf463ab1029735f5d3cdc56f34d118545e5ebe647","observation_id":"90cb00ee-5387-4568-af70-1a4c4781ecf3","resolution":{"observed_at":"2026-08-05T14:22:35.530681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.517985Z","title":"Salmonn: Towards generic hearing abilities for large language models","venue":null,"work_id":"904c7206-f8a4-4133-a43e-5007716e2e40","year":2024},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.872720Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:cf2660259df19ef1adb86017a724791a9bb199cc2c2149fec0555f023ab14e55","observation_id":"09d16adf-5107-46f1-bb0e-e5f9d8bf2d42","resolution":{"observed_at":"2026-08-05T14:22:35.521493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T14:22:34.875777Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.875777Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:b58a605c30aa4cd5e622489f314e326cfe1ebe5ed18053ed6583f4e73a1070a2","observation_id":"4e4f081b-e1f0-4e0c-887e-5c4cd491836a","resolution":{"observed_at":"2026-08-05T14:22:34.875777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.10310","last_updated":"2020-10-24T06:07:01Z","snapshot_observed_at":"2026-08-01T17:44:35.425095Z","submitted_at":"2020-07-20T17:53:35Z","title":"CoVoST 2 and Massively Multilingual Speech-to-Text Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.10310","snapshot_observed_at":"2026-08-05T14:22:34.879225Z","title":"CoV oST 2 and massively multilingual speech-to-text translation","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.879225Z"},"links":{"cited_paper":"/paper/2007.10310","citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:f2bfca55144afabaf4a4df9e20a5ede0d1388d0fbd59b5dc30dc8ba6b690e1aa","observation_id":"3abc1829-0a24-4cb6-bc49-48c29cb16690","resolution":{"observed_at":"2026-08-05T14:22:34.879225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-05T14:22:34.882641Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.882641Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:3e71a6fa37a93037af641b616501f1114fc86a58d9c44c616a2b103675029783","observation_id":"b57f1fcb-69fa-49dc-8cfe-fa202f93dd4e","resolution":{"observed_at":"2026-08-05T14:22:34.882641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-05T14:22:34.886194Z","title":"Qwen3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.886194Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:28f2f82a9609c1af09e65d677607016983bf1579ceb77946d059abf993f160bb","observation_id":"81ee07bf-d9ee-44bb-b7c7-8ea7ded00799","resolution":{"observed_at":"2026-08-05T14:22:34.886194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07729","last_updated":"2024-07-26T06:30:47Z","snapshot_observed_at":"2026-08-06T03:59:19.956442Z","submitted_at":"2024-02-12T15:41:22Z","title":"AIR-Bench: Benchmarking Large Audio-Language Models via Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07729","snapshot_observed_at":"2026-08-05T14:22:34.889693Z","title":"AIR-Bench: Benchmarking large audio-language models via generative comprehension","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.889693Z"},"links":{"cited_paper":"/paper/2402.07729","citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:ae01489f309f87596a06972f04110ebb47648408c4e3a020445ccbfa69a86c63","observation_id":"d1b45dbc-f6be-4405-871f-4538421e4457","resolution":{"observed_at":"2026-08-05T14:22:34.889693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.509334Z","title":"Speechlm: Enhanced speech pre-training with unpaired textual data","venue":null,"work_id":"a3436166-df6f-4b7a-af97-39cc7ffbb3e6","year":2024},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.893240Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:159556840f0653ef5e35536559e5f7fcb9e0dbbea987d86945940905071af5d4","observation_id":"4d5afb4d-7645-48d4-86bc-306b24464242","resolution":{"observed_at":"2026-08-05T14:22:35.512709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.10752","last_updated":"2018-06-04T07:46:02Z","snapshot_observed_at":"2026-07-06T06:35:57.913552Z","submitted_at":"2018-04-28T06:54:11Z","title":"Syllable-Based Sequence-to-Sequence Speech Recognition with the Transformer in Mandarin Chinese","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.10752","snapshot_observed_at":"2026-08-05T14:22:34.896569Z","title":"6-12\" #Children","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.896569Z"},"links":{"cited_paper":"/paper/1804.10752","citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:78c33cb25808a904f04c4a49e2d56f9467d03e63eb639f64dac8e88de384b686","observation_id":"e4df7286-3747-4109-a699-fcaec0306b8a","resolution":{"observed_at":"2026-08-05T14:22:34.896569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.500960Z","title":null,"venue":null,"work_id":"e4040159-2c1f-47b1-982e-c3ddd29de38e","year":null},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.901477Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:cbefd2d6450218e66c673d15909f3c13f8365cc9c90a770ad91767e8c53dd40f","observation_id":"f46aaaf8-49d0-4b7f-9471-8852c1804a6d","resolution":{"observed_at":"2026-08-05T14:22:35.503933Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.492648Z","title":null,"venue":null,"work_id":"b60f790e-ea32-4e58-89f7-66945a961a8a","year":null},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.905490Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:7c90c2ee8a6a11e4ffc822a3e4da102c9b69455aab846189ecdd2229c5e9d491","observation_id":"6b02af22-b3d2-4244-a430-85bf59d46073","resolution":{"observed_at":"2026-08-05T14:22:35.495380Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.484415Z","title":"humorous and imaginative","venue":null,"work_id":"372b396e-69de-474e-be9c-75dabd41c19a","year":2082},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.908871Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:9f0a6b370541d79b369bf822a02168e40092dfa1522b71b4ffa44a7d3f18affe","observation_id":"94f55932-df50-4f9f-ae84-315f1317d399","resolution":{"observed_at":"2026-08-05T14:22:35.487336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.476279Z","title":null,"venue":null,"work_id":"67781ce1-7fd7-45bb-8f36-1d38b76b0514","year":null},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.912676Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:b232a9010753a7d4fcb08e05f955c371d4b77b86d92c13c24968c8f483db1b95","observation_id":"9122540e-17ca-44f8-9f7d-e72828c7eedb","resolution":{"observed_at":"2026-08-05T14:22:35.478978Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.467566Z","title":null,"venue":null,"work_id":"302a0062-28a7-4403-bd6e-f6385a1f4251","year":null},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.916173Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:a73c65e9e72c3c2fec086dfea3fb94a58dfee7d7a3e917aa727131f705ad4bfb","observation_id":"36bc4d4e-83e2-4d0e-bf9d-0e3c89ed6915","resolution":{"observed_at":"2026-08-05T14:22:35.470623Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.458189Z","title":"E.1.1 Obtaining a list of contrasting roles We use the list of roles from PAIRS (replicated in Table A4) to seed the generation of speech content","venue":null,"work_id":"a9190f09-ff40-44f5-a633-f8de6d5d5dca","year":null},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.919399Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:e885577a4837f6db2b92367e7f4c2ec909bbe5b3ab60e90ff15c0a8a0450188e","observation_id":"746c16fa-8b67-4ab6-8ddd-f90736f57628","resolution":{"observed_at":"2026-08-05T14:22:35.461880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.450053Z","title":null,"venue":null,"work_id":"bce3fece-1494-4bab-aaa4-bee930c36f9d","year":null},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.922630Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:f0156c718c06281fc85119c24a9b5be477a0f78924c558e3778338cf460318f8","observation_id":"1953059c-e1a3-4b3a-9680-cad11029ab8e","resolution":{"observed_at":"2026-08-05T14:22:35.452859Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.442252Z","title":"You should refer to the score rubric","venue":null,"work_id":"06a07d50-cbc1-4b66-8d9b-5529782164e0","year":null},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.926181Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:3228bbc01976a4a823395ebb8b1d06cdbcb0d0413b04f49a249bf78ca253055c","observation_id":"7100bcb0-534f-44b1-853f-e0a1fb4429cb","resolution":{"observed_at":"2026-08-05T14:22:35.445050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.434730Z","title":null,"venue":null,"work_id":"71646057-6049-4a84-8ff2-7d6dbaa76254","year":2024},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.929628Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:aaceae70f1c2f629f258508e3b9bae22a0be0240148306ab55c1ebf68fca2930","observation_id":"91bc551c-76b9-45aa-bc4f-37b5f5d10b12","resolution":{"observed_at":"2026-08-05T14:22:35.437420Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.426503Z","title":"haha”) or throat clearing (e.g., “ahem","venue":null,"work_id":"969c9d66-8a74-44f5-97a5-730049f0da89","year":null},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.933794Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:70f91fbb82d069bf029fac7b80a113d0a0cc38aa1bc38563b22c269123da43e0","observation_id":"fd9eec2a-1908-42c0-81cc-67730c0c68d4","resolution":{"observed_at":"2026-08-05T14:22:35.429327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.418739Z","title":null,"venue":null,"work_id":"dec939a0-cf95-47a7-bfaa-45bf165a87d0","year":2024},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.937749Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:a5d118db6d1158385b5665562df33a9d933d5b830b91beca5b1c4b8dd2a96f24","observation_id":"cafd4911-0adb-4276-8e8d-1cd50d4a9aeb","resolution":{"observed_at":"2026-08-05T14:22:35.421481Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.410501Z","title":"From Table A9, we see that Qwen2-Audio Instruct takes the lead in audio knowledge, followed by Gemini 2.5 Pro (05-06 Preview) and then Gemini 2.0 Flash","venue":null,"work_id":"27024e6e-a014-4be3-bcfa-c4728b8dc6f1","year":null},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.940870Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:ab3f40b2a55b11243eb2aacd2dfcfe97ed961edaa72496e714e74f36848295ba","observation_id":"d000f3ec-6c48-4317-99a0-4a1f55975eaf","resolution":{"observed_at":"2026-08-05T14:22:35.413407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.401996Z","title":"When looking at the safety aspect, we see that OpenAI models are robust to the voice jailbreak attack","venue":null,"work_id":"08c8b61a-6b3d-42f5-a5d5-3cf5a3f1a0d4","year":null},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.944391Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:8a973043d10870af452424b6aaa8f2f11a96b8f0e77626a05ce1fc9c6872431d","observation_id":"0ad1c622-00ad-4d0f-be3a-b2dc963f88b7","resolution":{"observed_at":"2026-08-05T14:22:35.404930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.393772Z","title":"We explain our benchmark in Section 3 and describe the experiments in Section 4 and report results in Section 5","venue":null,"work_id":"e34ffc41-0e17-4e22-8123-1d13af06911e","year":null},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.947659Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:87c194651eccfda09e499e83025904eced22e49ad5a5b2e12f39cc7240a83990","observation_id":"ce0143f0-edec-44b0-a2c5-f3104c8eec86","resolution":{"observed_at":"2026-08-05T14:22:35.396940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.384845Z","title":"Limitations","venue":null,"work_id":"98d11b80-da25-41b4-8fe7-8c61b315a57c","year":null},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.950813Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:d94d29461189114b2e6845a2bb744bfd33eaead30afdc61000537d27386888e3","observation_id":"fe1d0241-7fb1-4404-878f-8d5d953d958a","resolution":{"observed_at":"2026-08-05T14:22:35.388203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.376436Z","title":"Guidelines: • The answer NA means that the paper does not include theoretical results","venue":null,"work_id":"56d609bb-4521-428f-9144-248213af90c7","year":null},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.954108Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:001805438dc1561a84a648d46e75867862c53826be118036d2a54b45b3593bbf","observation_id":"94467b2d-8bef-4025-b527-944ac890cf07","resolution":{"observed_at":"2026-08-05T14:22:35.379320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.368377Z","title":"Guidelines: • The answer NA means that the paper does not include experiments","venue":null,"work_id":"cafbb3c5-ae9e-42b9-8c74-0fc2ff017a5e","year":null},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.957811Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:1de34190916779ffe812c5af197e2e136e5aeff33d0ffb549bcd46c47eba0cff","observation_id":"865d1775-6ed3-449e-a803-01997f63b213","resolution":{"observed_at":"2026-08-05T14:22:35.371248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.359448Z","title":"com/stanford-crfm/helm and the new datasets at https://huggingface.co/ datasets/UCSC-VLAA/PARADE_audio and https://huggingface.co/datasets/ stanford-crfm/CoReBench_v1","venue":null,"work_id":"0806a528-4da6-4534-952f-b6995809dd4f","year":null},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.961310Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:0a87361748bb509584e7800bb6da25d9d5b88fd4bbcf442bd042139f5e276b2a","observation_id":"bed55278-f3a2-4c5b-942a-36e402193d8b","resolution":{"observed_at":"2026-08-05T14:22:35.362856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.350765Z","title":"Guidelines: • The answer NA means that the paper does not include experiments","venue":null,"work_id":"c5ccc09f-9903-498c-b585-e568d3becf77","year":null},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.964523Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:0197c2017ab12b42425f4478d2cea174b9bc26109342ff12853fc5010c084a7d","observation_id":"31b3c5a6-d911-4336-a6d4-ab1b7ac171cd","resolution":{"observed_at":"2026-08-05T14:22:35.354147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.341776Z","title":"But we do not compute error bars for other scenarios","venue":null,"work_id":"9c31f242-f5cb-4e0c-a708-992bfdb011cb","year":null},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.967592Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:f8fc3208319ac6af5422d608c60be2d0d770d4153b3937f6c0a1a685dfb367cd","observation_id":"c9c61ba0-91ae-45a4-bcfd-6cd5a60f4db5","resolution":{"observed_at":"2026-08-05T14:22:35.344723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.332843Z","title":"Guidelines: • The answer NA means that the paper does not include experiments","venue":null,"work_id":"b31130c9-4e78-44ee-b77e-da5b013b3a3e","year":null},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.970937Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:c5b66c997e4ef6241b18ae56345e662af5172df9adb75b2ffcd19f00a1b310fd","observation_id":"2b1cd651-9153-45be-a311-d04b174b3f1d","resolution":{"observed_at":"2026-08-05T14:22:35.335836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.324609Z","title":"Guidelines: • The answer NA means that the authors have not reviewed the NeurIPS Code of Ethics","venue":null,"work_id":"e21c6d72-99b1-450b-b217-cef40d642cc6","year":null},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.974113Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:1e73af6fc1a65af6d2447067e6309432c006e602f000b8b3d174ee3cb7b12913","observation_id":"0ba18208-7e04-4b5c-8bd6-64e4f23efcec","resolution":{"observed_at":"2026-08-05T14:22:35.327529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.315133Z","title":"Guidelines: • The answer NA means that there is no societal impact of the work performed","venue":null,"work_id":"97737f7b-5efa-4766-a7ab-d06c9a968ecd","year":null},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.977488Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:b3923b46eb52a1c0496ab8380292de77b400f865b9254104ced7a7f89e201076","observation_id":"1aacc2fa-b354-4c1b-82a3-e84f0db5faf4","resolution":{"observed_at":"2026-08-05T14:22:35.318849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.306167Z","title":"Before transforming tran- scripts to audio, we performed human scrutiny of the audio transcripts to make sure that there is no improper or toxic content in the metadata","venue":null,"work_id":"f03b44d8-4af8-47b9-9ca1-4ffe763afef0","year":null},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.980801Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:76e7cdb4da35023c012ce924d233fc9b73163f0b182605f6cf7361fcf4f41536","observation_id":"462c6a8a-0ff0-46e1-ae74-e02ca8c24b93","resolution":{"observed_at":"2026-08-05T14:22:35.309287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.296962Z","title":"We cite all the datasets and models used in our work","venue":null,"work_id":"e0abafa8-7be6-42ab-8a15-2f549ec06789","year":null},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.983943Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:eef32a40f81400ff3bd4a924d91cd2afb1984b962ffd92a5507a7489267cf2b8","observation_id":"979de6e4-0d9a-433a-8dfa-f1b0852bb2da","resolution":{"observed_at":"2026-08-05T14:22:35.300092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.286804Z","title":"PARADE is available at https://huggingface.co/datasets/UCSC-VLAA/PARADE_ audio","venue":null,"work_id":"27f32d48-2406-490c-a59d-dffa9dd463c3","year":null},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.987392Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:8e6f194f40c675bb6dc5653e17294097d0a4a2c71ae3881b53cf7155e738ce17","observation_id":"e119bfdd-abc9-4fae-92af-603f17650782","resolution":{"observed_at":"2026-08-05T14:22:35.289975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.276410Z","title":"Guidelines: • The answer NA means that the paper does not involve crowdsourcing nor research with human subjects","venue":null,"work_id":"80b409af-f5a4-40c9-9394-3002461a0d5e","year":null},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.990404Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:5cf039052235d5555a9460b15fa62879f683c8a788d0903371dbb226e51e5a37","observation_id":"85324c3b-c3d3-4ad6-904e-fa33b94ec416","resolution":{"observed_at":"2026-08-05T14:22:35.279914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.266428Z","title":"Guidelines: • The answer NA means that the paper does not involve crowdsourcing nor research with human subjects","venue":null,"work_id":"07d4114f-ca78-472f-be3f-712f3d67e889","year":null},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.993270Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:e3c92b4e69447b31625232ad09be26e30e06b46e62046fac0d05e1424aee02f9","observation_id":"48de1972-aa06-47ee-883c-a22d9a349457","resolution":{"observed_at":"2026-08-05T14:22:35.269972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.256702Z","title":"Answer: [Yes] Justification: As detailed in the Appendix B, we leverage OpenAI’s GPT-4o to create audio transcripts for the curation of PARADE benchmark","venue":null,"work_id":"66480334-69e6-423e-98aa-261816f7daca","year":2025},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.997009Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:ae79826e8572400cfbf59a87aaa94a4e3b6fd325601c7f8ee3addf21f0676893","observation_id":"913828ab-683a-4f62-91d4-fe2b0213da28","resolution":{"observed_at":"2026-08-05T14:22:35.259930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models"},"reference_resolution":{"displayed":75,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":2,"verified_fuzzy":47},"total_outbound_references":75},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 75 of 75 outbound references and 10 inbound Pith citation observations for arXiv:2508.21376."}