{"as_of":"2026-08-08T06:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f8d49dcf8f685884999cd1135851a5a984b9e815432f5907926269ff17e76f2c","coverage":[{"denominator":71,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":71,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:28:45.760195Z","state":"measured"},{"denominator":74,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":74,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T23:50:12.369547Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-13T20:58:15.805732Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2506.05140","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05140","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Audiolens: A closer look at auditory attribute percep- tion of large audio-language models","venue":null,"work_id":"8dd24cf8-e623-4632-8803-7781e663564e","year":2025},"citing_paper":{"arxiv_id":"2604.02605","last_updated":"2026-04-03T00:48:49Z","snapshot_observed_at":"2026-07-31T12:45:01.220506Z","submitted_at":"2026-04-03T00:48:49Z","title":"Do Audio-Visual Large Language Models Really See and Hear?","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-13T20:56:19.815569Z"},"links":{"cited_paper":"/paper/2506.05140","citing_paper":"/paper/2604.02605"},"observation_digest":"sha256:61f3638601678b101e99a1feaf7bfadcae08c69d7d71ac54b93f3657623f4145","observation_id":"4b4c16e3-ffa9-4279-b092-f29e7075d693","resolution":{"observed_at":"2026-05-13T20:58:15.807264Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2506.05140","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05140","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Audiolens: A closer look at auditory attribute percep- tion of large audio-language models","venue":null,"work_id":"8dd24cf8-e623-4632-8803-7781e663564e","year":2025},"citing_paper":{"arxiv_id":"2604.24401","last_updated":"2026-04-27T12:25:18Z","snapshot_observed_at":"2026-07-06T23:10:24.992210Z","submitted_at":"2026-04-27T12:25:18Z","title":"All That Glitters Is Not Audio: Rethinking Text Priors and Audio Reliance in Audio-Language Evaluation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-07T17:39:38.234052Z"},"links":{"cited_paper":"/paper/2506.05140","citing_paper":"/paper/2604.24401"},"observation_digest":"sha256:5cf3d225ca723d2d5afc3c01191d3818a019dc145963282e9cf6ae1ebb45f92a","observation_id":"8c896b53-acc0-4529-9cc0-d8c7d500e765","resolution":{"observed_at":"2026-05-11T23:16:36.162279Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05140","snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"Audiolens: A closer look at auditory attribute perception of large audio-language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-06T19:21:14.835962Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"cited_paper":"/paper/2506.05140","citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:bd059c58144644a4e7fa794e707f48182917584515979e4ee22e6495358a21fc","observation_id":"81c5aee3-dbe6-4897-8bb8-a06c1a164750","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.05140/citation-record","integrity":"/paper/2506.05140/integrity","json":"/paper/2506.05140/citation-record.json","paper":"/paper/2506.05140"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-06T23:27:24.356320Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-07T10:28:39.289563Z","title":"A survey of large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:39.289563Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:06194be16f391812ecd1ca1ca0427298a321c0a2751cae3d56344eb38e8c388e","observation_id":"d255a0df-3d68-409c-b1c0-c4e4b494e658","resolution":{"observed_at":"2026-08-07T10:28:39.289563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T10:28:39.368889Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:39.368889Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:73118530c65f00a96c9207a97a40fd83f0301e30eccf2b9db6d1dcf55b3334c6","observation_id":"09a13ad8-30a3-4816-90a7-3fe3e762fe76","resolution":{"observed_at":"2026-08-07T10:28:39.368889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T10:28:39.425083Z","title":"Gpt-4o system card,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:39.425083Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:77f18de8edf159fdbf99b352ad3b52291f43e3385a9d8d044f90c30a9ebdec6b","observation_id":"3e11c524-40f8-470b-ace5-40f1b20f116c","resolution":{"observed_at":"2026-08-07T10:28:39.425083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:56.358065Z","title":"Listen, think, and understand,","venue":null,"work_id":"08c4b39e-8280-4916-85f4-7c4d81f66b7b","year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:39.511419Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:4b214798a6c903c7c3522ddbfe0f32cf867ca07fa1f1080ec7e9abf82192ee07","observation_id":"74343a86-4951-42cf-b9ba-192289de4466","resolution":{"observed_at":"2026-08-07T10:28:56.449419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-07T10:28:39.609105Z","title":"Qwen-audio: Advancing universal audio understanding via unified large-scale audio-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:39.609105Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:b04dfbd8a9c9df8f4f9b94dcd0d67667b5239814ff29331c29b058ce0b5f4b32","observation_id":"06c2db3d-8dc4-43c5-93ed-13457067cb84","resolution":{"observed_at":"2026-08-07T10:28:39.609105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-07T10:28:39.675867Z","title":"Qwen2-audio technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:39.675867Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:cd8a630714386029897c78133569adb225bece5471ab770a2adf2ca4b526eb61","observation_id":"f9d1cb11-b26b-4789-89c6-6ab6f631035e","resolution":{"observed_at":"2026-08-07T10:28:39.675867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:56.155174Z","title":"Developing instruction-following speech language model without speech instruction-tuning data,","venue":null,"work_id":"30f71d0c-a54a-4f05-9916-3d8461e7e784","year":2025},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:39.744849Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:84d73349b8f7da7c342d74bc52d16693f0269b1d4646d3e440206c8c3fa9b323","observation_id":"0aa6d605-d714-4d2c-aec3-1d12316476a5","resolution":{"observed_at":"2026-08-07T10:28:56.244037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:55.980480Z","title":"Gama: A large audio- language model with advanced audio understanding and complex rea- soning abilities,","venue":null,"work_id":"e9dd4c44-4d7f-444b-8734-7d6f11e36bf0","year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:39.817469Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:6a0f4bf22910bd273390a047e7d74e1b2c7ec5323527df88e2aede21b8184539","observation_id":"268f2fec-eaef-4029-b141-05f4e0660226","resolution":{"observed_at":"2026-08-07T10:28:56.069942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:55.762268Z","title":"Desta: Enhancing speech language models through descriptive speech-text alignment,","venue":null,"work_id":"3a42835f-87f4-4c56-9dd0-221a3a0dda8b","year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:39.893515Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:d57f1c4342a280e0d5b35e5f1c010db96895cd6c28c5ff4bef16ea40d9628d38","observation_id":"e83d794b-92f2-4d92-bab5-8f4112697b21","resolution":{"observed_at":"2026-08-07T10:28:55.881715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:55.544973Z","title":"Speech- copilot: Leveraging large language models for speech processing via task decomposition, modularization, and program generation,","venue":null,"work_id":"d3dc1f8e-4d65-478e-9e60-713663df0937","year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:39.944369Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:058764e58eec7d8cda85389c964e77352777739472ca6f160d11764be82d7557","observation_id":"b1ef3cf5-5cc5-493c-b006-a94f6d3ef0fe","resolution":{"observed_at":"2026-08-07T10:28:55.670146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:55.375762Z","title":"Joint audio and speech understanding,","venue":null,"work_id":"80d8b51b-2847-4379-ace6-c55a088d7a75","year":2023},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:40.030275Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:1e793e182959a2f0181131f498ac20cfa0c5d8822dabf08c0c703acceb93c76a","observation_id":"80086a8e-fdc5-4f4e-a2bb-53e7a2c60d6c","resolution":{"observed_at":"2026-08-07T10:28:55.460892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:55.210390Z","title":"SALMONN: Towards generic hearing abilities for large language models,","venue":null,"work_id":"8b5fbc54-a9ba-49c7-9742-ec9a603e9f72","year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:40.127663Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:4bb6f634f16560aea6eb8427d36f45c452d15ad7ad7fb689e2c3564038e4e747","observation_id":"42ea304d-b4fb-4fa3-a560-e4a5fcde6884","resolution":{"observed_at":"2026-08-07T10:28:55.289586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:54.988786Z","title":"Blsp-emo: Towards empathetic large speech-language models,","venue":null,"work_id":"315a19dd-6111-40fd-90e6-f56b63bb0ded","year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:40.209530Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:8bcdb06e691ffac1cdf6f007ee6d5b07fb5fa1ffdfed000248ad63c05125f317","observation_id":"7288f801-6165-4eab-aa62-3ccff0ea25e8","resolution":{"observed_at":"2026-08-07T10:28:55.099265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:54.804136Z","title":"Wavllm: Towards robust and adaptive speech large language model,","venue":null,"work_id":"8ff768e8-edaa-4d85-917d-49a6c07ca4c1","year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:40.279680Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:57ff703473de72576377e7910035dece0c0ae3ed504c7f4d842780ea55cd821e","observation_id":"d3296e3e-e49b-46ab-8237-1dc6ffb0ccf7","resolution":{"observed_at":"2026-08-07T10:28:54.892249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:54.647798Z","title":"Dynamic-SUPERB phase-2: A collaboratively expanding benchmark for measuring the capabilities of spoken language models with 180 tasks,","venue":null,"work_id":"6d1a9a1d-d763-4596-8638-32bbb11285cf","year":2025},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:40.359251Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:19559f61a32f7d318e76537cc1c4edaf16f858a68c2a58876d8ddc08dc4a29a9","observation_id":"d6326ed4-33da-4b47-a841-0c12665efe2a","resolution":{"observed_at":"2026-08-07T10:28:54.718898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:54.477451Z","title":"AIR-bench: Benchmarking large audio-language models via generative comprehension,","venue":null,"work_id":"6e82cf96-1e99-499f-9200-ff05123af229","year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:40.445257Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:4d9e238ffdb165b2a1d6856977b43b438336322c18b31abb67f61de4a4dc12ae","observation_id":"4e271325-a613-4d92-ab4b-3f8917f15ed5","resolution":{"observed_at":"2026-08-07T10:28:54.568234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:54.291829Z","title":"MMAU: A massive multi- task audio understanding and reasoning benchmark,","venue":null,"work_id":"e44d761c-533f-45be-9cc4-540dcf7af959","year":2025},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:40.534392Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:be54562c8110a117027774e51f97f5b5dccb362c8d1e1f8ec68880781752f797","observation_id":"261eee84-01c6-4106-9279-3b23d98e4978","resolution":{"observed_at":"2026-08-07T10:28:54.372004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:54.091653Z","title":"SD-eval: A benchmark dataset for spoken dialogue understanding beyond words,","venue":null,"work_id":"fd4a3bdd-ef35-49a8-9caa-3947667d5b25","year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:40.610768Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:7402f59c9effc527e55edd545738bbafebf8c44271559454550db5ad089477ce","observation_id":"ae3d2463-73c5-43c8-8ffa-27f2a4a310bd","resolution":{"observed_at":"2026-08-07T10:28:54.212745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:53.881175Z","title":"Audiobench: A universal benchmark for audio large language models,","venue":null,"work_id":"720f9508-a318-49e2-ab44-fb0b2643a143","year":2025},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:40.679645Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:61ec25477f59e45c54ac5dd9ba74c485ebe9f3fb86abdc8ef2ca45cb6e484c83","observation_id":"3f1de721-b173-43c7-861d-358b2804662d","resolution":{"observed_at":"2026-08-07T10:28:53.957156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:53.684716Z","title":"Sakura: On the multi- hop reasoning of large audio-language models based on speech and audio information,","venue":null,"work_id":"ac76ea48-f9d4-4bc0-a637-2f9e6939f8fa","year":2025},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:40.743369Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:0624a0a59ef0a9b5be7269dc470289e76250628a7a45cfc57692336cb6c71ada","observation_id":"6cf1eb72-eeaf-4b9d-8c4c-2781d612b8b9","resolution":{"observed_at":"2026-08-07T10:28:53.774159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15957","last_updated":"2026-04-26T17:05:53Z","snapshot_observed_at":"2026-07-06T21:28:06.120576Z","submitted_at":"2025-05-21T19:17:29Z","title":"Towards Holistic Evaluation of Large Audio-Language Models: A Comprehensive Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15957","snapshot_observed_at":"2026-08-07T10:28:40.806283Z","title":"Towards holistic evaluation of large audio-language models: A comprehensive survey,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:40.806283Z"},"links":{"cited_paper":"/paper/2505.15957","citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:9dc79e75adc68722e6a5cc1a9d90b22c8b4747067f06660968c0435d7c776321","observation_id":"3c7cc759-9795-4eb5-945d-edce1eeb0748","resolution":{"observed_at":"2026-08-07T10:28:40.806283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09940","last_updated":"2025-02-14T06:34:08Z","snapshot_observed_at":"2026-08-07T19:57:13.037270Z","submitted_at":"2025-02-14T06:34:08Z","title":"A Preliminary Exploration with GPT-4o Voice Mode","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09940","snapshot_observed_at":"2026-08-07T10:28:40.942515Z","title":"A preliminary exploration with gpt-4o voice mode,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:40.942515Z"},"links":{"cited_paper":"/paper/2502.09940","citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:8653857cf65bdd00194b65f5657ffcce8b3ca961087ee562617e67f0c186b237","observation_id":"63a5ae1d-f3b6-4eb2-8f1b-02d5633e1e7e","resolution":{"observed_at":"2026-08-07T10:28:40.942515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:53.550421Z","title":"Language-specific neurons: The key to multilingual ca- pabilities in large language models,","venue":null,"work_id":"0fea6b67-a2ba-4a9a-9cf4-bac9db4e30d0","year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:41.060069Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:7a5c883aa9740dbe712e3faf54f93713aa3958a3f97db288d0ab2dacf2030107","observation_id":"08f9681f-dccd-4625-9f1f-ae80d6dbca1b","resolution":{"observed_at":"2026-08-07T10:28:53.628004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14928","last_updated":"2023-10-23T13:31:32Z","snapshot_observed_at":"2026-08-06T15:12:21.110974Z","submitted_at":"2023-10-23T13:31:32Z","title":"Unveiling A Core Linguistic Region in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14928","snapshot_observed_at":"2026-08-07T10:28:41.154385Z","title":"Unveiling a core linguistic region in large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:41.154385Z"},"links":{"cited_paper":"/paper/2310.14928","citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:26615ba80ec8adc8494ebcde9f8a93f695b526d930a1c186f7e11ed2473d3d06","observation_id":"41ccb67a-b407-4d0d-a330-a5ceba50c27a","resolution":{"observed_at":"2026-08-07T10:28:41.154385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:53.411420Z","title":"Do large language models latently perform multi-hop reasoning?","venue":null,"work_id":"eb82ef5a-6007-48c5-afeb-b8932fa3f130","year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:41.278719Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:91d26dcb3924dfd229e183e4fdaa850a3e3507157ec28225625c5db2f0bd78a5","observation_id":"b5a452b7-0514-4390-a217-1cc74004e77b","resolution":{"observed_at":"2026-08-07T10:28:53.495179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:53.259166Z","title":"Hopping too late: Exploring the limitations of large language models on multi-hop queries,","venue":null,"work_id":"8af92aa8-be0c-4aa2-a35d-c7d5fa12ec10","year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:41.344013Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:2600892b1bc1d1a7df3ec31aed68423c3fe3699f48c720d56e04f65944237d26","observation_id":"80808549-20ef-42be-93a5-7f56642fa035","resolution":{"observed_at":"2026-08-07T10:28:53.328622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10835","last_updated":"2025-02-15T15:36:42Z","snapshot_observed_at":"2026-08-07T18:15:44.142696Z","submitted_at":"2025-02-15T15:36:42Z","title":"Back Attention: Understanding and Enhancing Multi-Hop Reasoning in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10835","snapshot_observed_at":"2026-08-07T10:28:41.444497Z","title":"Back attention: Understanding and enhancing multi-hop reasoning in large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:41.444497Z"},"links":{"cited_paper":"/paper/2502.10835","citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:9d1664ae944a6c60e00ca7c7dee335d815bd152605c3c0bf78c1a234f52dbb89","observation_id":"34373ead-3978-4a9a-a669-ff175d7c1a59","resolution":{"observed_at":"2026-08-07T10:28:41.444497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:53.075158Z","title":"Knowledge neurons in pretrained transformers,","venue":null,"work_id":"ba246c6f-6502-4387-9658-76fc25c01e4f","year":2022},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:41.540789Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:9ac4ee39082006880a2cc02f3ec5b8d6886713d277f4868285b95cdcb4602e0f","observation_id":"e3ab0f48-158b-4f3a-89ba-1a5ca2385c40","resolution":{"observed_at":"2026-08-07T10:28:53.207526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:52.857630Z","title":"Neuron-level knowledge attribution in large language models,","venue":null,"work_id":"370b11a2-d5fa-4f4e-8229-83b09baaf7ca","year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:41.604588Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:ebb0dd43fd12247fea81e36d7b8ee93ecd5b3cfa6c3ce9c26ae21f0adb9f2cf4","observation_id":"2d6b254a-74ab-48d4-b9b1-92c825e88c96","resolution":{"observed_at":"2026-08-07T10:28:52.986466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:52.676898Z","title":"Listen and speak fairly: a study on semantic gender bias in speech integrated large language models,","venue":null,"work_id":"b226f6f2-5fe6-472c-bb1a-4fa3e80507bb","year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:41.682261Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:3fb695751846a62934e10a675a9960e6955912e34880d9ade7c1272c82bcb67e","observation_id":"0cdcd27e-ab70-4947-b130-04fd06516c98","resolution":{"observed_at":"2026-08-07T10:28:52.768197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12787","last_updated":"2024-10-16T17:59:02Z","snapshot_observed_at":"2026-07-06T19:34:46.714277Z","submitted_at":"2024-10-16T17:59:02Z","title":"The Curse of Multi-Modalities: Evaluating Hallucinations of Large Multimodal Models across Language, Visual, and Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12787","snapshot_observed_at":"2026-08-07T10:28:41.761053Z","title":"The curse of multi-modalities: Evaluating hallucinations of large multimodal models across language, visual, and audio,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:41.761053Z"},"links":{"cited_paper":"/paper/2410.12787","citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:0794061401df4fd52ad253a1d5940429d950b3774b98993761d11d322caf668c","observation_id":"430d8b40-28c3-485f-a683-4845b1a48d5a","resolution":{"observed_at":"2026-08-07T10:28:41.761053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:52.516225Z","title":"Can large audio-language models truly hear? tackling hallucinations with multi-task assessment and stepwise audio reasoning,","venue":null,"work_id":"eabc5957-eae3-4bd1-935e-11fded988a30","year":2025},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:41.850501Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:9f01f8652d9ab71365409019c93fb8fae86f6afc8d9ea57229df311047d72097","observation_id":"fdc3dfa9-8676-4cf3-8fd8-b0ea56244600","resolution":{"observed_at":"2026-08-07T10:28:52.597249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:52.326341Z","title":"Interpreting GPT: the logit lens,","venue":null,"work_id":"d33dc863-9efb-4e75-a470-8aef444bbf2e","year":2020},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:41.923742Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:6d94e0692d53f69788cf61f74c6d40f911a4b900cd3de17236823912217e9d9e","observation_id":"71985eb9-f25d-4fb9-973d-c94817a254f4","resolution":{"observed_at":"2026-08-07T10:28:52.405947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:52.133589Z","title":"Transformer feed- forward layers build predictions by promoting concepts in the vocabulary space,","venue":null,"work_id":"5ba8b128-9419-4083-bab0-3a6f26a84486","year":2022},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:42.032988Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:97fb287ad693bd42c223251ef446a0ee57682b50e18aa7e8a8c47957f4ff1c81","observation_id":"7faaee5b-4393-464f-bafe-97049a2d0928","resolution":{"observed_at":"2026-08-07T10:28:52.248234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:51.921885Z","title":"Jump to conclusions: Short-cutting transformers with linear transformations,","venue":null,"work_id":"b2dba37b-9d76-454d-9c71-b515d15161f7","year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:42.170174Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:5660b4f612092e4d0b06451efa5a4976e53ab6e37a7523ba96e610da7648c145","observation_id":"5f52850f-a96f-4253-b79c-127c79882dc4","resolution":{"observed_at":"2026-08-07T10:28:52.035359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08112","last_updated":"2025-11-11T01:13:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-14T17:47:09Z","title":"Eliciting Latent Predictions from Transformers with the Tuned Lens","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08112","snapshot_observed_at":"2026-08-07T10:28:42.267367Z","title":"Eliciting latent predictions from trans- formers with the tuned lens,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:42.267367Z"},"links":{"cited_paper":"/paper/2303.08112","citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:249d5aa765463f1fc9f49c20696ad0cb5a01a005c4476644b41b8578c9cda31a","observation_id":"11a12ac2-19ca-4bd8-92a9-80ff236f836d","resolution":{"observed_at":"2026-08-07T10:28:42.267367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:51.697452Z","title":"Superb: Speech processing universal performance benchmark,","venue":null,"work_id":"ef6ed792-9bf1-4960-8152-9d5b0d40d151","year":2021},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:42.341114Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:d29bc58169a13241922cca65e80024f53bb8c1b4f8bb6cef03a484d333d67fe6","observation_id":"a6d30e0a-e916-4e67-8afb-90d45e4d2926","resolution":{"observed_at":"2026-08-07T10:28:51.805057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:51.434241Z","title":"Superb-sg: Enhanced speech processing universal performance benchmark for semantic and generative capabilities,","venue":null,"work_id":"8b98821d-0c02-4f75-8734-f6fcda8e669a","year":2022},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:42.439650Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:23ee67a71905c4250eeab633203ed7ee1302785c89d3bf4c60c9c1314cf77ae2","observation_id":"87c54f9d-7cc2-45bc-9464-4467e2c43df8","resolution":{"observed_at":"2026-08-07T10:28:51.562454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:51.237056Z","title":"Hear: Holistic evaluation of audio representations,","venue":null,"work_id":"359457f5-97ad-47c9-aaa3-9f8dfcaa78b9","year":2021},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:42.535596Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:1dfc645ac58b0e79bca64ffe454604a078fe82432b41b4524cd2996650c6d0dc","observation_id":"f9d3a312-8c5f-42a5-95bb-23778ae1dfe8","resolution":{"observed_at":"2026-08-07T10:28:51.327559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:51.017826Z","title":"Marble: Music audio representation benchmark for universal evaluation,","venue":null,"work_id":"224e454c-d697-42bd-bdc7-ed6f33ee4a78","year":2023},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:42.630486Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:56160fbe30970ea49ee003840e641357cea1f0a6e99d2d39bd1573c5b25d0920","observation_id":"533e4995-5bb6-4683-ae37-237e9e1525f2","resolution":{"observed_at":"2026-08-07T10:28:51.103447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:50.813807Z","title":"The zero resource speech benchmark 2021: Metrics and baselines for unsupervised spoken lan- guage modeling,","venue":null,"work_id":"1ccbc578-4a48-4eba-a542-9747a7fa4bd7","year":2021},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:42.742459Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:de9506d8161016d5c1a0bacd6b6406651b2029d28c6ed4307f7621f1ae65f96a","observation_id":"20771945-269a-49d7-b377-95965a6790f5","resolution":{"observed_at":"2026-08-07T10:28:50.920026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:50.624996Z","title":"Zero re- source code-switched speech benchmark using speech utterance pairs for multiple spoken languages,","venue":null,"work_id":"239e4ffc-6492-4497-a91f-004e8d90199f","year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:42.847809Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:7b0ae678f6f3a9bf501e6cc16df4a82d3286e6215ccb435da70726d8206892d9","observation_id":"c17ec7f1-7408-4b10-a54a-17411905ff03","resolution":{"observed_at":"2026-08-07T10:28:50.713540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:50.406684Z","title":"Yang, K.-P","venue":null,"work_id":"0a7c7014-e627-494e-ac41-6dd60f8c629f","year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:42.973675Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:53053e9ed49b4980a5ae9d6ed4f6bc5f8ec06cb789b7bfe1b75e67e51e49287c","observation_id":"88ec8539-a0f7-4678-8022-20978f78219e","resolution":{"observed_at":"2026-08-07T10:28:50.480191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:50.214732Z","title":"Ml-superb: Multi- lingual speech universal performance benchmark,","venue":null,"work_id":"578931e6-dfc1-4693-abee-c2ff33cd08ae","year":2023},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:43.081636Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:808fcc1b2265e61f07d78dac769dde80cc4097301f915e1cc4482ffca7a430f4","observation_id":"999177de-285d-4738-92ef-8c66b8a859c5","resolution":{"observed_at":"2026-08-07T10:28:50.304813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:43.163518Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:43.163518Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:98dabeaf131e813d0500c63adb77922d07ff6813e6fd7ea74cda79aaf32488b0","observation_id":"7a5f1b1c-f4c1-4dce-900b-24c38ee814aa","resolution":{"observed_at":"2026-08-07T10:28:43.163518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:50.014980Z","title":"Distilhubert: Speech represen- tation learning by layer-wise distillation of hidden-unit bert,","venue":null,"work_id":"655cc194-2f28-4a20-b0fb-fa6cad68d383","year":2022},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:43.282638Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:b4861e572c2fd1c5471c2d8ed1794046e213b00660af438e5cb84adce7a2680a","observation_id":"d6b02991-a84d-41ba-ae29-a98470367764","resolution":{"observed_at":"2026-08-07T10:28:50.116539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:49.739422Z","title":"wav2vec: Unsu- pervised pre-training for speech recognition,","venue":null,"work_id":"a6f32d7a-2486-4858-89c7-ae07acbf06be","year":2019},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:43.363926Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:5bced22ba50ee69e6ddb234e5a3e7fc5948a028f1933dd7c710e68c5fb381841","observation_id":"d23963c7-5910-4dbc-a95b-18c54acff6b6","resolution":{"observed_at":"2026-08-07T10:28:49.884518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:43.464970Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:43.464970Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:d28e619a7ce6b1c7d5513566ea9e6f9b29071227610556ddb3d1187fb2007f46","observation_id":"13472697-22eb-4688-ac30-eb7430aa469b","resolution":{"observed_at":"2026-08-07T10:28:43.464970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:49.545806Z","title":"Un- supervised cross-lingual representation learning for speech recognition,","venue":null,"work_id":"37c89446-7b63-4f71-8723-1d3f93c8d4ae","year":2021},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:43.615965Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:c29105c0e1d768b2777cb65b8a1ccdf6cd60bf955f054a2110d260b4ced4b96e","observation_id":"590f5ae6-61a5-47bc-8428-42360c4161cd","resolution":{"observed_at":"2026-08-07T10:28:49.629438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:43.713167Z","title":"Layer-wise analysis of a self-supervised speech representation model,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:43.713167Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:607f4b3c29ec94ce1bf20c67b7889c3047333e20b3f36e53a0a152dbbcc4c6a5","observation_id":"2dc9822f-7971-4ae7-bf39-39f123942272","resolution":{"observed_at":"2026-08-07T10:28:43.713167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:49.323702Z","title":"Comparative layer-wise analysis of self-supervised speech models,","venue":null,"work_id":"54f6a850-8b32-4179-b265-3ce84db1c3e7","year":2023},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:43.802905Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:96e27626035659e69eebac86c5172426857094a679d45395e02878a772018aed","observation_id":"358c2750-2aac-4303-a883-fe4b5d4e8a6d","resolution":{"observed_at":"2026-08-07T10:28:49.412394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:43.922682Z","title":"What do self- supervised speech models know about words?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:43.922682Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:cf95d790619202933409f1f216c06446a6265d17f09997bf75117cf3c55d9652","observation_id":"fd57bbe1-a919-4430-8d50-c1ac6b5de80a","resolution":{"observed_at":"2026-08-07T10:28:43.922682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:49.029089Z","title":"Self-supervised speech representations are more phonetic than semantic,","venue":null,"work_id":"8d812bf5-818d-4458-a6ed-eeec28d6339a","year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:44.021653Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:7f91b1863c40a64ffedf260474ea366966af8c1dc5d82aebdc534dd82cd60dbd","observation_id":"e4d48e92-c3e0-4404-81d0-f62e8e5d66d7","resolution":{"observed_at":"2026-08-07T10:28:49.151047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:48.774907Z","title":"Property neurons in self-supervised speech transformers,","venue":null,"work_id":"99e16a44-af8a-495d-9012-c6b1e86ebe0b","year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:44.138736Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:cc4755f36a19d974875b83bc3c80b4997c0ed95cfa5caf96ba38471cc04c956b","observation_id":"38d0acc9-7ce4-43ff-a5e1-66cd90910740","resolution":{"observed_at":"2026-08-07T10:28:48.904036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:48.560702Z","title":"And: Audio network dissection for interpreting deep acoustic models,","venue":null,"work_id":"9a36cbe9-0dc1-4cba-a8c6-68e95628e35b","year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:44.271750Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:320baac69e55946fe725c3e1d59882aef7ddad3b2ea527c594402476c8379357","observation_id":"2f9ac762-9a08-4a90-a56c-a7fa6e953d72","resolution":{"observed_at":"2026-08-07T10:28:48.686867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:48.341952Z","title":"Do prompts really prompt? exploring the prompt understanding capability of whisper,","venue":null,"work_id":"30141884-b487-49b4-a732-262a19bafe2a","year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:44.360094Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:f2a125fc8a99094a648f9b48c83b2c37c4fc22baaffa9cac525b6196843f0558","observation_id":"11f6f6d0-df7a-49e2-92c0-68c998ce1662","resolution":{"observed_at":"2026-08-07T10:28:48.464754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:48.098793Z","title":"Hey asr system! why aren’t you more inclusive? automatic speech recognition systems’ bias and proposed bias mitigation techniques. a literature review,","venue":null,"work_id":"3b59fbfc-aaa5-4823-8772-797b5c95ad97","year":2022},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:44.446769Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:14b402b6fd800eb20089a15f351d4ac667ae315ebeb5f79d06a28d6bd1db7469","observation_id":"85a15553-dbcb-4263-be7f-fd6d326401ba","resolution":{"observed_at":"2026-08-07T10:28:48.211091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:47.915526Z","title":"Emo-bias: A large scale evaluation of social bias on speech emotion recognition,","venue":null,"work_id":"5462b187-541a-41a3-ab5f-defaecbe2729","year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:44.544838Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:9891740e8065ab97da5adde184a22101921d4e89f8454318ac947b663417d7ef","observation_id":"83b29e76-ecc0-4b82-8780-90d542a34aa2","resolution":{"observed_at":"2026-08-07T10:28:48.035026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:47.727757Z","title":"Attention is not only a weight: Analyzing transformers with vector norms,","venue":null,"work_id":"378bb5ff-743a-4a02-b7bf-8ff74f0f7ef4","year":2020},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:44.632292Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:0b06b238945995f1400af380b7485875a93ec404414f25c485c64af4437dff9f","observation_id":"bef6882b-a9e1-47a8-8fac-fa1f6f7d6a20","resolution":{"observed_at":"2026-08-07T10:28:47.828288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:47.481722Z","title":"An investigation of neuron activation as a unified lens to explain chain-of-thought eliciting arithmetic reasoning of llms,","venue":null,"work_id":"31ee2ccf-ea63-42b9-b207-a528d460a0c2","year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:44.708581Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:421d06015a3eb53cd470038680267c47a3047cef7c3533ee6e7b19714e896d03","observation_id":"216ff809-949b-444b-9ec9-f362e8d5e61f","resolution":{"observed_at":"2026-08-07T10:28:47.602048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:47.272657Z","title":"Understanding and enhancing safety mechanisms of LLMs via safety-specific neuron,","venue":null,"work_id":"970e4878-5432-43b2-91ef-1acf75d4881c","year":2025},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:44.785659Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:1ede9b5a5687dcb73424aef80b1148ed3b5e8e0ed664b9c35fdd454e74891538","observation_id":"60238b45-8fe9-4896-9f52-5a5bacfbaac4","resolution":{"observed_at":"2026-08-07T10:28:47.389645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:47.119574Z","title":"Patchscopes: a unifying framework for inspecting hidden representa- tions of language models,","venue":null,"work_id":"90448d52-1b59-43c9-8f4a-12e396df9002","year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:44.872331Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:23fb65f4773d796662f646547d684a99813befb3e12b8f09acb88a2e1437347c","observation_id":"a2f09161-2083-467f-8363-d8b0d72f539c","resolution":{"observed_at":"2026-08-07T10:28:47.186010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:47.002371Z","title":"Probing classifiers: Promises, shortcomings, and ad- vances,","venue":null,"work_id":"bec9c855-1743-42e4-b65a-2da09420cf51","year":2022},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:44.980870Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:8d69ee4c8640931e51a0a319a923c6335a5efb9bd2bb2c5e7bcb554adeb321d3","observation_id":"8cb66489-fe01-4ea8-bfdd-537e2eb355be","resolution":{"observed_at":"2026-08-07T10:28:47.054969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:45.070032Z","title":"Locating and editing factual associations in gpt,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:45.070032Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:b2eac87096fa54c16242da5c448259980f6f2fed6dced3cd4c35f5e9c60e9daa","observation_id":"9d3fb428-92da-47fb-8450-ab53a9eed2e2","resolution":{"observed_at":"2026-08-07T10:28:45.070032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:46.827332Z","title":"Language models implement simple word2vec-style vector arithmetic,","venue":null,"work_id":"a965e68f-471f-49dc-a4b2-f22620c14f65","year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:45.155817Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:fa9a01ac44e82b4e2a4a892bbf57c68c2081becfe213629cc0f0a70e40a7e7bd","observation_id":"efc027ab-9f73-4900-8149-fb0eda0c8a69","resolution":{"observed_at":"2026-08-07T10:28:46.923791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:46.602696Z","title":"Dissecting recall of factual associations in auto-regressive language models,","venue":null,"work_id":"6a12ef1a-b7dd-41bc-9e04-483312893b5f","year":2023},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:45.247861Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:0bcdb8c3376d3d794cecc9024193332931b9bcb4de87a3581849329bea724af8","observation_id":"6b0bba89-a4fe-4ea7-92a7-2662a66a5fc1","resolution":{"observed_at":"2026-08-07T10:28:46.707136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11667","last_updated":"2025-02-24T03:37:44Z","snapshot_observed_at":"2026-08-07T17:54:26.489901Z","submitted_at":"2025-02-24T03:37:44Z","title":"LogitLens4LLMs: Extending Logit Lens Analysis to Modern Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11667","snapshot_observed_at":"2026-08-07T10:28:45.356667Z","title":"Logitlens4llms: Extending logit lens analysis to modern large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:45.356667Z"},"links":{"cited_paper":"/paper/2503.11667","citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:cdd669186afc6e32255c89fd705c657323a819dcc2024c297b027507b88d2979","observation_id":"dc29f272-fae9-4ad9-896c-ba6620f2bc85","resolution":{"observed_at":"2026-08-07T10:28:45.356667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:46.416232Z","title":"Interpreting and editing vision-language representations to mitigate hallucinations,","venue":null,"work_id":"9827dd8d-2ae6-45cb-8945-0c7e1a9c7b9b","year":2025},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:45.458884Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:f86ee42d39d46cfbb3b71c498743a99cd4ed3a620408f5b6ba312af27bb9a2ff","observation_id":"3de112a3-c617-426c-9ba7-d876bd1c4740","resolution":{"observed_at":"2026-08-07T10:28:46.518839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07149","last_updated":"2025-04-26T06:47:21Z","snapshot_observed_at":"2026-08-03T16:26:26.684826Z","submitted_at":"2024-10-09T17:55:02Z","title":"Towards Interpreting Visual Information Processing in Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07149","snapshot_observed_at":"2026-08-07T10:28:45.549978Z","title":"Towards interpreting visual information processing in vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:45.549978Z"},"links":{"cited_paper":"/paper/2410.07149","citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:16981d2175a63b4b0eed5bb9927d147f8a037ebc62bb62ff2e3228c314604505","observation_id":"29447404-6719-40ec-9937-d267fb413939","resolution":{"observed_at":"2026-08-07T10:28:45.549978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:46.245462Z","title":"Mmneuron: Discovering neuron-level domain-specific interpretation in multimodal large language model,","venue":null,"work_id":"688c7473-8cd4-48a4-a4f4-67fd27725412","year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:45.660126Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:b3d7917eddfb0eefe97f8f6ce81341f1a4a4849ed77469ed9661eac213d35e95","observation_id":"d82bdc62-f328-427b-984a-1ab6dc9fc555","resolution":{"observed_at":"2026-08-07T10:28:46.335269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:46.013893Z","title":"Measuring massive multitask language understanding,","venue":null,"work_id":"5af215c9-ffa3-4208-a03a-b587719993f9","year":2021},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:45.760195Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:e9a740b7f5edc8f840b8356a199155d5ad946bd13ffc41907d98485b4cb8f4fb","observation_id":"311eee3a-54e4-4a15-b4ca-19732ab683c8","resolution":{"observed_at":"2026-08-07T10:28:46.132024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T10:21:00.879638Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models"},"reference_resolution":{"displayed":71,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":0,"verified_fuzzy":53},"total_outbound_references":71},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 71 of 71 outbound references and 3 inbound Pith citation observations for arXiv:2506.05140."}