{"as_of":"2026-08-12T14:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4cd97fb6a1f4ae72f1310f48fb502499a1e05f180d6071731d1a2bb537f52a5b","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T03:05:43.100032Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.11801/citation-record","integrity":"/paper/2607.11801/integrity","json":"/paper/2607.11801/citation-record.json","paper":"/paper/2607.11801"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"Audio flamingo: A novel audio language model with few-shot learning and dialogue abilities,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:ce09d9c5eb86f83babd899cd46c085e93526d40fb677b8a81a25301e594a1493","observation_id":"fb361fb7-14d3-43b4-8d11-f7bc10001f0d","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"Audio flamingo 2: An audio-language model with long-audio understanding and expert reasoning abilities,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:1d4984beb674cc94bfe99a3f7d061b6d54d291a9c1278a1a4b9269084870b400","observation_id":"4462a8e7-31fb-4770-872b-7fab9764687c","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"Audio flamingo 3: Advancing audio intelligence with fully open large audio language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:ae96a7c8772ebd22db240db03b92b2ef2295ccc170930d8700e963f802f25271","observation_id":"43810817-6229-44ed-a6c7-5f3113286e29","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"Qwen-Audio: Advancing universal audio understanding via unified large-scale audio-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:3cd95c2dc27259b22b2899a6898c6c7b7a4acd74d9ac998e87da4c7b282cbc69","observation_id":"067f93c4-858e-4db1-b790-e75b117b852f","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"Qwen2-audio technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:14b3c58243d6058e3a77becc83a66292139394c0e34320ada0cc5848259eb101","observation_id":"5c49525b-c620-4c94-9bd2-649372b74215","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"Qwen2.5-Omni technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:a3b5091c99ef7cca5e98af0fac9b16d7d4f97703e648d34907911ed7a111629d","observation_id":"be4aeef7-7c0e-4418-9f6d-e175df8ef8f4","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"DeSTA: Enhancing Speech Language Models through Descriptive Speech-Text Alignment,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:8b0f965bfc85241c79b445aed4448dac62de17289f22d25bd2bc5422b37e09a1","observation_id":"1532eb11-22ca-40c1-a3d8-0e57b27a0a74","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"Developing instruction-following speech language model without speech instruction-tuning data,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:7a2ac54a9474df71da5801d8022c9f8fec98c7299d44230e1d96eb392df3ad00","observation_id":"6321ef0e-76f6-4102-aaae-b06728e41bd0","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"DeSTA2.5-Audio: Toward general-purpose large audio language model with self-generated cross-modal alignment,","venue":null,"work_id":null,"year":2062},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:b0c767624500d2c4806a40ad041fe5d66b32b7c553f2c6ad4c0772d665edf263","observation_id":"6d0ac00b-c966-4faf-bd2c-5bb4461370e4","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"SALMONN: Towards generic hearing abilities for large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:66741827f63cd675824bb0647c6542b92292db0a3c1aeff29ea41889553892f8","observation_id":"1fa467f1-62e3-4828-be9a-184064ecfcf3","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09940","last_updated":"2025-02-14T06:34:08Z","snapshot_observed_at":"2026-08-10T19:45:52.146308Z","submitted_at":"2025-02-14T06:34:08Z","title":"A Preliminary Exploration with GPT-4o Voice Mode","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09940","snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"A preliminary exploration with GPT-4o voice mode,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"cited_paper":"/paper/2502.09940","citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:3e805439cfa713591b1ebe8362a5337b237ae5a6b7682dc05facd29c707dcd9e","observation_id":"b40423e5-fe69-42c1-84b8-3cdb4d8f8380","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07111","last_updated":"2024-12-27T07:29:19Z","snapshot_observed_at":"2026-08-09T10:09:14.177754Z","submitted_at":"2024-11-11T16:37:40Z","title":"Building a Taiwanese Mandarin Spoken Language Model: A First Attempt","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.07111","snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"Building a Taiwanese Mandarin spoken language model: A first attempt,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"cited_paper":"/paper/2411.07111","citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:55f17c8c146c80de4815531987e203c1a8ed0fe2941c0462ed7072eed30db6ee","observation_id":"653d43fc-a586-42c7-b3e4-86d1812ea642","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.18425","last_updated":"2025-04-25T15:31:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-25T15:31:46Z","title":"Kimi-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.18425","snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"Kimi-audio technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"cited_paper":"/paper/2504.18425","citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:f9d4a5b2b41bbf22fe1c84e9f3daa44786ed70c253e91db20e48a1d63b877e62","observation_id":"dc1fd655-188a-45c6-9aa5-0b635d9207ab","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"Robust speech recognition via large-scale weak supervi- sion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:fbec93a0fdc00f432c6814acdae0caca357c35e818dc7cf47fbecc31434e0254","observation_id":"46dddb03-fdec-4777-bb20-78c12c60a264","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"Beats: Audio pre-training with acoustic tokenizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:3719d55cb88975eac94714b4953182a98c3497acf9393fbf9c0061a50bb4151e","observation_id":"8fc1f2cf-e54e-42c8-944a-3d39b6a6899a","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"AudioLens: A closer look at auditory attribute perception of large audio-language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:e4a7e253c3ab6e451cb285d2bb1a9dde4b330f1f46e8b809273c297e08d4e58f","observation_id":"2d543860-3c69-4cc1-b525-bf57f471fda2","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"SAKE: Towards editing auditory attribute knowledge of large audio- language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:fdf058ffc507304c8a61f70bf642bea0b72646a1910df481bb6102c118f6124c","observation_id":"7cf08649-9342-4fbc-8639-81b814f8fb3e","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"How auditory knowledge in LLM backbones shapes audio language models: A holistic evaluation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:66614ca85b14c61eb9a1df7c91436bce2170077045008d22b95b2c66e103c86a","observation_id":"9a137a1a-420a-49a2-80d2-9f6dd3212853","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"Towards holistic evaluation of large audio-language models: A comprehensive survey,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:345bc6919d9bc6e9b07e345e174eff20d3fb38d03af0d0335060ae49bddb0804","observation_id":"85c82a0d-0ff5-4aca-ad30-091f5aa7f37f","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"MMAU: A massive multi-task audio understanding and reasoning benchmark,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:5b52b6aaee83db0adea997a9cec6f3e520399bfc7e044cfd738df2058e844adc","observation_id":"4ecea2c0-2bad-40a7-a5fa-2258fc6fba52","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"Do audio LLMs listen or read? analyzing and mitigating paralinguistic failures with V oxParadox,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:4feb1ca609a6a71803ab272cfffa272a65bfa14823fed156b364fda39315e5a1","observation_id":"d733bfe5-6f85-420d-b78b-3eb570151225","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"Speech- copilot: Leveraging large language models for speech processing via task decomposition, modularization, and program generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:bd75864b35c809257af1e179047d42b3da28b5587e821d69e08bdf63082172d4","observation_id":"6868cb04-7466-404f-942b-e676070d21e4","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"Resurfacing paralinguistic awareness in large audio language models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:3335a8eab9159634da859403e39d52bd6367c9dd599489f73f661c65f6d0d9c3","observation_id":"2f96f987-d239-4f6f-b90e-4c9f9d7a6501","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"AudioBench: A universal benchmark for audio large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:e2f28c626683285f7e91226ce22410d9e2f6d3125e0d112c836e929323d5dee9","observation_id":"0466acd0-f658-4bc7-a3f6-72e57569e406","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"SAKURA: On the multi- hop reasoning of large audio-language models based on speech and audio information,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:92bc60994c3306f621c92d045d4722755e1415dcdcb5b45ff48af0586d8fe4ce","observation_id":"4a7dc05d-658e-49c3-9ef2-c12fb4b6263e","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14648","last_updated":"2025-05-20T17:36:41Z","snapshot_observed_at":"2026-08-08T04:51:39.118604Z","submitted_at":"2025-05-20T17:36:41Z","title":"Vox-Profile: A Speech Foundation Model Benchmark for Characterizing Diverse Speaker and Speech Traits","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14648","snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"V ox-Profile: A speech foundation model benchmark for characterizing diverse speaker and speech traits,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"cited_paper":"/paper/2505.14648","citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:8e34068c6c55b4240148c41d2e6294faf3cddb9f17605c0e20aab9839585e6a4","observation_id":"7bde52fe-9e09-4fc6-9340-b0e29bb05fbf","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"EchoMind: An interrelated multi-level benchmark for evaluating empathetic speech language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:390f1b64d076ea8c925f3e6d043741db91fe86826084bab05050ee505b70aa8f","observation_id":"7f933386-9fc1-4332-ac5d-b86624d7df3d","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"Reducing object hal- lucination in large audio-language models via audio-aware decoding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:ad299dba7e60ee02ee98b0bc333948092a65befa417505649f3564999930620e","observation_id":"25c73c1f-e803-4e38-8dbe-82d9a4c411c7","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"How contrastive decoding enhances large audio language models?","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:e023ff12df806006841a97b37bf6d07040df54c47caa909681124f946018ba01","observation_id":"920e3d1b-f3e5-4004-9e6d-efcfe6781f5d","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.00247","last_updated":"2026-08-02T10:40:21Z","snapshot_observed_at":"2026-08-06T23:24:46.404599Z","submitted_at":"2026-06-30T22:55:22Z","title":"Adaptive Perturbation Selection for Contrastive Audio Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.00247","snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"Adaptive perturbation selection for contrastive audio decoding,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"cited_paper":"/paper/2607.00247","citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:2c4597000a936e5fa416551db98f2582a8c232bf373aa6a7b76dd540d7cbd10c","observation_id":"a4824fbf-b5e6-43bd-8ba1-54c263b821fa","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"Adaptive vector steering: A training-free, layer-wise intervention for hallucination mitigation in large audio and multimodal models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:4f2ccdfe832df7f9da703069c829f13f5dd30007d27890ed2b762c36494dace0","observation_id":"2ca5896a-a5af-42c9-93b8-efecf79cc776","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"Nudging hidden states: Training-free model steering for chain- of-thought reasoning in large audio-language models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:d1be90b033150e0f7ee5808790e2ab6994f73f5b5c9f2865fee08399b381c747","observation_id":"4c6ae993-6f6f-46bb-8b30-9d37bee56ebf","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"Are audio-language models listening? audio-specialist heads for adaptive audio steering,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:3218c84c88a30e85862a3e335fe9105cfe7ee6b9b8ec54fd0db7c1c8e6693a02","observation_id":"27da7dce-f530-48b0-bca8-2cf881de4cc7","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"Neuron- level emotion control in speech-generative large audio-language models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:3867d3f7d7aa1e0aa962cf24acc57a1f84350865f89c07f6bfb088e6dc6062d8","observation_id":"0c9a1437-e2e3-4d90-81e7-f6a664d1467f","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.18924","last_updated":"2026-06-17T10:55:15Z","snapshot_observed_at":"2026-08-01T16:41:40.998912Z","submitted_at":"2026-06-17T10:55:15Z","title":"Who Wins the Conflict? Mechanistic Interpretability of Text Bias in Audio LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.18924","snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"Who wins the conflict? mechanistic interpretability of text bias in audio llms,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"cited_paper":"/paper/2606.18924","citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:245094d39dca37de3ae723760b2935c4b686610d85b228907e5a7b3b899d4a46","observation_id":"732c2c25-323b-485b-98a2-de2c2d6fa864","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"Anatomy of the modality gap: Dissecting the internal states of end-to-end speech LLMs,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:08f5a7c06d5bb3638aeb27ffa6b813a05875301280118aa2fca096575bb6bae5","observation_id":"68cb0112-6273-481f-95d6-10ca2413bbbd","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03037","last_updated":"2024-10-03T22:48:04Z","snapshot_observed_at":"2026-08-08T02:33:10.769393Z","submitted_at":"2024-10-03T22:48:04Z","title":"Disentangling Textual and Acoustic Features of Neural Speech Representations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03037","snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"Disen- tangling textual and acoustic features of neural speech representations,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"cited_paper":"/paper/2410.03037","citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:fc9e8dcb3e968396707677217f5f434b543359167460b651ba9a429aa8a0e93d","observation_id":"a45a9f0b-5f9b-4e08-9ca7-9dafc8c88cfa","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"Whisper-AT: Noise- robust automatic speech recognizers are also strong general audio event taggers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:1fb36a1079cb2038e77b90ac5160cba5ffab02b883222391f5ce2673cf5b8424","observation_id":"923170fb-6784-47ae-b0e9-33e4ec343f0a","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"Layer-wise analysis of a self- supervised speech representation model,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:500218d8265754d54b056774d44ef03b899e546928197953ded5a019b5a8c74c","observation_id":"5541459d-3a51-41e9-8fc5-13debb3dc067","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"Behind the scenes: Mechanistic interpretability of LoRA-adapted Whisper for speech emo- tion recognition,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:0f68c6da151cdad2934d0a26593c9ca0ce0d48383a3d3bb2cb6ba5f42bef0a7f","observation_id":"b2bbf2cf-3194-4cc9-bb29-ce3a9ad103aa","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"Speech-IFEval: Evaluat- ing Instruction-Following and Quantifying Catastrophic Forgetting in Speech-Aware Language Models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:0eb9afb986f2ff31e14ab6dbc042e1cacc6eca99246a5d69f5ad8bfedfd0cda0","observation_id":"8b019907-052e-41ed-8748-a20a9066facb","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"Dynamic-superb: Towards a dynamic, collaborative, and comprehensive instruction-tuning bench- mark for speech,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:07c6e7194181909d5a6b1f39e54b006bbc9dea6a6d7e57063c43d1ad5244ddb1","observation_id":"fa095789-3f82-4f55-b655-197ea987814a","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"Dynamic-SUPERB Phase- 2: A collaboratively expanding benchmark for measuring the capabilities of spoken language models with 180 tasks,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:2fb109093c4983d20d1ded9a8fda9665afdcfd33091465422526095207b19da7","observation_id":"0133961c-8a2f-4f5f-b9ab-b91edfe33626","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"AIR-Bench: Benchmarking large audio- language models via generative comprehension,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:ec4adef965338d8b988b206903822dc735087951456beb4e04dfed97f6feddd6","observation_id":"1565217a-16fa-4815-b781-2f4a2c487e76","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"MMAR: A challenging benchmark for deep reasoning in speech, audio, music, and their mix,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:a80f4cfc8d4333a82ef989181de471d8475b56ecc7371599179b7f688f2179be","observation_id":"c18841f7-e3d6-4466-84e9-b3b0827ba349","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.09714","last_updated":"2026-07-12T21:54:08Z","snapshot_observed_at":"2026-08-11T18:06:11.325915Z","submitted_at":"2026-03-10T14:22:22Z","title":"MUGEN: Evaluating and Improving Multi-audio Understanding of Large Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.09714","snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"Mugen: Evaluating and improving multi-audio understanding of large audio-language models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"cited_paper":"/paper/2603.09714","citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:4e254fec38c2ce4044000e07a4c9c82364647131de73325662d6a8070d992631","observation_id":"a5ac20e4-81c9-4694-9a6c-5b51cf1394d2","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"Listen and speak fairly: a study on semantic gender bias in speech integrated large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:52b978e82127bf712377bf6f8d9f1c3ed064378f4c546e1b64752cec2db925ae","observation_id":"9df8bd10-83cb-4445-a6da-49e62d8875f7","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"Emotional damage: Investigating safety vulnerabilities of large audio-language models under speaker emotional variations,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:fd14405b3f1681392f662bdd3f6dbe38da31a6046e33a4347888240e3d22aa38","observation_id":"d15b84ed-9f21-4780-88da-d2f162105b7a","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"Hearing the order: Investigating position bias in large audio-language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:3803887d29c439c7f65e170624e6aff1bb484096b1f16167e55c0d9f2b88f280","observation_id":"f16e4012-1566-4901-b117-f39545da32c6","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"When audio and text disagree: Benchmarking text bias in large audio-language models under cross-modal inconsistencies,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:43bb99d486e817b9b2495a5113d7981d452d68d94417b6657fa99f5489558691","observation_id":"92440560-4d3a-4985-a7ea-53b82fa74910","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"SD-Eval: A benchmark dataset for spoken dialogue under- standing beyond words,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:b4473904e18afde1c060a99e4426be5580f1c100bb42938872c0476e5084a71a","observation_id":"7cfd5333-cd6e-42c3-b6c2-1895845ddf0e","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"Benchmarking contextual and paralinguistic reasoning in speech-LLMs: A case study with in-the-wild data,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:576159960195a34e4566d52473c05dc642b137d1237d4ccc8b437f0792ce7a6c","observation_id":"da3d7d96-221b-4c05-a124-da4862b8a528","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"Do audio LLMs really LISTEN, or just transcribe? measuring lexical vs. acoustic emotion cues reliance,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:b2f1fd910540ff2d9cc627591963920288d6a0ef3e018602f1811caf18a636c5","observation_id":"f660c174-c49b-4ea5-9084-07d149546671","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"TAU: A benchmark for cultural sound understanding beyond se- mantics,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:c983c34ec2c9963f658a2408ed51ac96da6846052c92cd0cadba6b315b7a5e5a","observation_id":"679e33e4-07e2-485d-b9d7-13249b7e4874","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"Contrastive decoding: Open-ended text generation as optimization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:3daaebf8a0009c3de1a3a527e0fd8ed82432c6774e761c651333636d74c138f1","observation_id":"7c92e3a0-49ff-4529-a9aa-8eb2b591bcd2","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"DoLa: Decoding by contrasting layers improves factuality in large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:f4c4357c5594c0092103e2f64ce868349e0e1f5e6447cca309f619c5b15e7eeb","observation_id":"2be598ca-1976-4ebd-af94-144fcc222613","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10248","last_updated":"2024-10-10T13:20:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-20T12:21:05Z","title":"Steering Language Models With Activation Engineering","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.10248","snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"Steering language models with activation engi- neering,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"cited_paper":"/paper/2308.10248","citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:3679a73f0578b01836cca034cb5eaaa2f190605ca55b6a509e38707079a16244","observation_id":"40c77132-a329-4275-ae6e-dae597f2af24","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"Steering llama 2 via contrastive activation addition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:a9e4318648ad65fe6de0881082281ec614ecc68a167771200335135de08fec80","observation_id":"2366cd0c-512e-499f-8b83-d1112ee30f0b","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"Inference- time intervention: Eliciting truthful answers from a language model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:39770c0fa0b5ece131b824fbe5ad10a303ee4f298565e3cbe0991d31f8351db4","observation_id":"6f24e691-88d6-4102-bad2-ce97774fa113","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01405","last_updated":"2025-03-03T06:14:14Z","snapshot_observed_at":"2026-07-06T16:26:38.284922Z","submitted_at":"2023-10-02T17:59:07Z","title":"Representation Engineering: A Top-Down Approach to AI Transparency","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01405","snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"Representation engineering: A top-down approach to ai transparency,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"cited_paper":"/paper/2310.01405","citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:2e51c7d5b6220857c14cebabb47c225c078053c0fa4aa84c08f8e4275731124a","observation_id":"e3c23d92-67d6-4c38-917a-2c2b59a0c762","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"Transformer feed-forward layers are key-value memories,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:e0c70cd3904b76a8d946e26f984ae3e38f034dccbfe76c9c17427401d1fe8340","observation_id":"e5d6a278-fdbe-41ff-be54-c038e7b9d2e2","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"Knowledge neurons in pretrained transformers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:27000162045da605f90774b711e4f8094fb32d22f7e38b391b463ca94a2837af","observation_id":"c1c1a318-ad4e-4420-87fe-4299c3364186","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"Locating and editing factual associations in GPT,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:9ae1dab2b983816a5f8d076e124b0cdcfd86614dfc4c45b43dbbd3b420e9a0ba","observation_id":"ab4ce4f4-7c94-48f3-9120-e0befbeadc98","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"A VCD: Mitigating hallucinations in audio-visual large language models through contrastive decoding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:364c4964d3413e60e851e3c3594bc12b765618dfbff9eef3bd23cfff3a6f3332","observation_id":"23aa3e4b-313e-4555-a730-ebf1ca130cb8","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15383","last_updated":"2026-04-16T02:30:41Z","snapshot_observed_at":"2026-08-11T04:27:04.271851Z","submitted_at":"2026-04-16T02:30:41Z","title":"Temporal Contrastive Decoding: A Training-Free Method for Large Audio-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.15383","snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"Temporal contrastive decoding: A training-free method for large audio-language models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"cited_paper":"/paper/2604.15383","citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:a3dc2cabfb48c804d85bf5c588e6896b5a14595af2e6b4f942151399bba50162","observation_id":"ea123020-aa18-4224-a4be-212a8342dff7","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.05813","last_updated":"2026-06-17T06:35:29Z","snapshot_observed_at":"2026-08-11T01:44:47.228793Z","submitted_at":"2026-03-06T01:54:28Z","title":"Activation Steering for Accent Adaptation in Large Audio Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.05813","snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"Activation steering for accent adaptation in large audio language models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"cited_paper":"/paper/2603.05813","citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:a48f635b0da7c3af1f274a8264438021dd0ec1858089feaf3b94339252cbd582","observation_id":"071f5a64-2513-435f-bd28-d5eeb1e2af6d","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"Language-specific neurons: The key to multilingual capabilities in large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:2f073b1db72f218f35cd6ff415119392df401234eeda7a825493d433eaba3440","observation_id":"c40e1ff2-ac6a-42e6-95ad-82eb7849a566","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"Direct preference optimization: Your language model is secretly a reward model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:fa0901af02f1a151e57c425954a697ae5d6ac61be8a0711000147ed7b6f76ffc","observation_id":"856a7f1c-a1ae-4551-974c-901ef427e23b","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"GPT-4o system card,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:e4b6fabdfd76f93864a5834091ef5c88d6282037cbe28c4ace157d42640767cd","observation_id":"3322ab9a-a68e-41fb-8aab-15b112f0496f","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"Gem- ini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:bff9d135c4cabcf06ceb4e1561439fd110e953efb1cbae9e7a544c808de72154","observation_id":"0623ee8f-662f-44b2-9b28-759916384067","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-12T07:41:11.762611Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":70,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 0 inbound Pith citation observations for arXiv:2607.11801."}