{"as_of":"2026-08-05T14:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f3de7a03f4796170a1b3ef055dd1eac5a8f447fff4c1ea08e70c4a5e88a6bb4e","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T19:02:41.528122Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.01881/citation-record","integrity":"/paper/2608.01881/integrity","json":"/paper/2608.01881/citation-record.json","paper":"/paper/2608.01881"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2010.00475","last_updated":"2022-04-23T20:12:00Z","snapshot_observed_at":"2026-08-02T22:15:33.611696Z","submitted_at":"2020-10-01T15:07:25Z","title":"FSD50K: An Open Dataset of Human-Labeled Sound Events","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.00475","snapshot_observed_at":"2026-08-04T19:02:40.771164Z","title":"Fu, Y.; Cheng, L.; and Lv, S","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2608.01881","last_updated":"2026-08-03T08:24:54Z","snapshot_observed_at":"2026-08-05T13:31:27.481283Z","submitted_at":"2026-08-03T08:24:54Z","title":"Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T19:02:40.771164Z"},"links":{"cited_paper":"/paper/2010.00475","citing_paper":"/paper/2608.01881"},"observation_digest":"sha256:511cda79b9ccb60929d17362dad08abfa9f1a7459f46dd476d87e9b93f2e9abd","observation_id":"77fb404d-c569-4f15-a722-967f86973136","resolution":{"observed_at":"2026-08-04T19:02:40.771164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.04847","last_updated":"2026-04-06T16:46:52Z","snapshot_observed_at":"2026-07-30T13:35:58.385594Z","submitted_at":"2026-04-06T16:46:52Z","title":"Full-Duplex-Bench-v3: Benchmarking Tool Use for Full-Duplex Voice Agents Under Real-World Disfluency","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.04847","snapshot_observed_at":"2026-08-04T19:02:40.932166Z","title":"Liu, X.; Wang, X.; and Sahidullah, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01881","last_updated":"2026-08-03T08:24:54Z","snapshot_observed_at":"2026-08-05T13:31:27.481283Z","submitted_at":"2026-08-03T08:24:54Z","title":"Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T19:02:40.932166Z"},"links":{"cited_paper":"/paper/2604.04847","citing_paper":"/paper/2608.01881"},"observation_digest":"sha256:513e2cb9af90dd1cc3c027e4a5b30c043e0f8a8eb3ccd8b8e48a94ccc0156efe","observation_id":"7211c381-a8d4-40ec-9e22-b8567e9480d9","resolution":{"observed_at":"2026-08-04T19:02:40.932166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13032","last_updated":"2025-05-19T12:18:42Z","snapshot_observed_at":"2026-08-04T21:45:55.994640Z","submitted_at":"2025-05-19T12:18:42Z","title":"MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13032","snapshot_observed_at":"2026-08-04T19:02:41.013510Z","title":"Maben, L","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01881","last_updated":"2026-08-03T08:24:54Z","snapshot_observed_at":"2026-08-05T13:31:27.481283Z","submitted_at":"2026-08-03T08:24:54Z","title":"Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T19:02:41.013510Z"},"links":{"cited_paper":"/paper/2505.13032","citing_paper":"/paper/2608.01881"},"observation_digest":"sha256:b450418813214f83dea4ba5a260dbf567605a396c4b2d6033272ac5a08a5b096","observation_id":"2e2a3dbc-9498-453c-a23b-34a3e2ccf11a","resolution":{"observed_at":"2026-08-04T19:02:41.013510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:02:41.053261Z","title":"InIEEE Au- tomatic Speech Recognition and Understanding Workshop, ASRU2025,Honolulu,HI,USA,December6-10,2025,1–4","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01881","last_updated":"2026-08-03T08:24:54Z","snapshot_observed_at":"2026-08-05T13:31:27.481283Z","submitted_at":"2026-08-03T08:24:54Z","title":"Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T19:02:41.053261Z"},"links":{"citing_paper":"/paper/2608.01881"},"observation_digest":"sha256:4a4d4cf7766c66d4f364a4cc4e4493d9f271fa491f0d1a1878b58617600cef82","observation_id":"6187c0fc-5fe1-4a16-ad07-e5a4d9c68382","resolution":{"observed_at":"2026-08-04T19:02:41.053261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:02:41.067683Z","title":"In Lacerda, F., ed.,18th Annual Conference of the Inter- national Speech Communication Association, Interspeech 2017, Stockholm, Sweden, August 20-24, 2017, 2616–2620","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.01881","last_updated":"2026-08-03T08:24:54Z","snapshot_observed_at":"2026-08-05T13:31:27.481283Z","submitted_at":"2026-08-03T08:24:54Z","title":"Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T19:02:41.067683Z"},"links":{"citing_paper":"/paper/2608.01881"},"observation_digest":"sha256:c160a55c9afeeeb060931bb8df51edaa3646fcc0ac40c764a7e4d900d11a303d","observation_id":"8b09f8e2-b07b-4cbf-ad50-41d679f06ce7","resolution":{"observed_at":"2026-08-04T19:02:41.067683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.22821","last_updated":"2026-04-28T17:29:55Z","snapshot_observed_at":"2026-08-03T17:25:43.148411Z","submitted_at":"2026-04-17T16:41:25Z","title":"Audio2Tool: Speak, Call, Act -- A Dataset for Benchmarking Speech Tool Use","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.22821","snapshot_observed_at":"2026-08-04T19:02:41.107158Z","title":"Rong, Y.; Li, C.; and Yu, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01881","last_updated":"2026-08-03T08:24:54Z","snapshot_observed_at":"2026-08-05T13:31:27.481283Z","submitted_at":"2026-08-03T08:24:54Z","title":"Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T19:02:41.107158Z"},"links":{"cited_paper":"/paper/2604.22821","citing_paper":"/paper/2608.01881"},"observation_digest":"sha256:8cb4a091231f349ce92d1cd58bd2fa7a7319bdd54a912df155afc634e5db3d24","observation_id":"34f5ce39-792b-48b8-87a2-61e208bc2c30","resolution":{"observed_at":"2026-08-04T19:02:41.107158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:02:41.148943Z","title":"Sakshi, S.; Tyagi, U.; and Kumar, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01881","last_updated":"2026-08-03T08:24:54Z","snapshot_observed_at":"2026-08-05T13:31:27.481283Z","submitted_at":"2026-08-03T08:24:54Z","title":"Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T19:02:41.148943Z"},"links":{"citing_paper":"/paper/2608.01881"},"observation_digest":"sha256:494759a2c2fc1b28d66925cf27f56d15b659832f8e6d880b0269a83fc460284a","observation_id":"1b4f6fc5-f7b4-4187-9e5a-c35004e175f5","resolution":{"observed_at":"2026-08-04T19:02:41.148943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.17765","last_updated":"2025-09-22T13:26:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-22T13:26:24Z","title":"Qwen3-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.17765","snapshot_observed_at":"2026-08-04T19:02:41.221713Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01881","last_updated":"2026-08-03T08:24:54Z","snapshot_observed_at":"2026-08-05T13:31:27.481283Z","submitted_at":"2026-08-03T08:24:54Z","title":"Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T19:02:41.221713Z"},"links":{"cited_paper":"/paper/2509.17765","citing_paper":"/paper/2608.01881"},"observation_digest":"sha256:a9088efc4adf34c05de155648b224d7c7f72013d0479d3f8a0b3f0a104074714","observation_id":"98553ed0-0e79-4d3e-a5ce-dc733f5d1faa","resolution":{"observed_at":"2026-08-04T19:02:41.221713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15804","last_updated":"2026-04-21T03:35:14Z","snapshot_observed_at":"2026-08-01T22:56:50.755050Z","submitted_at":"2026-04-17T08:05:46Z","title":"Qwen3.5-Omni Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.15804","snapshot_observed_at":"2026-08-04T19:02:41.256146Z","title":"Tian, F.; Zhang, X","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01881","last_updated":"2026-08-03T08:24:54Z","snapshot_observed_at":"2026-08-05T13:31:27.481283Z","submitted_at":"2026-08-03T08:24:54Z","title":"Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T19:02:41.256146Z"},"links":{"cited_paper":"/paper/2604.15804","citing_paper":"/paper/2608.01881"},"observation_digest":"sha256:c3f82a06c556f043dc301038ffa02360d52be3acb7d27c5246357ab081c6c0af","observation_id":"bc62cbbc-a02d-4d4d-bb71-bace030c9f48","resolution":{"observed_at":"2026-08-04T19:02:41.256146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:02:41.293091Z","title":"Tong, S.; Li, X.; and Wang, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01881","last_updated":"2026-08-03T08:24:54Z","snapshot_observed_at":"2026-08-05T13:31:27.481283Z","submitted_at":"2026-08-03T08:24:54Z","title":"Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T19:02:41.293091Z"},"links":{"citing_paper":"/paper/2608.01881"},"observation_digest":"sha256:788be7dcfc0530256a4e29948110a18013ba3949b7fa2bed84cfb30690511ae7","observation_id":"4b09b3f9-95d8-4749-8218-152e34f768e0","resolution":{"observed_at":"2026-08-04T19:02:41.293091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:02:41.335720Z","title":"Wang, B.; Zou, X.; and Lin, G","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01881","last_updated":"2026-08-03T08:24:54Z","snapshot_observed_at":"2026-08-05T13:31:27.481283Z","submitted_at":"2026-08-03T08:24:54Z","title":"Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T19:02:41.335720Z"},"links":{"citing_paper":"/paper/2608.01881"},"observation_digest":"sha256:99449b7ade2bd3459ea1d5aa7ecc0d23382b8c45cc303f0ea41387bf4402d374","observation_id":"3f03065c-a706-42ed-8410-2f5b6d2d8c21","resolution":{"observed_at":"2026-08-04T19:02:41.335720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:02:41.353060Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01881","last_updated":"2026-08-03T08:24:54Z","snapshot_observed_at":"2026-08-05T13:31:27.481283Z","submitted_at":"2026-08-03T08:24:54Z","title":"Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T19:02:41.353060Z"},"links":{"citing_paper":"/paper/2608.01881"},"observation_digest":"sha256:b822dba778812a2d51ec1e85ba8ad0e43d4b65a3f52988011a3afad592876999","observation_id":"6f0e38b8-5a61-44bb-a818-8123a40a4ac6","resolution":{"observed_at":"2026-08-04T19:02:41.353060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.08155","last_updated":"2025-08-11T16:31:32Z","snapshot_observed_at":"2026-07-06T22:11:19.157797Z","submitted_at":"2025-08-11T16:31:32Z","title":"MSU-Bench: Towards Understanding the Conversational Multi-talker Scenarios","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.08155","snapshot_observed_at":"2026-08-04T19:02:41.392890Z","title":"Wang, Y.; Peng, J.; and Li, H","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01881","last_updated":"2026-08-03T08:24:54Z","snapshot_observed_at":"2026-08-05T13:31:27.481283Z","submitted_at":"2026-08-03T08:24:54Z","title":"Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T19:02:41.392890Z"},"links":{"cited_paper":"/paper/2508.08155","citing_paper":"/paper/2608.01881"},"observation_digest":"sha256:88913202bdef3fe818a7e662d87228ce5fa3081e7cf1b559bd87533cddf51db9","observation_id":"f91bf7a1-04a2-4871-b173-21ed1dd452e9","resolution":{"observed_at":"2026-08-04T19:02:41.392890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.28480","last_updated":"2026-05-27T13:39:14Z","snapshot_observed_at":"2026-08-05T07:57:19.273326Z","submitted_at":"2026-05-27T13:39:14Z","title":"Audio-Mind: An Auditable Agentic Framework for Audio Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.28480","snapshot_observed_at":"2026-08-04T19:02:41.428446Z","title":"Wijngaard,G.;Formisano,E.;andDumontier,M.2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01881","last_updated":"2026-08-03T08:24:54Z","snapshot_observed_at":"2026-08-05T13:31:27.481283Z","submitted_at":"2026-08-03T08:24:54Z","title":"Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T19:02:41.428446Z"},"links":{"cited_paper":"/paper/2605.28480","citing_paper":"/paper/2608.01881"},"observation_digest":"sha256:5fb3ee95d46b7f0dc4afbb2dbb2afed40e203cd73637ed6d6d89595cee8efd8e","observation_id":"c834345b-e7e9-450f-a683-d09f2176cb2e","resolution":{"observed_at":"2026-08-04T19:02:41.428446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:02:41.470759Z","title":"Xie,Z.;Lin,M.;andLiu,Z.2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01881","last_updated":"2026-08-03T08:24:54Z","snapshot_observed_at":"2026-08-05T13:31:27.481283Z","submitted_at":"2026-08-03T08:24:54Z","title":"Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T19:02:41.470759Z"},"links":{"citing_paper":"/paper/2608.01881"},"observation_digest":"sha256:1ee3444f154a8402bf7f73cf7aae8c2e3970c05cb5cabfb040c2b34cd80e66ec","observation_id":"eb13be1e-37ad-453a-a48e-e22c2db5df73","resolution":{"observed_at":"2026-08-04T19:02:41.470759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:02:41.491746Z","title":"CoRR, abs/2606.15141","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01881","last_updated":"2026-08-03T08:24:54Z","snapshot_observed_at":"2026-08-05T13:31:27.481283Z","submitted_at":"2026-08-03T08:24:54Z","title":"Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T19:02:41.491746Z"},"links":{"citing_paper":"/paper/2608.01881"},"observation_digest":"sha256:7bbc427f030707eb972cd1d35331f7a68cde6ac2224196b24247af98b57f49a7","observation_id":"9be4a0b8-7f58-41f1-a43b-7f2bb47ef9ac","resolution":{"observed_at":"2026-08-04T19:02:41.491746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1709.05522","last_updated":"2017-09-16T14:33:27Z","snapshot_observed_at":"2026-07-06T05:59:57.626517Z","submitted_at":"2017-09-16T14:33:27Z","title":"AISHELL-1: An Open-Source Mandarin Speech Corpus and A Speech Recognition Baseline","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1709.05522","snapshot_observed_at":"2026-08-04T19:02:40.653124Z","title":"Chen, L.; Chen, H.; and Cai, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01881","last_updated":"2026-08-03T08:24:54Z","snapshot_observed_at":"2026-08-05T13:31:27.481283Z","submitted_at":"2026-08-03T08:24:54Z","title":"Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-04T19:02:40.653124Z"},"links":{"cited_paper":"/paper/1709.05522","citing_paper":"/paper/2608.01881"},"observation_digest":"sha256:c6e5a10b055bcd394583fc50848e39538c31e29e9eec4d1d5b2ff177080db5ab","observation_id":"13256ed0-1e9f-4e28-bbfc-217dd82fbb6a","resolution":{"observed_at":"2026-08-04T19:02:40.653124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.00320","last_updated":"2018-04-01T17:12:47Z","snapshot_observed_at":"2026-07-06T06:31:14.582990Z","submitted_at":"2018-04-01T17:12:47Z","title":"Spoken SQuAD: A Study of Mitigating the Impact of Speech Recognition Errors on Listening Comprehension","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.00320","snapshot_observed_at":"2026-08-04T19:02:40.885771Z","title":"Li, L.; Chen, H.; Li, Z.; Hu, Q.; Kang, J.; Li, J.; Xie, L.; and Li,Y.2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01881","last_updated":"2026-08-03T08:24:54Z","snapshot_observed_at":"2026-08-05T13:31:27.481283Z","submitted_at":"2026-08-03T08:24:54Z","title":"Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-04T19:02:40.885771Z"},"links":{"cited_paper":"/paper/1804.00320","citing_paper":"/paper/2608.01881"},"observation_digest":"sha256:cb0a5b0507bad55aa819ea266fe6473318a8c297f9425ab0c7019d0d549c3630","observation_id":"c8bcbcec-dc56-4ace-9a1a-ea4a8567596b","resolution":{"observed_at":"2026-08-04T19:02:40.885771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-04T10:15:33.124350Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-08-04T19:02:40.730450Z","title":"arXiv:2005.11262","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2608.01881","last_updated":"2026-08-03T08:24:54Z","snapshot_observed_at":"2026-08-05T13:31:27.481283Z","submitted_at":"2026-08-03T08:24:54Z","title":"Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-04T19:02:40.730450Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2608.01881"},"observation_digest":"sha256:568c8b87833b876893a5a3c0a640be6d033b8173f9072c18486ab0cdbd4b1f77","observation_id":"d71e7252-bb08-46c4-9f06-f0a42d6c960f","resolution":{"observed_at":"2026-08-04T19:02:40.730450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.03603","last_updated":"2021-08-10T09:15:00Z","snapshot_observed_at":"2026-07-06T10:57:34.353038Z","submitted_at":"2021-04-08T08:38:44Z","title":"AISHELL-4: An Open Source Dataset for Speech Enhancement, Separation, Recognition and Speaker Diarization in Conference Scenario","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.03603","snapshot_observed_at":"2026-08-04T19:02:40.804727Z","title":"Jain, D.; Shukla, H.; and Rajeev, G","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01881","last_updated":"2026-08-03T08:24:54Z","snapshot_observed_at":"2026-08-05T13:31:27.481283Z","submitted_at":"2026-08-03T08:24:54Z","title":"Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-04T19:02:40.804727Z"},"links":{"cited_paper":"/paper/2104.03603","citing_paper":"/paper/2608.01881"},"observation_digest":"sha256:c88fe13801d5002237b546be2db571e1e3d771c4fada31be6f6dcc11fef92497","observation_id":"724f824a-7e93-4787-920e-4654dc3fc791","resolution":{"observed_at":"2026-08-04T19:02:40.804727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02437","last_updated":"2023-06-22T13:00:56Z","snapshot_observed_at":"2026-07-06T14:00:05.253488Z","submitted_at":"2022-10-05T17:57:29Z","title":"ASVspoof 2021: Towards Spoofed and Deepfake Speech Detection in the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02437","snapshot_observed_at":"2026-08-04T19:02:40.969960Z","title":"Ma, Z.; Ma, Y.; and Zhu, Y","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.01881","last_updated":"2026-08-03T08:24:54Z","snapshot_observed_at":"2026-08-05T13:31:27.481283Z","submitted_at":"2026-08-03T08:24:54Z","title":"Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-04T19:02:40.969960Z"},"links":{"cited_paper":"/paper/2210.02437","citing_paper":"/paper/2608.01881"},"observation_digest":"sha256:097ddace947c590dceeeaa7a8496e9dfe1df5966899732a3ed4f6f2c7edace71","observation_id":"4dcc0451-20e1-44a7-b907-4a2f4d95a0fc","resolution":{"observed_at":"2026-08-04T19:02:40.969960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10390","last_updated":"2024-04-18T08:13:58Z","snapshot_observed_at":"2026-08-04T01:33:33.914588Z","submitted_at":"2023-08-20T23:47:23Z","title":"LibriSQA: A Novel Dataset and Framework for Spoken Question Answering with Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.10390","snapshot_observed_at":"2026-08-04T19:02:41.528122Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01881","last_updated":"2026-08-03T08:24:54Z","snapshot_observed_at":"2026-08-05T13:31:27.481283Z","submitted_at":"2026-08-03T08:24:54Z","title":"Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T19:02:41.528122Z"},"links":{"cited_paper":"/paper/2308.10390","citing_paper":"/paper/2608.01881"},"observation_digest":"sha256:99e518c8158eb299f099f803102274efcd8c13878e80ab7a3441130900daabd9","observation_id":"9c752120-f0a1-4d5f-b55f-f14617d2bbb0","resolution":{"observed_at":"2026-08-04T19:02:41.528122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19168","last_updated":"2024-10-24T21:20:10Z","snapshot_observed_at":"2026-07-06T19:39:23.839070Z","submitted_at":"2024-10-24T21:20:10Z","title":"MMAU: A Massive Multi-Task Audio Understanding and Reasoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.19168","snapshot_observed_at":"2026-08-04T19:02:41.181470Z","title":"Sussman, E","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01881","last_updated":"2026-08-03T08:24:54Z","snapshot_observed_at":"2026-08-05T13:31:27.481283Z","submitted_at":"2026-08-03T08:24:54Z","title":"Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T19:02:41.181470Z"},"links":{"cited_paper":"/paper/2410.19168","citing_paper":"/paper/2608.01881"},"observation_digest":"sha256:9cba0702f424de8ac09bd24ae938909dbe0bb9dfad0ee60e81628c2fd42d3c17","observation_id":"132df9a7-37fb-47bd-a385-bfcccba9b1e1","resolution":{"observed_at":"2026-08-04T19:02:41.181470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:02:40.849020Z","title":"KimiTeam;Ding,D.;andJu,Z.2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01881","last_updated":"2026-08-03T08:24:54Z","snapshot_observed_at":"2026-08-05T13:31:27.481283Z","submitted_at":"2026-08-03T08:24:54Z","title":"Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T19:02:40.849020Z"},"links":{"citing_paper":"/paper/2608.01881"},"observation_digest":"sha256:13ec38ba9d16f04bde8445dd640c7deaacdba0ed67c237d03d8eeb4fa4ff0d97","observation_id":"adbdab8b-0935-4d1e-abf1-c57a5fb4f5e9","resolution":{"observed_at":"2026-08-04T19:02:40.849020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:02:40.693596Z","title":"CoRR, abs/2602.10439","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01881","last_updated":"2026-08-03T08:24:54Z","snapshot_observed_at":"2026-08-05T13:31:27.481283Z","submitted_at":"2026-08-03T08:24:54Z","title":"Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-04T19:02:40.693596Z"},"links":{"citing_paper":"/paper/2608.01881"},"observation_digest":"sha256:c165812031b20d27a5d4d43e8bc2990ec594fe3856edaec107fd08ec923ff9ea","observation_id":"a4d5a1be-9bd3-4ea1-8cc1-7032541fc61f","resolution":{"observed_at":"2026-08-04T19:02:40.693596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.01881","last_updated":"2026-08-03T08:24:54Z","latest_version":1,"primary_category":"cs.MM","snapshot_observed_at":"2026-08-05T13:31:27.481283Z","submitted_at":"2026-08-03T08:24:54Z","title":"Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 0 inbound Pith citation observations for arXiv:2608.01881."}