{"as_of":"2026-08-08T01:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b8f3d6a3ff4d8a9346f943db96d6f0eefde952c27acf505d02c0e5c7c599afc7","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T10:03:54.653164Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T19:02:41.428446Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.28480","last_updated":"2026-05-27T13:39:14Z","snapshot_observed_at":"2026-08-07T09:43:33.557408Z","submitted_at":"2026-05-27T13:39:14Z","title":"Audio-Mind: An Auditable Agentic Framework for Audio Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.28480","snapshot_observed_at":"2026-08-01T16:37:24.362798Z","title":"Audio-mind: An auditable agentic framework for audio understanding.arXiv preprint arXiv:2605.28480, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.362798Z"},"links":{"cited_paper":"/paper/2605.28480","citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:d834be58cf4fa7e3c31ce6ed9c1eef185a46545ea3f58b3707727ac53f84262d","observation_id":"b931952c-42e1-4b70-a83b-9a03bd5b5a6c","resolution":{"observed_at":"2026-08-01T16:37:24.362798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.28480","last_updated":"2026-05-27T13:39:14Z","snapshot_observed_at":"2026-08-07T09:43:33.557408Z","submitted_at":"2026-05-27T13:39:14Z","title":"Audio-Mind: An Auditable Agentic Framework for Audio Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.28480","snapshot_observed_at":"2026-08-04T19:02:41.428446Z","title":"Wijngaard,G.;Formisano,E.;andDumontier,M.2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01881","last_updated":"2026-08-03T08:24:54Z","snapshot_observed_at":"2026-08-07T17:03:26.722829Z","submitted_at":"2026-08-03T08:24:54Z","title":"Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T19:02:41.428446Z"},"links":{"cited_paper":"/paper/2605.28480","citing_paper":"/paper/2608.01881"},"observation_digest":"sha256:8e816a015b903179daee8e2ac549bf222efade642eaadaa1497630bf4eb321a4","observation_id":"c834345b-e7e9-450f-a683-d09f2176cb2e","resolution":{"observed_at":"2026-08-04T19:02:41.428446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.28480/citation-record","integrity":"/paper/2605.28480/integrity","json":"/paper/2605.28480/citation-record.json","paper":"/paper/2605.28480"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2605.28480","last_updated":"2026-05-27T13:39:14Z","snapshot_observed_at":"2026-08-07T09:43:33.557408Z","submitted_at":"2026-05-27T13:39:14Z","title":"Audio-Mind: An Auditable Agentic Framework for Audio Understanding","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-06-29T10:03:54.653164Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2605.28480"},"observation_digest":"sha256:d320c8067d1d2d2a5a0cb06f09fc3b7883c308b8bcbf5e85a5cf4c2c5eae4552","observation_id":"c1506217-13ea-4ee1-b44f-b84d1c492850","resolution":{"observed_at":"2026-06-29T10:13:17.942116Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00747","last_updated":"2023-07-11T17:07:19Z","snapshot_observed_at":"2026-08-07T11:26:26.674534Z","submitted_at":"2023-03-01T18:59:13Z","title":"WhisperX: Time-Accurate Speech Transcription of Long-Form Audio","version":2},"cited_work":{"arxiv_id":"2303.00747","doi":"10.48550/arxiv.2303.00747","metadata_source":"pith","pith_arxiv_id":"2303.00747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WhisperX: Time-accurate speech transcription of long-form audio","venue":"cs.SD","work_id":"da9839e2-3c0b-4792-87a5-17cd9c608769","year":2023},"citing_paper":{"arxiv_id":"2605.28480","last_updated":"2026-05-27T13:39:14Z","snapshot_observed_at":"2026-08-07T09:43:33.557408Z","submitted_at":"2026-05-27T13:39:14Z","title":"Audio-Mind: An Auditable Agentic Framework for Audio Understanding","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-29T10:03:54.653164Z"},"links":{"cited_paper":"/paper/2303.00747","citing_paper":"/paper/2605.28480"},"observation_digest":"sha256:74774a41c651d882736487b282873daa381154e9f3c2b234ef43c3c522e5e6b6","observation_id":"7f46dda7-5abc-4b0b-9806-0ebd148e07b2","resolution":{"observed_at":"2026-06-29T10:13:17.548499Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T10:03:54.653164Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.28480","last_updated":"2026-05-27T13:39:14Z","snapshot_observed_at":"2026-08-07T09:43:33.557408Z","submitted_at":"2026-05-27T13:39:14Z","title":"Audio-Mind: An Auditable Agentic Framework for Audio Understanding","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-29T10:03:54.653164Z"},"links":{"citing_paper":"/paper/2605.28480"},"observation_digest":"sha256:a08a030660d6f3a7647d621648a918cd63186f063fe5ba78b2753267d531c8ea","observation_id":"329522a9-4391-477f-bf17-e9651b0ed5a3","resolution":{"observed_at":"2026-06-29T10:03:54.653164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.10439","doi":"10.48550/arxiv.2602.10439","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"Open MIND","work_id":"f40830f0-1bde-4fb8-b403-c0f7dfb7e51d","year":2026},"citing_paper":{"arxiv_id":"2605.28480","last_updated":"2026-05-27T13:39:14Z","snapshot_observed_at":"2026-08-07T09:43:33.557408Z","submitted_at":"2026-05-27T13:39:14Z","title":"Audio-Mind: An Auditable Agentic Framework for Audio Understanding","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-29T10:03:54.653164Z"},"links":{"citing_paper":"/paper/2605.28480"},"observation_digest":"sha256:6196db247a89a86d34bb3ac8b494f0e7f9337fd8ff0201bead7a4cdb740925b7","observation_id":"cf248996-2560-46a7-8d1f-25da4e8dc723","resolution":{"observed_at":"2026-06-29T10:13:17.551269Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T10:03:54.653164Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.28480","last_updated":"2026-05-27T13:39:14Z","snapshot_observed_at":"2026-08-07T09:43:33.557408Z","submitted_at":"2026-05-27T13:39:14Z","title":"Audio-Mind: An Auditable Agentic Framework for Audio Understanding","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-29T10:03:54.653164Z"},"links":{"citing_paper":"/paper/2605.28480"},"observation_digest":"sha256:0c7bb6b4c7a2ae8f182e66ac764c3376053fb54cc6dcded316e1f09e52c38611","observation_id":"b0753620-f81b-494e-b3a4-2db185ec4dcb","resolution":{"observed_at":"2026-06-29T10:03:54.653164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":"2407.10759","doi":"10.48550/arxiv.2407.10759","metadata_source":"pith","pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2-Audio Technical Report","venue":"eess.AS","work_id":"c249e63c-cf40-408f-a4ff-fdf68e8cbeb8","year":2024},"citing_paper":{"arxiv_id":"2605.28480","last_updated":"2026-05-27T13:39:14Z","snapshot_observed_at":"2026-08-07T09:43:33.557408Z","submitted_at":"2026-05-27T13:39:14Z","title":"Audio-Mind: An Auditable Agentic Framework for Audio Understanding","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-29T10:03:54.653164Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2605.28480"},"observation_digest":"sha256:7e43648f994cb9105d10f8c8a6d1ec400842374e140432de09fa3ba27b191b08","observation_id":"9d196c85-a767-40bc-a470-8570b1c3169c","resolution":{"observed_at":"2026-06-29T10:13:17.588585Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":"2507.06261","doi":"10.48550/arxiv.2503.19","metadata_source":"pith","pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T03:17:51.364436Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","venue":"cs.CL","work_id":"008df105-2fdd-45d8-857a-8e35868aecb6","year":2025},"citing_paper":{"arxiv_id":"2605.28480","last_updated":"2026-05-27T13:39:14Z","snapshot_observed_at":"2026-08-07T09:43:33.557408Z","submitted_at":"2026-05-27T13:39:14Z","title":"Audio-Mind: An Auditable Agentic Framework for Audio Understanding","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-29T10:03:54.653164Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2605.28480"},"observation_digest":"sha256:6e4f92c8221dd90d779698f613f079f92c03cef3122c817bf95b5390c61b94a7","observation_id":"f6e9c809-2583-4e2d-858f-43685f97e682","resolution":{"observed_at":"2026-06-29T10:13:17.930336Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03751","last_updated":"2025-08-07T13:29:43Z","snapshot_observed_at":"2026-08-04T10:22:48.346908Z","submitted_at":"2024-10-01T21:48:12Z","title":"Recent Advances in Speech Language Models: A Survey","version":4},"cited_work":{"arxiv_id":"2410.03751","doi":"10.48550/arxiv.2410.03751","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03751","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Recent advances in speech language models: A survey.arXiv preprint arXiv:2410.03751","venue":"arXiv (Cornell University)","work_id":"f00839a5-7958-4b3f-a510-746f20ca6ffd","year":2024},"citing_paper":{"arxiv_id":"2605.28480","last_updated":"2026-05-27T13:39:14Z","snapshot_observed_at":"2026-08-07T09:43:33.557408Z","submitted_at":"2026-05-27T13:39:14Z","title":"Audio-Mind: An Auditable Agentic Framework for Audio Understanding","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-29T10:03:54.653164Z"},"links":{"cited_paper":"/paper/2410.03751","citing_paper":"/paper/2605.28480"},"observation_digest":"sha256:0a9733c28acad5fe2a64ad11669234c3dd196b86e1bc6c95d6116e68de73ee76","observation_id":"c94f2c74-304e-43c0-a0a7-0e9a07fef51c","resolution":{"observed_at":"2026-06-29T10:13:17.598343Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.18425","last_updated":"2025-04-25T15:31:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-25T15:31:46Z","title":"Kimi-Audio Technical Report","version":1},"cited_work":{"arxiv_id":"2504.18425","doi":"10.48550/arxiv.2504.18425","metadata_source":"pith","pith_arxiv_id":"2504.18425","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kimi-Audio Technical Report","venue":"eess.AS","work_id":"9c2ba56b-5585-4f28-b751-703f31dca2d5","year":2025},"citing_paper":{"arxiv_id":"2605.28480","last_updated":"2026-05-27T13:39:14Z","snapshot_observed_at":"2026-08-07T09:43:33.557408Z","submitted_at":"2026-05-27T13:39:14Z","title":"Audio-Mind: An Auditable Agentic Framework for Audio Understanding","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-29T10:03:54.653164Z"},"links":{"cited_paper":"/paper/2504.18425","citing_paper":"/paper/2605.28480"},"observation_digest":"sha256:d688589431b049d9b4c823774d54e12c5968cc3c99ccb05361d1cc8142d535f9","observation_id":"787d3b99-3b5d-4bd7-83b8-9d284ab7cf94","resolution":{"observed_at":"2026-06-29T10:13:17.935066Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.08128","last_updated":"2025-07-28T22:53:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-10T19:40:21Z","title":"Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models","version":2},"cited_work":{"arxiv_id":"2507.08128","doi":"10.48550/arxiv.2507.08128","metadata_source":"pith","pith_arxiv_id":"2507.08128","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models","venue":"cs.SD","work_id":"67c2892d-8e27-4da1-8198-71c48e673e96","year":2025},"citing_paper":{"arxiv_id":"2605.28480","last_updated":"2026-05-27T13:39:14Z","snapshot_observed_at":"2026-08-07T09:43:33.557408Z","submitted_at":"2026-05-27T13:39:14Z","title":"Audio-Mind: An Auditable Agentic Framework for Audio Understanding","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-29T10:03:54.653164Z"},"links":{"cited_paper":"/paper/2507.08128","citing_paper":"/paper/2605.28480"},"observation_digest":"sha256:be84ad1858fcda0710b9f0de51b307ba30d4bd4265632e73b61872cc25c13359","observation_id":"ccd6e72f-21c0-4627-a178-cd4a6c480c30","resolution":{"observed_at":"2026-06-29T10:13:17.625234Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T10:03:54.653164Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.28480","last_updated":"2026-05-27T13:39:14Z","snapshot_observed_at":"2026-08-07T09:43:33.557408Z","submitted_at":"2026-05-27T13:39:14Z","title":"Audio-Mind: An Auditable Agentic Framework for Audio Understanding","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-29T10:03:54.653164Z"},"links":{"citing_paper":"/paper/2605.28480"},"observation_digest":"sha256:b4645db2020db160043a77a216f5895abca53eb19a31364a7d38551b8a83b383","observation_id":"7f417745-1396-4451-9c96-88e4e4df356e","resolution":{"observed_at":"2026-06-29T10:03:54.653164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T10:03:54.653164Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.28480","last_updated":"2026-05-27T13:39:14Z","snapshot_observed_at":"2026-08-07T09:43:33.557408Z","submitted_at":"2026-05-27T13:39:14Z","title":"Audio-Mind: An Auditable Agentic Framework for Audio Understanding","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-29T10:03:54.653164Z"},"links":{"citing_paper":"/paper/2605.28480"},"observation_digest":"sha256:9f0d682e286f05492631a1d9fef24abe74dc5b83f7bc8ff0e5deccb08b882952","observation_id":"9948a2fc-0017-4122-8a73-fc1160340dc7","resolution":{"observed_at":"2026-06-29T10:03:54.653164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.18623","doi":"10.48550/arxiv.2506.18623","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient and generalizable speaker diarization via structured pruning of self-supervised models","venue":"arXiv (Cornell University)","work_id":"cfa7f299-c2b6-460a-8027-858d27468a98","year":2026},"citing_paper":{"arxiv_id":"2605.28480","last_updated":"2026-05-27T13:39:14Z","snapshot_observed_at":"2026-08-07T09:43:33.557408Z","submitted_at":"2026-05-27T13:39:14Z","title":"Audio-Mind: An Auditable Agentic Framework for Audio Understanding","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-29T10:03:54.653164Z"},"links":{"citing_paper":"/paper/2605.28480"},"observation_digest":"sha256:9998f8183b3b98c7bafe345a290d3fadbbc02e523e32ffde0a33c33302f4e534","observation_id":"a674a3bd-4aa2-4ed3-bf00-2038385cfcbe","resolution":{"observed_at":"2026-06-29T10:13:17.581607Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"cited_work":{"arxiv_id":"2502.11946","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.11946","snapshot_observed_at":"2026-07-04T02:49:25.012133Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","venue":"cs.CL","work_id":"03de0b74-a423-4e22-be1b-76d588429220","year":2025},"citing_paper":{"arxiv_id":"2605.28480","last_updated":"2026-05-27T13:39:14Z","snapshot_observed_at":"2026-08-07T09:43:33.557408Z","submitted_at":"2026-05-27T13:39:14Z","title":"Audio-Mind: An Auditable Agentic Framework for Audio Understanding","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-29T10:03:54.653164Z"},"links":{"cited_paper":"/paper/2502.11946","citing_paper":"/paper/2605.28480"},"observation_digest":"sha256:d52d7d2693e387bebca41866f3790e415414260dfc6665fff037f5b146de16b3","observation_id":"6105dafd-069c-4ad2-bbf2-f004becb9545","resolution":{"observed_at":"2026-06-29T10:13:17.925272Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":"2410.21276","doi":"10.1177/15248380231178756","metadata_source":"pith","pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4o System Card","venue":"cs.CL","work_id":"f37bf1c7-4964-4e56-9762-d20da8d9009f","year":2024},"citing_paper":{"arxiv_id":"2605.28480","last_updated":"2026-05-27T13:39:14Z","snapshot_observed_at":"2026-08-07T09:43:33.557408Z","submitted_at":"2026-05-27T13:39:14Z","title":"Audio-Mind: An Auditable Agentic Framework for Audio Understanding","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-29T10:03:54.653164Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2605.28480"},"observation_digest":"sha256:4f0fd0bbd380ab8313ec321f63edd66fa7485a8a90dd150df65490c03e3ec02a","observation_id":"856faebb-ddd4-4d10-8861-fc1523e065cb","resolution":{"observed_at":"2026-06-29T10:13:17.927951Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T10:03:54.653164Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2605.28480","last_updated":"2026-05-27T13:39:14Z","snapshot_observed_at":"2026-08-07T09:43:33.557408Z","submitted_at":"2026-05-27T13:39:14Z","title":"Audio-Mind: An Auditable Agentic Framework for Audio Understanding","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-29T10:03:54.653164Z"},"links":{"citing_paper":"/paper/2605.28480"},"observation_digest":"sha256:b520862ec2243827a56795dd1ea319c3d29476056a0daa33e62fa0aa8c7f051d","observation_id":"e44bec0d-72aa-4f24-8a42-d703c3f2990d","resolution":{"observed_at":"2026-06-29T10:03:54.653164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01831","last_updated":"2024-05-28T05:44:53Z","snapshot_observed_at":"2026-08-07T19:26:44.980429Z","submitted_at":"2024-02-02T18:58:34Z","title":"Audio Flamingo: A Novel Audio Language Model with Few-Shot Learning and Dialogue Abilities","version":3},"cited_work":{"arxiv_id":"2402.01831","doi":"10.48550/arxiv.2402.01831","metadata_source":"pith","pith_arxiv_id":"2402.01831","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audio flamingo: A novel audio language model with few-shot learning and dialogue abilities","venue":"cs.SD","work_id":"7df2c8af-e882-4b7d-97cd-2f377fbe4695","year":2024},"citing_paper":{"arxiv_id":"2605.28480","last_updated":"2026-05-27T13:39:14Z","snapshot_observed_at":"2026-08-07T09:43:33.557408Z","submitted_at":"2026-05-27T13:39:14Z","title":"Audio-Mind: An Auditable Agentic Framework for Audio Understanding","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-29T10:03:54.653164Z"},"links":{"cited_paper":"/paper/2402.01831","citing_paper":"/paper/2605.28480"},"observation_digest":"sha256:7c26cc0ad7b34f895341606d88739eb919752a669fcb6e5b84646eb22284b1e5","observation_id":"1834ea9a-084a-42d3-8884-b32c1d7595a6","resolution":{"observed_at":"2026-06-29T10:13:17.584186Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.09552","last_updated":"2017-06-29T02:38:02Z","snapshot_observed_at":"2026-08-07T12:35:05.459578Z","submitted_at":"2017-06-29T02:38:02Z","title":"Chord Label Personalization through Deep Learning of Integrated Harmonic Interval-based Representations","version":1},"cited_work":{"arxiv_id":"1706.09552","doi":null,"metadata_source":"pith","pith_arxiv_id":"1706.09552","snapshot_observed_at":"2026-06-29T10:13:17.921308Z","title":"Chord Label Personalization through Deep Learning of Integrated Harmonic Interval-based Representations","venue":"cs.SD","work_id":"4af0ae70-abfa-4728-91f5-3def2107d559","year":2017},"citing_paper":{"arxiv_id":"2605.28480","last_updated":"2026-05-27T13:39:14Z","snapshot_observed_at":"2026-08-07T09:43:33.557408Z","submitted_at":"2026-05-27T13:39:14Z","title":"Audio-Mind: An Auditable Agentic Framework for Audio Understanding","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-29T10:03:54.653164Z"},"links":{"cited_paper":"/paper/1706.09552","citing_paper":"/paper/2605.28480"},"observation_digest":"sha256:b774da4c95bb0c48d6d5ab6d908df718e1537e6a3eeded80adc9f2845abe4a8e","observation_id":"2c8b6ede-7e34-42c0-9af4-3eb310b479da","resolution":{"observed_at":"2026-06-29T10:13:17.922805Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.09886","last_updated":"2024-09-23T16:45:04Z","snapshot_observed_at":"2026-07-06T18:45:52.286287Z","submitted_at":"2024-07-13T13:26:43Z","title":"Speech-Copilot: Leveraging Large Language Models for Speech Processing via Task Decomposition, Modularization, and Program Generation","version":2},"cited_work":{"arxiv_id":"2407.09886","doi":"10.48550/arxiv.2407.09886","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.09886","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"arXiv (Cornell University)","work_id":"0f9d6cd6-36b3-4999-a4a5-670b8af45aa3","year":2024},"citing_paper":{"arxiv_id":"2605.28480","last_updated":"2026-05-27T13:39:14Z","snapshot_observed_at":"2026-08-07T09:43:33.557408Z","submitted_at":"2026-05-27T13:39:14Z","title":"Audio-Mind: An Auditable Agentic Framework for Audio Understanding","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-29T10:03:54.653164Z"},"links":{"cited_paper":"/paper/2407.09886","citing_paper":"/paper/2605.28480"},"observation_digest":"sha256:41cd5046ddd197fccb4991134da1699b255476a36caa64fc84442303638e54f5","observation_id":"91bd9b4c-97f0-4bf3-b81b-9634cd6dba38","resolution":{"observed_at":"2026-06-29T10:13:17.573738Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13992","last_updated":"2025-08-19T16:33:49Z","snapshot_observed_at":"2026-08-05T18:48:28.371759Z","submitted_at":"2025-08-19T16:33:49Z","title":"MMAU-Pro: A Challenging and Comprehensive Benchmark for Holistic Evaluation of Audio General Intelligence","version":1},"cited_work":{"arxiv_id":"2508.13992","doi":"10.48550/arxiv.2508.13992","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.13992","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Mmau-pro: A challenging and comprehensive benchmark for holistic evaluation of audio general intelligence","venue":null,"work_id":"34fbbc93-cd79-4b11-a99d-32d597b71a37","year":2025},"citing_paper":{"arxiv_id":"2605.28480","last_updated":"2026-05-27T13:39:14Z","snapshot_observed_at":"2026-08-07T09:43:33.557408Z","submitted_at":"2026-05-27T13:39:14Z","title":"Audio-Mind: An Auditable Agentic Framework for Audio Understanding","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-29T10:03:54.653164Z"},"links":{"cited_paper":"/paper/2508.13992","citing_paper":"/paper/2605.28480"},"observation_digest":"sha256:ad9d53ca20eb28be9665750a7a0d0fab85cc01ecfac6e133a9c5653329b837d5","observation_id":"107c5050-9c44-47d3-9984-f432ec791da5","resolution":{"observed_at":"2026-06-29T10:13:17.567135Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.11454","doi":"10.48550/arxiv.2510.11454","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audio-Maestro: Enhanc- ing large audio-language models with tool-augmented reasoning,","venue":"arXiv (Cornell University)","work_id":"f706ed97-5c15-4d47-9eb1-5b9046ba0263","year":2025},"citing_paper":{"arxiv_id":"2605.28480","last_updated":"2026-05-27T13:39:14Z","snapshot_observed_at":"2026-08-07T09:43:33.557408Z","submitted_at":"2026-05-27T13:39:14Z","title":"Audio-Mind: An Auditable Agentic Framework for Audio Understanding","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-29T10:03:54.653164Z"},"links":{"citing_paper":"/paper/2605.28480"},"observation_digest":"sha256:0ba52b5a312bfddd9fad9b04e7e6d0e553481c926c2ba2247f4f2aa1bc3fd453","observation_id":"d10481d1-be7e-4d14-ac7e-5fecb6c3ad85","resolution":{"observed_at":"2026-06-29T10:13:17.571518Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13032","last_updated":"2025-05-19T12:18:42Z","snapshot_observed_at":"2026-08-07T15:43:15.821319Z","submitted_at":"2025-05-19T12:18:42Z","title":"MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix","version":1},"cited_work":{"arxiv_id":"2505.13032","doi":"10.48550/arxiv.2505.13032","metadata_source":"pith","pith_arxiv_id":"2505.13032","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mmar: A challenging benchmark for deep reasoning in speech, audio, music, and their mix","venue":"cs.SD","work_id":"fe97a573-dedf-4e07-af07-b22508260a10","year":2025},"citing_paper":{"arxiv_id":"2605.28480","last_updated":"2026-05-27T13:39:14Z","snapshot_observed_at":"2026-08-07T09:43:33.557408Z","submitted_at":"2026-05-27T13:39:14Z","title":"Audio-Mind: An Auditable Agentic Framework for Audio Understanding","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-29T10:03:54.653164Z"},"links":{"cited_paper":"/paper/2505.13032","citing_paper":"/paper/2605.28480"},"observation_digest":"sha256:2f5fbb0d10848d3bdafbd721260000590758ad071b7016ecd0c8c88a85de90af","observation_id":"f915d858-d9f7-49f3-9296-81babc305094","resolution":{"observed_at":"2026-06-29T10:13:17.578490Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.14224","doi":"10.48550/arxiv.2602.14224","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The interspeech 2026 audio reasoning chal- lenge: Evaluating reasoning process quality for audio reasoning models and agents","venue":"Open MIND","work_id":"235d1022-58e5-4528-8ba4-9e2e87a97242","year":2026},"citing_paper":{"arxiv_id":"2605.28480","last_updated":"2026-05-27T13:39:14Z","snapshot_observed_at":"2026-08-07T09:43:33.557408Z","submitted_at":"2026-05-27T13:39:14Z","title":"Audio-Mind: An Auditable Agentic Framework for Audio Understanding","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-29T10:03:54.653164Z"},"links":{"citing_paper":"/paper/2605.28480"},"observation_digest":"sha256:41117f2f2b19fb448c2001e4c551aac6fdc616fa301013c2ffbe399f0f5f20dd","observation_id":"b1752b84-5199-4337-a201-24af2e5789c6","resolution":{"observed_at":"2026-06-29T10:13:17.586530Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T10:03:54.653164Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2605.28480","last_updated":"2026-05-27T13:39:14Z","snapshot_observed_at":"2026-08-07T09:43:33.557408Z","submitted_at":"2026-05-27T13:39:14Z","title":"Audio-Mind: An Auditable Agentic Framework for Audio Understanding","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-06-29T10:03:54.653164Z"},"links":{"citing_paper":"/paper/2605.28480"},"observation_digest":"sha256:01fbef95ca7b382fa2b6bd14440c6a5fd51d9c17178dcbdc4eeadeb14f04868b","observation_id":"5940a835-3ead-4561-9d4c-b83f3b107d76","resolution":{"observed_at":"2026-06-29T10:03:54.653164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.17822","doi":"10.48550/arxiv.2603.17822","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"arXiv (Cornell University)","work_id":"4f676fe3-a681-4afa-b3f1-f3ecbabf8b00","year":2026},"citing_paper":{"arxiv_id":"2605.28480","last_updated":"2026-05-27T13:39:14Z","snapshot_observed_at":"2026-08-07T09:43:33.557408Z","submitted_at":"2026-05-27T13:39:14Z","title":"Audio-Mind: An Auditable Agentic Framework for Audio Understanding","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-29T10:03:54.653164Z"},"links":{"citing_paper":"/paper/2605.28480"},"observation_digest":"sha256:a38f17d28f0a10f70e8126655aa50673d65975f58b1c320e22c9346b696e5d90","observation_id":"021fa0e0-ea9a-4152-ad90-2388694b91a2","resolution":{"observed_at":"2026-06-29T10:13:17.595640Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06656","last_updated":"2025-07-19T18:18:34Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:20:11Z","title":"Sortformer: A Novel Approach for Permutation-Resolved Speaker Supervision in Speech-to-Text Systems","version":3},"cited_work":{"arxiv_id":"2409.06656","doi":"10.48550/arxiv.2409.06656","metadata_source":"arxiv_reference","pith_arxiv_id":"2409.06656","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sortformer: A novel approach for permutation-resolved speaker supervision in speech-to-text systems","venue":"arXiv (Cornell University)","work_id":"76b062da-e86d-4202-9b1d-f73b5e226391","year":2024},"citing_paper":{"arxiv_id":"2605.28480","last_updated":"2026-05-27T13:39:14Z","snapshot_observed_at":"2026-08-07T09:43:33.557408Z","submitted_at":"2026-05-27T13:39:14Z","title":"Audio-Mind: An Auditable Agentic Framework for Audio Understanding","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-29T10:03:54.653164Z"},"links":{"cited_paper":"/paper/2409.06656","citing_paper":"/paper/2605.28480"},"observation_digest":"sha256:3fab441c8f17e5e3e4f86dd698b7bdf4f36c01f1716741a2662d964349be5c15","observation_id":"6e02d4d5-1fba-4931-8dd9-f269d5b180e6","resolution":{"observed_at":"2026-06-29T10:13:17.553901Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2410.18908","doi":"10.48550/arxiv.2410.18908","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A survey on speech large language models","venue":"arXiv (Cornell University)","work_id":"68d577e7-8e5e-46a4-bfaf-babf6209ba81","year":2024},"citing_paper":{"arxiv_id":"2605.28480","last_updated":"2026-05-27T13:39:14Z","snapshot_observed_at":"2026-08-07T09:43:33.557408Z","submitted_at":"2026-05-27T13:39:14Z","title":"Audio-Mind: An Auditable Agentic Framework for Audio Understanding","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-06-29T10:03:54.653164Z"},"links":{"citing_paper":"/paper/2605.28480"},"observation_digest":"sha256:a4a4fbc1199d782ef4cc50fbb4ef3da7337788e10021bd5382b65e2eda54141e","observation_id":"d8c259d6-6d82-4ef9-940e-bd8ec60704dd","resolution":{"observed_at":"2026-06-29T10:13:17.556558Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T10:03:54.653164Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.28480","last_updated":"2026-05-27T13:39:14Z","snapshot_observed_at":"2026-08-07T09:43:33.557408Z","submitted_at":"2026-05-27T13:39:14Z","title":"Audio-Mind: An Auditable Agentic Framework for Audio Understanding","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-29T10:03:54.653164Z"},"links":{"citing_paper":"/paper/2605.28480"},"observation_digest":"sha256:d26b7bff00d37e93f71d6efd571b2af27d54a90c836100af04aa9af37698dceb","observation_id":"5dcd32bd-4df6-424b-9551-05497ca559c9","resolution":{"observed_at":"2026-06-29T10:03:54.653164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15804","last_updated":"2026-04-21T03:35:14Z","snapshot_observed_at":"2026-08-01T22:56:50.755050Z","submitted_at":"2026-04-17T08:05:46Z","title":"Qwen3.5-Omni Technical Report","version":2},"cited_work":{"arxiv_id":"2604.15804","doi":"10.48550/arxiv.2604.15804","metadata_source":"pith","pith_arxiv_id":"2604.15804","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Qwen3.5-Omni Technical Report","venue":"cs.CL","work_id":"9d0aeac4-3b94-4a09-af62-5e32286fdf5f","year":2026},"citing_paper":{"arxiv_id":"2605.28480","last_updated":"2026-05-27T13:39:14Z","snapshot_observed_at":"2026-08-07T09:43:33.557408Z","submitted_at":"2026-05-27T13:39:14Z","title":"Audio-Mind: An Auditable Agentic Framework for Audio Understanding","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-06-29T10:03:54.653164Z"},"links":{"cited_paper":"/paper/2604.15804","citing_paper":"/paper/2605.28480"},"observation_digest":"sha256:9f29376acf766e78426b74af69678fee833c36101ea5ee3cdf23e25679bb8c08","observation_id":"5384afd3-e3d9-4f2b-b910-6fcf3d05e811","resolution":{"observed_at":"2026-06-29T10:13:17.559143Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.16971","doi":"10.48550/arxiv.2509.16971","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Audiogenie-reasoner: A training- free multi-agent framework for coarse-to-fine audio deep reasoning","venue":null,"work_id":"ccb6953c-a124-48da-bafd-bf91c30902d4","year":2025},"citing_paper":{"arxiv_id":"2605.28480","last_updated":"2026-05-27T13:39:14Z","snapshot_observed_at":"2026-08-07T09:43:33.557408Z","submitted_at":"2026-05-27T13:39:14Z","title":"Audio-Mind: An Auditable Agentic Framework for Audio Understanding","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-06-29T10:03:54.653164Z"},"links":{"citing_paper":"/paper/2605.28480"},"observation_digest":"sha256:66d7b8390b84fd6bc96b15b85da8bdc8f31b10fe022998101737abfedaca4ce3","observation_id":"5224713f-bdac-42ea-abb5-cff0f84df98a","resolution":{"observed_at":"2026-06-29T10:13:17.561988Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19168","last_updated":"2024-10-24T21:20:10Z","snapshot_observed_at":"2026-07-06T19:39:23.839070Z","submitted_at":"2024-10-24T21:20:10Z","title":"MMAU: A Massive Multi-Task Audio Understanding and Reasoning Benchmark","version":1},"cited_work":{"arxiv_id":"2410.19168","doi":"10.48550/arxiv.2410.19168","metadata_source":"pith","pith_arxiv_id":"2410.19168","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MMAU: A Massive Multi-Task Audio Understanding and Reasoning Benchmark","venue":"eess.AS","work_id":"e60f85db-636c-4830-af85-5d31ebc74a1b","year":2024},"citing_paper":{"arxiv_id":"2605.28480","last_updated":"2026-05-27T13:39:14Z","snapshot_observed_at":"2026-08-07T09:43:33.557408Z","submitted_at":"2026-05-27T13:39:14Z","title":"Audio-Mind: An Auditable Agentic Framework for Audio Understanding","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-29T10:03:54.653164Z"},"links":{"cited_paper":"/paper/2410.19168","citing_paper":"/paper/2605.28480"},"observation_digest":"sha256:a82350c7dcbe2ee6ed8f10120c15632d7560a43d5a51890f157e144f1af12606","observation_id":"47ce616d-5194-43da-b624-434a76da46b0","resolution":{"observed_at":"2026-06-29T10:13:17.564501Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.5281/zenodo.1492353","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T10:13:17.574212Z","title":null,"venue":null,"work_id":"e23e39a8-99b4-4034-a825-13d8f63e1bc8","year":2018},"citing_paper":{"arxiv_id":"2605.28480","last_updated":"2026-05-27T13:39:14Z","snapshot_observed_at":"2026-08-07T09:43:33.557408Z","submitted_at":"2026-05-27T13:39:14Z","title":"Audio-Mind: An Auditable Agentic Framework for Audio Understanding","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-29T10:03:54.653164Z"},"links":{"citing_paper":"/paper/2605.28480"},"observation_digest":"sha256:5804902d48ad5fca92b30e81feef1e5359a90ca6c23bb26639e09430b39b39c9","observation_id":"82219fe5-09c2-46ae-8452-afcaa9b840b4","resolution":{"observed_at":"2026-06-29T10:13:17.575295Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.22245","last_updated":"2026-04-24T05:40:46Z","snapshot_observed_at":"2026-08-07T20:08:59.059721Z","submitted_at":"2026-04-24T05:40:46Z","title":"Listening with Time: Precise Temporal Awareness for Long-Form Audio Understanding","version":1},"cited_work":{"arxiv_id":"2604.22245","doi":"10.48550/arxiv.2604.22245","metadata_source":"pith","pith_arxiv_id":"2604.22245","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Listening with Time: Precise Temporal Awareness for Long-Form Audio Understanding","venue":"eess.AS","work_id":"481a0866-4447-4848-b22b-9c555f71692d","year":2026},"citing_paper":{"arxiv_id":"2605.28480","last_updated":"2026-05-27T13:39:14Z","snapshot_observed_at":"2026-08-07T09:43:33.557408Z","submitted_at":"2026-05-27T13:39:14Z","title":"Audio-Mind: An Auditable Agentic Framework for Audio Understanding","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-29T10:03:54.653164Z"},"links":{"cited_paper":"/paper/2604.22245","citing_paper":"/paper/2605.28480"},"observation_digest":"sha256:7cbdf086cadad764ac4f4e79914bd1e05f6a08d2cb96a78c134eefac4e034255","observation_id":"ce687dc8-6093-4861-8d1a-28f5153af99d","resolution":{"observed_at":"2026-06-29T10:13:17.611327Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.21337","last_updated":"2026-01-30T02:58:48Z","snapshot_observed_at":"2026-07-06T22:43:26.250071Z","submitted_at":"2026-01-29T06:58:13Z","title":"Qwen3-ASR Technical Report","version":2},"cited_work":{"arxiv_id":"2601.21337","doi":"10.48550/arxiv.2601.21337","metadata_source":"pith","pith_arxiv_id":"2601.21337","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-ASR Technical Report","venue":"cs.CL","work_id":"db50e258-4a3d-4141-ba30-f76f8f953880","year":2026},"citing_paper":{"arxiv_id":"2605.28480","last_updated":"2026-05-27T13:39:14Z","snapshot_observed_at":"2026-08-07T09:43:33.557408Z","submitted_at":"2026-05-27T13:39:14Z","title":"Audio-Mind: An Auditable Agentic Framework for Audio Understanding","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-06-29T10:03:54.653164Z"},"links":{"cited_paper":"/paper/2601.21337","citing_paper":"/paper/2605.28480"},"observation_digest":"sha256:609ca1d36f60b25910c20b420a13ebfbd82e94b5e715669fcb5ad341b2bf4f64","observation_id":"94dc971e-2020-4cbc-9a94-bb5a7c3dfd48","resolution":{"observed_at":"2026-06-29T10:13:17.569247Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13289","last_updated":"2024-04-08T06:12:52Z","snapshot_observed_at":"2026-08-02T21:51:36.809095Z","submitted_at":"2023-10-20T05:41:57Z","title":"SALMONN: Towards Generic Hearing Abilities for Large Language Models","version":2},"cited_work":{"arxiv_id":"2310.13289","doi":"10.1016/j.ajhg.2009.06.010","metadata_source":"pith","pith_arxiv_id":"2310.13289","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SALMONN: Towards Generic Hearing Abilities for Large Language Models","venue":"cs.SD","work_id":"b06d6def-ea7a-4cbd-8bb3-73f6a81db238","year":2023},"citing_paper":{"arxiv_id":"2605.28480","last_updated":"2026-05-27T13:39:14Z","snapshot_observed_at":"2026-08-07T09:43:33.557408Z","submitted_at":"2026-05-27T13:39:14Z","title":"Audio-Mind: An Auditable Agentic Framework for Audio Understanding","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-06-29T10:03:54.653164Z"},"links":{"cited_paper":"/paper/2310.13289","citing_paper":"/paper/2605.28480"},"observation_digest":"sha256:ef0e347f85ed5fa21fba5448228d07875f9d4fe7961ea2c7702ea33f05a434ff","observation_id":"b943b762-204c-45c0-9770-8229f2d793b4","resolution":{"observed_at":"2026-06-29T10:13:17.605795Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.15848","doi":"10.48550/arxiv.2511.15848","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-audio-r1 technical report","venue":"arXiv (Cornell University)","work_id":"80b24600-9960-4df9-97b2-66714cfd73f5","year":2025},"citing_paper":{"arxiv_id":"2605.28480","last_updated":"2026-05-27T13:39:14Z","snapshot_observed_at":"2026-08-07T09:43:33.557408Z","submitted_at":"2026-05-27T13:39:14Z","title":"Audio-Mind: An Auditable Agentic Framework for Audio Understanding","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-29T10:03:54.653164Z"},"links":{"citing_paper":"/paper/2605.28480"},"observation_digest":"sha256:52928b1905cf27af8edeb5ec268b17aaffe7b1101756f080a7178a59107627f4","observation_id":"16113a10-cb66-4f05-8e04-cdfd9c3cd49d","resolution":{"observed_at":"2026-06-29T10:13:17.614085Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T10:03:54.653164Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2605.28480","last_updated":"2026-05-27T13:39:14Z","snapshot_observed_at":"2026-08-07T09:43:33.557408Z","submitted_at":"2026-05-27T13:39:14Z","title":"Audio-Mind: An Auditable Agentic Framework for Audio Understanding","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-06-29T10:03:54.653164Z"},"links":{"citing_paper":"/paper/2605.28480"},"observation_digest":"sha256:504247e08e24667c0afdb80b05277be32f1e275bc96dd4ca0cc2743f812f7acc","observation_id":"ba763aba-a68c-4075-aaad-79bb67eb5773","resolution":{"observed_at":"2026-06-29T10:03:54.653164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.13685","doi":"10.48550/arxiv.2602.13685","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Autagent: A reinforcement learning framework for tool-augmented audio reasoning","venue":"Open MIND","work_id":"9c5dcd07-06de-4c35-bb5b-45c2cec717fa","year":2017},"citing_paper":{"arxiv_id":"2605.28480","last_updated":"2026-05-27T13:39:14Z","snapshot_observed_at":"2026-08-07T09:43:33.557408Z","submitted_at":"2026-05-27T13:39:14Z","title":"Audio-Mind: An Auditable Agentic Framework for Audio Understanding","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-29T10:03:54.653164Z"},"links":{"citing_paper":"/paper/2605.28480"},"observation_digest":"sha256:2dd82cbe5bd991f3e093c8b50e5d420238921ba661741c262ae1d5b49ef5cf9f","observation_id":"6a673bc6-0ab6-430a-a9d1-76761ab82065","resolution":{"observed_at":"2026-06-29T10:13:17.591027Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.09413","last_updated":"2026-05-18T16:18:39Z","snapshot_observed_at":"2026-08-05T07:58:44.170651Z","submitted_at":"2026-01-14T12:06:50Z","title":"Speech-Hands: A Self-Reflection Voice Agentic Approach to Speech Recognition and Audio Reasoning with Omni Perception","version":2},"cited_work":{"arxiv_id":"2601.09413","doi":"10.48550/arxiv.2601.09413","metadata_source":"pith","pith_arxiv_id":"2601.09413","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Speech-Hands: A Self-Reflection Voice Agentic Approach to Speech Recognition and Audio Reasoning with Omni Perception","venue":"cs.SD","work_id":"96f78491-aef6-4f0a-93cb-3d3bf4fa674f","year":2026},"citing_paper":{"arxiv_id":"2605.28480","last_updated":"2026-05-27T13:39:14Z","snapshot_observed_at":"2026-08-07T09:43:33.557408Z","submitted_at":"2026-05-27T13:39:14Z","title":"Audio-Mind: An Auditable Agentic Framework for Audio Understanding","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-06-29T10:03:54.653164Z"},"links":{"cited_paper":"/paper/2601.09413","citing_paper":"/paper/2605.28480"},"observation_digest":"sha256:4208b42a51d9400e0e76d50a42888a13ea7428a51d12df99f25c884c64aa8ef1","observation_id":"b3c730db-8447-417a-b87e-592e8131b0c0","resolution":{"observed_at":"2026-06-29T10:13:17.600602Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17016","last_updated":"2022-11-01T08:18:35Z","snapshot_observed_at":"2026-07-06T14:12:18.389495Z","submitted_at":"2022-10-31T02:11:58Z","title":"Wespeaker: A Research and Production oriented Speaker Embedding Learning Toolkit","version":2},"cited_work":{"arxiv_id":"2210.17016","doi":"10.48550/arxiv.2210.17016","metadata_source":"arxiv_reference","pith_arxiv_id":"2210.17016","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"arXiv (Cornell University)","work_id":"9a265637-141b-4a2b-a86d-b80d734c2e75","year":2023},"citing_paper":{"arxiv_id":"2605.28480","last_updated":"2026-05-27T13:39:14Z","snapshot_observed_at":"2026-08-07T09:43:33.557408Z","submitted_at":"2026-05-27T13:39:14Z","title":"Audio-Mind: An Auditable Agentic Framework for Audio Understanding","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-06-29T10:03:54.653164Z"},"links":{"cited_paper":"/paper/2210.17016","citing_paper":"/paper/2605.28480"},"observation_digest":"sha256:924658a2d481dec5341bb9555937dd50dca5ea9de9978cb3a307ccac3e985abf","observation_id":"56905657-2e58-441a-afda-e53445f1bd55","resolution":{"observed_at":"2026-06-29T10:13:17.603410Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.08155","last_updated":"2025-08-11T16:31:32Z","snapshot_observed_at":"2026-08-06T14:00:57.707478Z","submitted_at":"2025-08-11T16:31:32Z","title":"MSU-Bench: Towards Understanding the Conversational Multi-talker Scenarios","version":1},"cited_work":{"arxiv_id":"2508.08155","doi":"10.48550/arxiv.2508.08155","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.08155","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Shuai Wang, Zhaokai Sun, Zhennan Lin, Chengyou Wang, Zhou Pan, and Lei Xie","venue":"ArXiv.org","work_id":"077a8ae9-0654-4c5a-a747-509c15bb9fd1","year":2025},"citing_paper":{"arxiv_id":"2605.28480","last_updated":"2026-05-27T13:39:14Z","snapshot_observed_at":"2026-08-07T09:43:33.557408Z","submitted_at":"2026-05-27T13:39:14Z","title":"Audio-Mind: An Auditable Agentic Framework for Audio Understanding","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-06-29T10:03:54.653164Z"},"links":{"cited_paper":"/paper/2508.08155","citing_paper":"/paper/2605.28480"},"observation_digest":"sha256:7fa6962d4a4d63a8766917e0ad1bf7a033984d62692d3ef2e24842154ac2d542","observation_id":"d8ff21f0-a445-46e5-875e-9c9043bc14fe","resolution":{"observed_at":"2026-06-29T10:13:17.619641Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.02995","doi":"10.48550/arxiv.2510.02995","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Au- diotoolagent: An agentic framework for audio-language mod- els","venue":"arXiv (Cornell University)","work_id":"e46ac902-9b95-4f03-945e-f84f6394862b","year":2025},"citing_paper":{"arxiv_id":"2605.28480","last_updated":"2026-05-27T13:39:14Z","snapshot_observed_at":"2026-08-07T09:43:33.557408Z","submitted_at":"2026-05-27T13:39:14Z","title":"Audio-Mind: An Auditable Agentic Framework for Audio Understanding","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-06-29T10:03:54.653164Z"},"links":{"citing_paper":"/paper/2605.28480"},"observation_digest":"sha256:3fd521128dc75ac62cf82a72c46a56526e8e9a5ab932bbb841214f3b9c25be6d","observation_id":"c4b9eb55-a699-4a37-855f-038fa2baac62","resolution":{"observed_at":"2026-06-29T10:13:17.622541Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16632","last_updated":"2025-08-27T16:42:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-22T14:23:55Z","title":"Step-Audio 2 Technical Report","version":3},"cited_work":{"arxiv_id":"2507.16632","doi":"10.48550/arxiv.2507.16632","metadata_source":"pith","pith_arxiv_id":"2507.16632","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-Audio 2 Technical Report","venue":"cs.CL","work_id":"2317bc9f-2d58-4e53-b7ea-804337e9fdef","year":2025},"citing_paper":{"arxiv_id":"2605.28480","last_updated":"2026-05-27T13:39:14Z","snapshot_observed_at":"2026-08-07T09:43:33.557408Z","submitted_at":"2026-05-27T13:39:14Z","title":"Audio-Mind: An Auditable Agentic Framework for Audio Understanding","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-06-29T10:03:54.653164Z"},"links":{"cited_paper":"/paper/2507.16632","citing_paper":"/paper/2605.28480"},"observation_digest":"sha256:8172db146160a09d4fc01ad8e0be00748658ac415556f8e034fdb64e34b3cff5","observation_id":"74408ede-d0f8-4bbe-b9df-84d9d21dea95","resolution":{"observed_at":"2026-06-29T10:13:17.937590Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:45.403831+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:45.403831+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.21749","doi":"10.48550/arxiv.2509.21749","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Thinking with sound: Audio chain-of-thought enables multimodal reasoning in large audio-language models","venue":"arXiv (Cornell University)","work_id":"85380550-036c-4fee-9b12-7e2089268565","year":2025},"citing_paper":{"arxiv_id":"2605.28480","last_updated":"2026-05-27T13:39:14Z","snapshot_observed_at":"2026-08-07T09:43:33.557408Z","submitted_at":"2026-05-27T13:39:14Z","title":"Audio-Mind: An Auditable Agentic Framework for Audio Understanding","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-06-29T10:03:54.653164Z"},"links":{"citing_paper":"/paper/2605.28480"},"observation_digest":"sha256:5ec9cd4cd57aff91df53a02aa87fb34c04395be6dc0d0d64fa5158d3f5a27ad9","observation_id":"0fb953db-3e5a-4cbb-86a1-f05b8102e72e","resolution":{"observed_at":"2026-06-29T10:13:17.617023Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.17765","last_updated":"2025-09-22T13:26:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-22T13:26:24Z","title":"Qwen3-Omni Technical Report","version":1},"cited_work":{"arxiv_id":"2509.17765","doi":"10.48550/arxiv.2509.17765","metadata_source":"pith","pith_arxiv_id":"2509.17765","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-Omni Technical Report","venue":"cs.CL","work_id":"ae43e594-8bab-4471-b6af-92a300f6a048","year":2025},"citing_paper":{"arxiv_id":"2605.28480","last_updated":"2026-05-27T13:39:14Z","snapshot_observed_at":"2026-08-07T09:43:33.557408Z","submitted_at":"2026-05-27T13:39:14Z","title":"Audio-Mind: An Auditable Agentic Framework for Audio Understanding","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-06-29T10:03:54.653164Z"},"links":{"cited_paper":"/paper/2509.17765","citing_paper":"/paper/2605.28480"},"observation_digest":"sha256:4a8590b750e77640cfe486b357035bb668ca2e0680266c735a140d68d7aaf33b","observation_id":"7072e4bb-2f5e-4f97-851b-e1bded280374","resolution":{"observed_at":"2026-06-29T10:13:17.939878Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14350","last_updated":"2025-01-24T09:21:41Z","snapshot_observed_at":"2026-08-05T01:17:13.454546Z","submitted_at":"2025-01-24T09:21:41Z","title":"FireRedASR: Open-Source Industrial-Grade Mandarin Speech Recognition Models from Encoder-Decoder to LLM Integration","version":1},"cited_work":{"arxiv_id":"2501.14350","doi":"10.48550/arxiv.2501.14350","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.14350","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fir- eredasr: Open-source industrial-grade mandarin speech recognition models from encoder-decoder to llm inte- gration","venue":"ArXiv.org","work_id":"62974ced-2120-413e-8766-01dae954001d","year":2025},"citing_paper":{"arxiv_id":"2605.28480","last_updated":"2026-05-27T13:39:14Z","snapshot_observed_at":"2026-08-07T09:43:33.557408Z","submitted_at":"2026-05-27T13:39:14Z","title":"Audio-Mind: An Auditable Agentic Framework for Audio Understanding","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-06-29T10:03:54.653164Z"},"links":{"cited_paper":"/paper/2501.14350","citing_paper":"/paper/2605.28480"},"observation_digest":"sha256:42d1c4d545fcff2cea1cdf8d5fff8f015797a94a4f8a25d3a57fd27de89b22f6","observation_id":"0edb7d8a-b937-42d0-a225-51d7743eb8b3","resolution":{"observed_at":"2026-06-29T10:13:17.609016Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.10420","doi":"10.48550/arxiv.2603.10420","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fireredasr2s: A state-of-the-art industrial-grade all-in-one automatic speech recognition system","venue":"arXiv (Cornell University)","work_id":"0d0cfa0e-e07f-4678-a921-30ff90c5d87d","year":2026},"citing_paper":{"arxiv_id":"2605.28480","last_updated":"2026-05-27T13:39:14Z","snapshot_observed_at":"2026-08-07T09:43:33.557408Z","submitted_at":"2026-05-27T13:39:14Z","title":"Audio-Mind: An Auditable Agentic Framework for Audio Understanding","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-06-29T10:03:54.653164Z"},"links":{"citing_paper":"/paper/2605.28480"},"observation_digest":"sha256:3fe88eb82dffd03445081e01d8aebe82304e34370a618c94f6f67c3a27800b5e","observation_id":"89ada80d-cd91-48a5-af2e-9229bf82fc58","resolution":{"observed_at":"2026-06-29T10:13:17.627925Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07729","last_updated":"2024-07-26T06:30:47Z","snapshot_observed_at":"2026-08-06T03:59:19.956442Z","submitted_at":"2024-02-12T15:41:22Z","title":"AIR-Bench: Benchmarking Large Audio-Language Models via Generative Comprehension","version":2},"cited_work":{"arxiv_id":"2402.07729","doi":"10.48550/arxiv.2402.07729","metadata_source":"pith","pith_arxiv_id":"2402.07729","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Air-bench: Benchmarking large audio-language models via generative comprehension","venue":"eess.AS","work_id":"d370d7c7-6672-4149-b423-fd65d5cc3cd1","year":2024},"citing_paper":{"arxiv_id":"2605.28480","last_updated":"2026-05-27T13:39:14Z","snapshot_observed_at":"2026-08-07T09:43:33.557408Z","submitted_at":"2026-05-27T13:39:14Z","title":"Audio-Mind: An Auditable Agentic Framework for Audio Understanding","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-06-29T10:03:54.653164Z"},"links":{"cited_paper":"/paper/2402.07729","citing_paper":"/paper/2605.28480"},"observation_digest":"sha256:52ae867bc2ce5db6cafc18e7d02d69bf9a54a184da68cd98e106997207311bbd","observation_id":"d0c51ded-a237-4e37-8afa-e567bec4833c","resolution":{"observed_at":"2026-06-29T10:13:17.630607Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03629","last_updated":"2023-03-10T01:00:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T01:00:32Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","version":3},"cited_work":{"arxiv_id":"2210.03629","doi":"10.48550/arxiv.2210.03629","metadata_source":"pith","pith_arxiv_id":"2210.03629","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","venue":"cs.CL","work_id":"407a2351-25f1-497d-b611-f77d0292a8e6","year":2022},"citing_paper":{"arxiv_id":"2605.28480","last_updated":"2026-05-27T13:39:14Z","snapshot_observed_at":"2026-08-07T09:43:33.557408Z","submitted_at":"2026-05-27T13:39:14Z","title":"Audio-Mind: An Auditable Agentic Framework for Audio Understanding","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-06-29T10:03:54.653164Z"},"links":{"cited_paper":"/paper/2210.03629","citing_paper":"/paper/2605.28480"},"observation_digest":"sha256:72e3adbffbf496b2dd119d1a2d81bc2fd4e5698d2ddc8f5941f456ba8c7da537","observation_id":"e6993045-ba14-481a-b61d-1fe74d5dc1dc","resolution":{"observed_at":"2026-06-29T10:13:17.593173Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-12T03:19:36.897515+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T03:19:36.897515+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.23808","doi":"10.48550/arxiv.2512.23808","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mimo-audio: Audio language models are few-shot learners","venue":"arXiv (Cornell University)","work_id":"8c438dfc-e0fb-45e5-983b-3708cd7afa91","year":2025},"citing_paper":{"arxiv_id":"2605.28480","last_updated":"2026-05-27T13:39:14Z","snapshot_observed_at":"2026-08-07T09:43:33.557408Z","submitted_at":"2026-05-27T13:39:14Z","title":"Audio-Mind: An Auditable Agentic Framework for Audio Understanding","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-06-29T10:03:54.653164Z"},"links":{"citing_paper":"/paper/2605.28480"},"observation_digest":"sha256:fdd130d5559ff2cd94043fd6a65ca7fe9e677db8f9a8471244dd0ad9e7e01946","observation_id":"657e8447-a686-4bea-aaa3-e04ba9014f86","resolution":{"observed_at":"2026-06-29T10:13:17.932817Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T10:03:54.653164Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.28480","last_updated":"2026-05-27T13:39:14Z","snapshot_observed_at":"2026-08-07T09:43:33.557408Z","submitted_at":"2026-05-27T13:39:14Z","title":"Audio-Mind: An Auditable Agentic Framework for Audio Understanding","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-06-29T10:03:54.653164Z"},"links":{"citing_paper":"/paper/2605.28480"},"observation_digest":"sha256:dc4698dcef3f8ec0706a980edd3c561303aa6bd4fb855e7578932b752abd0d66","observation_id":"c57bac54-7fe5-4cd1-a4f8-b6857bf31b18","resolution":{"observed_at":"2026-06-29T10:03:54.653164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T10:03:54.653164Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.28480","last_updated":"2026-05-27T13:39:14Z","snapshot_observed_at":"2026-08-07T09:43:33.557408Z","submitted_at":"2026-05-27T13:39:14Z","title":"Audio-Mind: An Auditable Agentic Framework for Audio Understanding","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-06-29T10:03:54.653164Z"},"links":{"citing_paper":"/paper/2605.28480"},"observation_digest":"sha256:fd20020f925d2789c6bef63ed36425ba70d5bd8719dba8bd3f72c9a38f65e9e2","observation_id":"5a0372af-caf5-4143-ab5b-f5fca9d7c233","resolution":{"observed_at":"2026-06-29T10:03:54.653164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2605.28480","last_updated":"2026-05-27T13:39:14Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-07T09:43:33.557408Z","submitted_at":"2026-05-27T13:39:14Z","title":"Audio-Mind: An Auditable Agentic Framework for Audio Understanding"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":10,"verified_exact":39,"verified_fuzzy":0},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 2 inbound Pith citation observations for arXiv:2605.28480."}