{"as_of":"2026-08-15T19:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8fd128b36249e68faa021d345ff5a9c9f3594b822aca868e663bd86c48d8b679","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:15:35.534745Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:15:31.637991Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T00:15:36.638294Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.14973","last_updated":"2025-06-17T20:49:41Z","snapshot_observed_at":"2026-08-09T13:35:29.921830Z","submitted_at":"2025-06-17T20:49:41Z","title":"Thinking in Directivity: Speech Large Language Model for Multi-Talker Directional Speech Recognition","version":1},"cited_work":{"arxiv_id":"2506.14973","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.14973","snapshot_observed_at":"2026-08-07T00:15:36.638294Z","title":"Thinking in Directivity: Speech Large Language Model for Multi-Talker Directional Speech Recognition","venue":"eess.AS","work_id":"5dbc140a-0bf9-4fc9-92f0-7d195d8eca10","year":2025},"citing_paper":{"arxiv_id":"2506.14973","last_updated":"2025-06-17T20:49:41Z","snapshot_observed_at":"2026-08-09T13:35:29.921830Z","submitted_at":"2025-06-17T20:49:41Z","title":"Thinking in Directivity: Speech Large Language Model for Multi-Talker Directional Speech Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:31.637991Z"},"links":{"cited_paper":"/paper/2506.14973","citing_paper":"/paper/2506.14973"},"observation_digest":"sha256:19e7eade01b0d199dba8a348748a04ecec05b6954eb38447f2b789e9e73f85cc","observation_id":"1cb698a3-00fe-4f98-b35f-911e14d81859","resolution":{"observed_at":"2026-08-07T00:15:36.767510Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.14973/citation-record","integrity":"/paper/2506.14973/integrity","json":"/paper/2506.14973/citation-record.json","paper":"/paper/2506.14973"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.14973","last_updated":"2025-06-17T20:49:41Z","snapshot_observed_at":"2026-08-09T13:35:29.921830Z","submitted_at":"2025-06-17T20:49:41Z","title":"Thinking in Directivity: Speech Large Language Model for Multi-Talker Directional Speech Recognition","version":1},"cited_work":{"arxiv_id":"2506.14973","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.14973","snapshot_observed_at":"2026-08-07T00:15:36.638294Z","title":"Thinking in Directivity: Speech Large Language Model for Multi-Talker Directional Speech Recognition","venue":"eess.AS","work_id":"5dbc140a-0bf9-4fc9-92f0-7d195d8eca10","year":2025},"citing_paper":{"arxiv_id":"2506.14973","last_updated":"2025-06-17T20:49:41Z","snapshot_observed_at":"2026-08-09T13:35:29.921830Z","submitted_at":"2025-06-17T20:49:41Z","title":"Thinking in Directivity: Speech Large Language Model for Multi-Talker Directional Speech Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:31.637991Z"},"links":{"cited_paper":"/paper/2506.14973","citing_paper":"/paper/2506.14973"},"observation_digest":"sha256:19e7eade01b0d199dba8a348748a04ecec05b6954eb38447f2b789e9e73f85cc","observation_id":"1cb698a3-00fe-4f98-b35f-911e14d81859","resolution":{"observed_at":"2026-08-07T00:15:36.767510Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:39.244356Z","title":"Multi-channel Speech Large Language Model Our training of multi-channel SLLM builds on recent approach that integrate speech capabilities into LLMs via audio encoders [6,7]","venue":null,"work_id":"032d3788-8560-4cf7-bffd-12ca44458a51","year":null},"citing_paper":{"arxiv_id":"2506.14973","last_updated":"2025-06-17T20:49:41Z","snapshot_observed_at":"2026-08-09T13:35:29.921830Z","submitted_at":"2025-06-17T20:49:41Z","title":"Thinking in Directivity: Speech Large Language Model for Multi-Talker Directional Speech Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:31.734751Z"},"links":{"citing_paper":"/paper/2506.14973"},"observation_digest":"sha256:ec16c9206b274487ff2f3ac9b2308a79fbca4dd7ec5d4d0d622e25b8ec873961","observation_id":"50e11f99-4d16-4569-beff-41f8e773917f","resolution":{"observed_at":"2026-08-07T00:15:39.248025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:39.232250Z","title":"The linear projection layer, inserted before the audio encoder, plays a crucial role in highlighting rel- evant information from different channels","venue":null,"work_id":"a8a161a8-e94e-4d9a-896a-328803d49411","year":null},"citing_paper":{"arxiv_id":"2506.14973","last_updated":"2025-06-17T20:49:41Z","snapshot_observed_at":"2026-08-09T13:35:29.921830Z","submitted_at":"2025-06-17T20:49:41Z","title":"Thinking in Directivity: Speech Large Language Model for Multi-Talker Directional Speech Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:31.855483Z"},"links":{"citing_paper":"/paper/2506.14973"},"observation_digest":"sha256:58aea02f7874e14250efc079b7431b3f20315142b0aaea2f14291d236717796e","observation_id":"fb20a46a-9dda-4040-977d-8ddecbbb1fc8","resolution":{"observed_at":"2026-08-07T00:15:39.237543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:39.221748Z","title":"what is said from where?","venue":null,"work_id":"e8d089f6-94ad-47e3-8904-dfb73c9abafb","year":null},"citing_paper":{"arxiv_id":"2506.14973","last_updated":"2025-06-17T20:49:41Z","snapshot_observed_at":"2026-08-09T13:35:29.921830Z","submitted_at":"2025-06-17T20:49:41Z","title":"Thinking in Directivity: Speech Large Language Model for Multi-Talker Directional Speech Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:31.964522Z"},"links":{"citing_paper":"/paper/2506.14973"},"observation_digest":"sha256:558351c195b3be57e4048f8534f6f82b605700c270738f9f75400b661f541d36","observation_id":"c591ff3e-7561-41dc-8f4f-315eec63794a","resolution":{"observed_at":"2026-08-07T00:15:39.225515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:39.211549Z","title":"Room impulse responses (RIRs) from real environments are used to model spatial diver- sity, generating 12 distinct directions at 30° resolution","venue":null,"work_id":"6fb3e8ea-a32d-438b-a904-b6a7c56b2171","year":null},"citing_paper":{"arxiv_id":"2506.14973","last_updated":"2025-06-17T20:49:41Z","snapshot_observed_at":"2026-08-09T13:35:29.921830Z","submitted_at":"2025-06-17T20:49:41Z","title":"Thinking in Directivity: Speech Large Language Model for Multi-Talker Directional Speech Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:32.084822Z"},"links":{"citing_paper":"/paper/2506.14973"},"observation_digest":"sha256:a351ff5e3eb09b89da52d1b0e01e6947f4b02f8f82be6c5e66fcc891672e4cc9","observation_id":"bb2995a2-50ce-4363-87ad-e3011940a432","resolution":{"observed_at":"2026-08-07T00:15:39.215265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:39.200867Z","title":"We propose two key techniques to infuse directional knowledge: serialized directional output training (S-DOT) and contrastive direction data augmentation (CDDA)","venue":null,"work_id":"df95f28e-d8d4-4b28-a8aa-4d06eb0e7ddf","year":null},"citing_paper":{"arxiv_id":"2506.14973","last_updated":"2025-06-17T20:49:41Z","snapshot_observed_at":"2026-08-09T13:35:29.921830Z","submitted_at":"2025-06-17T20:49:41Z","title":"Thinking in Directivity: Speech Large Language Model for Multi-Talker Directional Speech Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:32.246855Z"},"links":{"citing_paper":"/paper/2506.14973"},"observation_digest":"sha256:bd623a0e51cf6922ae89d69b63f12094754ddc5e6ead9475cb562d2e25218b43","observation_id":"15a52cad-7e59-40c2-b47a-c169233a8b01","resolution":{"observed_at":"2026-08-07T00:15:39.204153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T00:15:32.388916Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14973","last_updated":"2025-06-17T20:49:41Z","snapshot_observed_at":"2026-08-09T13:35:29.921830Z","submitted_at":"2025-06-17T20:49:41Z","title":"Thinking in Directivity: Speech Large Language Model for Multi-Talker Directional Speech Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:32.388916Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.14973"},"observation_digest":"sha256:10c081c82dfa14c8140555a02734ee968adf33fec9d9537cecdeefdcf92494ef","observation_id":"5b10a140-ff96-45eb-85c7-17f2229eecec","resolution":{"observed_at":"2026-08-07T00:15:32.388916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:32.596278Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14973","last_updated":"2025-06-17T20:49:41Z","snapshot_observed_at":"2026-08-09T13:35:29.921830Z","submitted_at":"2025-06-17T20:49:41Z","title":"Thinking in Directivity: Speech Large Language Model for Multi-Talker Directional Speech Recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:32.596278Z"},"links":{"citing_paper":"/paper/2506.14973"},"observation_digest":"sha256:95e1d1c4021630cb168e7d121ad461d1731905c948cf526d52a874d9d360c6b9","observation_id":"56dd6d6f-3888-4ced-ad1f-c4cebc8ed60f","resolution":{"observed_at":"2026-08-07T00:15:32.596278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:39.180636Z","title":"Flamingo: a visual language model for few-shot learning,","venue":null,"work_id":"042069d3-effd-41ee-86f0-38fdc6059a27","year":2022},"citing_paper":{"arxiv_id":"2506.14973","last_updated":"2025-06-17T20:49:41Z","snapshot_observed_at":"2026-08-09T13:35:29.921830Z","submitted_at":"2025-06-17T20:49:41Z","title":"Thinking in Directivity: Speech Large Language Model for Multi-Talker Directional Speech Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:32.750842Z"},"links":{"citing_paper":"/paper/2506.14973"},"observation_digest":"sha256:47ac9fd69d974c129bba42c3ac8fe70d7205d0330185be23e613f5661cc5f2b8","observation_id":"d8325d0f-97bb-40d7-a816-2a9df751ad3b","resolution":{"observed_at":"2026-08-07T00:15:39.184198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:39.170771Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models,","venue":null,"work_id":"129c2980-4417-43fa-8572-7e33cd937380","year":2023},"citing_paper":{"arxiv_id":"2506.14973","last_updated":"2025-06-17T20:49:41Z","snapshot_observed_at":"2026-08-09T13:35:29.921830Z","submitted_at":"2025-06-17T20:49:41Z","title":"Thinking in Directivity: Speech Large Language Model for Multi-Talker Directional Speech Recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:32.895617Z"},"links":{"citing_paper":"/paper/2506.14973"},"observation_digest":"sha256:ebfa2983f4de8df948e94a337a0b8fd73b48d1abb6e35401ded8f315032a5790","observation_id":"4f54d92f-7020-4eea-b640-2f31990c8bad","resolution":{"observed_at":"2026-08-07T00:15:39.173990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-13T11:39:40.594833Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-07T00:15:33.044745Z","title":"Listen, think, and understand,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14973","last_updated":"2025-06-17T20:49:41Z","snapshot_observed_at":"2026-08-09T13:35:29.921830Z","submitted_at":"2025-06-17T20:49:41Z","title":"Thinking in Directivity: Speech Large Language Model for Multi-Talker Directional Speech Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:33.044745Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2506.14973"},"observation_digest":"sha256:6a4078ff4bfd2bdccd5a38c03ba0c5077330128dba8333b03cf91fd1feafa09e","observation_id":"da6c1df5-b888-478a-a255-ece4e2b54297","resolution":{"observed_at":"2026-08-07T00:15:33.044745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-07T00:15:33.154751Z","title":"Qwen-audio: Advancing universal audio understand- ing via unified large-scale audio-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14973","last_updated":"2025-06-17T20:49:41Z","snapshot_observed_at":"2026-08-09T13:35:29.921830Z","submitted_at":"2025-06-17T20:49:41Z","title":"Thinking in Directivity: Speech Large Language Model for Multi-Talker Directional Speech Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:33.154751Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2506.14973"},"observation_digest":"sha256:946ec450909374a1f6ef20b5c63f0376b9e10cfea9e9505b4ad0ece74f0fc98e","observation_id":"38f7772e-a80c-470e-b9a1-6a7f69c7302a","resolution":{"observed_at":"2026-08-07T00:15:33.154751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:39.158634Z","title":"Prompt- ing large language models with speech recognition abilities,","venue":null,"work_id":"8d817e6b-5f97-4165-ad28-c94ca919a1f2","year":2024},"citing_paper":{"arxiv_id":"2506.14973","last_updated":"2025-06-17T20:49:41Z","snapshot_observed_at":"2026-08-09T13:35:29.921830Z","submitted_at":"2025-06-17T20:49:41Z","title":"Thinking in Directivity: Speech Large Language Model for Multi-Talker Directional Speech Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:33.279701Z"},"links":{"citing_paper":"/paper/2506.14973"},"observation_digest":"sha256:efc0579c502567e20dcb73a19ea9af6088312e601102ff51b57dd912a76a415a","observation_id":"5b7e93bf-5eb8-43e9-b9a6-55750feeaa97","resolution":{"observed_at":"2026-08-07T00:15:39.164049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:33.402493Z","title":"On decoder-only architecture for speech- to-text and large language model integration,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14973","last_updated":"2025-06-17T20:49:41Z","snapshot_observed_at":"2026-08-09T13:35:29.921830Z","submitted_at":"2025-06-17T20:49:41Z","title":"Thinking in Directivity: Speech Large Language Model for Multi-Talker Directional Speech Recognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:33.402493Z"},"links":{"citing_paper":"/paper/2506.14973"},"observation_digest":"sha256:6f6ed08b67023caa6767fda4db69072c785c93bfda7e50890f1e6accd1c71d80","observation_id":"4a17e89e-1ff1-4317-84f3-7f7f2abdfd49","resolution":{"observed_at":"2026-08-07T00:15:33.402493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03506","last_updated":"2025-01-08T21:53:33Z","snapshot_observed_at":"2026-08-15T04:32:07.233432Z","submitted_at":"2024-01-07T14:54:57Z","title":"DiarizationLM: Speaker Diarization Post-Processing with Large Language Models","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03506","snapshot_observed_at":"2026-08-07T00:15:33.511719Z","title":"Di- arizationlm: Speaker diarization post-processing with large lan- guage models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14973","last_updated":"2025-06-17T20:49:41Z","snapshot_observed_at":"2026-08-09T13:35:29.921830Z","submitted_at":"2025-06-17T20:49:41Z","title":"Thinking in Directivity: Speech Large Language Model for Multi-Talker Directional Speech Recognition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:33.511719Z"},"links":{"cited_paper":"/paper/2401.03506","citing_paper":"/paper/2506.14973"},"observation_digest":"sha256:1171c43762921e13c81d56e7949bd0b002ac644be542639156d217c37a0c77f1","observation_id":"5ba36f91-7c00-45e0-8d8b-5dd98e62360c","resolution":{"observed_at":"2026-08-07T00:15:33.511719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:39.135913Z","title":"Enhancing speaker diarization with large language models: A contextual beam search approach,","venue":null,"work_id":"94367772-10c4-4b12-bd0d-0a8cfddb9efa","year":2024},"citing_paper":{"arxiv_id":"2506.14973","last_updated":"2025-06-17T20:49:41Z","snapshot_observed_at":"2026-08-09T13:35:29.921830Z","submitted_at":"2025-06-17T20:49:41Z","title":"Thinking in Directivity: Speech Large Language Model for Multi-Talker Directional Speech Recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:33.654754Z"},"links":{"citing_paper":"/paper/2506.14973"},"observation_digest":"sha256:351113b21f183fce261fc671e4372ecd4d7ff49e525b7c21c2b2ae9e9cd96d3f","observation_id":"01323e4e-b7f6-401b-b0e0-80cdde10a410","resolution":{"observed_at":"2026-08-07T00:15:39.140431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-15T00:22:53.406062Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-08-07T00:15:33.745532Z","title":"Speechtok- enizer: Unified speech tokenizer for speech large language mod- els,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14973","last_updated":"2025-06-17T20:49:41Z","snapshot_observed_at":"2026-08-09T13:35:29.921830Z","submitted_at":"2025-06-17T20:49:41Z","title":"Thinking in Directivity: Speech Large Language Model for Multi-Talker Directional Speech Recognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:33.745532Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2506.14973"},"observation_digest":"sha256:f5213f4dc97f06a35920d499a60e0d979fce84d6749cc3e6002981d6821e1c38","observation_id":"0e339b61-9b3f-41ca-b9c8-68f7e852692c","resolution":{"observed_at":"2026-08-07T00:15:33.745532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-07T00:15:33.903012Z","title":"Neural codec language mod- els are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14973","last_updated":"2025-06-17T20:49:41Z","snapshot_observed_at":"2026-08-09T13:35:29.921830Z","submitted_at":"2025-06-17T20:49:41Z","title":"Thinking in Directivity: Speech Large Language Model for Multi-Talker Directional Speech Recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:33.903012Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2506.14973"},"observation_digest":"sha256:8ccac04f680e9abb161d164b9f82c82cc13462ec6a01a32771faf24fca39eb6b","observation_id":"ae76af26-db9a-431e-91ec-fd57123a4bdf","resolution":{"observed_at":"2026-08-07T00:15:33.903012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:39.123045Z","title":"A consolidated perspective on multimicrophone speech enhance- ment and source separation,","venue":null,"work_id":"c025653d-3613-4fc0-aa84-0b196fefa8ed","year":2017},"citing_paper":{"arxiv_id":"2506.14973","last_updated":"2025-06-17T20:49:41Z","snapshot_observed_at":"2026-08-09T13:35:29.921830Z","submitted_at":"2025-06-17T20:49:41Z","title":"Thinking in Directivity: Speech Large Language Model for Multi-Talker Directional Speech Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:34.045696Z"},"links":{"citing_paper":"/paper/2506.14973"},"observation_digest":"sha256:af8a767666feec192199b9c688e028df5d6596419b6ba9a8373905abeefa9d09","observation_id":"0f9a1f53-f4e5-4fec-8133-2537b80faf4d","resolution":{"observed_at":"2026-08-07T00:15:39.126518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:39.111648Z","title":"Brandstein and D","venue":null,"work_id":"6ecbe7a8-7e68-4c0a-91b6-f960ae6fe8fb","year":2013},"citing_paper":{"arxiv_id":"2506.14973","last_updated":"2025-06-17T20:49:41Z","snapshot_observed_at":"2026-08-09T13:35:29.921830Z","submitted_at":"2025-06-17T20:49:41Z","title":"Thinking in Directivity: Speech Large Language Model for Multi-Talker Directional Speech Recognition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:34.170371Z"},"links":{"citing_paper":"/paper/2506.14973"},"observation_digest":"sha256:a20e713b1ae2a8fb310afbe6d54a1b35dfd7291f68e8ee7dd739ef70dd8be893","observation_id":"71860510-eea6-4232-9f90-e2b47f8e5002","resolution":{"observed_at":"2026-08-07T00:15:39.115657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:39.091795Z","title":"Zotter and M","venue":null,"work_id":"e645455a-d3df-4b4f-bdf2-a8fd8ec274e0","year":2019},"citing_paper":{"arxiv_id":"2506.14973","last_updated":"2025-06-17T20:49:41Z","snapshot_observed_at":"2026-08-09T13:35:29.921830Z","submitted_at":"2025-06-17T20:49:41Z","title":"Thinking in Directivity: Speech Large Language Model for Multi-Talker Directional Speech Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:34.292080Z"},"links":{"citing_paper":"/paper/2506.14973"},"observation_digest":"sha256:7271309420c8a79a54b5c5eb41cb0ea3beb874b2bfd69cd4f61a69b1c60bd7fe","observation_id":"47d13b95-e54d-4271-95bd-f1254597a91e","resolution":{"observed_at":"2026-08-07T00:15:39.095902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:39.066242Z","title":"Microphone arrays,","venue":null,"work_id":"608add9a-fb69-4b5c-8b57-7c1449449c3e","year":2008},"citing_paper":{"arxiv_id":"2506.14973","last_updated":"2025-06-17T20:49:41Z","snapshot_observed_at":"2026-08-09T13:35:29.921830Z","submitted_at":"2025-06-17T20:49:41Z","title":"Thinking in Directivity: Speech Large Language Model for Multi-Talker Directional Speech Recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:34.345503Z"},"links":{"citing_paper":"/paper/2506.14973"},"observation_digest":"sha256:15b6fc6c8e45f52a95720e162d1e6ce73676fbccc54f7b29292e052978453191","observation_id":"3ce9e89e-389f-4100-8770-0ffc268262a2","resolution":{"observed_at":"2026-08-07T00:15:39.077048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:39.042041Z","title":"Superdirectional microphone arrays,","venue":null,"work_id":"56946bb2-d20a-486d-8100-bb5bf429d8e8","year":2000},"citing_paper":{"arxiv_id":"2506.14973","last_updated":"2025-06-17T20:49:41Z","snapshot_observed_at":"2026-08-09T13:35:29.921830Z","submitted_at":"2025-06-17T20:49:41Z","title":"Thinking in Directivity: Speech Large Language Model for Multi-Talker Directional Speech Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:34.371680Z"},"links":{"citing_paper":"/paper/2506.14973"},"observation_digest":"sha256:fec7b7cc70c93ee0214458621c58c42c141757315efab203ced8a24f97236af9","observation_id":"b9c3ccde-d41b-4734-a612-e545a2a8e62b","resolution":{"observed_at":"2026-08-07T00:15:39.053546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:38.997944Z","title":"Deep beamforming networks for multi-channel speech recognition,","venue":null,"work_id":"9abd8cd6-4fc8-4664-8b27-affa6e60288b","year":2016},"citing_paper":{"arxiv_id":"2506.14973","last_updated":"2025-06-17T20:49:41Z","snapshot_observed_at":"2026-08-09T13:35:29.921830Z","submitted_at":"2025-06-17T20:49:41Z","title":"Thinking in Directivity: Speech Large Language Model for Multi-Talker Directional Speech Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:34.384769Z"},"links":{"citing_paper":"/paper/2506.14973"},"observation_digest":"sha256:bcb1be204b22cb6968d1ecfc27955ea93f0fc021954f337678e07e444168d129","observation_id":"12b1c040-f580-404d-bec9-3f57041fdb38","resolution":{"observed_at":"2026-08-07T00:15:39.009949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:38.983184Z","title":"Probabilistic spa- tial dictionary based online adaptive beamforming for meeting recognition in noisy and reverberant environments,","venue":null,"work_id":"106ca09b-c05a-4086-ae9b-620e6c886d06","year":2017},"citing_paper":{"arxiv_id":"2506.14973","last_updated":"2025-06-17T20:49:41Z","snapshot_observed_at":"2026-08-09T13:35:29.921830Z","submitted_at":"2025-06-17T20:49:41Z","title":"Thinking in Directivity: Speech Large Language Model for Multi-Talker Directional Speech Recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:34.388750Z"},"links":{"citing_paper":"/paper/2506.14973"},"observation_digest":"sha256:5e8f29175c742de46afd6346a2d76433937e45b6185ce9fc462be7c975a5fc16","observation_id":"b974f605-8e6f-4f6d-9c71-29b1c273ea28","resolution":{"observed_at":"2026-08-07T00:15:38.986803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.03655","last_updated":"2018-10-08T18:50:54Z","snapshot_observed_at":"2026-08-14T18:17:46.515919Z","submitted_at":"2018-10-08T18:50:54Z","title":"Recognizing Overlapped Speech in Meetings: A Multichannel Separation Approach Using Neural Networks","version":1},"cited_work":{"arxiv_id":"1810.03655","doi":null,"metadata_source":"pith","pith_arxiv_id":"1810.03655","snapshot_observed_at":"2026-08-07T00:15:36.294902Z","title":"Recognizing Overlapped Speech in Meetings: A Multichannel Separation Approach Using Neural Networks","venue":"eess.AS","work_id":"404fd013-64a7-4b8e-b28d-89827a730ca3","year":2018},"citing_paper":{"arxiv_id":"2506.14973","last_updated":"2025-06-17T20:49:41Z","snapshot_observed_at":"2026-08-09T13:35:29.921830Z","submitted_at":"2025-06-17T20:49:41Z","title":"Thinking in Directivity: Speech Large Language Model for Multi-Talker Directional Speech Recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:34.392281Z"},"links":{"cited_paper":"/paper/1810.03655","citing_paper":"/paper/2506.14973"},"observation_digest":"sha256:80aaa1ea031f8685f9d24ae5257ded61baadbb82c6c9bafbb361125e092b8472","observation_id":"6b8bc205-daff-4162-a275-93c90d715fed","resolution":{"observed_at":"2026-08-07T00:15:36.387995Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:38.963259Z","title":"Directional speech recognition for speaker disambiguation and cross-talk suppression,","venue":null,"work_id":"04f9dcd7-9bdc-4594-a833-7894bfa0b569","year":2023},"citing_paper":{"arxiv_id":"2506.14973","last_updated":"2025-06-17T20:49:41Z","snapshot_observed_at":"2026-08-09T13:35:29.921830Z","submitted_at":"2025-06-17T20:49:41Z","title":"Thinking in Directivity: Speech Large Language Model for Multi-Talker Directional Speech Recognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:34.397213Z"},"links":{"citing_paper":"/paper/2506.14973"},"observation_digest":"sha256:965aca710a2eecb603784a048cfdc2a2e2fa5499ca8c26bf9d0ab383eb0e8d14","observation_id":"31854048-be1d-4b0f-b6ff-ebb21eaab68d","resolution":{"observed_at":"2026-08-07T00:15:38.968731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10993","last_updated":"2025-06-14T11:36:35Z","snapshot_observed_at":"2026-08-14T03:34:09.191502Z","submitted_at":"2023-09-20T01:23:16Z","title":"Directional Source Separation for Robust Speech Recognition on Smart Glasses","version":2},"cited_work":{"arxiv_id":"2309.10993","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.10993","snapshot_observed_at":"2026-08-07T00:15:36.030947Z","title":"Directional Source Separation for Robust Speech Recognition on Smart Glasses","venue":"cs.SD","work_id":"637871f6-c016-4f61-89ea-2160b06c5778","year":2023},"citing_paper":{"arxiv_id":"2506.14973","last_updated":"2025-06-17T20:49:41Z","snapshot_observed_at":"2026-08-09T13:35:29.921830Z","submitted_at":"2025-06-17T20:49:41Z","title":"Thinking in Directivity: Speech Large Language Model for Multi-Talker Directional Speech Recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:34.456812Z"},"links":{"cited_paper":"/paper/2309.10993","citing_paper":"/paper/2506.14973"},"observation_digest":"sha256:caeccaec6ecb29230c383359ebab433de5c3ce7b9cffb1fe9c596a2f22d72a5f","observation_id":"3e603ac7-2b99-47fa-80d3-fff4c023ac52","resolution":{"observed_at":"2026-08-07T00:15:36.114932Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:38.894754Z","title":"Enhancing end-to-end multi-channel speech separation via spatial feature learning,","venue":null,"work_id":"c5707aa6-d4cb-40c2-b600-f56c9a34f042","year":2020},"citing_paper":{"arxiv_id":"2506.14973","last_updated":"2025-06-17T20:49:41Z","snapshot_observed_at":"2026-08-09T13:35:29.921830Z","submitted_at":"2025-06-17T20:49:41Z","title":"Thinking in Directivity: Speech Large Language Model for Multi-Talker Directional Speech Recognition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:34.493472Z"},"links":{"citing_paper":"/paper/2506.14973"},"observation_digest":"sha256:a91c01a7f9018710c8245774313c81d908be4ee34e506b5f3e735d76323359f7","observation_id":"48845ac0-023b-46e7-8b35-6d3d50191440","resolution":{"observed_at":"2026-08-07T00:15:38.947158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:38.618005Z","title":"Mimo-speech: End-to-end multi-channel multi-speaker speech recognition,","venue":null,"work_id":"cf9b7b34-b806-4f4b-b7fb-a3f13d350c96","year":2019},"citing_paper":{"arxiv_id":"2506.14973","last_updated":"2025-06-17T20:49:41Z","snapshot_observed_at":"2026-08-09T13:35:29.921830Z","submitted_at":"2025-06-17T20:49:41Z","title":"Thinking in Directivity: Speech Large Language Model for Multi-Talker Directional Speech Recognition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:34.516471Z"},"links":{"citing_paper":"/paper/2506.14973"},"observation_digest":"sha256:792a7d3ef58d8be271f1c814d17155c646dd1cb5514d00cc5610a2b642d92eb5","observation_id":"ee99d47c-a641-4d19-85b4-903c31e9fffa","resolution":{"observed_at":"2026-08-07T00:15:38.756170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:34.554749Z","title":"Neural target speech extraction: An overview,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14973","last_updated":"2025-06-17T20:49:41Z","snapshot_observed_at":"2026-08-09T13:35:29.921830Z","submitted_at":"2025-06-17T20:49:41Z","title":"Thinking in Directivity: Speech Large Language Model for Multi-Talker Directional Speech Recognition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:34.554749Z"},"links":{"citing_paper":"/paper/2506.14973"},"observation_digest":"sha256:99107689dba519093a689581e2d309632a81ddf2110545d6a23601d2b4d70af1","observation_id":"a1985a62-bd9e-4738-a26f-b5ad12b8cab5","resolution":{"observed_at":"2026-08-07T00:15:34.554749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01591","last_updated":"2025-05-17T22:03:39Z","snapshot_observed_at":"2026-08-13T04:28:11.471963Z","submitted_at":"2024-02-02T17:34:53Z","title":"BAT: Learning to Reason about Spatial Sounds with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01591","snapshot_observed_at":"2026-08-07T00:15:34.589561Z","title":"Bat: Learning to reason about spatial sounds with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14973","last_updated":"2025-06-17T20:49:41Z","snapshot_observed_at":"2026-08-09T13:35:29.921830Z","submitted_at":"2025-06-17T20:49:41Z","title":"Thinking in Directivity: Speech Large Language Model for Multi-Talker Directional Speech Recognition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:34.589561Z"},"links":{"cited_paper":"/paper/2402.01591","citing_paper":"/paper/2506.14973"},"observation_digest":"sha256:492201f4e5c1069fd90cae38a4e3a1afe3dcd0712105b1a2df9eece112f55a18","observation_id":"535f180e-af2b-4c86-b58b-b85bc8ddf28d","resolution":{"observed_at":"2026-08-07T00:15:34.589561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07914","last_updated":"2024-06-14T10:42:12Z","snapshot_observed_at":"2026-08-12T23:44:54.456591Z","submitted_at":"2024-06-12T06:34:21Z","title":"Can Large Language Models Understand Spatial Audio?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07914","snapshot_observed_at":"2026-08-07T00:15:34.635035Z","title":"Can large language models understand spatial audio?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14973","last_updated":"2025-06-17T20:49:41Z","snapshot_observed_at":"2026-08-09T13:35:29.921830Z","submitted_at":"2025-06-17T20:49:41Z","title":"Thinking in Directivity: Speech Large Language Model for Multi-Talker Directional Speech Recognition","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:34.635035Z"},"links":{"cited_paper":"/paper/2406.07914","citing_paper":"/paper/2506.14973"},"observation_digest":"sha256:79dae8c798ff386c40b93e7e646d1ac50e6688881e82c2569e8d3a44b75f40df","observation_id":"07974889-09e9-4dca-ba57-b5ebdcd56858","resolution":{"observed_at":"2026-08-07T00:15:34.635035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:38.281072Z","title":"Teleconference application and b-format microphone array for directional audio coding,","venue":null,"work_id":"77bf4d21-ff3f-4782-9d42-bbf75a280fad","year":2007},"citing_paper":{"arxiv_id":"2506.14973","last_updated":"2025-06-17T20:49:41Z","snapshot_observed_at":"2026-08-09T13:35:29.921830Z","submitted_at":"2025-06-17T20:49:41Z","title":"Thinking in Directivity: Speech Large Language Model for Multi-Talker Directional Speech Recognition","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:34.679366Z"},"links":{"citing_paper":"/paper/2506.14973"},"observation_digest":"sha256:44142fef5b33484185ca7ee3289b59a1f87cca94d7464f2668054b4072941f34","observation_id":"d3574386-e408-4bea-8dce-8269fad04817","resolution":{"observed_at":"2026-08-07T00:15:38.436430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:38.046470Z","title":"Agadir: Towards array-geometry agnostic direc- tional speech recognition,","venue":null,"work_id":"fbdf2b9c-4419-4934-b147-08579c4a767f","year":2024},"citing_paper":{"arxiv_id":"2506.14973","last_updated":"2025-06-17T20:49:41Z","snapshot_observed_at":"2026-08-09T13:35:29.921830Z","submitted_at":"2025-06-17T20:49:41Z","title":"Thinking in Directivity: Speech Large Language Model for Multi-Talker Directional Speech Recognition","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:34.761160Z"},"links":{"citing_paper":"/paper/2506.14973"},"observation_digest":"sha256:333975521a00f2adea89319116018f3a004ecc0c3065c6af7179360a203513e7","observation_id":"06288c03-cb96-480f-90b2-d299b56ac390","resolution":{"observed_at":"2026-08-07T00:15:38.136109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:34.856268Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.14973","last_updated":"2025-06-17T20:49:41Z","snapshot_observed_at":"2026-08-09T13:35:29.921830Z","submitted_at":"2025-06-17T20:49:41Z","title":"Thinking in Directivity: Speech Large Language Model for Multi-Talker Directional Speech Recognition","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:34.856268Z"},"links":{"citing_paper":"/paper/2506.14973"},"observation_digest":"sha256:7cb7511fd5bafe3c8124443922750a0b2f91e8541576d5b99a89683e2bbed8c1","observation_id":"a40baea8-9927-4ff6-b9a3-2bd36eb0a20e","resolution":{"observed_at":"2026-08-07T00:15:34.856268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.12687","last_updated":"2020-08-08T20:08:37Z","snapshot_observed_at":"2026-08-04T07:16:40.156853Z","submitted_at":"2020-03-28T02:37:09Z","title":"Serialized Output Training for End-to-End Overlapped Speech Recognition","version":2},"cited_work":{"arxiv_id":"2003.12687","doi":null,"metadata_source":"pith","pith_arxiv_id":"2003.12687","snapshot_observed_at":"2026-08-07T00:15:35.725251Z","title":"Serialized Output Training for End-to-End Overlapped Speech Recognition","venue":"cs.CL","work_id":"a9b2de3a-e407-4432-9beb-976a8766c763","year":2020},"citing_paper":{"arxiv_id":"2506.14973","last_updated":"2025-06-17T20:49:41Z","snapshot_observed_at":"2026-08-09T13:35:29.921830Z","submitted_at":"2025-06-17T20:49:41Z","title":"Thinking in Directivity: Speech Large Language Model for Multi-Talker Directional Speech Recognition","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:34.924764Z"},"links":{"cited_paper":"/paper/2003.12687","citing_paper":"/paper/2506.14973"},"observation_digest":"sha256:070daa507529be88995a0d576dacf84ceefd99ce22f23ce0c69e0057fdc668bf","observation_id":"5d7dc434-8070-4b91-bcb5-7a33a907233a","resolution":{"observed_at":"2026-08-07T00:15:35.844750Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:37.782114Z","title":"Supervised contrastive learning,","venue":null,"work_id":"ea78c544-ae41-482c-bbf9-e75ff0b9c188","year":2020},"citing_paper":{"arxiv_id":"2506.14973","last_updated":"2025-06-17T20:49:41Z","snapshot_observed_at":"2026-08-09T13:35:29.921830Z","submitted_at":"2025-06-17T20:49:41Z","title":"Thinking in Directivity: Speech Large Language Model for Multi-Talker Directional Speech Recognition","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:34.996830Z"},"links":{"citing_paper":"/paper/2506.14973"},"observation_digest":"sha256:7ed00c8d70e2652b28d180ea44fbc71bd3f43d2116aa1f355a309502ad20237d","observation_id":"cb5befdf-20b5-43f9-bcd6-4f17ea54a192","resolution":{"observed_at":"2026-08-07T00:15:37.898018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:37.487258Z","title":"Robust speech recognition via large-scale weak su- pervision,","venue":null,"work_id":"c7501e9f-2202-4586-af40-9f0a6c55ed00","year":2023},"citing_paper":{"arxiv_id":"2506.14973","last_updated":"2025-06-17T20:49:41Z","snapshot_observed_at":"2026-08-09T13:35:29.921830Z","submitted_at":"2025-06-17T20:49:41Z","title":"Thinking in Directivity: Speech Large Language Model for Multi-Talker Directional Speech Recognition","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:35.104184Z"},"links":{"citing_paper":"/paper/2506.14973"},"observation_digest":"sha256:2244816c8502f12ed083341a7dd928b1193ecac73fff0c5baff0412e3b5964c6","observation_id":"a328c598-2467-4ce8-a5cc-32d34b5aae82","resolution":{"observed_at":"2026-08-07T00:15:37.626666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13561","last_updated":"2023-10-01T20:16:22Z","snapshot_observed_at":"2026-08-13T14:52:21.014234Z","submitted_at":"2023-08-24T20:42:21Z","title":"Project Aria: A New Tool for Egocentric Multi-Modal AI Research","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.13561","snapshot_observed_at":"2026-08-07T00:15:35.232303Z","title":"Project aria: A new tool for egocentric multi-modal ai research,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14973","last_updated":"2025-06-17T20:49:41Z","snapshot_observed_at":"2026-08-09T13:35:29.921830Z","submitted_at":"2025-06-17T20:49:41Z","title":"Thinking in Directivity: Speech Large Language Model for Multi-Talker Directional Speech Recognition","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:35.232303Z"},"links":{"cited_paper":"/paper/2308.13561","citing_paper":"/paper/2506.14973"},"observation_digest":"sha256:aa3c5707d4677324817657b6486ed29b650a17127ee83f466d16181ce45fe92a","observation_id":"af3b3db4-609d-43a5-8c4f-2ee5a22968eb","resolution":{"observed_at":"2026-08-07T00:15:35.232303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:37.265531Z","title":"Lib- rispeech: an asr corpus based on public domain audio books,","venue":null,"work_id":"3edda7a9-bf4e-415d-bcb6-3ac310ba3869","year":2015},"citing_paper":{"arxiv_id":"2506.14973","last_updated":"2025-06-17T20:49:41Z","snapshot_observed_at":"2026-08-09T13:35:29.921830Z","submitted_at":"2025-06-17T20:49:41Z","title":"Thinking in Directivity: Speech Large Language Model for Multi-Talker Directional Speech Recognition","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:35.373106Z"},"links":{"citing_paper":"/paper/2506.14973"},"observation_digest":"sha256:edac330973edafb5f4a09df773d7de70be9554d1978c645fc8a0fef47d91c735","observation_id":"f95bb6b6-41ec-48d9-ac9d-8f4df2722ed4","resolution":{"observed_at":"2026-08-07T00:15:37.360530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:36.952206Z","title":"Au- diochatllama: Towards general-purpose speech abilities for llms,","venue":null,"work_id":"7688a439-cc72-4bb9-aaad-c56e7b565678","year":2024},"citing_paper":{"arxiv_id":"2506.14973","last_updated":"2025-06-17T20:49:41Z","snapshot_observed_at":"2026-08-09T13:35:29.921830Z","submitted_at":"2025-06-17T20:49:41Z","title":"Thinking in Directivity: Speech Large Language Model for Multi-Talker Directional Speech Recognition","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:35.534745Z"},"links":{"citing_paper":"/paper/2506.14973"},"observation_digest":"sha256:5c6b7d60460c6ec3dac2c93a418580477f14ce77f81e40be576374f2124b71f9","observation_id":"7daee259-b54f-4b21-abd2-996543c29792","resolution":{"observed_at":"2026-08-07T00:15:37.083079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.14973","last_updated":"2025-06-17T20:49:41Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-09T13:35:29.921830Z","submitted_at":"2025-06-17T20:49:41Z","title":"Thinking in Directivity: Speech Large Language Model for Multi-Talker Directional Speech Recognition"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":13,"verified_exact":3,"verified_fuzzy":25},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 1 inbound Pith citation observation for arXiv:2506.14973."}