{"as_of":"2026-08-01T14:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:06c109ae537f36d68a6993042d11ec01262235de50bebbe560266e7978b248db","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T11:35:16.646773Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-01T06:32:01.292127+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T11:35:16.646773Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T07:57:44.596905Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"cited_work":{"arxiv_id":"2606.10838","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.10838","snapshot_observed_at":"2026-07-03T07:57:44.596905Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","venue":"eess.AS","work_id":"aaaa2183-4b1a-4e4a-b22b-b93a0e649612","year":2026},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"cited_paper":"/paper/2606.10838","citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:4758d528b900f42c9af8eba74eed7b201b424fca200c01ad9c643a62188e0516","observation_id":"9a1743c7-d57e-4f03-85a2-1688951c6e5f","resolution":{"observed_at":"2026-07-03T07:57:44.598243Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2606.10838/citation-record","integrity":"/paper/2606.10838/integrity","json":"/paper/2606.10838/citation-record.json","paper":"/paper/2606.10838"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"Therefore, research is shifting to- wards adaptation of pre-trained large language models (LLM) for speech recognition and understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:28d4f8d4dd50aff5231f744f2d3c193ec43d0c33d34a1dcdb31619af2be6eb77","observation_id":"acd5e373-7857-4386-bbf5-07fba0ae9dfb","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"cited_work":{"arxiv_id":"2606.10838","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.10838","snapshot_observed_at":"2026-07-03T07:57:44.596905Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","venue":"eess.AS","work_id":"aaaa2183-4b1a-4e4a-b22b-b93a0e649612","year":2026},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"cited_paper":"/paper/2606.10838","citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:4758d528b900f42c9af8eba74eed7b201b424fca200c01ad9c643a62188e0516","observation_id":"9a1743c7-d57e-4f03-85a2-1688951c6e5f","resolution":{"observed_at":"2026-07-03T07:57:44.598243Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"audio-only","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:c2bfcf6ec5fa08012eebf9fa12488f6cfa620afdb62c56a73648e1bffb06dfdc","observation_id":"7b8adb40-daff-40b0-aa79-2917692a0321","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"use the context","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:f058499eab00ca77110ac439a6c60da726bb60f417db1b4881139d4ce712bc9a","observation_id":"e381f047-59fc-4796-962b-7e8ea919df76","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"Hence, we should not expect massive WER improvements, especially when segments are rather short","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:32cd5fddaa369497f75b80e3343289215e1e97b61322dd706474c03af6bb5054","observation_id":"ea0d76a0-27a8-4635-a2bf-8e2a1e38a3f7","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"We also introduced a pipeline and dataset that pair metadata with contextual transcript errors and correction rationales","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:15a50bc6976014dccf3a20951656e7ec9e5a88b6264f3e705688ba679e9ed46f","observation_id":"8a1e48c3-bcee-4131-a022-dd9ca0bbaba1","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:4f39ee04ac4fe069c18952710d8f8bb2ed2b1b12abad79e3ca060e5f87f3fb00","observation_id":"f784c8bd-53c0-4df0-a516-049f0f4a5b85","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"No part of the manuscript’s content or ideas was produced by generative AI","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:87f5e6d5ff413771b5667660e18deddc7be5721291bce9df2534d883847383b9","observation_id":"020b58d4-090a-4f0c-9044-9173d43025b2","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"Robust speech recognition via large-scale weak su- pervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:3c159eababc89d20c3f7695742a766909958ac0d9eea9b81e20aa8685bba93de","observation_id":"d165279a-20bc-4274-9b35-5125fdcb84b0","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"OWSM v4: Improving open whisper-style speech models via data scaling and cleaning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:9874b6c8a84f80077f4e136568731a5a2033ff657490955fcd75a5f4653b59fd","observation_id":"eab2204e-8c00-4b1b-a18f-9702595a57b3","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"Less is more: Accu- rate speech recognition & translation without web-scale data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:4750106ed7c26b13c6966b50d7e8a400a28483b3739bdd663fbcb67e699b6ca1","observation_id":"b4342c52-138b-495d-b4d1-540952a43f17","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"Contextualized end-to-end automatic speech recognition with intermediate bias- ing loss,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:727ae628cf0fc5b7697524eec862fc1c658366bd54526b2f692bf397c1415574","observation_id":"d455614f-ef5a-47f3-85ea-c30083f859f0","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"BR- ASR: Efficient and scalable bias retrieval framework for contex- tual biasing ASR in speech LLM,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:34ec80891125328bae41ac1568df24bbd8f606573b160329c52acf8fa24b2d2c","observation_id":"223b4596-07f9-4cc7-abdb-33ed92d9db3f","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"Contextual biasing speech recognition in speech-enhanced large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:069ea3dac0bce76d7109e0cb930eea6ac9bfac25573db59b30a4c80f73063be9","observation_id":"33b18c3a-27f2-443e-a7ee-7ed0964e4051","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"Improving domain-specific ASR with LLM-generated contextual descriptions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:ac99029b3658e78689e4051f458e8dd76b82ae1ac597dc63439fed879926a517","observation_id":"1e4361a6-2b13-4d4a-ae45-1ba3897b0215","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"MaLa- ASR: Multimedia-assisted LLM-based ASR,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:f39d0e9ff7bf54a71109a1b2c4cf841ed0609bc4f3853c41f5e9b8e8a934759b","observation_id":"89c05a2f-3aad-4286-b1f4-ef00acaee108","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"Contextual biasing of named-entities with large lan- guage models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:7726b4a061cfaecf26e12feb90b753c3666e1c8c573d7476bd9bfbe89a8b414e","observation_id":"802a4f8d-684f-40f1-bd6f-74c85405b212","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"Listen again and choose the right answer: A new paradigm for automatic speech recognition with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:347012f2fedf15ea3a697adf18503b6531d00d28afa5cb1711e096c225cfb206","observation_id":"a85f323b-93d5-4371-b69e-de5908bdb9e2","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"Towards interfacing large language models with asr systems using confidence measures and prompting,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:f4cc71d8a315be4e12957e74a72d36d5be49a6dae57a4b4f911d558214017ee4","observation_id":"3db1e8d5-4731-406e-999a-4f36eda89892","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"Predicting compact phrasal rewrites with large language models for ASR post edit- ing,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:f6f5a81dca107f416048ce2895f7cfb29085251b49d79c23cdee300030082b45","observation_id":"87c3bb3f-1cff-4a71-8c80-5be085830b21","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"Chain-of-thought prompting elic- its reasoning in large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:ea9d45e4329f6a213031f10e3112549269004c114fda539950a7b04346dac031","observation_id":"cefe8e71-cb86-42f0-8935-72eda160ebac","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"Distilling step-by-step! outperforming larger language models with less training data and smaller model sizes,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:2f49fab342681e6a25ddc0b9f06db275675de701d0ffb61c90f2d7754a32b55d","observation_id":"85227b8a-768c-43ce-aea9-730a1382386f","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"Speech recognition rescoring with large speech-text foundation models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:d2966eb0d4a4782b37d54f829e0cdf794236caf6e71723cbe55d076a6a847fa6","observation_id":"a323edff-fbb5-404f-a8a7-d13e1c1228c0","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"Phonetically-augmented discriminative rescoring for voice search error correction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:f4e90cd29d972ec3b849953672a06f40b133e160757ccb34ee2803f2248be36c","observation_id":"9259eaa1-fe73-416a-898d-290458286e7b","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"SALSA: Speedy ASR-LLM synchronous aggregation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:d8711800c9a3c5dd6a9b98c5cc6cd074a260ec6592a499db384f2f45e7c392f4","observation_id":"68dde5ba-dfa9-4e03-8391-48a514d37a25","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"Skip-Salsa: Skip synchronous fusion of ASR LLM de- coders,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:39e2a60a2487923994d657740eeeee543c6c2fab1fb07b85e607ed2a021f51ca","observation_id":"545d17d0-bfff-41fb-acd5-a98076934f6c","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"SAKURA: On the multi-hop reasoning of large audio-language models based on speech and audio information,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:1c68e7b02d1c8cf9a85ddff7de70caea2bb9719187330a3e2d63bd8c751b02c8","observation_id":"35eda3da-a87d-4dcb-8e26-e4993f24c6de","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"MMAU: A mas- sive multi-task audio understanding and reasoning benchmark,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:14e76c1d87bff54e4d73cdb6d6e6363d29f92af34e28785ae790f08612c65099","observation_id":"686169e5-8eb6-4272-a024-a89dfb3179e7","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07246","last_updated":"2025-01-13T11:54:40Z","snapshot_observed_at":"2026-08-01T10:25:58.860404Z","submitted_at":"2025-01-13T11:54:40Z","title":"Audio-CoT: Exploring Chain-of-Thought Reasoning in Large Audio Language Model","version":1},"cited_work":{"arxiv_id":"2501.07246","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.07246","snapshot_observed_at":"2026-07-03T07:57:44.602800Z","title":"Audio-cot: Exploring chain-of-thought reasoning in large audio language model","venue":null,"work_id":"a29ac5b5-b39a-4024-b423-9a8a9f536e29","year":2025},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"cited_paper":"/paper/2501.07246","citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:01fe1e566e326d1a24945ad6b9ca7b78ff85fc493503b0eeb7c9ded06043a673","observation_id":"2017c47c-82d9-43f0-a6f4-89138b205358","resolution":{"observed_at":"2026-07-03T07:57:44.604366Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"Audio- reasoner: Improving reasoning capability in large audio language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:6ce28181ea221e9ff759fec460db0fea719294fcd047d8e1b6fac161458b231e","observation_id":"3e6019b8-a250-4d77-9ec6-2806549b1c65","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"Can large audio-language models truly hear? tackling hallucinations with multi-task assessment and stepwise audio reasoning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:3f22ab8f012e19413c379ec0525d3df000f0e61bbccce0974ea69a8ea3677a62","observation_id":"1e5b62ca-2395-481a-b670-fb09cca10408","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"DeSTA: Enhancing speech language mod- els through descriptive speech-text alignment,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:09a61bd3e838578157eeb6ed33107b69eaa594c5859e07f269e6f55eb9885c80","observation_id":"d3024e32-e923-4cb2-88a3-3c95211dd8d1","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"Developing instruction- following speech language model without speech instruction- tuning data,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:55b21883181e9d4d4c0893df21649ba6b02ba100f82fdabe349f0862948162fa","observation_id":"c695309d-20f2-4b9d-a53e-d3b0b92d4c23","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.02768","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T19:35:32.882924Z","title":"Desta2. 5-audio: Toward general-purpose large audio language model with self-generated cross-modal alignment","venue":null,"work_id":"610f2c2b-d9a0-4b63-8595-d0902c725b31","year":2026},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:bc31096e9869607e825d2072bf648e5c0acaf0f6beeb6e57757db4f61a731088","observation_id":"e8599cf0-eef5-487d-8c9c-9839136ce988","resolution":{"observed_at":"2026-07-03T07:57:44.601381Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"GAMA: A large audio-language model with advanced audio understanding and complex reasoning abilities,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:40c968332b3d4ebed99a8bf86ae1b87be15487b296cb53c46379313cd960e92f","observation_id":"18ee4180-e07f-45d2-994d-a7e493e06cc4","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"GigaSpeech: An evolving, multi-domain ASR cor- pus with 10,000 hours of transcribed audio,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:72f23280ef18531e7fb6cd87ec76b156e24756601ff0d4a5f4a048203aabddbd","observation_id":"f3062b14-86a2-46f7-8d3e-ce76488ef62b","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"SlideSpeech: A large scale slide-enriched audio-visual corpus,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:a222d09e8e656a0b554fdcf1b7ffb84658374285fada65aa63fc41d94a2fecfc","observation_id":"e7320777-0e57-4ee5-a56c-f88cd74721c1","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"SlideA VSR: A dataset of paper explanation videos for audio-visual speech recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:12f363b3a3c363a1d5f2a3b18fc0b6b631a876d32b223b41af784d9491b4f99b","observation_id":"d8e43eff-2ebf-45a5-aa2b-efd4b4c9af5e","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"M 3A V: A multimodal, multigenre, and multi- purpose audio-visual academic lecture dataset,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:012842013bdb24f6ecb80dc1d2007e8731659151a020979cddbfaa0154b5608d","observation_id":"a955a042-d024-4580-90f4-9bbe6c244734","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"BERT: Pre- training of deep bidirectional transformers for language under- standing,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:fc3187ebe0982241a4915d5e5eb9b1cb87c29fb483ba84e2f3d786917da8bd3e","observation_id":"82170b27-1925-4d80-bca0-df0dbf45eda2","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"QLoRA: Efficient finetuning of quantized llms,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:b0a39cb90e5979c9a4e29c9a6bdb1ccbb217c29bdbfb9d450b1aeda2c0480fae","observation_id":"57b9fb9d-ddd8-4c1a-8e00-c663128684de","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":2,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":36,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"thesis":"As of 1 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 1 inbound Pith citation observation for arXiv:2606.10838."}