{"as_of":"2026-08-18T02:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9ef93b2855bac7a687dfa464615403efd012b9df7afd0b58c36f42aa0039edb3","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:23:07.533974Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.12034/citation-record","integrity":"/paper/2608.12034/integrity","json":"/paper/2608.12034/citation-record.json","paper":"/paper/2608.12034"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-16T00:23:07.415367Z","title":"GPT-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.12034","last_updated":"2026-08-12T13:18:49Z","snapshot_observed_at":"2026-08-17T05:08:42.639004Z","submitted_at":"2026-08-12T13:18:49Z","title":"The SLT 2026 SmartGlasses Challenge: Benchmarking Egocentric Multi-Talker Speech Recognition and Understanding with Audio-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T00:23:07.415367Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2608.12034"},"observation_digest":"sha256:596d9fe265a31fba34ac4f1dd8b10c726294ae7707cac368cb36d1e83b98dd3f","observation_id":"60e70064-f763-4b1d-9434-3ac55c57aead","resolution":{"observed_at":"2026-08-16T00:23:07.415367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-16T00:23:07.419462Z","title":"The Llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12034","last_updated":"2026-08-12T13:18:49Z","snapshot_observed_at":"2026-08-17T05:08:42.639004Z","submitted_at":"2026-08-12T13:18:49Z","title":"The SLT 2026 SmartGlasses Challenge: Benchmarking Egocentric Multi-Talker Speech Recognition and Understanding with Audio-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T00:23:07.419462Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2608.12034"},"observation_digest":"sha256:a9e7d40b1b13819fa80ebeb0833fffceb6f28d65e8731b7ae8640d76c2c46f34","observation_id":"5dee3de8-eb87-46c6-a3a6-168af74bed14","resolution":{"observed_at":"2026-08-16T00:23:07.419462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.17765","last_updated":"2025-09-22T13:26:24Z","snapshot_observed_at":"2026-08-11T00:14:34.061687Z","submitted_at":"2025-09-22T13:26:24Z","title":"Qwen3-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.17765","snapshot_observed_at":"2026-08-16T00:23:07.422884Z","title":"Qwen3-Omni technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12034","last_updated":"2026-08-12T13:18:49Z","snapshot_observed_at":"2026-08-17T05:08:42.639004Z","submitted_at":"2026-08-12T13:18:49Z","title":"The SLT 2026 SmartGlasses Challenge: Benchmarking Egocentric Multi-Talker Speech Recognition and Understanding with Audio-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T00:23:07.422884Z"},"links":{"cited_paper":"/paper/2509.17765","citing_paper":"/paper/2608.12034"},"observation_digest":"sha256:9d830c39e35c59c9f10ca098d44ac08327ed067056d48e8c9d692ed49077c4fb","observation_id":"2a33887e-eba3-4e25-9f9e-a15d40c02726","resolution":{"observed_at":"2026-08-16T00:23:07.422884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:23:07.986185Z","title":"Gemini 3.1 Pro model card,","venue":null,"work_id":"7ec4a254-93f4-4ff2-a2ac-c44e5835ff2f","year":2026},"citing_paper":{"arxiv_id":"2608.12034","last_updated":"2026-08-12T13:18:49Z","snapshot_observed_at":"2026-08-17T05:08:42.639004Z","submitted_at":"2026-08-12T13:18:49Z","title":"The SLT 2026 SmartGlasses Challenge: Benchmarking Egocentric Multi-Talker Speech Recognition and Understanding with Audio-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T00:23:07.426649Z"},"links":{"citing_paper":"/paper/2608.12034"},"observation_digest":"sha256:249d42b23583004ae902c70ecc2dd5a7336aa135b44797435be7d50029c728bf","observation_id":"014f9437-5283-4b9f-9cf1-950c33ebc0a3","resolution":{"observed_at":"2026-08-16T00:23:07.989893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:23:07.974677Z","title":"SALMONN: Towards generic hearing abilities for large language models,","venue":null,"work_id":"e1362276-2603-436e-8a8a-c6665355327e","year":2024},"citing_paper":{"arxiv_id":"2608.12034","last_updated":"2026-08-12T13:18:49Z","snapshot_observed_at":"2026-08-17T05:08:42.639004Z","submitted_at":"2026-08-12T13:18:49Z","title":"The SLT 2026 SmartGlasses Challenge: Benchmarking Egocentric Multi-Talker Speech Recognition and Understanding with Audio-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T00:23:07.430158Z"},"links":{"citing_paper":"/paper/2608.12034"},"observation_digest":"sha256:719accea5756ec24ddef3f6f2a80ae49c5d7455995366c197ad2b953ae90edae","observation_id":"b856bf75-309d-48f7-b6da-cc5ec49c1ec1","resolution":{"observed_at":"2026-08-16T00:23:07.978819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-16T00:23:07.433724Z","title":"Qwen-Audio: Advancing universal audio understanding via unified large-scale audio- language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.12034","last_updated":"2026-08-12T13:18:49Z","snapshot_observed_at":"2026-08-17T05:08:42.639004Z","submitted_at":"2026-08-12T13:18:49Z","title":"The SLT 2026 SmartGlasses Challenge: Benchmarking Egocentric Multi-Talker Speech Recognition and Understanding with Audio-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T00:23:07.433724Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2608.12034"},"observation_digest":"sha256:1127c9f738c61e3009e9cf887cb66ca57e12a9baedeb701f362bc4bfb74a4289","observation_id":"8a1b1f80-79bf-4d3c-83d8-8cdc1dcc44cd","resolution":{"observed_at":"2026-08-16T00:23:07.433724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:23:07.437548Z","title":"Robust speech recognition via large-scale weak supervi- sion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.12034","last_updated":"2026-08-12T13:18:49Z","snapshot_observed_at":"2026-08-17T05:08:42.639004Z","submitted_at":"2026-08-12T13:18:49Z","title":"The SLT 2026 SmartGlasses Challenge: Benchmarking Egocentric Multi-Talker Speech Recognition and Understanding with Audio-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T00:23:07.437548Z"},"links":{"citing_paper":"/paper/2608.12034"},"observation_digest":"sha256:f749e94b7769c2d6833596cec16bcc6557aedddbcb35324d242266dc198f0b0b","observation_id":"a44e4502-90ed-4aa8-9676-455e729cd3a7","resolution":{"observed_at":"2026-08-16T00:23:07.437548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-08-14T01:27:16.843576Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-16T00:23:07.440032Z","title":"Qwen2-Audio technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12034","last_updated":"2026-08-12T13:18:49Z","snapshot_observed_at":"2026-08-17T05:08:42.639004Z","submitted_at":"2026-08-12T13:18:49Z","title":"The SLT 2026 SmartGlasses Challenge: Benchmarking Egocentric Multi-Talker Speech Recognition and Understanding with Audio-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T00:23:07.440032Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2608.12034"},"observation_digest":"sha256:5ecd4fab37facc0a1b2f52ff3e1e1b5a4339de56cb7ffc600d74698ce01baa04","observation_id":"2b260830-4bef-4c03-9031-e50c0a90c1eb","resolution":{"observed_at":"2026-08-16T00:23:07.440032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-08-07T01:18:02.068918Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-08-16T00:23:07.442776Z","title":"AudioPaLM: A large language model that can speak and listen,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.12034","last_updated":"2026-08-12T13:18:49Z","snapshot_observed_at":"2026-08-17T05:08:42.639004Z","submitted_at":"2026-08-12T13:18:49Z","title":"The SLT 2026 SmartGlasses Challenge: Benchmarking Egocentric Multi-Talker Speech Recognition and Understanding with Audio-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T00:23:07.442776Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2608.12034"},"observation_digest":"sha256:e8caad9f5f1956597fac492b4fd63de49bd173fba66e306e656254d5df9bfddf","observation_id":"c7029b54-c214-4f18-8a9c-948cea2a5ed7","resolution":{"observed_at":"2026-08-16T00:23:07.442776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11000","last_updated":"2023-05-19T14:41:16Z","snapshot_observed_at":"2026-08-16T15:31:59.521123Z","submitted_at":"2023-05-18T14:23:25Z","title":"SpeechGPT: Empowering Large Language Models with Intrinsic Cross-Modal Conversational Abilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11000","snapshot_observed_at":"2026-08-16T00:23:07.445644Z","title":"SpeechGPT: Empowering large language models with intrinsic cross- modal conversational abilities,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.12034","last_updated":"2026-08-12T13:18:49Z","snapshot_observed_at":"2026-08-17T05:08:42.639004Z","submitted_at":"2026-08-12T13:18:49Z","title":"The SLT 2026 SmartGlasses Challenge: Benchmarking Egocentric Multi-Talker Speech Recognition and Understanding with Audio-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T00:23:07.445644Z"},"links":{"cited_paper":"/paper/2305.11000","citing_paper":"/paper/2608.12034"},"observation_digest":"sha256:c58fa0649ab930730c76866c845069d7abe52c89e14b0560e6338bea22d9971c","observation_id":"be23c409-a793-4675-9e6c-a642d3a2c234","resolution":{"observed_at":"2026-08-16T00:23:07.445644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:23:07.956873Z","title":"Pengi: An audio language model for audio tasks,","venue":null,"work_id":"e98ff5bc-70e4-4b43-839d-88215625a426","year":2023},"citing_paper":{"arxiv_id":"2608.12034","last_updated":"2026-08-12T13:18:49Z","snapshot_observed_at":"2026-08-17T05:08:42.639004Z","submitted_at":"2026-08-12T13:18:49Z","title":"The SLT 2026 SmartGlasses Challenge: Benchmarking Egocentric Multi-Talker Speech Recognition and Understanding with Audio-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T00:23:07.448498Z"},"links":{"citing_paper":"/paper/2608.12034"},"observation_digest":"sha256:4116351977bed5bbad628a7b6d29bbbf2cd877427df148f467774f564854127a","observation_id":"d5befcf1-8e97-4322-8bb2-85b21ee9d748","resolution":{"observed_at":"2026-08-16T00:23:07.960878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:23:07.945186Z","title":"Listen, think, and understand,","venue":null,"work_id":"65f2327a-cdfd-4c3d-bec0-e44231641001","year":2024},"citing_paper":{"arxiv_id":"2608.12034","last_updated":"2026-08-12T13:18:49Z","snapshot_observed_at":"2026-08-17T05:08:42.639004Z","submitted_at":"2026-08-12T13:18:49Z","title":"The SLT 2026 SmartGlasses Challenge: Benchmarking Egocentric Multi-Talker Speech Recognition and Understanding with Audio-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T00:23:07.451174Z"},"links":{"citing_paper":"/paper/2608.12034"},"observation_digest":"sha256:46ee1db48a379bd148086008fb187d2b6c043b6d63fa76ef2d3bcbec64f40d8b","observation_id":"bcf4e1c3-41fd-48c5-9031-f9e6068469b4","resolution":{"observed_at":"2026-08-16T00:23:07.949403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01831","last_updated":"2024-05-28T05:44:53Z","snapshot_observed_at":"2026-08-16T14:22:01.900523Z","submitted_at":"2024-02-02T18:58:34Z","title":"Audio Flamingo: A Novel Audio Language Model with Few-Shot Learning and Dialogue Abilities","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01831","snapshot_observed_at":"2026-08-16T00:23:07.453921Z","title":"Audio Flamingo: A novel audio language model with few-shot learning and dialogue abilities,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12034","last_updated":"2026-08-12T13:18:49Z","snapshot_observed_at":"2026-08-17T05:08:42.639004Z","submitted_at":"2026-08-12T13:18:49Z","title":"The SLT 2026 SmartGlasses Challenge: Benchmarking Egocentric Multi-Talker Speech Recognition and Understanding with Audio-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T00:23:07.453921Z"},"links":{"cited_paper":"/paper/2402.01831","citing_paper":"/paper/2608.12034"},"observation_digest":"sha256:1eec62d0090c432ad25a984cc94c381227bf8cb3fedb43aaabda9d49e6b16495","observation_id":"436e92b9-7991-4f55-9f3e-9c3b11f90875","resolution":{"observed_at":"2026-08-16T00:23:07.453921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.18425","last_updated":"2025-04-25T15:31:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-25T15:31:46Z","title":"Kimi-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.18425","snapshot_observed_at":"2026-08-16T00:23:07.457110Z","title":"Kimi-Audio technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12034","last_updated":"2026-08-12T13:18:49Z","snapshot_observed_at":"2026-08-17T05:08:42.639004Z","submitted_at":"2026-08-12T13:18:49Z","title":"The SLT 2026 SmartGlasses Challenge: Benchmarking Egocentric Multi-Talker Speech Recognition and Understanding with Audio-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T00:23:07.457110Z"},"links":{"cited_paper":"/paper/2504.18425","citing_paper":"/paper/2608.12034"},"observation_digest":"sha256:3c43d363d44ae6823a4d2bc3f18f1b2b54a4eb68d5722f638291ad4aad95bdc1","observation_id":"1c649c4c-8438-43d7-a1ea-e3f888208f58","resolution":{"observed_at":"2026-08-16T00:23:07.457110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13349","last_updated":"2024-02-22T03:37:36Z","snapshot_observed_at":"2026-08-16T14:16:49.875435Z","submitted_at":"2024-02-20T19:53:15Z","title":"Aria Everyday Activities Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13349","snapshot_observed_at":"2026-08-16T00:23:07.460521Z","title":"Aria everyday activities dataset,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12034","last_updated":"2026-08-12T13:18:49Z","snapshot_observed_at":"2026-08-17T05:08:42.639004Z","submitted_at":"2026-08-12T13:18:49Z","title":"The SLT 2026 SmartGlasses Challenge: Benchmarking Egocentric Multi-Talker Speech Recognition and Understanding with Audio-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T00:23:07.460521Z"},"links":{"cited_paper":"/paper/2402.13349","citing_paper":"/paper/2608.12034"},"observation_digest":"sha256:479eb69abf02decac80692a6e4cb89ad3de3d7c39346da38c12b6e90785b4c9c","observation_id":"b6cfd123-2aea-4ecf-b097-9c31e077f598","resolution":{"observed_at":"2026-08-16T00:23:07.460521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:23:07.933375Z","title":"Group conversations in noisy environments (GiN) – multimedia recordings for location-aware speech enhancement,","venue":null,"work_id":"466645a3-6522-425e-94a8-ca33fe7d602c","year":2024},"citing_paper":{"arxiv_id":"2608.12034","last_updated":"2026-08-12T13:18:49Z","snapshot_observed_at":"2026-08-17T05:08:42.639004Z","submitted_at":"2026-08-12T13:18:49Z","title":"The SLT 2026 SmartGlasses Challenge: Benchmarking Egocentric Multi-Talker Speech Recognition and Understanding with Audio-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T00:23:07.464159Z"},"links":{"citing_paper":"/paper/2608.12034"},"observation_digest":"sha256:3ea8f0fd49119f72ad6a8d23d54fe701edce061fc4a92fcb50fe2d5c095c12af","observation_id":"061529ae-8eb2-41ef-95a4-ef57a1e42f44","resolution":{"observed_at":"2026-08-16T00:23:07.938183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:23:07.922275Z","title":"A survey on speech large language models for understanding,","venue":null,"work_id":"f33f146c-fcae-4e19-a085-e1623b1789b1","year":2025},"citing_paper":{"arxiv_id":"2608.12034","last_updated":"2026-08-12T13:18:49Z","snapshot_observed_at":"2026-08-17T05:08:42.639004Z","submitted_at":"2026-08-12T13:18:49Z","title":"The SLT 2026 SmartGlasses Challenge: Benchmarking Egocentric Multi-Talker Speech Recognition and Understanding with Audio-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T00:23:07.467286Z"},"links":{"citing_paper":"/paper/2608.12034"},"observation_digest":"sha256:922813370d1b9135577a4ebbce8b0a72ff319cc1b9c5d2c734aa35d4bcf25a86","observation_id":"f2d41da8-e687-47c1-9386-eeaef19d19fd","resolution":{"observed_at":"2026-08-16T00:23:07.926402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:23:07.910274Z","title":"TagSpeech: End-to-end multi-speaker ASR and diarization with fine-grained temporal grounding,","venue":null,"work_id":"ba947b82-c959-4438-ba5d-c83d59156bdb","year":2026},"citing_paper":{"arxiv_id":"2608.12034","last_updated":"2026-08-12T13:18:49Z","snapshot_observed_at":"2026-08-17T05:08:42.639004Z","submitted_at":"2026-08-12T13:18:49Z","title":"The SLT 2026 SmartGlasses Challenge: Benchmarking Egocentric Multi-Talker Speech Recognition and Understanding with Audio-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T00:23:07.471053Z"},"links":{"citing_paper":"/paper/2608.12034"},"observation_digest":"sha256:462fdc9f6edef6482ea9516ccad252b81510a8dd81ddbc258c6a628461776498","observation_id":"9485ef4c-b066-4279-856c-a3d7d3e69bc2","resolution":{"observed_at":"2026-08-16T00:23:07.914641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:23:07.898739Z","title":"The AMI meeting corpus: A pre-announcement,","venue":null,"work_id":"d6766c76-cf1e-4312-b632-d05a2c95e3fc","year":null},"citing_paper":{"arxiv_id":"2608.12034","last_updated":"2026-08-12T13:18:49Z","snapshot_observed_at":"2026-08-17T05:08:42.639004Z","submitted_at":"2026-08-12T13:18:49Z","title":"The SLT 2026 SmartGlasses Challenge: Benchmarking Egocentric Multi-Talker Speech Recognition and Understanding with Audio-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T00:23:07.474587Z"},"links":{"citing_paper":"/paper/2608.12034"},"observation_digest":"sha256:0f559608f2b6a2038bf7f9a0c3d4eb1fdfbccc57a3a6267142a70dcec5ab6738","observation_id":"d22f0655-98cf-49d7-9c6d-e78e969e082b","resolution":{"observed_at":"2026-08-16T00:23:07.902778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:23:07.876358Z","title":"The ICSI meeting corpus,","venue":null,"work_id":"a53e99df-585b-4585-abcb-625886884863","year":2003},"citing_paper":{"arxiv_id":"2608.12034","last_updated":"2026-08-12T13:18:49Z","snapshot_observed_at":"2026-08-17T05:08:42.639004Z","submitted_at":"2026-08-12T13:18:49Z","title":"The SLT 2026 SmartGlasses Challenge: Benchmarking Egocentric Multi-Talker Speech Recognition and Understanding with Audio-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T00:23:07.481729Z"},"links":{"citing_paper":"/paper/2608.12034"},"observation_digest":"sha256:e5668138397b9a00eb935de1b3fb3b171d374786166e11605eaeb5e4053ed970","observation_id":"95d8291e-abac-4e04-9fd1-73f67945f4d0","resolution":{"observed_at":"2026-08-16T00:23:07.880559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:23:07.864582Z","title":"AISHELL-4: An open source dataset for speech enhancement, separation, recognition and speaker diarization in conference scenario,","venue":null,"work_id":"967c0ec0-b6e1-45e6-959f-e93f88185f9e","year":2021},"citing_paper":{"arxiv_id":"2608.12034","last_updated":"2026-08-12T13:18:49Z","snapshot_observed_at":"2026-08-17T05:08:42.639004Z","submitted_at":"2026-08-12T13:18:49Z","title":"The SLT 2026 SmartGlasses Challenge: Benchmarking Egocentric Multi-Talker Speech Recognition and Understanding with Audio-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T00:23:07.484871Z"},"links":{"citing_paper":"/paper/2608.12034"},"observation_digest":"sha256:951ec27061aa770f9ee3f042bc1440e22b08efe4bfec7371b06953b0e4f57b83","observation_id":"0d6b4e68-45a4-4a90-b05a-6d0dc63a03a0","resolution":{"observed_at":"2026-08-16T00:23:07.869312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:23:07.853071Z","title":"M2MeT: The ICASSP 2022 multi-channel multi-party meeting transcription challenge,","venue":null,"work_id":"0d203e7a-3ef6-4199-acff-a523d22b0cc9","year":2022},"citing_paper":{"arxiv_id":"2608.12034","last_updated":"2026-08-12T13:18:49Z","snapshot_observed_at":"2026-08-17T05:08:42.639004Z","submitted_at":"2026-08-12T13:18:49Z","title":"The SLT 2026 SmartGlasses Challenge: Benchmarking Egocentric Multi-Talker Speech Recognition and Understanding with Audio-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T00:23:07.487905Z"},"links":{"citing_paper":"/paper/2608.12034"},"observation_digest":"sha256:8e5f863f29519b032796c348e18114f451bd5630279e0811c04c529cd067c0db","observation_id":"ad19c90c-f343-4d45-8a11-29bb2dfac25d","resolution":{"observed_at":"2026-08-16T00:23:07.857394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:23:07.841377Z","title":"NOTSOFAR-1 challenge: New datasets, baseline, and tasks for distant meeting transcription,","venue":null,"work_id":"9d4a0135-9c34-483c-91d7-577908d0fc95","year":2024},"citing_paper":{"arxiv_id":"2608.12034","last_updated":"2026-08-12T13:18:49Z","snapshot_observed_at":"2026-08-17T05:08:42.639004Z","submitted_at":"2026-08-12T13:18:49Z","title":"The SLT 2026 SmartGlasses Challenge: Benchmarking Egocentric Multi-Talker Speech Recognition and Understanding with Audio-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T00:23:07.491186Z"},"links":{"citing_paper":"/paper/2608.12034"},"observation_digest":"sha256:36a11553144428ef10a353157c0e8de0e89e3dd2ad0d58b0a0cc9d62c0199573","observation_id":"ec1af94d-8e78-494c-b671-3c272d73b89d","resolution":{"observed_at":"2026-08-16T00:23:07.845691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:23:07.830004Z","title":"WearV ox: An egocentric multichannel voice assistant benchmark for wearables,","venue":null,"work_id":"54befb84-3ddd-493c-9b11-a0691d8f75f5","year":2026},"citing_paper":{"arxiv_id":"2608.12034","last_updated":"2026-08-12T13:18:49Z","snapshot_observed_at":"2026-08-17T05:08:42.639004Z","submitted_at":"2026-08-12T13:18:49Z","title":"The SLT 2026 SmartGlasses Challenge: Benchmarking Egocentric Multi-Talker Speech Recognition and Understanding with Audio-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T00:23:07.494345Z"},"links":{"citing_paper":"/paper/2608.12034"},"observation_digest":"sha256:e1cb439eba48ad2896ff7abbc3604146385aa3c44e5a2672d4aa6e2d148f5e82","observation_id":"58dadf7d-539a-4ed9-b2d1-84ff239e7417","resolution":{"observed_at":"2026-08-16T00:23:07.834338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:23:07.819586Z","title":"The CHiME-8 MMCSG challenge: Multi-modal conversations in smart glasses,","venue":null,"work_id":"ee99233c-5b75-4dec-956e-c2dc7ca2914d","year":2024},"citing_paper":{"arxiv_id":"2608.12034","last_updated":"2026-08-12T13:18:49Z","snapshot_observed_at":"2026-08-17T05:08:42.639004Z","submitted_at":"2026-08-12T13:18:49Z","title":"The SLT 2026 SmartGlasses Challenge: Benchmarking Egocentric Multi-Talker Speech Recognition and Understanding with Audio-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T00:23:07.497398Z"},"links":{"citing_paper":"/paper/2608.12034"},"observation_digest":"sha256:c09f369a20bf49319d4f29ec5252b79c078346c8a7fde300f5b704607d2f9108","observation_id":"743a6f61-a4b0-4c22-86f3-5a0be64e710e","resolution":{"observed_at":"2026-08-16T00:23:07.823414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:23:07.808511Z","title":"On the evaluation of speech foundation models for spoken language understanding,","venue":null,"work_id":"c89cdd0c-3039-4270-8480-5e442a63ae38","year":2024},"citing_paper":{"arxiv_id":"2608.12034","last_updated":"2026-08-12T13:18:49Z","snapshot_observed_at":"2026-08-17T05:08:42.639004Z","submitted_at":"2026-08-12T13:18:49Z","title":"The SLT 2026 SmartGlasses Challenge: Benchmarking Egocentric Multi-Talker Speech Recognition and Understanding with Audio-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T00:23:07.500785Z"},"links":{"citing_paper":"/paper/2608.12034"},"observation_digest":"sha256:5b1fc4e471945fdbf91c7de2e70a4511d75b088aad666f634bf568e9df498e1a","observation_id":"5820bc6d-7b18-44fc-a417-e6ae5baddb8c","resolution":{"observed_at":"2026-08-16T00:23:07.812409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:23:07.796688Z","title":"MeetEval: A toolkit for computation of word error rates for meeting transcription systems,","venue":null,"work_id":"ca33f56b-cf70-4342-aec1-bdb3c9f49ba7","year":2023},"citing_paper":{"arxiv_id":"2608.12034","last_updated":"2026-08-12T13:18:49Z","snapshot_observed_at":"2026-08-17T05:08:42.639004Z","submitted_at":"2026-08-12T13:18:49Z","title":"The SLT 2026 SmartGlasses Challenge: Benchmarking Egocentric Multi-Talker Speech Recognition and Understanding with Audio-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T00:23:07.503872Z"},"links":{"citing_paper":"/paper/2608.12034"},"observation_digest":"sha256:ce5f2829f88f1cf4809c65efe013168782ef7a3c77da0249817794c0177824f5","observation_id":"283e0114-9c86-4942-a851-0016637dc9f6","resolution":{"observed_at":"2026-08-16T00:23:07.800572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02400","last_updated":"2026-06-02T17:20:11Z","snapshot_observed_at":"2026-08-13T20:35:50.965130Z","submitted_at":"2026-06-01T15:47:01Z","title":"SoulX-Transcriber: A Robust End-to-End Framework for Multi-Speaker Speech Transcription","version":2},"cited_work":{"arxiv_id":"2606.02400","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.02400","snapshot_observed_at":"2026-08-16T00:23:07.660364Z","title":"SoulX-Transcriber: A Robust End-to-End Framework for Multi-Speaker Speech Transcription","venue":"eess.AS","work_id":"e7dd4165-cfa6-40f4-a848-ceeb765dae7f","year":2026},"citing_paper":{"arxiv_id":"2608.12034","last_updated":"2026-08-12T13:18:49Z","snapshot_observed_at":"2026-08-17T05:08:42.639004Z","submitted_at":"2026-08-12T13:18:49Z","title":"The SLT 2026 SmartGlasses Challenge: Benchmarking Egocentric Multi-Talker Speech Recognition and Understanding with Audio-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T00:23:07.506953Z"},"links":{"cited_paper":"/paper/2606.02400","citing_paper":"/paper/2608.12034"},"observation_digest":"sha256:f98748e60e4129d8e3ccc53ca8317812692351b69a6a8fd00b5f0388cf2cdcb2","observation_id":"fbee5349-d3e1-4161-b89d-3e31ae416d45","resolution":{"observed_at":"2026-08-16T00:23:07.667222Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:23:07.510255Z","title":"VIBEVOICE-ASR technical report,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.12034","last_updated":"2026-08-12T13:18:49Z","snapshot_observed_at":"2026-08-17T05:08:42.639004Z","submitted_at":"2026-08-12T13:18:49Z","title":"The SLT 2026 SmartGlasses Challenge: Benchmarking Egocentric Multi-Talker Speech Recognition and Understanding with Audio-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T00:23:07.510255Z"},"links":{"citing_paper":"/paper/2608.12034"},"observation_digest":"sha256:888ca6c555a714c4e28519f70b52e60cd2ed42b333263708ebd5f05b4506b375","observation_id":"1b482ad0-3f66-406d-a53f-4a458aac120a","resolution":{"observed_at":"2026-08-16T00:23:07.510255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:23:07.513237Z","title":"WavLM: Large-scale self-supervised pre- training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12034","last_updated":"2026-08-12T13:18:49Z","snapshot_observed_at":"2026-08-17T05:08:42.639004Z","submitted_at":"2026-08-12T13:18:49Z","title":"The SLT 2026 SmartGlasses Challenge: Benchmarking Egocentric Multi-Talker Speech Recognition and Understanding with Audio-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T00:23:07.513237Z"},"links":{"citing_paper":"/paper/2608.12034"},"observation_digest":"sha256:e9d6fb4d4871766f70233f1696e89f6257fe8f3d96daff69046e5cc20f216fdd","observation_id":"52eea81b-4be9-4429-83bd-66235d3bc8b9","resolution":{"observed_at":"2026-08-16T00:23:07.513237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.01554","last_updated":"2026-07-17T03:41:37Z","snapshot_observed_at":"2026-08-17T22:27:20.805234Z","submitted_at":"2026-01-04T15:01:10Z","title":"MOSS Transcribe Diarize Technical Report","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.01554","snapshot_observed_at":"2026-08-16T00:23:07.516057Z","title":"MOSS transcribe diarize: Accurate transcription with speaker diarization,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.12034","last_updated":"2026-08-12T13:18:49Z","snapshot_observed_at":"2026-08-17T05:08:42.639004Z","submitted_at":"2026-08-12T13:18:49Z","title":"The SLT 2026 SmartGlasses Challenge: Benchmarking Egocentric Multi-Talker Speech Recognition and Understanding with Audio-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T00:23:07.516057Z"},"links":{"cited_paper":"/paper/2601.01554","citing_paper":"/paper/2608.12034"},"observation_digest":"sha256:13ada24d45194833ecdf0c588b9984e66c232be9cb72a29a40ed55913d7dd92d","observation_id":"3a94ce0e-a34b-4f8c-bd7d-7706b9d80f26","resolution":{"observed_at":"2026-08-16T00:23:07.516057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-16T00:23:07.518938Z","title":"Qwen3 technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12034","last_updated":"2026-08-12T13:18:49Z","snapshot_observed_at":"2026-08-17T05:08:42.639004Z","submitted_at":"2026-08-12T13:18:49Z","title":"The SLT 2026 SmartGlasses Challenge: Benchmarking Egocentric Multi-Talker Speech Recognition and Understanding with Audio-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T00:23:07.518938Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.12034"},"observation_digest":"sha256:886113ef81a8cfc93696307afecf1778c6065ed58c742e45ae2c96e5ff0bb994","observation_id":"51fb96f5-6a85-4f93-ad33-b34cf8061fbe","resolution":{"observed_at":"2026-08-16T00:23:07.518938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:23:07.778375Z","title":"GPU-accelerated guided source separation for meeting transcription,","venue":null,"work_id":"df0d1c53-a5d2-4e24-bfd7-2d81c81ad385","year":2023},"citing_paper":{"arxiv_id":"2608.12034","last_updated":"2026-08-12T13:18:49Z","snapshot_observed_at":"2026-08-17T05:08:42.639004Z","submitted_at":"2026-08-12T13:18:49Z","title":"The SLT 2026 SmartGlasses Challenge: Benchmarking Egocentric Multi-Talker Speech Recognition and Understanding with Audio-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T00:23:07.522013Z"},"links":{"citing_paper":"/paper/2608.12034"},"observation_digest":"sha256:0e54bea0b45a24fadbbdb60cd54567335979df2e421c3328e0e2caed1e60f3fa","observation_id":"2809d181-e360-480e-83b2-1161658f149c","resolution":{"observed_at":"2026-08-16T00:23:07.782325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:23:07.766274Z","title":"Dual-path RNN: Efficient long sequence modeling for time-domain single-channel speech separation,","venue":null,"work_id":"f9819359-139b-461c-8716-e79ce9e2e4ff","year":2020},"citing_paper":{"arxiv_id":"2608.12034","last_updated":"2026-08-12T13:18:49Z","snapshot_observed_at":"2026-08-17T05:08:42.639004Z","submitted_at":"2026-08-12T13:18:49Z","title":"The SLT 2026 SmartGlasses Challenge: Benchmarking Egocentric Multi-Talker Speech Recognition and Understanding with Audio-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T00:23:07.524792Z"},"links":{"citing_paper":"/paper/2608.12034"},"observation_digest":"sha256:a9149d175fac4f6359d12a1989e40602b9d75e51d5daa5bde7bd6917d9c7b7d3","observation_id":"c144e878-9957-4523-a2d4-469aef10f5f6","resolution":{"observed_at":"2026-08-16T00:23:07.770642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-16T00:23:07.527433Z","title":"Qwen2.5-Omni technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12034","last_updated":"2026-08-12T13:18:49Z","snapshot_observed_at":"2026-08-17T05:08:42.639004Z","submitted_at":"2026-08-12T13:18:49Z","title":"The SLT 2026 SmartGlasses Challenge: Benchmarking Egocentric Multi-Talker Speech Recognition and Understanding with Audio-Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T00:23:07.527433Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2608.12034"},"observation_digest":"sha256:d48bf80150d4c4431ffd4136b9cee248de623bda91155ba7a49828c13dba8123","observation_id":"8f9747ac-539c-4b7b-960a-11b3d08b2176","resolution":{"observed_at":"2026-08-16T00:23:07.527433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-08-16T10:18:33.973164Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.01802","snapshot_observed_at":"2026-08-16T00:23:07.530792Z","title":"MOSS-Audio technical report,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.12034","last_updated":"2026-08-12T13:18:49Z","snapshot_observed_at":"2026-08-17T05:08:42.639004Z","submitted_at":"2026-08-12T13:18:49Z","title":"The SLT 2026 SmartGlasses Challenge: Benchmarking Egocentric Multi-Talker Speech Recognition and Understanding with Audio-Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T00:23:07.530792Z"},"links":{"cited_paper":"/paper/2606.01802","citing_paper":"/paper/2608.12034"},"observation_digest":"sha256:ed446c5e6d736e166d61dc6aefb4d58c56e85656355a953cb687d7e412c807fa","observation_id":"93f9dc6c-fe8c-46dd-95ef-832cc8cefd88","resolution":{"observed_at":"2026-08-16T00:23:07.530792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:23:07.755879Z","title":"QLoRA: Efficient finetuning of quantized LLMs,","venue":null,"work_id":"43a88258-3384-4afd-8155-2e67980ab1cf","year":2023},"citing_paper":{"arxiv_id":"2608.12034","last_updated":"2026-08-12T13:18:49Z","snapshot_observed_at":"2026-08-17T05:08:42.639004Z","submitted_at":"2026-08-12T13:18:49Z","title":"The SLT 2026 SmartGlasses Challenge: Benchmarking Egocentric Multi-Talker Speech Recognition and Understanding with Audio-Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T00:23:07.533974Z"},"links":{"citing_paper":"/paper/2608.12034"},"observation_digest":"sha256:3863e5b154f5c153ecf10a37ae6d205e5ffd3de1788e5db6e342cc548fee75a0","observation_id":"a56544fc-2114-4101-a056-afd53c6469d4","resolution":{"observed_at":"2026-08-16T00:23:07.759555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:23:07.887075Z","title":null,"venue":null,"work_id":"cc9797f4-0d5e-4fde-9591-c835a13595d2","year":2006},"citing_paper":{"arxiv_id":"2608.12034","last_updated":"2026-08-12T13:18:49Z","snapshot_observed_at":"2026-08-17T05:08:42.639004Z","submitted_at":"2026-08-12T13:18:49Z","title":"The SLT 2026 SmartGlasses Challenge: Benchmarking Egocentric Multi-Talker Speech Recognition and Understanding with Audio-Language Models","version":1},"reference_index":3869,"source":"pdf_text","source_observed_at":"2026-08-16T00:23:07.478334Z"},"links":{"citing_paper":"/paper/2608.12034"},"observation_digest":"sha256:892a8a6b5e4e804a895d61735f6892dbb11a0cb29d24970beae7b8b8c456d39e","observation_id":"6baccc7b-3362-406b-9858-0416a474c502","resolution":{"observed_at":"2026-08-16T00:23:07.891006Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.12034","last_updated":"2026-08-12T13:18:49Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-17T05:08:42.639004Z","submitted_at":"2026-08-12T13:18:49Z","title":"The SLT 2026 SmartGlasses Challenge: Benchmarking Egocentric Multi-Talker Speech Recognition and Understanding with Audio-Language Models"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":1,"verified_fuzzy":19},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 0 inbound Pith citation observations for arXiv:2608.12034."}