{"as_of":"2026-08-10T10:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:de564059102c825e5ee9ea1413dd72b96037c0b4c8c8addb82992adde0ea78d1","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T20:20:58.963820Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.19377/citation-record","integrity":"/paper/2501.19377/integrity","json":"/paper/2501.19377/citation-record.json","paper":"/paper/2501.19377"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:20:59.511863Z","title":"V oice trigger system for Siri,","venue":null,"work_id":"03911181-4065-4cd4-9fc3-4a8593d2b997","year":2023},"citing_paper":{"arxiv_id":"2501.19377","last_updated":"2025-02-03T17:35:35Z","snapshot_observed_at":"2026-08-09T20:15:32.638699Z","submitted_at":"2025-01-31T18:30:36Z","title":"SELMA: A Speech-Enabled Language Model for Virtual Assistant Interactions","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-09T20:20:58.831640Z"},"links":{"citing_paper":"/paper/2501.19377"},"observation_digest":"sha256:bfe297406201c538620b2586cea24156c1b8e3fd9b194b70e498c3f1d47fdd87","observation_id":"9ad20b1c-eea4-4c56-bf5a-8e99c81bb305","resolution":{"observed_at":"2026-08-09T20:20:59.515361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:20:59.502840Z","title":"Efficient V oice Trigger Detection for Low Resource Hardware,","venue":null,"work_id":"d5c05083-8900-4035-b78c-3bd3940e9aa9","year":2018},"citing_paper":{"arxiv_id":"2501.19377","last_updated":"2025-02-03T17:35:35Z","snapshot_observed_at":"2026-08-09T20:15:32.638699Z","submitted_at":"2025-01-31T18:30:36Z","title":"SELMA: A Speech-Enabled Language Model for Virtual Assistant Interactions","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-09T20:20:58.835844Z"},"links":{"citing_paper":"/paper/2501.19377"},"observation_digest":"sha256:3c0fd13de38a4b73a0f34802c7402401b749fe877521a4a87db954a8bd56909e","observation_id":"2e722739-cb4b-4c7d-a7a1-bf045052f374","resolution":{"observed_at":"2026-08-09T20:20:59.506092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16036","last_updated":"2024-02-14T00:28:50Z","snapshot_observed_at":"2026-08-06T07:32:42.505862Z","submitted_at":"2023-09-27T21:28:50Z","title":"Multichannel Voice Trigger Detection Based on Transform-average-concatenate","version":2},"cited_work":{"arxiv_id":"2309.16036","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.16036","snapshot_observed_at":"2026-08-09T20:20:59.259299Z","title":"Multichannel Voice Trigger Detection Based on Transform-average-concatenate","venue":"eess.AS","work_id":"7b4fc8ad-2e58-4850-945f-cba5743e8d9b","year":2023},"citing_paper":{"arxiv_id":"2501.19377","last_updated":"2025-02-03T17:35:35Z","snapshot_observed_at":"2026-08-09T20:15:32.638699Z","submitted_at":"2025-01-31T18:30:36Z","title":"SELMA: A Speech-Enabled Language Model for Virtual Assistant Interactions","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-09T20:20:58.839275Z"},"links":{"cited_paper":"/paper/2309.16036","citing_paper":"/paper/2501.19377"},"observation_digest":"sha256:e6b718c3a059f5764521b86048460217f1f59d98363b64443f21b3a3bb0c9835","observation_id":"ca2235bb-1f43-4566-8e74-a9a38429c89d","resolution":{"observed_at":"2026-08-09T20:20:59.263101Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:20:59.493808Z","title":"Accurate Detection of Wake Word Start and End Using a CNN,","venue":null,"work_id":"4130d119-6283-4a5f-85eb-283cbd297ed0","year":2020},"citing_paper":{"arxiv_id":"2501.19377","last_updated":"2025-02-03T17:35:35Z","snapshot_observed_at":"2026-08-09T20:15:32.638699Z","submitted_at":"2025-01-31T18:30:36Z","title":"SELMA: A Speech-Enabled Language Model for Virtual Assistant Interactions","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-09T20:20:58.843158Z"},"links":{"citing_paper":"/paper/2501.19377"},"observation_digest":"sha256:be0737e0b6fe7c9ab16a6903e8dd13ec5f905e9b3047658a2dc0c84affb2f026","observation_id":"aae3cc85-6e7f-4d00-b069-e2762db084c1","resolution":{"observed_at":"2026-08-09T20:20:59.497178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:20:59.484782Z","title":"Low-resource Low-footprint Wake-word Detec- tion using Knowledge Distillation,","venue":null,"work_id":"a0b165e5-97bb-48e1-befe-2c4c2739d157","year":2022},"citing_paper":{"arxiv_id":"2501.19377","last_updated":"2025-02-03T17:35:35Z","snapshot_observed_at":"2026-08-09T20:15:32.638699Z","submitted_at":"2025-01-31T18:30:36Z","title":"SELMA: A Speech-Enabled Language Model for Virtual Assistant Interactions","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-09T20:20:58.846492Z"},"links":{"citing_paper":"/paper/2501.19377"},"observation_digest":"sha256:9d9c508745d2c6c5f4a561cb5c4234e5be256c677384e9e8290e3d9e6877f771","observation_id":"b76181ae-2991-4843-afaf-29c6e9742f5a","resolution":{"observed_at":"2026-08-09T20:20:59.488115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:20:59.475513Z","title":"Convolutional neural networks for small-footprint keyword spotting,","venue":null,"work_id":"cf54afc1-2cf0-4ac4-b22e-cdb030daacbd","year":2015},"citing_paper":{"arxiv_id":"2501.19377","last_updated":"2025-02-03T17:35:35Z","snapshot_observed_at":"2026-08-09T20:15:32.638699Z","submitted_at":"2025-01-31T18:30:36Z","title":"SELMA: A Speech-Enabled Language Model for Virtual Assistant Interactions","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-09T20:20:58.849724Z"},"links":{"citing_paper":"/paper/2501.19377"},"observation_digest":"sha256:a1ea3e7edd8ffad0901e72547645dd5abd863f3d958f0b83760a0c7b948e234d","observation_id":"46e1db43-40d3-4262-937b-951bbd0cc1b3","resolution":{"observed_at":"2026-08-09T20:20:59.478648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:20:59.466507Z","title":"Keyword spotting for google assistant using contextual speech recognition,","venue":null,"work_id":"1244a906-1dc5-4409-813c-c6abdab8659d","year":2017},"citing_paper":{"arxiv_id":"2501.19377","last_updated":"2025-02-03T17:35:35Z","snapshot_observed_at":"2026-08-09T20:15:32.638699Z","submitted_at":"2025-01-31T18:30:36Z","title":"SELMA: A Speech-Enabled Language Model for Virtual Assistant Interactions","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-09T20:20:58.853924Z"},"links":{"citing_paper":"/paper/2501.19377"},"observation_digest":"sha256:0ca7898f6212f4d5c0b361faaf810ceaa4c296f1eb9658325df63250cd67c503","observation_id":"5210ff4e-e116-4ab1-a79d-888765c123ab","resolution":{"observed_at":"2026-08-09T20:20:59.470328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:20:59.457968Z","title":"Contrastive speech mixup for low-resource keyword spotting,","venue":null,"work_id":"ccbd1c99-ea85-442c-b595-4b541a308b5b","year":2023},"citing_paper":{"arxiv_id":"2501.19377","last_updated":"2025-02-03T17:35:35Z","snapshot_observed_at":"2026-08-09T20:15:32.638699Z","submitted_at":"2025-01-31T18:30:36Z","title":"SELMA: A Speech-Enabled Language Model for Virtual Assistant Interactions","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-09T20:20:58.856844Z"},"links":{"citing_paper":"/paper/2501.19377"},"observation_digest":"sha256:4e8ef19fa805dab0ff41c80022111f5556144cabdafff5b23a16ca3cfe751a19","observation_id":"5d15b3df-0e73-4450-84e8-9fcc72243bcc","resolution":{"observed_at":"2026-08-09T20:20:59.461170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:20:59.449378Z","title":"A multimodal approach to device-directed speech detection with large language models,","venue":null,"work_id":"885dc2c1-bf00-4ad5-85a8-eb5aeaab0abe","year":2024},"citing_paper":{"arxiv_id":"2501.19377","last_updated":"2025-02-03T17:35:35Z","snapshot_observed_at":"2026-08-09T20:15:32.638699Z","submitted_at":"2025-01-31T18:30:36Z","title":"SELMA: A Speech-Enabled Language Model for Virtual Assistant Interactions","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-09T20:20:58.859767Z"},"links":{"citing_paper":"/paper/2501.19377"},"observation_digest":"sha256:308e592a748c2f7bacd75759bfe8e7696bf3676aa82bec6c40d50be2fe875264","observation_id":"8412ed77-3cd1-4a24-94f0-51a438590792","resolution":{"observed_at":"2026-08-09T20:20:59.452594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:20:59.440501Z","title":"Learning when to listen: detecting system-addressed speech in human-human-computer dialog,","venue":null,"work_id":"5637a2fa-4e74-4fc6-a8d5-ebdbae476247","year":2012},"citing_paper":{"arxiv_id":"2501.19377","last_updated":"2025-02-03T17:35:35Z","snapshot_observed_at":"2026-08-09T20:15:32.638699Z","submitted_at":"2025-01-31T18:30:36Z","title":"SELMA: A Speech-Enabled Language Model for Virtual Assistant Interactions","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-09T20:20:58.862813Z"},"links":{"citing_paper":"/paper/2501.19377"},"observation_digest":"sha256:d2930e767a618701a8d415fcc7f89f66e52bf4d819aafdf283840125907abff8","observation_id":"860f977e-0f5b-4ed3-a46e-e0a184380191","resolution":{"observed_at":"2026-08-09T20:20:59.443887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:20:59.431415Z","title":"Device-directed utterance detection,","venue":null,"work_id":"96d461fd-9213-4a33-a844-51365eb32df7","year":2018},"citing_paper":{"arxiv_id":"2501.19377","last_updated":"2025-02-03T17:35:35Z","snapshot_observed_at":"2026-08-09T20:15:32.638699Z","submitted_at":"2025-01-31T18:30:36Z","title":"SELMA: A Speech-Enabled Language Model for Virtual Assistant Interactions","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-09T20:20:58.865981Z"},"links":{"citing_paper":"/paper/2501.19377"},"observation_digest":"sha256:a1f3b060797ac4d3766fbb5e81114b3e9bc4301259be02a8b1f94e1fd8d7fd60","observation_id":"509ad48b-53c4-46e5-97c3-60c9318c08a4","resolution":{"observed_at":"2026-08-09T20:20:59.434812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:20:59.422156Z","title":"Device-directed speech detection: Regularization via distillation for weakly-supervised models,","venue":null,"work_id":"8ed455b7-b571-4082-ab36-3c8d519743ba","year":2022},"citing_paper":{"arxiv_id":"2501.19377","last_updated":"2025-02-03T17:35:35Z","snapshot_observed_at":"2026-08-09T20:15:32.638699Z","submitted_at":"2025-01-31T18:30:36Z","title":"SELMA: A Speech-Enabled Language Model for Virtual Assistant Interactions","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-09T20:20:58.869367Z"},"links":{"citing_paper":"/paper/2501.19377"},"observation_digest":"sha256:107d272a67fd6007445d5793e4e3932b12dd090d4fdbe70052b5f9ac7074911a","observation_id":"aa08ea72-9b41-40a6-bda7-f5a36a376d30","resolution":{"observed_at":"2026-08-09T20:20:59.425821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:20:59.412606Z","title":"Streaming Transformer for Hardware Efficient V oice Trigger Detection and False Trigger Mitigation,","venue":null,"work_id":"bfe52173-ac79-460e-bb04-cba2ecac2314","year":2021},"citing_paper":{"arxiv_id":"2501.19377","last_updated":"2025-02-03T17:35:35Z","snapshot_observed_at":"2026-08-09T20:15:32.638699Z","submitted_at":"2025-01-31T18:30:36Z","title":"SELMA: A Speech-Enabled Language Model for Virtual Assistant Interactions","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-09T20:20:58.872268Z"},"links":{"citing_paper":"/paper/2501.19377"},"observation_digest":"sha256:a967d777aeed32025c141bab813775333e7cd7b65e4aca8edf03ae4ed65bc0a4","observation_id":"19a59fd6-e635-459c-8792-542c59c93044","resolution":{"observed_at":"2026-08-09T20:20:59.416237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:20:59.403510Z","title":"Lattice-based improvements for voice triggering using graph neural networks,","venue":null,"work_id":"786f7194-dc3f-4bed-89de-5538ba81bb1b","year":2020},"citing_paper":{"arxiv_id":"2501.19377","last_updated":"2025-02-03T17:35:35Z","snapshot_observed_at":"2026-08-09T20:15:32.638699Z","submitted_at":"2025-01-31T18:30:36Z","title":"SELMA: A Speech-Enabled Language Model for Virtual Assistant Interactions","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-09T20:20:58.875326Z"},"links":{"citing_paper":"/paper/2501.19377"},"observation_digest":"sha256:5ed651215fa16b9d4a74ee2e760cc4fe448310e02097499771598913ccb0747e","observation_id":"4d728883-85f0-43d0-b05a-2e821a15e0d8","resolution":{"observed_at":"2026-08-09T20:20:59.406804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:20:59.394435Z","title":"V oice trigger detection from lvcsr hypothesis lattices using bidirectional lattice recurrent neural networks,","venue":null,"work_id":"6c1bc1fd-10c1-4314-8568-514fea3a41a0","year":2019},"citing_paper":{"arxiv_id":"2501.19377","last_updated":"2025-02-03T17:35:35Z","snapshot_observed_at":"2026-08-09T20:15:32.638699Z","submitted_at":"2025-01-31T18:30:36Z","title":"SELMA: A Speech-Enabled Language Model for Virtual Assistant Interactions","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-09T20:20:58.878246Z"},"links":{"citing_paper":"/paper/2501.19377"},"observation_digest":"sha256:df41afca93b8b35098e96d35d10745e0da14375c490fbddbeb9dd460344d8347","observation_id":"89376b3a-efdf-4f42-9612-cb340d402641","resolution":{"observed_at":"2026-08-09T20:20:59.398050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:20:59.385313Z","title":"Exploring attention mechanism for acoustic-based classification of speech utterances into system-directed and non-system-directed,","venue":null,"work_id":"fbac2424-5aff-440a-a1a8-6ccd2c081813","year":2019},"citing_paper":{"arxiv_id":"2501.19377","last_updated":"2025-02-03T17:35:35Z","snapshot_observed_at":"2026-08-09T20:15:32.638699Z","submitted_at":"2025-01-31T18:30:36Z","title":"SELMA: A Speech-Enabled Language Model for Virtual Assistant Interactions","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-09T20:20:58.881339Z"},"links":{"citing_paper":"/paper/2501.19377"},"observation_digest":"sha256:bf5492cdc6a7daff6c5f3182855f781de331b5c4981868cf15b5597a5b02f8b4","observation_id":"9d97c1f0-5f5f-4d00-8d3f-7ea29f74a97a","resolution":{"observed_at":"2026-08-09T20:20:59.388777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:20:59.376360Z","title":"Less is more: A unified architecture for device- directed speech detection with multiple invocation types,","venue":null,"work_id":"4c3fbd79-de4e-4bff-b8dc-0a9374f5ce18","year":2023},"citing_paper":{"arxiv_id":"2501.19377","last_updated":"2025-02-03T17:35:35Z","snapshot_observed_at":"2026-08-09T20:15:32.638699Z","submitted_at":"2025-01-31T18:30:36Z","title":"SELMA: A Speech-Enabled Language Model for Virtual Assistant Interactions","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-09T20:20:58.884199Z"},"links":{"citing_paper":"/paper/2501.19377"},"observation_digest":"sha256:f187bdca23800c24f16d9c42b1594cf4719228d70372a8c29b7f35feded74bed","observation_id":"cc11b4e8-a369-4360-9c4d-24c615e8657c","resolution":{"observed_at":"2026-08-09T20:20:59.379798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:20:59.366898Z","title":"A Study for Improving Device-Directed Speech De- tection Toward Frictionless Human-Machine Interaction,","venue":null,"work_id":"396de0c3-b49a-4455-8fc8-eab9946c04c0","year":2019},"citing_paper":{"arxiv_id":"2501.19377","last_updated":"2025-02-03T17:35:35Z","snapshot_observed_at":"2026-08-09T20:15:32.638699Z","submitted_at":"2025-01-31T18:30:36Z","title":"SELMA: A Speech-Enabled Language Model for Virtual Assistant Interactions","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-09T20:20:58.887464Z"},"links":{"citing_paper":"/paper/2501.19377"},"observation_digest":"sha256:0ed62b879f3f16c2ae178602bf3f935e1bbddaf43700cfaa020fc4cf596d1e8b","observation_id":"2783894e-3a8e-4962-9a17-db55186ed5cf","resolution":{"observed_at":"2026-08-09T20:20:59.370313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15261","last_updated":"2023-10-23T18:09:31Z","snapshot_observed_at":"2026-07-06T16:37:27.609912Z","submitted_at":"2023-10-23T18:09:31Z","title":"Modality Dropout for Multimodal Device Directed Speech Detection using Verbal and Non-Verbal Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15261","snapshot_observed_at":"2026-08-09T20:20:58.891002Z","title":"Modality dropout for multimodal device directed speech detection using verbal and non-verbal features,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.19377","last_updated":"2025-02-03T17:35:35Z","snapshot_observed_at":"2026-08-09T20:15:32.638699Z","submitted_at":"2025-01-31T18:30:36Z","title":"SELMA: A Speech-Enabled Language Model for Virtual Assistant Interactions","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-09T20:20:58.891002Z"},"links":{"cited_paper":"/paper/2310.15261","citing_paper":"/paper/2501.19377"},"observation_digest":"sha256:92dd03332398bfb3249c3cea1df04407002b0a2f2cc3e83a02d67e5c3b82def0","observation_id":"833d2349-e460-49be-a96e-5d6cfa999c25","resolution":{"observed_at":"2026-08-09T20:20:58.891002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:20:59.357861Z","title":"Multimodal large language models with fusion low rank adaptation for device directed speech detection,","venue":null,"work_id":"873d12a5-5a66-41bb-bf95-551f58347065","year":2024},"citing_paper":{"arxiv_id":"2501.19377","last_updated":"2025-02-03T17:35:35Z","snapshot_observed_at":"2026-08-09T20:15:32.638699Z","submitted_at":"2025-01-31T18:30:36Z","title":"SELMA: A Speech-Enabled Language Model for Virtual Assistant Interactions","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-09T20:20:58.895318Z"},"links":{"citing_paper":"/paper/2501.19377"},"observation_digest":"sha256:8a708ae781f58bd5c0332e594113edbe51394c3dbce5ee220604472e8ccf9282","observation_id":"909051c9-eb4e-4683-b661-381f2ed5dbd1","resolution":{"observed_at":"2026-08-09T20:20:59.361278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11267","last_updated":"2023-06-16T17:04:09Z","snapshot_observed_at":"2026-07-06T15:18:34.225078Z","submitted_at":"2023-04-21T22:40:29Z","title":"Speed Is All You Need: On-Device Acceleration of Large Diffusion Models via GPU-Aware Optimizations","version":2},"cited_work":{"arxiv_id":"2304.11267","doi":null,"metadata_source":"pith","pith_arxiv_id":"2304.11267","snapshot_observed_at":"2026-08-09T20:20:59.235100Z","title":"Speed Is All You Need: On-Device Acceleration of Large Diffusion Models via GPU-Aware Optimizations","venue":"cs.CV","work_id":"72f6ed3b-c6f3-4cde-877e-790572a44181","year":2023},"citing_paper":{"arxiv_id":"2501.19377","last_updated":"2025-02-03T17:35:35Z","snapshot_observed_at":"2026-08-09T20:15:32.638699Z","submitted_at":"2025-01-31T18:30:36Z","title":"SELMA: A Speech-Enabled Language Model for Virtual Assistant Interactions","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-09T20:20:58.898337Z"},"links":{"cited_paper":"/paper/2304.11267","citing_paper":"/paper/2501.19377"},"observation_digest":"sha256:bce386153f5b732d5d5ae85be013b86808792b2f9f8415a950886d9ba3cb10bb","observation_id":"aea614d5-84f7-41de-9d86-e9eede63427c","resolution":{"observed_at":"2026-08-09T20:20:59.240915Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:20:58.901528Z","title":"Apple intelligence foundation language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19377","last_updated":"2025-02-03T17:35:35Z","snapshot_observed_at":"2026-08-09T20:15:32.638699Z","submitted_at":"2025-01-31T18:30:36Z","title":"SELMA: A Speech-Enabled Language Model for Virtual Assistant Interactions","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-09T20:20:58.901528Z"},"links":{"citing_paper":"/paper/2501.19377"},"observation_digest":"sha256:379034fee13d59b6889445f26fa0b38325b287268d088de034d6c3c0baeda528","observation_id":"7bcb1b3f-f61f-446b-becd-a5ecf9799726","resolution":{"observed_at":"2026-08-09T20:20:58.901528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:20:59.348844Z","title":"Large language models are zero-shot reasoners,","venue":null,"work_id":"78e78a71-e434-433a-8624-ba6ef269eaba","year":2022},"citing_paper":{"arxiv_id":"2501.19377","last_updated":"2025-02-03T17:35:35Z","snapshot_observed_at":"2026-08-09T20:15:32.638699Z","submitted_at":"2025-01-31T18:30:36Z","title":"SELMA: A Speech-Enabled Language Model for Virtual Assistant Interactions","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-09T20:20:58.908317Z"},"links":{"citing_paper":"/paper/2501.19377"},"observation_digest":"sha256:1f91dd236e7c30041790f6213a247ac99648680e8b08c6fd9c5e610ae126e285","observation_id":"b93b0366-5968-410f-8bf8-0d92bf27c0ad","resolution":{"observed_at":"2026-08-09T20:20:59.352137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-09T20:20:58.912349Z","title":"Language models are few-shot learners,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.19377","last_updated":"2025-02-03T17:35:35Z","snapshot_observed_at":"2026-08-09T20:15:32.638699Z","submitted_at":"2025-01-31T18:30:36Z","title":"SELMA: A Speech-Enabled Language Model for Virtual Assistant Interactions","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-09T20:20:58.912349Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2501.19377"},"observation_digest":"sha256:54ca416a5950a4e76dd7abc07d2122f9263b4840fe874419152bb2f38b29eb5a","observation_id":"6200b4eb-10aa-4022-8fbd-fd871087f912","resolution":{"observed_at":"2026-08-09T20:20:58.912349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01831","last_updated":"2024-05-28T05:44:53Z","snapshot_observed_at":"2026-08-07T19:26:44.980429Z","submitted_at":"2024-02-02T18:58:34Z","title":"Audio Flamingo: A Novel Audio Language Model with Few-Shot Learning and Dialogue Abilities","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01831","snapshot_observed_at":"2026-08-09T20:20:58.916296Z","title":"Audio flamingo: A novel audio language model with few-shot learning and dialogue abilities,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19377","last_updated":"2025-02-03T17:35:35Z","snapshot_observed_at":"2026-08-09T20:15:32.638699Z","submitted_at":"2025-01-31T18:30:36Z","title":"SELMA: A Speech-Enabled Language Model for Virtual Assistant Interactions","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-09T20:20:58.916296Z"},"links":{"cited_paper":"/paper/2402.01831","citing_paper":"/paper/2501.19377"},"observation_digest":"sha256:ec18e69814b7cc4c851e3e054d2600ed43565fee63d668dcae28a4c18010dd3d","observation_id":"0791a6b4-b47a-4795-a295-f704924594c8","resolution":{"observed_at":"2026-08-09T20:20:58.916296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:20:59.339540Z","title":"SALMONN: Towards generic hearing abilities for large language models,","venue":null,"work_id":"927a18c2-3cfe-4a6a-bf1d-1e2f10bd28fa","year":2024},"citing_paper":{"arxiv_id":"2501.19377","last_updated":"2025-02-03T17:35:35Z","snapshot_observed_at":"2026-08-09T20:15:32.638699Z","submitted_at":"2025-01-31T18:30:36Z","title":"SELMA: A Speech-Enabled Language Model for Virtual Assistant Interactions","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-09T20:20:58.920418Z"},"links":{"citing_paper":"/paper/2501.19377"},"observation_digest":"sha256:fe09624a2121af13e5408dfa4dc5e625a7897e119c87137fecb4a02e54efa14a","observation_id":"ee24ee33-d0ea-43ee-a8cd-093623714cdf","resolution":{"observed_at":"2026-08-09T20:20:59.343108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-09T20:20:58.924487Z","title":"Qwen-audio: Advancing universal audio un- derstanding via unified large-scale audio-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.19377","last_updated":"2025-02-03T17:35:35Z","snapshot_observed_at":"2026-08-09T20:15:32.638699Z","submitted_at":"2025-01-31T18:30:36Z","title":"SELMA: A Speech-Enabled Language Model for Virtual Assistant Interactions","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-09T20:20:58.924487Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2501.19377"},"observation_digest":"sha256:76f715533cd20fb856e29e46c088d267ecbec70629353e7f91ef214e35a7e1fc","observation_id":"4a5677dc-a289-47f0-8369-c96da10ea8fe","resolution":{"observed_at":"2026-08-09T20:20:58.924487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-08-07T01:18:02.068918Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-08-09T20:20:58.928239Z","title":"Audiopalm: A large language model that can speak and listen,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.19377","last_updated":"2025-02-03T17:35:35Z","snapshot_observed_at":"2026-08-09T20:15:32.638699Z","submitted_at":"2025-01-31T18:30:36Z","title":"SELMA: A Speech-Enabled Language Model for Virtual Assistant Interactions","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-09T20:20:58.928239Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2501.19377"},"observation_digest":"sha256:55a795115609027b1c27d0061106c8172a6861aba1bb1f907f489c7e0cf31f26","observation_id":"3cdb25bb-6333-4523-afd6-851f14efbbbe","resolution":{"observed_at":"2026-08-09T20:20:58.928239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:20:59.330274Z","title":"Pengi: An audio language model for audio tasks,","venue":null,"work_id":"e86ee6be-011f-4cf0-8874-1959a92eaa1f","year":2023},"citing_paper":{"arxiv_id":"2501.19377","last_updated":"2025-02-03T17:35:35Z","snapshot_observed_at":"2026-08-09T20:15:32.638699Z","submitted_at":"2025-01-31T18:30:36Z","title":"SELMA: A Speech-Enabled Language Model for Virtual Assistant Interactions","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-09T20:20:58.931937Z"},"links":{"citing_paper":"/paper/2501.19377"},"observation_digest":"sha256:9e5a0a79374f32cc504a60cf1905fce5957c30fafeb0133ce88dca9c74446736","observation_id":"cd45b56f-1a13-4d18-8351-cc832aae6ad6","resolution":{"observed_at":"2026-08-09T20:20:59.333627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:20:59.320421Z","title":"Coding dialogs with the damsl annota- tion scheme,","venue":null,"work_id":"bb896124-6e10-4861-9d94-be403ee4fd3f","year":1997},"citing_paper":{"arxiv_id":"2501.19377","last_updated":"2025-02-03T17:35:35Z","snapshot_observed_at":"2026-08-09T20:15:32.638699Z","submitted_at":"2025-01-31T18:30:36Z","title":"SELMA: A Speech-Enabled Language Model for Virtual Assistant Interactions","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-09T20:20:58.935437Z"},"links":{"citing_paper":"/paper/2501.19377"},"observation_digest":"sha256:7d321fcdb5cbb04baa3993b985cb7e77575c2d4f0bfd2d9213949ca4dda67e22","observation_id":"f6ea27e2-f63a-4fc7-9ea2-9fd4d2f5a677","resolution":{"observed_at":"2026-08-09T20:20:59.324148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:20:59.309768Z","title":"Multimodal Data and Resource Efficient Device-Directed Speech Detection with Large Foundation Models,","venue":null,"work_id":"6e629922-1bcd-4a7e-9881-ec228ea78d35","year":2023},"citing_paper":{"arxiv_id":"2501.19377","last_updated":"2025-02-03T17:35:35Z","snapshot_observed_at":"2026-08-09T20:15:32.638699Z","submitted_at":"2025-01-31T18:30:36Z","title":"SELMA: A Speech-Enabled Language Model for Virtual Assistant Interactions","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-09T20:20:58.939037Z"},"links":{"citing_paper":"/paper/2501.19377"},"observation_digest":"sha256:bd02a48f1e40f79262e5dea3075ca04072d633b893ccdb86e91a95366566ebf3","observation_id":"ac7f3887-7acb-4211-8c45-d9df3b98897e","resolution":{"observed_at":"2026-08-09T20:20:59.313695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:20:59.300290Z","title":"Attention is all you need,","venue":null,"work_id":"39b1547c-c646-4526-af72-2c48f2303d10","year":2017},"citing_paper":{"arxiv_id":"2501.19377","last_updated":"2025-02-03T17:35:35Z","snapshot_observed_at":"2026-08-09T20:15:32.638699Z","submitted_at":"2025-01-31T18:30:36Z","title":"SELMA: A Speech-Enabled Language Model for Virtual Assistant Interactions","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-09T20:20:58.942686Z"},"links":{"citing_paper":"/paper/2501.19377"},"observation_digest":"sha256:3c702ce97ac0a0b92f1c003ec0c2b8ce02d05031f1bb5bfbea70d72a9bfee80d","observation_id":"9ed93ffe-b75a-455c-8f61-6beafef2717c","resolution":{"observed_at":"2026-08-09T20:20:59.303711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-09T20:20:58.946422Z","title":"Robust speech recognition via large- scale weak supervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.19377","last_updated":"2025-02-03T17:35:35Z","snapshot_observed_at":"2026-08-09T20:15:32.638699Z","submitted_at":"2025-01-31T18:30:36Z","title":"SELMA: A Speech-Enabled Language Model for Virtual Assistant Interactions","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-09T20:20:58.946422Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2501.19377"},"observation_digest":"sha256:399c06773bb30746a90ec08b2d760b17d06e0afa91e8cce3ec8e80def8519ec6","observation_id":"0b56fcd9-dbb9-434f-9f7b-2f1ec0e7c116","resolution":{"observed_at":"2026-08-09T20:20:58.946422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-09T20:20:58.950073Z","title":"Qwen technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.19377","last_updated":"2025-02-03T17:35:35Z","snapshot_observed_at":"2026-08-09T20:15:32.638699Z","submitted_at":"2025-01-31T18:30:36Z","title":"SELMA: A Speech-Enabled Language Model for Virtual Assistant Interactions","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-09T20:20:58.950073Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2501.19377"},"observation_digest":"sha256:ecacbe62c98f99aba24e2a46245863b9f4a0ad964518a4211ed50fe20f7700f8","observation_id":"daab60d2-a255-466d-9ce8-6c52c3b5474b","resolution":{"observed_at":"2026-08-09T20:20:58.950073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:20:59.290356Z","title":"Quan- tizable transformers: Removing outliers by helping attention heads do nothing,","venue":null,"work_id":"d1184822-ec78-46c9-a3f5-7798555dde08","year":2023},"citing_paper":{"arxiv_id":"2501.19377","last_updated":"2025-02-03T17:35:35Z","snapshot_observed_at":"2026-08-09T20:15:32.638699Z","submitted_at":"2025-01-31T18:30:36Z","title":"SELMA: A Speech-Enabled Language Model for Virtual Assistant Interactions","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-09T20:20:58.953841Z"},"links":{"citing_paper":"/paper/2501.19377"},"observation_digest":"sha256:d265c6c7ac65562ecf58237276f448b600780b27f483f98da33502dc30527626","observation_id":"1673c25c-5f5e-45fe-961c-4143fef101a9","resolution":{"observed_at":"2026-08-09T20:20:59.293801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:20:59.280449Z","title":"LoRA: Low-rank adaptation of large language models,","venue":null,"work_id":"6ef9c15e-6b87-459d-9192-7b50ffcfe012","year":2022},"citing_paper":{"arxiv_id":"2501.19377","last_updated":"2025-02-03T17:35:35Z","snapshot_observed_at":"2026-08-09T20:15:32.638699Z","submitted_at":"2025-01-31T18:30:36Z","title":"SELMA: A Speech-Enabled Language Model for Virtual Assistant Interactions","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-09T20:20:58.957594Z"},"links":{"citing_paper":"/paper/2501.19377"},"observation_digest":"sha256:3583b7125b4043dc5616348477679c0e08eccad1e254997d3ab6671dba09f83b","observation_id":"1feded89-0bfd-4f35-9626-dd35b84f5e8a","resolution":{"observed_at":"2026-08-09T20:20:59.284045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:20:59.270363Z","title":"Decoupled weight decay regu- larization,","venue":null,"work_id":"cf0fd712-93fa-42e6-9aa9-855e5519da44","year":2019},"citing_paper":{"arxiv_id":"2501.19377","last_updated":"2025-02-03T17:35:35Z","snapshot_observed_at":"2026-08-09T20:15:32.638699Z","submitted_at":"2025-01-31T18:30:36Z","title":"SELMA: A Speech-Enabled Language Model for Virtual Assistant Interactions","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-09T20:20:58.960749Z"},"links":{"citing_paper":"/paper/2501.19377"},"observation_digest":"sha256:8eeae85423d200471b37ae2703353e42ea9645981d63553518e6f6b95a42278c","observation_id":"59208eb0-7fda-4c43-9c7f-51dde672b5e8","resolution":{"observed_at":"2026-08-09T20:20:59.273882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-09T20:20:58.963820Z","title":"Phi-3 technical report: A highly capable language model locally on your phone,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19377","last_updated":"2025-02-03T17:35:35Z","snapshot_observed_at":"2026-08-09T20:15:32.638699Z","submitted_at":"2025-01-31T18:30:36Z","title":"SELMA: A Speech-Enabled Language Model for Virtual Assistant Interactions","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-09T20:20:58.963820Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2501.19377"},"observation_digest":"sha256:4f1b1b1a27ad113e80f1ebe478e8f9b8fb8d6ed5f1c091b5b5bf62d1bef03f3d","observation_id":"d51af6b7-8950-4124-939d-b0fe2db28e8e","resolution":{"observed_at":"2026-08-09T20:20:58.963820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.19377","last_updated":"2025-02-03T17:35:35Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-09T20:15:32.638699Z","submitted_at":"2025-01-31T18:30:36Z","title":"SELMA: A Speech-Enabled Language Model for Virtual Assistant Interactions"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":2,"verified_fuzzy":27},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 0 inbound Pith citation observations for arXiv:2501.19377."}