{"as_of":"2026-08-10T06:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9cc2d87a732db9b0cdaaf684d5ded17ede2f6686a8cb8752fe69463b9522ed31","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T01:19:07.656877Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T01:19:04.458152Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.25870","last_updated":"2026-07-28T15:37:44Z","snapshot_observed_at":"2026-08-06T06:44:04.480037Z","submitted_at":"2026-07-28T15:37:44Z","title":"VAD to the Bone: Ultra-Tiny Speech Activity Detection for Edge Deployment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.25870","snapshot_observed_at":"2026-08-01T01:19:04.458152Z","title":"reported values are not directly comparable because of two competing inference pro- tocols","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25870","last_updated":"2026-07-28T15:37:44Z","snapshot_observed_at":"2026-08-06T06:44:04.480037Z","submitted_at":"2026-07-28T15:37:44Z","title":"VAD to the Bone: Ultra-Tiny Speech Activity Detection for Edge Deployment","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T01:19:04.458152Z"},"links":{"cited_paper":"/paper/2607.25870","citing_paper":"/paper/2607.25870"},"observation_digest":"sha256:1ac6a759e66a5094015d73c620841be2e5007ff4be783163632c56ee7a7c9145","observation_id":"b0d74b9f-414d-4249-a27a-adbed8dadea4","resolution":{"observed_at":"2026-08-01T01:19:04.458152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2607.25870/citation-record","integrity":"/paper/2607.25870/integrity","json":"/paper/2607.25870/citation-record.json","paper":"/paper/2607.25870"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.25870","last_updated":"2026-07-28T15:37:44Z","snapshot_observed_at":"2026-08-06T06:44:04.480037Z","submitted_at":"2026-07-28T15:37:44Z","title":"VAD to the Bone: Ultra-Tiny Speech Activity Detection for Edge Deployment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.25870","snapshot_observed_at":"2026-08-01T01:19:04.458152Z","title":"reported values are not directly comparable because of two competing inference pro- tocols","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25870","last_updated":"2026-07-28T15:37:44Z","snapshot_observed_at":"2026-08-06T06:44:04.480037Z","submitted_at":"2026-07-28T15:37:44Z","title":"VAD to the Bone: Ultra-Tiny Speech Activity Detection for Edge Deployment","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T01:19:04.458152Z"},"links":{"cited_paper":"/paper/2607.25870","citing_paper":"/paper/2607.25870"},"observation_digest":"sha256:1ac6a759e66a5094015d73c620841be2e5007ff4be783163632c56ee7a7c9145","observation_id":"b0d74b9f-414d-4249-a27a-adbed8dadea4","resolution":{"observed_at":"2026-08-01T01:19:04.458152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:19:04.543286Z","title":"Model Architecture The kiloV AD architecture is optimized for cross-platform em- bedded support under standard operator constraints","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25870","last_updated":"2026-07-28T15:37:44Z","snapshot_observed_at":"2026-08-06T06:44:04.480037Z","submitted_at":"2026-07-28T15:37:44Z","title":"VAD to the Bone: Ultra-Tiny Speech Activity Detection for Edge Deployment","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T01:19:04.543286Z"},"links":{"citing_paper":"/paper/2607.25870"},"observation_digest":"sha256:e0dadbd42bb1b6b45ae50ce448ec834002389137b972279ab85a5e6a26e4bb12","observation_id":"8b7791f6-711d-447a-be82-15986f74e5a4","resolution":{"observed_at":"2026-08-01T01:19:04.543286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:19:04.649524Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25870","last_updated":"2026-07-28T15:37:44Z","snapshot_observed_at":"2026-08-06T06:44:04.480037Z","submitted_at":"2026-07-28T15:37:44Z","title":"VAD to the Bone: Ultra-Tiny Speech Activity Detection for Edge Deployment","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T01:19:04.649524Z"},"links":{"citing_paper":"/paper/2607.25870"},"observation_digest":"sha256:cc7a6cf1e4f10344edb748760c3522d910d405b169f517e97aa8c664e755f49d","observation_id":"31381024-bebd-4248-975a-c148313988fe","resolution":{"observed_at":"2026-08-01T01:19:04.649524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:19:04.791307Z","title":"This mixture exposes the model to both environmental noise (wind) and diverse acoustic interference (DNS)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25870","last_updated":"2026-07-28T15:37:44Z","snapshot_observed_at":"2026-08-06T06:44:04.480037Z","submitted_at":"2026-07-28T15:37:44Z","title":"VAD to the Bone: Ultra-Tiny Speech Activity Detection for Edge Deployment","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T01:19:04.791307Z"},"links":{"citing_paper":"/paper/2607.25870"},"observation_digest":"sha256:bcc8dff87e6a34576aaaa4f6c7ba7d58104f4ed3974ddb7cf11976725453d2d4","observation_id":"ba7d1da4-b945-435e-b9b7-bf76b74ba0d8","resolution":{"observed_at":"2026-08-01T01:19:04.791307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:19:04.903562Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25870","last_updated":"2026-07-28T15:37:44Z","snapshot_observed_at":"2026-08-06T06:44:04.480037Z","submitted_at":"2026-07-28T15:37:44Z","title":"VAD to the Bone: Ultra-Tiny Speech Activity Detection for Edge Deployment","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T01:19:04.903562Z"},"links":{"citing_paper":"/paper/2607.25870"},"observation_digest":"sha256:83f509479fed2cbf4ad69ff5101b27294c867cb3782dd50fb9f26dd15f25979d","observation_id":"d01f3a1b-9fa5-4c95-ac96-2b2966f1c8ff","resolution":{"observed_at":"2026-08-01T01:19:04.903562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:19:04.983714Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25870","last_updated":"2026-07-28T15:37:44Z","snapshot_observed_at":"2026-08-06T06:44:04.480037Z","submitted_at":"2026-07-28T15:37:44Z","title":"VAD to the Bone: Ultra-Tiny Speech Activity Detection for Edge Deployment","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T01:19:04.983714Z"},"links":{"citing_paper":"/paper/2607.25870"},"observation_digest":"sha256:83ac8350709c0b356cba1033f8e127ee631dd0eae499d2f2a44f859d79b2f7ba","observation_id":"66aa8f8e-98a8-446f-b5c5-9df3d96b38ee","resolution":{"observed_at":"2026-08-01T01:19:04.983714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:19:05.210556Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25870","last_updated":"2026-07-28T15:37:44Z","snapshot_observed_at":"2026-08-06T06:44:04.480037Z","submitted_at":"2026-07-28T15:37:44Z","title":"VAD to the Bone: Ultra-Tiny Speech Activity Detection for Edge Deployment","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T01:19:05.210556Z"},"links":{"citing_paper":"/paper/2607.25870"},"observation_digest":"sha256:11e088ee3ee8150c93e704cfe1be63075bc318fce418b56145584aca23b91b5c","observation_id":"d2a95cd2-683f-43c0-b929-4ad54e949e1b","resolution":{"observed_at":"2026-08-01T01:19:05.210556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:19:05.247643Z","title":"The authors reviewed and validated all outputs and retain full responsibility for the work presented","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25870","last_updated":"2026-07-28T15:37:44Z","snapshot_observed_at":"2026-08-06T06:44:04.480037Z","submitted_at":"2026-07-28T15:37:44Z","title":"VAD to the Bone: Ultra-Tiny Speech Activity Detection for Edge Deployment","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T01:19:05.247643Z"},"links":{"citing_paper":"/paper/2607.25870"},"observation_digest":"sha256:ae116ac6cf6dd991190fe3ea4ea7fc54bd0f42b51d0b3eede8bb2c0571ffdced","observation_id":"870c9a74-f40e-49a1-9c22-ed6a18ee34e7","resolution":{"observed_at":"2026-08-01T01:19:05.247643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:19:05.326053Z","title":"Silero vad: Pre-trained enterprise-grade voice activity detector (vad) models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25870","last_updated":"2026-07-28T15:37:44Z","snapshot_observed_at":"2026-08-06T06:44:04.480037Z","submitted_at":"2026-07-28T15:37:44Z","title":"VAD to the Bone: Ultra-Tiny Speech Activity Detection for Edge Deployment","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T01:19:05.326053Z"},"links":{"citing_paper":"/paper/2607.25870"},"observation_digest":"sha256:a4136b2418b54debfded8dc269941a3ea0a347a314d660e55f0a3799d1f94ef2","observation_id":"d3c694d5-a059-4985-ad08-cfcc9b5ed281","resolution":{"observed_at":"2026-08-01T01:19:05.326053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:19:05.362958Z","title":"An efficient transformer-based model for voice activity detection,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.25870","last_updated":"2026-07-28T15:37:44Z","snapshot_observed_at":"2026-08-06T06:44:04.480037Z","submitted_at":"2026-07-28T15:37:44Z","title":"VAD to the Bone: Ultra-Tiny Speech Activity Detection for Edge Deployment","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T01:19:05.362958Z"},"links":{"citing_paper":"/paper/2607.25870"},"observation_digest":"sha256:342d599db5aa6811cbb7dd6b42687acf468b249afe3b4c06c2c75640eab73bf5","observation_id":"adc9ae45-5614-4d0c-83f6-fbb4f3981b99","resolution":{"observed_at":"2026-08-01T01:19:05.362958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:19:05.432006Z","title":"A transformer-based voice activity detector,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25870","last_updated":"2026-07-28T15:37:44Z","snapshot_observed_at":"2026-08-06T06:44:04.480037Z","submitted_at":"2026-07-28T15:37:44Z","title":"VAD to the Bone: Ultra-Tiny Speech Activity Detection for Edge Deployment","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T01:19:05.432006Z"},"links":{"citing_paper":"/paper/2607.25870"},"observation_digest":"sha256:0e2d337e31e0112af07a94bbd7d914a1e85acc71d6b230d8a265e961c1907d3b","observation_id":"f5dcda2a-a1a7-40c4-b5aa-235d66df7d8f","resolution":{"observed_at":"2026-08-01T01:19:05.432006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:19:05.519817Z","title":"Pyannote.audio: Neural building blocks for speaker diarization,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.25870","last_updated":"2026-07-28T15:37:44Z","snapshot_observed_at":"2026-08-06T06:44:04.480037Z","submitted_at":"2026-07-28T15:37:44Z","title":"VAD to the Bone: Ultra-Tiny Speech Activity Detection for Edge Deployment","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T01:19:05.519817Z"},"links":{"citing_paper":"/paper/2607.25870"},"observation_digest":"sha256:bf58ceff18df58df8fc688b3c9e6f49b78e85b9a3d5dc1b21e5783ad7fa94d5d","observation_id":"f5ecfa70-1445-4edf-81ea-70e32e580aa6","resolution":{"observed_at":"2026-08-01T01:19:05.519817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.13886","last_updated":"2021-02-11T19:53:58Z","snapshot_observed_at":"2026-08-05T16:46:31.718115Z","submitted_at":"2020-10-26T20:26:05Z","title":"MarbleNet: Deep 1D Time-Channel Separable Convolutional Neural Network for Voice Activity Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.13886","snapshot_observed_at":"2026-08-01T01:19:05.613475Z","title":"Marblenet: Deep 1d time-channel separable convolutional neural network for voice activity detection,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.25870","last_updated":"2026-07-28T15:37:44Z","snapshot_observed_at":"2026-08-06T06:44:04.480037Z","submitted_at":"2026-07-28T15:37:44Z","title":"VAD to the Bone: Ultra-Tiny Speech Activity Detection for Edge Deployment","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T01:19:05.613475Z"},"links":{"cited_paper":"/paper/2010.13886","citing_paper":"/paper/2607.25870"},"observation_digest":"sha256:06060a6090ab0e712320b8c8baf8382a773be8d6117cd6adf54b928037b10dec","observation_id":"57f57a91-9e9f-49ad-8069-a1a5303c80ad","resolution":{"observed_at":"2026-08-01T01:19:05.613475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:19:05.704156Z","title":"Small-footprint convolutional neural net- work with reduced feature map for voice activity detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25870","last_updated":"2026-07-28T15:37:44Z","snapshot_observed_at":"2026-08-06T06:44:04.480037Z","submitted_at":"2026-07-28T15:37:44Z","title":"VAD to the Bone: Ultra-Tiny Speech Activity Detection for Edge Deployment","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T01:19:05.704156Z"},"links":{"citing_paper":"/paper/2607.25870"},"observation_digest":"sha256:1f98e5105589e251b494fce78d50bda23767649b0f91915faba3c02242e1c078","observation_id":"3a491a2a-ffcc-4663-bb42-e8a492127794","resolution":{"observed_at":"2026-08-01T01:19:05.704156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20885","last_updated":"2025-08-28T15:14:39Z","snapshot_observed_at":"2026-08-05T14:49:40.095904Z","submitted_at":"2025-08-28T15:14:39Z","title":"SincQDR-VAD: A Noise-Robust Voice Activity Detection Framework Leveraging Learnable Filters and Ranking-Aware Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.20885","snapshot_observed_at":"2026-08-01T01:19:05.797308Z","title":"Sincqdr-vad: A noise-robust voice activity de- tection framework leveraging learnable filters and ranking-aware optimization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25870","last_updated":"2026-07-28T15:37:44Z","snapshot_observed_at":"2026-08-06T06:44:04.480037Z","submitted_at":"2026-07-28T15:37:44Z","title":"VAD to the Bone: Ultra-Tiny Speech Activity Detection for Edge Deployment","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T01:19:05.797308Z"},"links":{"cited_paper":"/paper/2508.20885","citing_paper":"/paper/2607.25870"},"observation_digest":"sha256:cb598f1fd055d1198813a926bfca77b4cf652c43a7794602bc3d947d86fc163f","observation_id":"7c7f35f5-a180-49c6-b2d6-56f0dccd8a09","resolution":{"observed_at":"2026-08-01T01:19:05.797308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:19:05.886107Z","title":"Resectnet: An efficient architecture for voice activity detection on mobile devices,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.25870","last_updated":"2026-07-28T15:37:44Z","snapshot_observed_at":"2026-08-06T06:44:04.480037Z","submitted_at":"2026-07-28T15:37:44Z","title":"VAD to the Bone: Ultra-Tiny Speech Activity Detection for Edge Deployment","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T01:19:05.886107Z"},"links":{"citing_paper":"/paper/2607.25870"},"observation_digest":"sha256:83b1fa420a89f9a15adf053f9ba3ce05a38dea6d299457bd2707a448a2950013","observation_id":"dd3bcae0-358f-447c-9513-c0fd302b6e01","resolution":{"observed_at":"2026-08-01T01:19:05.886107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:19:05.974392Z","title":"Sg-vad: Stochastic gates based speech activity detection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25870","last_updated":"2026-07-28T15:37:44Z","snapshot_observed_at":"2026-08-06T06:44:04.480037Z","submitted_at":"2026-07-28T15:37:44Z","title":"VAD to the Bone: Ultra-Tiny Speech Activity Detection for Edge Deployment","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T01:19:05.974392Z"},"links":{"citing_paper":"/paper/2607.25870"},"observation_digest":"sha256:b33a7991b53b6cd5d84cc61571145c9b094f7d98be503e989811d2b6515668fe","observation_id":"51283cda-7ded-41e8-85c4-acd46b7fd791","resolution":{"observed_at":"2026-08-01T01:19:05.974392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:19:06.047231Z","title":"Atomicvad: A tiny voice activity detection model for efficient inference in intelligent iot systems,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25870","last_updated":"2026-07-28T15:37:44Z","snapshot_observed_at":"2026-08-06T06:44:04.480037Z","submitted_at":"2026-07-28T15:37:44Z","title":"VAD to the Bone: Ultra-Tiny Speech Activity Detection for Edge Deployment","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T01:19:06.047231Z"},"links":{"citing_paper":"/paper/2607.25870"},"observation_digest":"sha256:471a6cf8ab755f571194d72d25d5a8df38b6d0dfb9cb07a5dac6e3c445b3ead3","observation_id":"433d4af2-ebda-4602-a0db-b42d8b1d2399","resolution":{"observed_at":"2026-08-01T01:19:06.047231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:19:06.159892Z","title":"A V A-Speech: A Densely Labeled Dataset of Speech Activity in Movies,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.25870","last_updated":"2026-07-28T15:37:44Z","snapshot_observed_at":"2026-08-06T06:44:04.480037Z","submitted_at":"2026-07-28T15:37:44Z","title":"VAD to the Bone: Ultra-Tiny Speech Activity Detection for Edge Deployment","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T01:19:06.159892Z"},"links":{"citing_paper":"/paper/2607.25870"},"observation_digest":"sha256:85b00656a7d259ce0d8a8e0a7ca70233a99ed0a55c8918679dd0410d11003f4f","observation_id":"7dcde86f-1243-4f9c-b643-7b7003469579","resolution":{"observed_at":"2026-08-01T01:19:06.159892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:19:06.192842Z","title":"Accurate and structured pruning for effi- cient automatic speech recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25870","last_updated":"2026-07-28T15:37:44Z","snapshot_observed_at":"2026-08-06T06:44:04.480037Z","submitted_at":"2026-07-28T15:37:44Z","title":"VAD to the Bone: Ultra-Tiny Speech Activity Detection for Edge Deployment","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T01:19:06.192842Z"},"links":{"citing_paper":"/paper/2607.25870"},"observation_digest":"sha256:02803f45244d0f61a4c68317e057e40fd0207f392f8f4cbadf54dff7435eaa8f","observation_id":"d1f71768-80ff-4cac-b0c8-0d9003e03078","resolution":{"observed_at":"2026-08-01T01:19:06.192842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:19:06.280806Z","title":"Quantization aware training with absolute-cosine regularization for automatic speech recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.25870","last_updated":"2026-07-28T15:37:44Z","snapshot_observed_at":"2026-08-06T06:44:04.480037Z","submitted_at":"2026-07-28T15:37:44Z","title":"VAD to the Bone: Ultra-Tiny Speech Activity Detection for Edge Deployment","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T01:19:06.280806Z"},"links":{"citing_paper":"/paper/2607.25870"},"observation_digest":"sha256:c5f20fdfa33e5aca775e0d9ad8a58bc33f0ff7d6b6127a63859e51002ae1c0e6","observation_id":"7fd8c8a4-651e-4553-a0d6-2cd489bbdf1d","resolution":{"observed_at":"2026-08-01T01:19:06.280806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:19:06.359191Z","title":"Tempo- ral properties of spontaneous speech—a syllable-centric perspec- tive,","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2607.25870","last_updated":"2026-07-28T15:37:44Z","snapshot_observed_at":"2026-08-06T06:44:04.480037Z","submitted_at":"2026-07-28T15:37:44Z","title":"VAD to the Bone: Ultra-Tiny Speech Activity Detection for Edge Deployment","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T01:19:06.359191Z"},"links":{"citing_paper":"/paper/2607.25870"},"observation_digest":"sha256:84df91c4feaddfd419ef77ef5f91e8a696bb95fa2aeb80fe3819fdf80067233a","observation_id":"b3b69b04-ab63-491a-a0cc-f5af4d5bbf07","resolution":{"observed_at":"2026-08-01T01:19:06.359191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:19:06.385016Z","title":"Depgraph: Towards any structural pruning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25870","last_updated":"2026-07-28T15:37:44Z","snapshot_observed_at":"2026-08-06T06:44:04.480037Z","submitted_at":"2026-07-28T15:37:44Z","title":"VAD to the Bone: Ultra-Tiny Speech Activity Detection for Edge Deployment","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T01:19:06.385016Z"},"links":{"citing_paper":"/paper/2607.25870"},"observation_digest":"sha256:e3243d86a483efef6e38e99a090cec8d0b064a8067922142ec57e6fda77ed07c","observation_id":"4cb6af76-88d4-4fda-b08b-43f29469ee81","resolution":{"observed_at":"2026-08-01T01:19:06.385016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:19:06.445064Z","title":"Optuna: A next-generation hyperparameter optimization framework,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.25870","last_updated":"2026-07-28T15:37:44Z","snapshot_observed_at":"2026-08-06T06:44:04.480037Z","submitted_at":"2026-07-28T15:37:44Z","title":"VAD to the Bone: Ultra-Tiny Speech Activity Detection for Edge Deployment","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T01:19:06.445064Z"},"links":{"citing_paper":"/paper/2607.25870"},"observation_digest":"sha256:45c76836924e66d2ecc6ab7907b317883ae87b1643f1e789cfa3aecc9c5d5a9f","observation_id":"4f3acb91-0c43-487c-ba1d-3415ef43316a","resolution":{"observed_at":"2026-08-01T01:19:06.445064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.07199","last_updated":"2017-05-19T21:33:00Z","snapshot_observed_at":"2026-07-06T05:43:27.961693Z","submitted_at":"2017-05-19T21:33:00Z","title":"The High-Dimensional Geometry of Binary Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.07199","snapshot_observed_at":"2026-08-01T01:19:06.588783Z","title":"The high-dimensional geome- try of binary neural networks,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.25870","last_updated":"2026-07-28T15:37:44Z","snapshot_observed_at":"2026-08-06T06:44:04.480037Z","submitted_at":"2026-07-28T15:37:44Z","title":"VAD to the Bone: Ultra-Tiny Speech Activity Detection for Edge Deployment","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T01:19:06.588783Z"},"links":{"cited_paper":"/paper/1705.07199","citing_paper":"/paper/2607.25870"},"observation_digest":"sha256:9e534e69b5591356ea5a2292d03c7532dbceb1de434eb8623c38c5299c9789dc","observation_id":"5b2888f4-704f-4233-893b-9da5b7ee8046","resolution":{"observed_at":"2026-08-01T01:19:06.588783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:19:06.698932Z","title":"Neural networks weights quantization: Target none-retraining ternary (tnt),","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.25870","last_updated":"2026-07-28T15:37:44Z","snapshot_observed_at":"2026-08-06T06:44:04.480037Z","submitted_at":"2026-07-28T15:37:44Z","title":"VAD to the Bone: Ultra-Tiny Speech Activity Detection for Edge Deployment","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T01:19:06.698932Z"},"links":{"citing_paper":"/paper/2607.25870"},"observation_digest":"sha256:79c69b64b435cfbd07982307a2417ebc8098d4bbeb12f73084397f5cf6b04e11","observation_id":"931f7e47-e850-4d08-99d7-410e4f29b9ec","resolution":{"observed_at":"2026-08-01T01:19:06.698932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:19:06.759342Z","title":"Feature affinity assisted knowledge distillation and quantization of deep neural networks on label-free data,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25870","last_updated":"2026-07-28T15:37:44Z","snapshot_observed_at":"2026-08-06T06:44:04.480037Z","submitted_at":"2026-07-28T15:37:44Z","title":"VAD to the Bone: Ultra-Tiny Speech Activity Detection for Edge Deployment","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T01:19:06.759342Z"},"links":{"citing_paper":"/paper/2607.25870"},"observation_digest":"sha256:eb198c7de9a7f1a56b3768d1bd623e0fb6cd3a46d0716fb578d715af458735c4","observation_id":"01fb534e-7bc5-4e4e-bdbd-79dc90948fab","resolution":{"observed_at":"2026-08-01T01:19:06.759342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:19:06.863846Z","title":"Sphereface: Deep hypersphere embedding for face recognition,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.25870","last_updated":"2026-07-28T15:37:44Z","snapshot_observed_at":"2026-08-06T06:44:04.480037Z","submitted_at":"2026-07-28T15:37:44Z","title":"VAD to the Bone: Ultra-Tiny Speech Activity Detection for Edge Deployment","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T01:19:06.863846Z"},"links":{"citing_paper":"/paper/2607.25870"},"observation_digest":"sha256:5c9e3462281a329e7f4947baeb2e7f746a7d15c6b0a4241bf49a5c65e944f2d8","observation_id":"679292bf-e639-4128-8b10-dc653249c1a5","resolution":{"observed_at":"2026-08-01T01:19:06.863846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:19:06.922461Z","title":"Cosface: Large margin cosine loss for deep face recog- nition,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.25870","last_updated":"2026-07-28T15:37:44Z","snapshot_observed_at":"2026-08-06T06:44:04.480037Z","submitted_at":"2026-07-28T15:37:44Z","title":"VAD to the Bone: Ultra-Tiny Speech Activity Detection for Edge Deployment","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T01:19:06.922461Z"},"links":{"citing_paper":"/paper/2607.25870"},"observation_digest":"sha256:7e464a0fd88e097c8f69ee7fd4d66a4c1d2fe723441a624abcef20a2151b084a","observation_id":"117a609b-a7a5-4df8-b02e-14bde2024766","resolution":{"observed_at":"2026-08-01T01:19:06.922461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:19:06.987127Z","title":"Arcface: Additive angular margin loss for deep face recognition,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.25870","last_updated":"2026-07-28T15:37:44Z","snapshot_observed_at":"2026-08-06T06:44:04.480037Z","submitted_at":"2026-07-28T15:37:44Z","title":"VAD to the Bone: Ultra-Tiny Speech Activity Detection for Edge Deployment","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T01:19:06.987127Z"},"links":{"citing_paper":"/paper/2607.25870"},"observation_digest":"sha256:f0904ec2c5e9344efa3ce38d1c30ffef1c75b823ff25d1eeadec279ceb114785","observation_id":"7b708316-ada2-468c-8e2a-e015183a735f","resolution":{"observed_at":"2026-08-01T01:19:06.987127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:19:07.049523Z","title":"Soft-to-hard vector quanti- zation for end-to-end learning compressible representations,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.25870","last_updated":"2026-07-28T15:37:44Z","snapshot_observed_at":"2026-08-06T06:44:04.480037Z","submitted_at":"2026-07-28T15:37:44Z","title":"VAD to the Bone: Ultra-Tiny Speech Activity Detection for Edge Deployment","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T01:19:07.049523Z"},"links":{"citing_paper":"/paper/2607.25870"},"observation_digest":"sha256:0de51b135115fff5aec6bc12ab1e503528a3bc6e12bd366993a92406b26d82c5","observation_id":"3281dbd3-71fb-43a1-bc3e-7978dbb0bc98","resolution":{"observed_at":"2026-08-01T01:19:07.049523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:19:07.150042Z","title":"Quantized neural networks: Training neural networks with low precision weights and activations,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.25870","last_updated":"2026-07-28T15:37:44Z","snapshot_observed_at":"2026-08-06T06:44:04.480037Z","submitted_at":"2026-07-28T15:37:44Z","title":"VAD to the Bone: Ultra-Tiny Speech Activity Detection for Edge Deployment","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T01:19:07.150042Z"},"links":{"citing_paper":"/paper/2607.25870"},"observation_digest":"sha256:d255c67d741563400f3e84abc7ad3c2479e94545fb6b766b47b80c3913dba7d9","observation_id":"6eaf9ea5-6d11-41e6-933e-f34c70e67f6a","resolution":{"observed_at":"2026-08-01T01:19:07.150042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:19:07.260808Z","title":"Lib- rispeech: an asr corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.25870","last_updated":"2026-07-28T15:37:44Z","snapshot_observed_at":"2026-08-06T06:44:04.480037Z","submitted_at":"2026-07-28T15:37:44Z","title":"VAD to the Bone: Ultra-Tiny Speech Activity Detection for Edge Deployment","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T01:19:07.260808Z"},"links":{"citing_paper":"/paper/2607.25870"},"observation_digest":"sha256:8626519bba38b83d9fc432cd73c699d3e421d56795610d22dd719e657b23a052","observation_id":"02f4be56-3cf5-46dc-87d5-e6ab16c5079c","resolution":{"observed_at":"2026-08-01T01:19:07.260808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:19:07.374942Z","title":"Simulating wind noise with airflow speed-dependent characteristics,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.25870","last_updated":"2026-07-28T15:37:44Z","snapshot_observed_at":"2026-08-06T06:44:04.480037Z","submitted_at":"2026-07-28T15:37:44Z","title":"VAD to the Bone: Ultra-Tiny Speech Activity Detection for Edge Deployment","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T01:19:07.374942Z"},"links":{"citing_paper":"/paper/2607.25870"},"observation_digest":"sha256:dd45e0d28b6e08f0f82c8b760738d01c414c75027a01f4ee11ec607825167aed","observation_id":"3edd41a5-84c8-4c5c-a35d-86ad89ab6338","resolution":{"observed_at":"2026-08-01T01:19:07.374942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:19:07.488612Z","title":"The interspeech 2020 deep noise suppression challenge: Datasets, subjective testing framework, and challenge results,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.25870","last_updated":"2026-07-28T15:37:44Z","snapshot_observed_at":"2026-08-06T06:44:04.480037Z","submitted_at":"2026-07-28T15:37:44Z","title":"VAD to the Bone: Ultra-Tiny Speech Activity Detection for Edge Deployment","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T01:19:07.488612Z"},"links":{"citing_paper":"/paper/2607.25870"},"observation_digest":"sha256:0b580c828e73856e97aeb7fd5231ce0be3485d20489ab58deff6a8ea6f6a7d17","observation_id":"5d50d093-3880-4a6b-a84f-8c0c6942f927","resolution":{"observed_at":"2026-08-01T01:19:07.488612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:19:07.548728Z","title":"Montreal Forced Aligner: Trainable Text-Speech Alignment Using Kaldi,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.25870","last_updated":"2026-07-28T15:37:44Z","snapshot_observed_at":"2026-08-06T06:44:04.480037Z","submitted_at":"2026-07-28T15:37:44Z","title":"VAD to the Bone: Ultra-Tiny Speech Activity Detection for Edge Deployment","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T01:19:07.548728Z"},"links":{"citing_paper":"/paper/2607.25870"},"observation_digest":"sha256:4b26f1bb371627eb782681c9c4165997aa8bc2825aeba414eaa3be833f780587","observation_id":"10298c1a-6990-4f45-9322-eed0a0c72857","resolution":{"observed_at":"2026-08-01T01:19:07.548728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.03670","last_updated":"2019-07-25T17:56:23Z","snapshot_observed_at":"2026-07-06T07:44:28.011439Z","submitted_at":"2019-04-07T15:24:32Z","title":"Speech Model Pre-training for End-to-End Spoken Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.03670","snapshot_observed_at":"2026-08-01T01:19:07.656877Z","title":"Speech model pre-training for end-to-end spoken language understanding,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.25870","last_updated":"2026-07-28T15:37:44Z","snapshot_observed_at":"2026-08-06T06:44:04.480037Z","submitted_at":"2026-07-28T15:37:44Z","title":"VAD to the Bone: Ultra-Tiny Speech Activity Detection for Edge Deployment","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T01:19:07.656877Z"},"links":{"cited_paper":"/paper/1904.03670","citing_paper":"/paper/2607.25870"},"observation_digest":"sha256:d08c92b16c27c49e32e553cf103ac9adb4185a8ef695f81e53259d163b020e4e","observation_id":"c69cc7ce-597c-4dab-8348-63faafe4144f","resolution":{"observed_at":"2026-08-01T01:19:07.656877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.25870","last_updated":"2026-07-28T15:37:44Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-06T06:44:04.480037Z","submitted_at":"2026-07-28T15:37:44Z","title":"VAD to the Bone: Ultra-Tiny Speech Activity Detection for Edge Deployment"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 1 inbound Pith citation observation for arXiv:2607.25870."}