{"as_of":"2026-08-08T09:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3562a8189193d3b4012e7cac5fd5debdff28357d31cbed2543a16eec2c8807ad","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:51:11.832886Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:51:09.479147Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T11:51:12.675415Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-07T11:41:26.339964Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"cited_work":{"arxiv_id":"2506.01365","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.01365","snapshot_observed_at":"2026-08-07T11:51:12.675415Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","venue":"cs.SD","work_id":"2639f9a8-95c0-4fe1-ae4d-106424684ed2","year":2025},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-07T11:41:26.339964Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:09.479147Z"},"links":{"cited_paper":"/paper/2506.01365","citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:12348be450bf42b1919e78d94af278c1c224715fe50c3d2d6b2cb30df4c625c2","observation_id":"939a4c94-c33e-41bb-a9eb-1d76b740d270","resolution":{"observed_at":"2026-08-07T11:51:12.791241Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.01365/citation-record","integrity":"/paper/2506.01365/integrity","json":"/paper/2506.01365/citation-record.json","paper":"/paper/2506.01365"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:16.264630Z","title":null,"venue":null,"work_id":"7c98ac5b-c418-4755-b73a-fe2b08c75358","year":null},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-07T11:41:26.339964Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:09.419307Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:045006b1ea7a276a55392b2ecc2087214db75d21ad243c6789fc9cc8258df656","observation_id":"ef798b6f-3a92-45cd-b13b-cb6e7ab9bd21","resolution":{"observed_at":"2026-08-07T11:51:16.275042Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-07T11:41:26.339964Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"cited_work":{"arxiv_id":"2506.01365","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.01365","snapshot_observed_at":"2026-08-07T11:51:12.675415Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","venue":"cs.SD","work_id":"2639f9a8-95c0-4fe1-ae4d-106424684ed2","year":2025},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-07T11:41:26.339964Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:09.479147Z"},"links":{"cited_paper":"/paper/2506.01365","citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:12348be450bf42b1919e78d94af278c1c224715fe50c3d2d6b2cb30df4c625c2","observation_id":"939a4c94-c33e-41bb-a9eb-1d76b740d270","resolution":{"observed_at":"2026-08-07T11:51:12.791241Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:16.238469Z","title":null,"venue":null,"work_id":"0f5834b1-e2ff-4a1b-8d3b-6d806c974323","year":null},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-07T11:41:26.339964Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:09.538212Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:b7275432d279b0e7a2e55a6fc814b7b9e28a7b5ecec741a50582c8160d4c6ccc","observation_id":"7d51e26a-34d5-40f0-8512-f376cac3e2b3","resolution":{"observed_at":"2026-08-07T11:51:16.248660Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:16.212049Z","title":null,"venue":null,"work_id":"0516af04-6340-42a3-9134-c222bad5fbb4","year":null},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-07T11:41:26.339964Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:09.594732Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:16f047b16d464a487e0fed52a99478ef9bac006f63a9948395898954e93b5600","observation_id":"37bfde91-3d9f-43eb-8622-27d6fb12c8ff","resolution":{"observed_at":"2026-08-07T11:51:16.220498Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:16.179005Z","title":null,"venue":null,"work_id":"7c4aa655-129a-4d48-ab17-bfe9e72afb30","year":null},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-07T11:41:26.339964Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:09.640441Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:f4e72955557897d9ef070233fd7f528e993c1bc4609f4b213cf9f7b3a6bae8f1","observation_id":"12d97d49-01a5-4d69-842c-ece9c0f60556","resolution":{"observed_at":"2026-08-07T11:51:16.192287Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:16.153903Z","title":"MFCC vs PTM Features Pre-trained model based features have proven effective for various speech tasks, including V AD","venue":null,"work_id":"6adfd1ea-b3c7-4483-8e0a-5db19396da1f","year":null},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-07T11:41:26.339964Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:09.706274Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:3a7464fe6614a870ccf2ba2751e4f28e953ddbf0c6fc0cfabb70ba8c0c8d5381","observation_id":"833c88b7-5636-4adb-96dd-659c7764811d","resolution":{"observed_at":"2026-08-07T11:51:16.162184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:16.056340Z","title":"Dataset and Evaluation Metrics We conducted all our experiments on three publicly available datasets, i.e., AMI, Callhome, and V oxConverse, to ensure do- main diversity","venue":null,"work_id":"12f8c1ce-829f-4e4a-93f2-126b445a5d50","year":null},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-07T11:41:26.339964Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:09.750716Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:709bf8f57dc2df8c872fb7fc22e131f4642e5284c8ed49a81c33c0e591237427","observation_id":"49fb3993-86dd-45c4-a184-64e4fb714be2","resolution":{"observed_at":"2026-08-07T11:51:16.136028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:14.788261Z","title":"A survey of convo- lutional neural networks: analysis, applications, and prospects,","venue":null,"work_id":"9b634fb0-6297-4cae-b7f1-8a18bc45d81c","year":2021},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-07T11:41:26.339964Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:10.213444Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:07c3e06075d4ae528e0febc4765149578f60293e464da09284f8c44a8c655688","observation_id":"3ef24849-27fb-4d4d-8e30-9ecf004c37ac","resolution":{"observed_at":"2026-08-07T11:51:14.879696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:15.718276Z","title":"MFCC vs PTM Features First 3 columns in Table 1 shows the performance of V AD with individual features in terms of DER, FAR and MR","venue":null,"work_id":"806b11e6-6b72-4caa-bb94-f1f2e9c93f15","year":null},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-07T11:41:26.339964Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:09.860129Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:9a4a464fdad54e8f0e456879e2935e54dfea79fa8b45a6112702b4cebbffef42","observation_id":"d398ae63-8724-4b6a-9f6b-eb80523e5a3e","resolution":{"observed_at":"2026-08-07T11:51:15.789229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:15.586020Z","title":"Our experiments show that simple fusion methods like addition and concatenation consistently outperform the more complex cross-attention mechanism","venue":null,"work_id":"20e16a87-c4c5-4422-a30b-0d86b07cd388","year":null},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-07T11:41:26.339964Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:09.900221Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:157ca3a1d3a421296ca5aecdfa9cd8682eccf0acc367829dfa5827d70807220f","observation_id":"eec9b035-31f0-4487-b22d-453ef6f20906","resolution":{"observed_at":"2026-08-07T11:51:15.646275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:15.559931Z","title":"Temporal modeling using di- lated convolution and gating for voice-activity-detection,","venue":null,"work_id":"ca9ada6b-fa05-4e4b-9a35-142ec2b1e445","year":2018},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-07T11:41:26.339964Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:09.938166Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:dabb9e230fb716ef52a798d4d3973be0a10a10ed13b4516a1c3b082cef74aa83","observation_id":"b7cf4512-d6fe-4bc2-90b6-bc82a25d59b4","resolution":{"observed_at":"2026-08-07T11:51:15.569898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:15.411025Z","title":"Wavoice: An mmwave-assisted noise-resistant speech recogni- tion system,","venue":null,"work_id":"8aae9364-59a4-42d3-b2f3-72007ebacfd4","year":2024},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-07T11:41:26.339964Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:09.973317Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:01e5127fbb5462632b720f2f29a9edc59ab4c9764d2a726a775c70b2b197f7a5","observation_id":"fd8a25d1-d16d-4e32-bb0e-4e3e79db3956","resolution":{"observed_at":"2026-08-07T11:51:15.488071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:15.261457Z","title":"Profile-error-tolerant target-speaker voice activity detection,","venue":null,"work_id":"ff4101af-0712-4644-8a51-500c73b2424c","year":2024},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-07T11:41:26.339964Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:10.016834Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:23040a39ed021be18998670d1d332e1d0b1d21269b3af0d99878f9e29236bf8d","observation_id":"8222dd9d-4393-4bb4-a8cb-5ce5f7d8b7f2","resolution":{"observed_at":"2026-08-07T11:51:15.321383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09142","last_updated":"2024-05-15T07:13:24Z","snapshot_observed_at":"2026-07-06T18:14:33.618470Z","submitted_at":"2024-05-15T07:13:24Z","title":"Speaker Embeddings With Weakly Supervised Voice Activity Detection For Efficient Speaker Diarization","version":1},"cited_work":{"arxiv_id":"2405.09142","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.09142","snapshot_observed_at":"2026-08-07T11:51:12.440616Z","title":"Speaker Embeddings With Weakly Supervised Voice Activity Detection For Efficient Speaker Diarization","venue":"eess.AS","work_id":"8639a631-897f-4211-aec6-09ec35603df3","year":2024},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-07T11:41:26.339964Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:10.058899Z"},"links":{"cited_paper":"/paper/2405.09142","citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:5b5be56b1c72191b3e0a0087566239ab86baaa7d6fb4060dc00172444fab42a8","observation_id":"679a867e-043f-416a-8b01-a477f1d0aee5","resolution":{"observed_at":"2026-08-07T11:51:12.535791Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:15.111769Z","title":"Unveiling the state-of-the-art: A com- prehensive survey on voice activity detection techniques,","venue":null,"work_id":"c61cbebb-f801-41e9-91d9-ca70221a120d","year":2024},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-07T11:41:26.339964Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:10.100937Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:eeb9ad352bbabea5c0db0b210eb588b71e0a5df5e49e66d1091d630b4cf11d90","observation_id":"e10244b7-7dfe-4a9b-b0ec-2a8203743f11","resolution":{"observed_at":"2026-08-07T11:51:15.185183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:14.995993Z","title":"V oice activity detection: Fusion of time and frequency domain features with a svm classifier,","venue":null,"work_id":"226d54c2-17c6-4113-a30b-23e304eba749","year":2022},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-07T11:41:26.339964Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:10.141767Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:ad011c0d7c70d5ee106eff81bcd76612aa0b4e81ac35764a8adaca924d063c44","observation_id":"783b5cb6-c1da-48ec-9972-8751fff5b9c9","resolution":{"observed_at":"2026-08-07T11:51:15.036588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:14.969370Z","title":"Analy- sis of derivative of instantaneous frequency and its application to voice activity detection,","venue":null,"work_id":"d0e44f00-ce3b-4211-b55f-78b0ff09a8f7","year":2021},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-07T11:41:26.339964Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:10.179305Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:a9b2c468cb888b5b4078cc1b9332f8d0222783ce9c9f21a52262f7ba3400933c","observation_id":"5cc4d5a4-f4aa-4fa3-be5d-d4802a5ec1f3","resolution":{"observed_at":"2026-08-07T11:51:14.979766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:10.788432Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-07T11:41:26.339964Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:10.788432Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:c6322293ff17747e2d104bff295c8787619a93e05bc69eb63442aeb78730312a","observation_id":"65f42d73-cb2d-4211-8c63-256f6bbaf333","resolution":{"observed_at":"2026-08-07T11:51:10.788432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:14.760352Z","title":"A review of recurrent neural networks: Lstm cells and network architectures,","venue":null,"work_id":"76be627c-e57f-4d89-83c6-8b5342d72186","year":2019},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-07T11:41:26.339964Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:10.265665Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:22687e83c98bbf56c9342de1942204156f2215d2d70cc5054b3661996e2613c5","observation_id":"f763f485-49cf-42f7-932f-47987f604b98","resolution":{"observed_at":"2026-08-07T11:51:14.767898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:14.621488Z","title":"A hybrid cnn-bilstm voice activity detector,","venue":null,"work_id":"d932f61e-0192-4d86-ae04-3ea7c7133b3f","year":2021},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-07T11:41:26.339964Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:10.304986Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:c99cfbc963b782251f43c0840d1454a31a94ea3dfe66b009cfec4bab8f2a16df","observation_id":"4266d00f-cbff-4121-94cd-08e422b1343e","resolution":{"observed_at":"2026-08-07T11:51:14.698211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:14.417481Z","title":"Feature learn- ing with raw-waveform cldnns for voice activity detection","venue":null,"work_id":"3880dc86-76a7-4158-b84b-bccabbe2a549","year":2016},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-07T11:41:26.339964Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:10.357047Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:71c0c95be3a45cc6699ff64fa512d2b135fa026839e58597a98d8ef214a37299","observation_id":"aa3820dd-fd68-4e94-998e-3ed5b946acf6","resolution":{"observed_at":"2026-08-07T11:51:14.505567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:10.407683Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech repre- sentations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-07T11:41:26.339964Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:10.407683Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:dc02b3492da9e793f39c716fa3aac433995f45049ed1f30df26d8c7941991074","observation_id":"e16e1dc1-7fb9-485b-80d5-66fac811bdc7","resolution":{"observed_at":"2026-08-07T11:51:10.407683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:10.456958Z","title":"Hubert: Self-supervised speech represen- tation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-07T11:41:26.339964Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:10.456958Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:d701c505da44ad8dbf62b5691fc07bd6fbf22473cd7fac7e809ea0357a39f3e5","observation_id":"867f4b01-b5f4-4431-988b-1c5c344019ba","resolution":{"observed_at":"2026-08-07T11:51:10.456958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:10.503910Z","title":"Wavlm: Large-scale self- supervised pre-training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-07T11:41:26.339964Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:10.503910Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:331f6e4ddf4b3727d2f0486437dbfd090c57bea8e53aaf90527b4cb895df4252","observation_id":"2bec1e50-8035-4bad-a19a-a50b21c65200","resolution":{"observed_at":"2026-08-07T11:51:10.503910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:14.246861Z","title":"A closer look at wav2vec2 embeddings for on-device single-channel speech en- hancement,","venue":null,"work_id":"18b338e3-0bee-414f-9631-d8ba05ec24c2","year":2024},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-07T11:41:26.339964Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:10.585637Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:2b048cb074d74b76d0c5d3c25d0504e90bc9f7dd40b8f33dc0b3057ed34100bd","observation_id":"e161ca1d-c447-43eb-a71c-267d0ee7f257","resolution":{"observed_at":"2026-08-07T11:51:14.316717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:14.166524Z","title":"Unispeech-sat: Universal speech rep- resentation learning with speaker aware pre-training,","venue":null,"work_id":"9bc08425-a53a-473c-a3b3-aace98db4be3","year":2022},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-07T11:41:26.339964Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:10.643292Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:72ba9224b2af8e1076e0a59c9bbc64ea6b665a12b64a6137f88f6e9048e43c8f","observation_id":"13345372-e7a2-4b62-a873-1fdfa45bfc5e","resolution":{"observed_at":"2026-08-07T11:51:14.190460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:10.710355Z","title":"Scaling speech technology to 1,000+ languages,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-07T11:41:26.339964Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:10.710355Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:1b5433cea65a431d664ad48858e3a5effe45607c6946690b5c33a31bb3abe5ba","observation_id":"775471c7-0d58-4ada-adc7-fc7114dd8980","resolution":{"observed_at":"2026-08-07T11:51:10.710355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.01216","last_updated":"2021-08-15T04:01:36Z","snapshot_observed_at":"2026-08-08T09:12:33.976519Z","submitted_at":"2020-07-02T15:55:54Z","title":"Spot the conversation: speaker diarisation in the wild","version":3},"cited_work":{"arxiv_id":"2007.01216","doi":null,"metadata_source":"pith","pith_arxiv_id":"2007.01216","snapshot_observed_at":"2026-08-07T11:51:11.943564Z","title":"Spot the conversation: speaker diarisation in the wild","venue":"cs.SD","work_id":"89acf94a-ad21-4289-a608-3c41e6896ea6","year":2020},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-07T11:41:26.339964Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:11.586294Z"},"links":{"cited_paper":"/paper/2007.01216","citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:9d21d5a666e91ac0e2c5963d59a987971b366fbb35eb34c9b7319dbdf555a790","observation_id":"b353c641-69c0-46cc-baa6-6a632f777a94","resolution":{"observed_at":"2026-08-07T11:51:12.046250Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:15.890857Z","title":"Base version checkpoints are considered for wav2vec 2.01, Hu- 1https://huggingface.co/facebook/ wav2vec2-base BERT2, WavLM3, UniSpeech 4and Whisper5","venue":null,"work_id":"7ef3bf75-2285-44c9-be60-bd904ea886ca","year":null},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-07T11:41:26.339964Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:09.817109Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:af02859c338b89990898a8441842ead8fc160ee9c9632c5ff916f937a13ae0dd","observation_id":"70e2a298-5d4d-4288-8bcd-cfa4935a237b","resolution":{"observed_at":"2026-08-07T11:51:15.960782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:10.873019Z","title":"Enhancing whisper’s accu- racy and speed for indian languages through prompt-tuning and tokenization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-07T11:41:26.339964Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:10.873019Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:5b8c620631e5180adde14b81fdd2431d8fa8b5034d501a2abf57c10536281f89","observation_id":"53a273fc-365b-4118-93fa-4e73e37f9a8d","resolution":{"observed_at":"2026-08-07T11:51:10.873019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:10.961151Z","title":"Self-supervised speech representation learning: A review,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-07T11:41:26.339964Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:10.961151Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:2e600c919d49a63a44666beb4bad378fb2dbadce4e771f5bd25441ba30ba4c9e","observation_id":"06ccb6e3-9ae4-49cb-a111-d5754034baee","resolution":{"observed_at":"2026-08-07T11:51:10.961151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17796","last_updated":"2024-12-23T18:53:15Z","snapshot_observed_at":"2026-08-04T11:37:53.484880Z","submitted_at":"2024-12-23T18:53:15Z","title":"Investigating Prosodic Signatures via Speech Pre-Trained Models for Audio Deepfake Source Attribution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.17796","snapshot_observed_at":"2026-08-07T11:51:11.040230Z","title":"Investigating prosodic signatures via speech pre- trained models for audio deepfake source attribution,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-07T11:41:26.339964Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:11.040230Z"},"links":{"cited_paper":"/paper/2412.17796","citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:d19264e0d32026001c77381eea4d70b2e63ffadba44414342a9b03de96dbc3f3","observation_id":"620f9e5c-8bd2-4289-90f8-8bc9f2f8eaeb","resolution":{"observed_at":"2026-08-07T11:51:11.040230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12947","last_updated":"2024-10-16T18:34:06Z","snapshot_observed_at":"2026-07-06T19:34:51.296918Z","submitted_at":"2024-10-16T18:34:06Z","title":"Multi-View Multi-Task Modeling with Speech Foundation Models for Speech Forensic Tasks","version":1},"cited_work":{"arxiv_id":"2410.12947","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.12947","snapshot_observed_at":"2026-08-07T11:51:12.211279Z","title":"Multi-View Multi-Task Modeling with Speech Foundation Models for Speech Forensic Tasks","venue":"eess.AS","work_id":"2717fe35-f0bc-4c97-85d1-b0abaf8b4732","year":2024},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-07T11:41:26.339964Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:11.101007Z"},"links":{"cited_paper":"/paper/2410.12947","citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:067f424cd74f9dcb116d967476a6fbd8808f35b37908f9f0afa91e8b87fcd008","observation_id":"6c1ee7fe-557f-4c6b-880a-fb3f624a8a3d","resolution":{"observed_at":"2026-08-07T11:51:12.273028Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:13.897407Z","title":"A transformer-based voice activity detector,","venue":null,"work_id":"2314ac57-652d-4727-9142-edb046315d8e","year":2024},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-07T11:41:26.339964Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:11.169108Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:c85b9a16043b36365ea155e300714ac5521def59c50f527e382a4e9916cd3f8c","observation_id":"b3150781-14ea-40fe-8a97-74a8b0ef0d2f","resolution":{"observed_at":"2026-08-07T11:51:14.040176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:13.666338Z","title":"Multitask detection of speaker changes, overlapping speech and voice activity using wav2vec 2.0,","venue":null,"work_id":"4878218c-9a12-48c3-b369-ad048ba2aee3","year":2023},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-07T11:41:26.339964Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:11.271319Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:3daca22bf1aa47302f75971973f2bd31d9139f830ee4be05d45016932936a1b7","observation_id":"b382a52b-bbd2-47fe-b586-6774fcc0acad","resolution":{"observed_at":"2026-08-07T11:51:13.742840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:13.529009Z","title":"Feature extrac- tion using mfcc,","venue":null,"work_id":"3be0fd15-d1b2-4f2b-ba72-848eb41b89b7","year":2013},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-07T11:41:26.339964Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:11.374716Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:94161899bd0de8dea82ab532c9e448fcb95580426e770ab4488b3e99d35516bf","observation_id":"b5687662-d01c-41fe-a795-98a53b41442f","resolution":{"observed_at":"2026-08-07T11:51:13.589638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:13.396090Z","title":"Unleashing the killer corpus: experiences in creating the multi-everything ami meeting corpus,","venue":null,"work_id":"3ce7f9ee-5435-4db8-97f4-75ec9fdf9b3b","year":2007},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-07T11:41:26.339964Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:11.439124Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:aa96caa2fea2f9d5fe80801ee8e9250df0f25807e455924b75e3bd4923b2aa12","observation_id":"4b3137c4-f96b-4e44-ad1f-7748b7e574d7","resolution":{"observed_at":"2026-08-07T11:51:13.459115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:13.280271Z","title":"2000 nist speaker recognition evaluation,","venue":null,"work_id":"81366b7b-bcf1-499d-81bf-1e938291c69d","year":2000},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-07T11:41:26.339964Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:11.507324Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:51592f423e1881221178d46e754fe24171b6bcbb322c147f1b741dd37fd77f57","observation_id":"d0a65c65-e5e5-4e6c-87d4-a2e1b5cc3b28","resolution":{"observed_at":"2026-08-07T11:51:13.335994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:13.199278Z","title":"Pyannote. audio: neural building blocks for speaker diarization,","venue":null,"work_id":"03da1fb8-59cf-466f-b98b-0cf71fd20adb","year":2020},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-07T11:41:26.339964Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:11.666189Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:c7dd9d5f9da2dce15bd08d476a7e2b19427d7c8a6348d187dbf927fbf8157966","observation_id":"46a94862-248c-4110-ad59-a7f343668c0a","resolution":{"observed_at":"2026-08-07T11:51:13.227135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04045","last_updated":"2021-06-10T13:51:47Z","snapshot_observed_at":"2026-08-04T08:32:24.769368Z","submitted_at":"2021-04-08T20:38:17Z","title":"End-to-end speaker segmentation for overlap-aware resegmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.04045","snapshot_observed_at":"2026-08-07T11:51:11.727872Z","title":"End-to-end speaker segmen- tation for overlap-aware resegmentation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-07T11:41:26.339964Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:11.727872Z"},"links":{"cited_paper":"/paper/2104.04045","citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:b921029dc652d71d05f87ddf845981e1f14297ee573286393ff6918a6f1bccb7","observation_id":"98c46501-02bf-4a18-b6c4-d86355140ca6","resolution":{"observed_at":"2026-08-07T11:51:11.727872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:13.083025Z","title":"Speaker recognition from raw wave- form with sincnet,","venue":null,"work_id":"f4eb984f-dcce-4c72-a397-00da0ffdc467","year":2018},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-07T11:41:26.339964Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:11.759953Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:d571b7ebae414153b9ff9cd1304e63e35f0b0140adaaa68e321eda703ba3e18a","observation_id":"8372bbce-579c-4296-9b7d-c874a795c96a","resolution":{"observed_at":"2026-08-07T11:51:13.170204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:12.985988Z","title":"rvad: An unsupervised segment- based robust voice activity detection method,","venue":null,"work_id":"362a9212-aaf0-4c25-96e0-1eaf3c0c1af1","year":2020},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-07T11:41:26.339964Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:11.789628Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:1151ca1df67f14df71a576243603591ddab65dc3831fc94a2a5d5062ee2b4938","observation_id":"a3c4611a-7a41-452d-b56e-3aa0e059262c","resolution":{"observed_at":"2026-08-07T11:51:13.021646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:12.893014Z","title":"Boosted deep neural networks and multi-resolution cochleagram features for voice activity detec- tion","venue":null,"work_id":"8bb044e6-34d2-4d2f-8251-0a942bf768ff","year":2014},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-07T11:41:26.339964Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:11.832886Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:9a07e7b427df708142b18962db90b8a1d10506e7b18f589098011ffcfe235f1b","observation_id":"49dbc3c4-1c47-4149-b9ef-c03473418d92","resolution":{"observed_at":"2026-08-07T11:51:12.933562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T11:41:26.339964Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":13,"verified_exact":3,"verified_fuzzy":26},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 1 inbound Pith citation observation for arXiv:2506.01365."}