{"as_of":"2026-08-22T10:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dcbb2f44824c68de8ccd1dc64ab8deeda01a73634e96a22c3cc85e1df45e201b","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:32:10.105502Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:32:07.527161Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T18:32:10.455611Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.07954","last_updated":"2025-07-10T17:39:03Z","snapshot_observed_at":"2026-08-06T18:25:52.153413Z","submitted_at":"2025-07-10T17:39:03Z","title":"Input Conditioned Layer Dropping in Speech Foundation Models","version":1},"cited_work":{"arxiv_id":"2507.07954","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.07954","snapshot_observed_at":"2026-08-06T18:32:10.455611Z","title":"Input Conditioned Layer Dropping in Speech Foundation Models","venue":"cs.SD","work_id":"46c0d117-7013-4ee7-8920-542b19592474","year":2025},"citing_paper":{"arxiv_id":"2507.07954","last_updated":"2025-07-10T17:39:03Z","snapshot_observed_at":"2026-08-06T18:25:52.153413Z","submitted_at":"2025-07-10T17:39:03Z","title":"Input Conditioned Layer Dropping in Speech Foundation Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:07.527161Z"},"links":{"cited_paper":"/paper/2507.07954","citing_paper":"/paper/2507.07954"},"observation_digest":"sha256:480958f12de01398a76adc0a5d420ec37fc8e26d02383db05405f750975d441b","observation_id":"068438fe-3d1c-439c-af4e-80019f1c267a","resolution":{"observed_at":"2026-08-06T18:32:10.539869Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.07954/citation-record","integrity":"/paper/2507.07954/integrity","json":"/paper/2507.07954/citation-record.json","paper":"/paper/2507.07954"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:17.922807Z","title":"However, their practicality on low resources / edge devices is limited due to significant com- putational overhead and enormous memory requirement","venue":null,"work_id":"828891e5-2e5e-4257-9e0a-42ac7681f96d","year":null},"citing_paper":{"arxiv_id":"2507.07954","last_updated":"2025-07-10T17:39:03Z","snapshot_observed_at":"2026-08-06T18:25:52.153413Z","submitted_at":"2025-07-10T17:39:03Z","title":"Input Conditioned Layer Dropping in Speech Foundation Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:07.466141Z"},"links":{"citing_paper":"/paper/2507.07954"},"observation_digest":"sha256:d4a444dca2133a113e978a642185a3e9bd1f0622d44aee5457a1eb5dfb927d51","observation_id":"dc9d661c-e363-4bcf-91e1-1f69de1aab55","resolution":{"observed_at":"2026-08-06T18:32:17.970260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:17.790463Z","title":"We will restrict the discus- sion to dynamic depth only as it encapsulates the early exit and layer dropping approaches","venue":null,"work_id":"ef08ec02-2953-40ed-aa79-28007e5aa81d","year":null},"citing_paper":{"arxiv_id":"2507.07954","last_updated":"2025-07-10T17:39:03Z","snapshot_observed_at":"2026-08-06T18:25:52.153413Z","submitted_at":"2025-07-10T17:39:03Z","title":"Input Conditioned Layer Dropping in Speech Foundation Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:07.605324Z"},"links":{"citing_paper":"/paper/2507.07954"},"observation_digest":"sha256:77369b0a885a3bd6690eb21b33d21bf65c280670cc4142fb6e297e2f77bec2f4","observation_id":"c122f81d-389a-43b4-8ef4-96971f9825e1","resolution":{"observed_at":"2026-08-06T18:32:17.856353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:17.707027Z","title":"For each input sample, the LS block selects the finest combination of encoder layers achieving optimal performance for various resource settings","venue":null,"work_id":"794f9dc8-8621-4e2a-9004-316346ef708f","year":null},"citing_paper":{"arxiv_id":"2507.07954","last_updated":"2025-07-10T17:39:03Z","snapshot_observed_at":"2026-08-06T18:25:52.153413Z","submitted_at":"2025-07-10T17:39:03Z","title":"Input Conditioned Layer Dropping in Speech Foundation Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:07.648504Z"},"links":{"citing_paper":"/paper/2507.07954"},"observation_digest":"sha256:44bb6ddc8016d209549b396e1f494d5b579aa6793e56dd07aee2dca7cd1ad725","observation_id":"8d6f4988-da0b-4083-b92f-897039b76745","resolution":{"observed_at":"2026-08-06T18:32:17.749181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:17.615532Z","title":"We utilized well- known transformer-based foundation models: (i) WavLM","venue":null,"work_id":"491e650a-117e-41f7-8618-5fd9a6932a7d","year":null},"citing_paper":{"arxiv_id":"2507.07954","last_updated":"2025-07-10T17:39:03Z","snapshot_observed_at":"2026-08-06T18:25:52.153413Z","submitted_at":"2025-07-10T17:39:03Z","title":"Input Conditioned Layer Dropping in Speech Foundation Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:07.687564Z"},"links":{"citing_paper":"/paper/2507.07954"},"observation_digest":"sha256:e8639e9003a8dd0960f5cac8d6f588c352288179b927d726dd9284cf2cffb490","observation_id":"8962fbf7-73bc-43ef-83d4-5fb2078595d1","resolution":{"observed_at":"2026-08-06T18:32:17.651407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:17.416066Z","title":null,"venue":null,"work_id":"17d7c1d4-e6a7-4b5c-9bdf-c6d58c4ce48d","year":null},"citing_paper":{"arxiv_id":"2507.07954","last_updated":"2025-07-10T17:39:03Z","snapshot_observed_at":"2026-08-06T18:25:52.153413Z","submitted_at":"2025-07-10T17:39:03Z","title":"Input Conditioned Layer Dropping in Speech Foundation Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:07.768758Z"},"links":{"citing_paper":"/paper/2507.07954"},"observation_digest":"sha256:a6306edae2fb104348749333d0372d169be8e60ffcb5074c209fed0cda0bcdf2","observation_id":"f90cb0f4-12fe-43c4-80e5-e1baf115bfda","resolution":{"observed_at":"2026-08-06T18:32:17.463460Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:16.511089Z","title":"Dynamic split computing for efficient deep edge intelligence,","venue":null,"work_id":"d3670229-9846-4a2b-ae23-cfff9a8e3711","year":2023},"citing_paper":{"arxiv_id":"2507.07954","last_updated":"2025-07-10T17:39:03Z","snapshot_observed_at":"2026-08-06T18:25:52.153413Z","submitted_at":"2025-07-10T17:39:03Z","title":"Input Conditioned Layer Dropping in Speech Foundation Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:07.940787Z"},"links":{"citing_paper":"/paper/2507.07954"},"observation_digest":"sha256:fbf3755be8e59928c18fb5282c98c04db3d9fc365a72b577af8483e99d3709f2","observation_id":"be7a05f4-3e83-41b3-868d-7b7e5c104d6c","resolution":{"observed_at":"2026-08-06T18:32:16.585614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:16.342020Z","title":"Split computing and early exiting for deep learning applications: Survey and research chal- lenges,","venue":null,"work_id":"43c1cc44-4473-4ef6-86a4-0555de996ebc","year":2022},"citing_paper":{"arxiv_id":"2507.07954","last_updated":"2025-07-10T17:39:03Z","snapshot_observed_at":"2026-08-06T18:25:52.153413Z","submitted_at":"2025-07-10T17:39:03Z","title":"Input Conditioned Layer Dropping in Speech Foundation Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:07.964911Z"},"links":{"citing_paper":"/paper/2507.07954"},"observation_digest":"sha256:797d02366e14d5f3c349558f8fb83851c2ab38dcd2343d6ed0063db283566f56","observation_id":"76dec4ca-c6f0-4718-9f4f-b1e8b23b40dd","resolution":{"observed_at":"2026-08-06T18:32:16.408886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:17.291921Z","title":"Learned token pruning for trans- formers,","venue":null,"work_id":"0c8efe88-96b0-43fd-b57f-18e1f82ca2e6","year":2022},"citing_paper":{"arxiv_id":"2507.07954","last_updated":"2025-07-10T17:39:03Z","snapshot_observed_at":"2026-08-06T18:25:52.153413Z","submitted_at":"2025-07-10T17:39:03Z","title":"Input Conditioned Layer Dropping in Speech Foundation Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:07.815502Z"},"links":{"citing_paper":"/paper/2507.07954"},"observation_digest":"sha256:ee55d9258ead46bcc07c61fec14ceb6220a66ccabef98fdc34023b07b9bb2524","observation_id":"21e6e435-9af1-4bff-91f8-7bb5571d3312","resolution":{"observed_at":"2026-08-06T18:32:17.359194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07954","last_updated":"2025-07-10T17:39:03Z","snapshot_observed_at":"2026-08-06T18:25:52.153413Z","submitted_at":"2025-07-10T17:39:03Z","title":"Input Conditioned Layer Dropping in Speech Foundation Models","version":1},"cited_work":{"arxiv_id":"2507.07954","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.07954","snapshot_observed_at":"2026-08-06T18:32:10.455611Z","title":"Input Conditioned Layer Dropping in Speech Foundation Models","venue":"cs.SD","work_id":"46c0d117-7013-4ee7-8920-542b19592474","year":2025},"citing_paper":{"arxiv_id":"2507.07954","last_updated":"2025-07-10T17:39:03Z","snapshot_observed_at":"2026-08-06T18:25:52.153413Z","submitted_at":"2025-07-10T17:39:03Z","title":"Input Conditioned Layer Dropping in Speech Foundation Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:07.527161Z"},"links":{"cited_paper":"/paper/2507.07954","citing_paper":"/paper/2507.07954"},"observation_digest":"sha256:480958f12de01398a76adc0a5d420ec37fc8e26d02383db05405f750975d441b","observation_id":"068438fe-3d1c-439c-af4e-80019f1c267a","resolution":{"observed_at":"2026-08-06T18:32:10.539869Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:17.132669Z","title":"FastFormers: Highly efficient transformer models for natural language understand- ing,","venue":null,"work_id":"0bf799b5-3112-4599-83cf-548315ae84c6","year":2020},"citing_paper":{"arxiv_id":"2507.07954","last_updated":"2025-07-10T17:39:03Z","snapshot_observed_at":"2026-08-06T18:25:52.153413Z","submitted_at":"2025-07-10T17:39:03Z","title":"Input Conditioned Layer Dropping in Speech Foundation Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:07.843871Z"},"links":{"citing_paper":"/paper/2507.07954"},"observation_digest":"sha256:178ccacb0da436c5b2b013703284b9f7ae95016345a6265675a9b1838e343df6","observation_id":"c6d8ee10-b44d-47c5-bd97-cd2f438b2345","resolution":{"observed_at":"2026-08-06T18:32:17.207676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:16.991045Z","title":"Lightweight and efficient end-to-end speech recognition using low-rank trans- former,","venue":null,"work_id":"68c12b65-8bce-4f17-81e9-ee8a041b1816","year":2020},"citing_paper":{"arxiv_id":"2507.07954","last_updated":"2025-07-10T17:39:03Z","snapshot_observed_at":"2026-08-06T18:25:52.153413Z","submitted_at":"2025-07-10T17:39:03Z","title":"Input Conditioned Layer Dropping in Speech Foundation Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:07.877522Z"},"links":{"citing_paper":"/paper/2507.07954"},"observation_digest":"sha256:9d5690eef2e0e6a83b95b6b4d8737447c05245fd317e59b27a2db4f2a72714b7","observation_id":"197efa5e-265b-4aee-97da-04f2fa5b77d6","resolution":{"observed_at":"2026-08-06T18:32:17.045500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:16.819120Z","title":"Bottleneck low-rank transformers for low-resource spoken language understanding,","venue":null,"work_id":"64ff7d9b-8822-4097-a05e-a6481a9a6d1e","year":2022},"citing_paper":{"arxiv_id":"2507.07954","last_updated":"2025-07-10T17:39:03Z","snapshot_observed_at":"2026-08-06T18:25:52.153413Z","submitted_at":"2025-07-10T17:39:03Z","title":"Input Conditioned Layer Dropping in Speech Foundation Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:07.892484Z"},"links":{"citing_paper":"/paper/2507.07954"},"observation_digest":"sha256:ba1b032ab1d8d83bb15a9260a8b2b3644b26f03d70316215e7d3bbffe669fb7d","observation_id":"04c53678-c757-4ee2-8cf5-6d2433584b48","resolution":{"observed_at":"2026-08-06T18:32:16.896664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:16.677738Z","title":"Tensor decomposition for minimization of E2E SLU model toward on-device pro- cessing,","venue":null,"work_id":"d76bbf36-375b-49be-a8c2-22fc82649894","year":2023},"citing_paper":{"arxiv_id":"2507.07954","last_updated":"2025-07-10T17:39:03Z","snapshot_observed_at":"2026-08-06T18:25:52.153413Z","submitted_at":"2025-07-10T17:39:03Z","title":"Input Conditioned Layer Dropping in Speech Foundation Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:07.916681Z"},"links":{"citing_paper":"/paper/2507.07954"},"observation_digest":"sha256:9baa34d6490f5f5c832cab22090ec70efb6ba909c0ff7a96e4efb5857897f77d","observation_id":"68b18cd7-c2e2-445e-ad70-66e88cc6e953","resolution":{"observed_at":"2026-08-06T18:32:16.731090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:15.378531Z","title":"Accelerating training of transformer-based language models with progressive layer dropping,","venue":null,"work_id":"696be3b1-e5ba-49ce-8477-aff5abaf3c87","year":2020},"citing_paper":{"arxiv_id":"2507.07954","last_updated":"2025-07-10T17:39:03Z","snapshot_observed_at":"2026-08-06T18:25:52.153413Z","submitted_at":"2025-07-10T17:39:03Z","title":"Input Conditioned Layer Dropping in Speech Foundation Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:08.462942Z"},"links":{"citing_paper":"/paper/2507.07954"},"observation_digest":"sha256:dd4aa46c3c83ae4103b8723c6b3779cfc8a969c39f88ba795d84577396adbdcb","observation_id":"27851904-01e3-4a46-aadf-a2e0add435ae","resolution":{"observed_at":"2026-08-06T18:32:15.466113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:16.174121Z","title":"HuBERT-EE: Early exiting Hu- BERT for efficient speech recognition,","venue":null,"work_id":"72e7a36e-058b-45b3-b3f3-798a0026102f","year":2024},"citing_paper":{"arxiv_id":"2507.07954","last_updated":"2025-07-10T17:39:03Z","snapshot_observed_at":"2026-08-06T18:25:52.153413Z","submitted_at":"2025-07-10T17:39:03Z","title":"Input Conditioned Layer Dropping in Speech Foundation Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:08.025068Z"},"links":{"citing_paper":"/paper/2507.07954"},"observation_digest":"sha256:8784052171f3a658d61a7835c2b1d12297dd368cd3f953921d86fb107bedb972","observation_id":"6e3e637b-a512-431d-b543-9cd6cc7d400d","resolution":{"observed_at":"2026-08-06T18:32:16.256411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:17.526977Z","title":"We employ Word Error Rate (WER) metric for ASR, and accuracy for the other tasks","venue":null,"work_id":"c976fb1a-dc87-42ac-b7c7-834ba1088f31","year":null},"citing_paper":{"arxiv_id":"2507.07954","last_updated":"2025-07-10T17:39:03Z","snapshot_observed_at":"2026-08-06T18:25:52.153413Z","submitted_at":"2025-07-10T17:39:03Z","title":"Input Conditioned Layer Dropping in Speech Foundation Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:07.745710Z"},"links":{"citing_paper":"/paper/2507.07954"},"observation_digest":"sha256:16963ab3aafd1c3bc26b26b380393dcede4ec656250d4a755b0e53ed1323918a","observation_id":"2e6f887d-1fa2-4288-baf5-bf61b858da8e","resolution":{"observed_at":"2026-08-06T18:32:17.602459Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:16.051257Z","title":"Fine-tuning strategies for faster in- ference using speech self-supervised models: a compar- ative study,","venue":null,"work_id":"20a36668-747f-4dfa-a515-6124a20ac29c","year":2023},"citing_paper":{"arxiv_id":"2507.07954","last_updated":"2025-07-10T17:39:03Z","snapshot_observed_at":"2026-08-06T18:25:52.153413Z","submitted_at":"2025-07-10T17:39:03Z","title":"Input Conditioned Layer Dropping in Speech Foundation Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:08.069846Z"},"links":{"citing_paper":"/paper/2507.07954"},"observation_digest":"sha256:7874b86c1f3bcda4294a59729804c0c99ce515b898ad77faebb5d785b5ad5a38","observation_id":"b9c9190a-4f63-4d46-8ddb-4300b1a8d5c8","resolution":{"observed_at":"2026-08-06T18:32:16.121933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.09546","last_updated":"2024-02-22T15:10:06Z","snapshot_observed_at":"2026-08-21T12:44:01.806563Z","submitted_at":"2023-09-18T07:45:16Z","title":"Training dynamic models using early exits for automatic speech recognition on resource-constrained devices","version":2},"cited_work":{"arxiv_id":"2309.09546","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.09546","snapshot_observed_at":"2026-08-06T18:32:10.247199Z","title":"Training dynamic models using early exits for automatic speech recognition on resource-constrained devices","venue":"eess.AS","work_id":"fe0f6cac-35a9-4000-823c-a805dae01dd2","year":2023},"citing_paper":{"arxiv_id":"2507.07954","last_updated":"2025-07-10T17:39:03Z","snapshot_observed_at":"2026-08-06T18:25:52.153413Z","submitted_at":"2025-07-10T17:39:03Z","title":"Input Conditioned Layer Dropping in Speech Foundation Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:08.159991Z"},"links":{"cited_paper":"/paper/2309.09546","citing_paper":"/paper/2507.07954"},"observation_digest":"sha256:84b983889af610ba41d39d6c5aa761a443e1ea57ac9075c4c008796f70f1de24","observation_id":"a905bab0-9e5d-4c95-bb83-b55f9039b894","resolution":{"observed_at":"2026-08-06T18:32:10.366066Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:15.881791Z","title":"Deep networks with stochastic depth,","venue":null,"work_id":"4672278f-0fab-4d9f-91cc-4b81f2a241bf","year":2016},"citing_paper":{"arxiv_id":"2507.07954","last_updated":"2025-07-10T17:39:03Z","snapshot_observed_at":"2026-08-06T18:25:52.153413Z","submitted_at":"2025-07-10T17:39:03Z","title":"Input Conditioned Layer Dropping in Speech Foundation Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:08.251953Z"},"links":{"citing_paper":"/paper/2507.07954"},"observation_digest":"sha256:71bbfa0a157e7a5a678b1f2b7d3423c543799f561fea0c9c22479f62fcbdf6e7","observation_id":"8873f0ac-b715-4273-a515-3c4cf594307d","resolution":{"observed_at":"2026-08-06T18:32:15.987443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:15.737527Z","title":"SkipNet: Learning dynamic routing in convolutional networks,","venue":null,"work_id":"731c088f-bab6-4b91-88ed-46dbb5aebbcc","year":2018},"citing_paper":{"arxiv_id":"2507.07954","last_updated":"2025-07-10T17:39:03Z","snapshot_observed_at":"2026-08-06T18:25:52.153413Z","submitted_at":"2025-07-10T17:39:03Z","title":"Input Conditioned Layer Dropping in Speech Foundation Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:08.308389Z"},"links":{"citing_paper":"/paper/2507.07954"},"observation_digest":"sha256:9e153b3dccd05a32f92a41ee4bfda82f3860de62cc437af1c23ddc051e9d02e1","observation_id":"a86e6256-a265-4a3d-9468-2a41d3fc78e3","resolution":{"observed_at":"2026-08-06T18:32:15.804043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:15.560343Z","title":"Reducing transformer depth on de- mand with structured dropout,","venue":null,"work_id":"3c38354d-59b0-4d4e-8b6b-c9c71dd14be6","year":2020},"citing_paper":{"arxiv_id":"2507.07954","last_updated":"2025-07-10T17:39:03Z","snapshot_observed_at":"2026-08-06T18:25:52.153413Z","submitted_at":"2025-07-10T17:39:03Z","title":"Input Conditioned Layer Dropping in Speech Foundation Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:08.363384Z"},"links":{"citing_paper":"/paper/2507.07954"},"observation_digest":"sha256:c3b0f7d25bfd0d59d61d8cbea48e45a63f6a8709f76c024d71b7be7d035fcee3","observation_id":"901d82dc-353c-45e3-8999-866c2419a16b","resolution":{"observed_at":"2026-08-06T18:32:15.631948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:15.175234Z","title":"On the effect of dropping layers of pre-trained transformer models,","venue":null,"work_id":"4baf6bd2-da59-4f3d-b95d-ba8d61c3be66","year":2023},"citing_paper":{"arxiv_id":"2507.07954","last_updated":"2025-07-10T17:39:03Z","snapshot_observed_at":"2026-08-06T18:25:52.153413Z","submitted_at":"2025-07-10T17:39:03Z","title":"Input Conditioned Layer Dropping in Speech Foundation Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:08.512580Z"},"links":{"citing_paper":"/paper/2507.07954"},"observation_digest":"sha256:efc6d19fbebe38870e0554ac1796a13075a29c963052f5d77a4b90e7e4c8744c","observation_id":"b2f0b61b-d39c-4884-a3bf-719ebb1bb03c","resolution":{"observed_at":"2026-08-06T18:32:15.269623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:15.029311Z","title":"WavLM: Large-scale self- supervised pre-training for full stack speech process- ing,","venue":null,"work_id":"7f87c732-4e38-477b-be10-d2bc4023f1fc","year":2022},"citing_paper":{"arxiv_id":"2507.07954","last_updated":"2025-07-10T17:39:03Z","snapshot_observed_at":"2026-08-06T18:25:52.153413Z","submitted_at":"2025-07-10T17:39:03Z","title":"Input Conditioned Layer Dropping in Speech Foundation Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:08.579688Z"},"links":{"citing_paper":"/paper/2507.07954"},"observation_digest":"sha256:b4d6ce87147016f6a8c4098e24646e8c6106a9d5957395ba89c42fadf0160190","observation_id":"8ed81a5f-547c-4e94-a901-e59dff41516f","resolution":{"observed_at":"2026-08-06T18:32:15.095753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:14.862610Z","title":"LDASR: An experimental study on layer drop using conformer-based architecture,","venue":null,"work_id":"32e91077-e0ac-4ca9-8153-dbb0e18b137d","year":2024},"citing_paper":{"arxiv_id":"2507.07954","last_updated":"2025-07-10T17:39:03Z","snapshot_observed_at":"2026-08-06T18:25:52.153413Z","submitted_at":"2025-07-10T17:39:03Z","title":"Input Conditioned Layer Dropping in Speech Foundation Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:08.635085Z"},"links":{"citing_paper":"/paper/2507.07954"},"observation_digest":"sha256:0ee32a599e34a4554a8ca7aa9cb10b6f9c7195f584d919783185b87c479fc861","observation_id":"29918fc9-3f87-4ed1-9509-57eade41684e","resolution":{"observed_at":"2026-08-06T18:32:14.930976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:14.740049Z","title":"Convolutional Networks with Adaptive Inference Graphs,","venue":null,"work_id":"216e0b34-7211-4fb3-b408-40001e8bf797","year":2018},"citing_paper":{"arxiv_id":"2507.07954","last_updated":"2025-07-10T17:39:03Z","snapshot_observed_at":"2026-08-06T18:25:52.153413Z","submitted_at":"2025-07-10T17:39:03Z","title":"Input Conditioned Layer Dropping in Speech Foundation Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:08.720440Z"},"links":{"citing_paper":"/paper/2507.07954"},"observation_digest":"sha256:c5b09db700dbabbd94df0d97b17a5117f9369b6f69b8272b3ad446fb8d157197","observation_id":"8e83fda6-88f2-41bd-9971-b66ea2675f4a","resolution":{"observed_at":"2026-08-06T18:32:14.792379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:14.567700Z","title":"I3D: Transformer architectures with input-dependent dynamic depth for speech recognition,","venue":null,"work_id":"ddff48cb-ebf5-4290-b9a3-62290af3780b","year":2023},"citing_paper":{"arxiv_id":"2507.07954","last_updated":"2025-07-10T17:39:03Z","snapshot_observed_at":"2026-08-06T18:25:52.153413Z","submitted_at":"2025-07-10T17:39:03Z","title":"Input Conditioned Layer Dropping in Speech Foundation Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:08.775351Z"},"links":{"citing_paper":"/paper/2507.07954"},"observation_digest":"sha256:77ceaeae97bfc7681e52636324df8f53faa6d5f3851f965677da58ed37429237","observation_id":"1f37d52b-5c38-445f-86ad-a6f2066ebdd9","resolution":{"observed_at":"2026-08-06T18:32:14.635583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:14.379537Z","title":"AST: Audio spectrogram trans- former,","venue":null,"work_id":"feeef318-3ebc-47ad-818b-4a7e5dd8a84f","year":2021},"citing_paper":{"arxiv_id":"2507.07954","last_updated":"2025-07-10T17:39:03Z","snapshot_observed_at":"2026-08-06T18:25:52.153413Z","submitted_at":"2025-07-10T17:39:03Z","title":"Input Conditioned Layer Dropping in Speech Foundation Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:08.840236Z"},"links":{"citing_paper":"/paper/2507.07954"},"observation_digest":"sha256:68be62ed846c88017cb4a062b33690f92e748a1774d4136ba56d373a28aa5882","observation_id":"85eb8d58-69dd-48fb-9e6c-bd52ed5f0898","resolution":{"observed_at":"2026-08-06T18:32:14.470399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:14.209723Z","title":"Squeeze-and-Excitation Networks,","venue":null,"work_id":"b7462556-161f-4c9c-834d-c369e94b52c7","year":2018},"citing_paper":{"arxiv_id":"2507.07954","last_updated":"2025-07-10T17:39:03Z","snapshot_observed_at":"2026-08-06T18:25:52.153413Z","submitted_at":"2025-07-10T17:39:03Z","title":"Input Conditioned Layer Dropping in Speech Foundation Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:08.894969Z"},"links":{"citing_paper":"/paper/2507.07954"},"observation_digest":"sha256:01e50c397fe6165be9c8d073a1a529ce88a4ec855992cf714b380cf12b78b4ec","observation_id":"f4b356ee-2363-45fb-87ef-038828d895e2","resolution":{"observed_at":"2026-08-06T18:32:14.270689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:14.009748Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient spar- sity,","venue":null,"work_id":"90a30e8c-f84c-4946-8b87-afcce43f1a9a","year":2022},"citing_paper":{"arxiv_id":"2507.07954","last_updated":"2025-07-10T17:39:03Z","snapshot_observed_at":"2026-08-06T18:25:52.153413Z","submitted_at":"2025-07-10T17:39:03Z","title":"Input Conditioned Layer Dropping in Speech Foundation Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:08.970881Z"},"links":{"citing_paper":"/paper/2507.07954"},"observation_digest":"sha256:59046da3bf068c28270a5074c36032c9b26d416319f8fe8c1b7860652bf3df2f","observation_id":"7097ac97-f852-4946-ae52-28d35ccb43e3","resolution":{"observed_at":"2026-08-06T18:32:14.074176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:13.826661Z","title":"Adaptive mixtures of local ex- perts,","venue":null,"work_id":"2c93c634-bc3d-4562-9d3c-56b953ef89f9","year":1991},"citing_paper":{"arxiv_id":"2507.07954","last_updated":"2025-07-10T17:39:03Z","snapshot_observed_at":"2026-08-06T18:25:52.153413Z","submitted_at":"2025-07-10T17:39:03Z","title":"Input Conditioned Layer Dropping in Speech Foundation Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:09.032644Z"},"links":{"citing_paper":"/paper/2507.07954"},"observation_digest":"sha256:718dc7a59f2171fb8af54ae779ef51d47f7a273c801cd267f2ca79cd6ce735f7","observation_id":"0c11495d-f462-46bb-bbc3-85854eec5e17","resolution":{"observed_at":"2026-08-06T18:32:13.927615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:13.633596Z","title":"Dynamic neural networks: A survey,","venue":null,"work_id":"777f87f4-5d95-47f5-84aa-bb1ce8bce532","year":2022},"citing_paper":{"arxiv_id":"2507.07954","last_updated":"2025-07-10T17:39:03Z","snapshot_observed_at":"2026-08-06T18:25:52.153413Z","submitted_at":"2025-07-10T17:39:03Z","title":"Input Conditioned Layer Dropping in Speech Foundation Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:09.068368Z"},"links":{"citing_paper":"/paper/2507.07954"},"observation_digest":"sha256:4c2f23f4abc39ae11bd1db1d971ff3e2e6affb9089a95662215db0f192021edf","observation_id":"459ebc2e-dd4e-4f16-b1ff-80304c4cc06b","resolution":{"observed_at":"2026-08-06T18:32:13.723541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:13.497792Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":"37c8d407-c705-4512-bb6b-e965b022ac16","year":2016},"citing_paper":{"arxiv_id":"2507.07954","last_updated":"2025-07-10T17:39:03Z","snapshot_observed_at":"2026-08-06T18:25:52.153413Z","submitted_at":"2025-07-10T17:39:03Z","title":"Input Conditioned Layer Dropping in Speech Foundation Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:09.146612Z"},"links":{"citing_paper":"/paper/2507.07954"},"observation_digest":"sha256:9ee48b79bb0f7e3d04eea13e828b6caa24a9dbd0322bbc200dcc1ff223d0d3ac","observation_id":"0ff9011d-35e7-4ff9-ae94-55eed34ed1c1","resolution":{"observed_at":"2026-08-06T18:32:13.549081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:13.333032Z","title":"Attention is all you need,","venue":null,"work_id":"3e62fa1e-9556-4231-8594-c01bf973529e","year":2017},"citing_paper":{"arxiv_id":"2507.07954","last_updated":"2025-07-10T17:39:03Z","snapshot_observed_at":"2026-08-06T18:25:52.153413Z","submitted_at":"2025-07-10T17:39:03Z","title":"Input Conditioned Layer Dropping in Speech Foundation Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:09.198957Z"},"links":{"citing_paper":"/paper/2507.07954"},"observation_digest":"sha256:14194a412364f28d9ce095f4aafb42342805e2d8590efbe2ac26a2f117ce9b34","observation_id":"b451474e-0eb8-4d49-a1d4-436e867ac9f7","resolution":{"observed_at":"2026-08-06T18:32:13.416203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:13.117986Z","title":"BlockDrop: Dynamic inference paths in residual networks,","venue":null,"work_id":"c60da938-fef6-4fc4-8208-82ad4c1855a1","year":2018},"citing_paper":{"arxiv_id":"2507.07954","last_updated":"2025-07-10T17:39:03Z","snapshot_observed_at":"2026-08-06T18:25:52.153413Z","submitted_at":"2025-07-10T17:39:03Z","title":"Input Conditioned Layer Dropping in Speech Foundation Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:09.266034Z"},"links":{"citing_paper":"/paper/2507.07954"},"observation_digest":"sha256:b71700902bd7e4c7f2b0d61f0b846a46d9593d011a5436aee6dacfcbd549061e","observation_id":"58fa47bd-bb83-47fc-bb4d-043c9201604c","resolution":{"observed_at":"2026-08-06T18:32:13.214674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:12.931887Z","title":"You look twice: Gaternet for dynamic filter selection in cnns,","venue":null,"work_id":"606e53d0-93b4-4d17-8016-21b0ac2d5c74","year":2019},"citing_paper":{"arxiv_id":"2507.07954","last_updated":"2025-07-10T17:39:03Z","snapshot_observed_at":"2026-08-06T18:25:52.153413Z","submitted_at":"2025-07-10T17:39:03Z","title":"Input Conditioned Layer Dropping in Speech Foundation Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:09.311235Z"},"links":{"citing_paper":"/paper/2507.07954"},"observation_digest":"sha256:1c7d0fc472a1c59f0f22458ec958bd7b10183983724e0063af9d8a9bf94cbf49","observation_id":"50823707-2d4f-4f9c-9b57-d70ccc445061","resolution":{"observed_at":"2026-08-06T18:32:13.033101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:12.669667Z","title":"Stop or forward: Dynamic layer skipping for efficient action recognition,","venue":null,"work_id":"69f07a48-1d81-4008-9ee5-af0fa18a02e5","year":2023},"citing_paper":{"arxiv_id":"2507.07954","last_updated":"2025-07-10T17:39:03Z","snapshot_observed_at":"2026-08-06T18:25:52.153413Z","submitted_at":"2025-07-10T17:39:03Z","title":"Input Conditioned Layer Dropping in Speech Foundation Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:09.378082Z"},"links":{"citing_paper":"/paper/2507.07954"},"observation_digest":"sha256:4eb6acf5a5e89dc8e5545372afebfcae50098480ca73cae18ebe6a3fe83d6be7","observation_id":"36524230-fa2b-4d5f-bb9d-04489128ef66","resolution":{"observed_at":"2026-08-06T18:32:12.766635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:12.397274Z","title":"Dual dynamic inference: Enabling more efficient, adaptive, and controllable deep infer- ence,","venue":null,"work_id":"2283f306-396e-42e3-a062-b7690c17db95","year":2020},"citing_paper":{"arxiv_id":"2507.07954","last_updated":"2025-07-10T17:39:03Z","snapshot_observed_at":"2026-08-06T18:25:52.153413Z","submitted_at":"2025-07-10T17:39:03Z","title":"Input Conditioned Layer Dropping in Speech Foundation Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:09.444954Z"},"links":{"citing_paper":"/paper/2507.07954"},"observation_digest":"sha256:02c03d3fb384c7ddbe272ede132bec3c772871aee1a9203081701d3cffd7851c","observation_id":"7fa74a84-b981-4d6a-8681-2569be8019d5","resolution":{"observed_at":"2026-08-06T18:32:12.500126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:12.251984Z","title":"Fully dynamic inference with deep neural networks,","venue":null,"work_id":"c74f3076-da1e-48d0-b337-b51d7a3465ac","year":2020},"citing_paper":{"arxiv_id":"2507.07954","last_updated":"2025-07-10T17:39:03Z","snapshot_observed_at":"2026-08-06T18:25:52.153413Z","submitted_at":"2025-07-10T17:39:03Z","title":"Input Conditioned Layer Dropping in Speech Foundation Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:09.514113Z"},"links":{"citing_paper":"/paper/2507.07954"},"observation_digest":"sha256:641d7e1294ba8d5edcd816ad1735a269bed4788792aeb9ac75fca99195214f5b","observation_id":"e1cddd06-9e3c-46a3-b8e3-8ba9f1781ff9","resolution":{"observed_at":"2026-08-06T18:32:12.318977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:12.101977Z","title":"Dynamic encoder size based on data- driven layer-wise pruning for speech recognition,","venue":null,"work_id":"00b6d808-a1d3-4718-8301-645cc5a13616","year":2024},"citing_paper":{"arxiv_id":"2507.07954","last_updated":"2025-07-10T17:39:03Z","snapshot_observed_at":"2026-08-06T18:25:52.153413Z","submitted_at":"2025-07-10T17:39:03Z","title":"Input Conditioned Layer Dropping in Speech Foundation Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:09.572483Z"},"links":{"citing_paper":"/paper/2507.07954"},"observation_digest":"sha256:00fa971b04979b0e8e1f8b998fada91cf6abdb8f2e52fffc983ca8167a9accad","observation_id":"bc2ec3bf-b8a5-4664-83de-1e77028cb25d","resolution":{"observed_at":"2026-08-06T18:32:12.187326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:11.871753Z","title":"Connectionist temporal classifica- tion: labelling unsegmented sequence data with recur- rent neural networks,","venue":null,"work_id":"fd99f5cd-a045-4a0a-9fcf-8ba20a96b090","year":2006},"citing_paper":{"arxiv_id":"2507.07954","last_updated":"2025-07-10T17:39:03Z","snapshot_observed_at":"2026-08-06T18:25:52.153413Z","submitted_at":"2025-07-10T17:39:03Z","title":"Input Conditioned Layer Dropping in Speech Foundation Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:09.628762Z"},"links":{"citing_paper":"/paper/2507.07954"},"observation_digest":"sha256:cc7febe9dd07a003185b359b879e4539251259d1d05015afa51a182885fbf766","observation_id":"48446f4c-f728-4f30-9164-7840e7bef5f4","resolution":{"observed_at":"2026-08-06T18:32:11.973217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:11.646070Z","title":"Librispeech: an asr corpus based on public domain audio books,","venue":null,"work_id":"19ae42d3-53ae-4bc7-b6f2-11a70613e6c7","year":2015},"citing_paper":{"arxiv_id":"2507.07954","last_updated":"2025-07-10T17:39:03Z","snapshot_observed_at":"2026-08-06T18:25:52.153413Z","submitted_at":"2025-07-10T17:39:03Z","title":"Input Conditioned Layer Dropping in Speech Foundation Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:09.705817Z"},"links":{"citing_paper":"/paper/2507.07954"},"observation_digest":"sha256:2c132325fa9e425e82fa0d69b38983c3188c070c965360d15f0956b2bef2adcd","observation_id":"0303e4a0-dd0c-4009-b5ef-a194c1c18943","resolution":{"observed_at":"2026-08-06T18:32:11.743681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:11.372782Z","title":"TED-LIUM 3: Twice as much data and corpus repartition for experiments on speaker adaptation,","venue":null,"work_id":"039bfd57-502f-489c-8ce4-d4052d6249d9","year":2018},"citing_paper":{"arxiv_id":"2507.07954","last_updated":"2025-07-10T17:39:03Z","snapshot_observed_at":"2026-08-06T18:25:52.153413Z","submitted_at":"2025-07-10T17:39:03Z","title":"Input Conditioned Layer Dropping in Speech Foundation Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:09.741038Z"},"links":{"citing_paper":"/paper/2507.07954"},"observation_digest":"sha256:f65ebcb455f6be19fdc4c13aa9ecba7424cc30070fcc005af4de61280cbd6f78","observation_id":"a1e14213-7f5e-4b71-95ff-2d5795de9f0d","resolution":{"observed_at":"2026-08-06T18:32:11.511102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:11.162329Z","title":"ESC: Dataset for Environmental Sound Classification,","venue":null,"work_id":"f6aa6cc1-2378-4a36-91e5-38e9408d2269","year":2015},"citing_paper":{"arxiv_id":"2507.07954","last_updated":"2025-07-10T17:39:03Z","snapshot_observed_at":"2026-08-06T18:25:52.153413Z","submitted_at":"2025-07-10T17:39:03Z","title":"Input Conditioned Layer Dropping in Speech Foundation Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:09.823635Z"},"links":{"citing_paper":"/paper/2507.07954"},"observation_digest":"sha256:b34130f73ebdeea8cc72d14fea80257dbc3853a0c0386539dde2c797fd5c0f5e","observation_id":"e2d18b6e-92d1-4cbb-b760-d7dec8a366d4","resolution":{"observed_at":"2026-08-06T18:32:11.256829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:10.992102Z","title":"Speech model pre-training for end-to-end spoken language understanding,","venue":null,"work_id":"5b48a936-7e59-49f9-ba37-57f214882b7a","year":2019},"citing_paper":{"arxiv_id":"2507.07954","last_updated":"2025-07-10T17:39:03Z","snapshot_observed_at":"2026-08-06T18:25:52.153413Z","submitted_at":"2025-07-10T17:39:03Z","title":"Input Conditioned Layer Dropping in Speech Foundation Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:09.927061Z"},"links":{"citing_paper":"/paper/2507.07954"},"observation_digest":"sha256:66a5ce93e97451776eacab643dc959c514e802c2e60c8e86672d10a0d724c587","observation_id":"7e2bdea3-c2b8-4feb-9ad2-e2b8aa015961","resolution":{"observed_at":"2026-08-06T18:32:11.054931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:10.819788Z","title":"IEMOCAP: Interactive emotional dyadic motion capture database,","venue":null,"work_id":"40118aef-9689-4e21-abdb-e01eb574cc61","year":2008},"citing_paper":{"arxiv_id":"2507.07954","last_updated":"2025-07-10T17:39:03Z","snapshot_observed_at":"2026-08-06T18:25:52.153413Z","submitted_at":"2025-07-10T17:39:03Z","title":"Input Conditioned Layer Dropping in Speech Foundation Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:10.045454Z"},"links":{"citing_paper":"/paper/2507.07954"},"observation_digest":"sha256:dc7c4ee9ca0f90c88dfda4c31cfb7e67a55e299d6a842620146b4cd9c1f0b16a","observation_id":"e6bdb5f9-7863-45b3-9de3-159c70630303","resolution":{"observed_at":"2026-08-06T18:32:10.866952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:10.616829Z","title":"SpecAugment: A simple data augmentation method for automatic speech recogni- tion,","venue":null,"work_id":"2852f173-654e-4bc6-8d64-6b57ff972b4e","year":2019},"citing_paper":{"arxiv_id":"2507.07954","last_updated":"2025-07-10T17:39:03Z","snapshot_observed_at":"2026-08-06T18:25:52.153413Z","submitted_at":"2025-07-10T17:39:03Z","title":"Input Conditioned Layer Dropping in Speech Foundation Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:10.105502Z"},"links":{"citing_paper":"/paper/2507.07954"},"observation_digest":"sha256:b60587edaaa48dba32be094c4f15f209fcdc5c132b217d3ef8249ba6ea7f68c2","observation_id":"1640dc7c-8d5e-409c-9e6f-92979e1bd3be","resolution":{"observed_at":"2026-08-06T18:32:10.711942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.07954","last_updated":"2025-07-10T17:39:03Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-06T18:25:52.153413Z","submitted_at":"2025-07-10T17:39:03Z","title":"Input Conditioned Layer Dropping in Speech Foundation Models"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":1,"verified_exact":2,"verified_fuzzy":42},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 1 inbound Pith citation observation for arXiv:2507.07954."}