{"as_of":"2026-08-12T08:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ff403818b20376d049c1cf2e672d74467ff7749beb6c25f5358b186080969d09","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T20:35:13.120441Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.08057/citation-record","integrity":"/paper/2501.08057/integrity","json":"/paper/2501.08057/citation-record.json","paper":"/paper/2501.08057"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:35:13.672500Z","title":"Introduction to digital speech processing,","venue":null,"work_id":"531e0728-83fe-4fc4-aa4f-ca52d677a029","year":2007},"citing_paper":{"arxiv_id":"2501.08057","last_updated":"2025-01-14T12:12:06Z","snapshot_observed_at":"2026-08-10T20:27:17.008602Z","submitted_at":"2025-01-14T12:12:06Z","title":"Optimizing Speech Multi-View Feature Fusion through Conditional Computation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T20:35:12.952741Z"},"links":{"citing_paper":"/paper/2501.08057"},"observation_digest":"sha256:d40e71b12c7a79385a91f5924b88ea7e4a59ce840150260d43d3a46fc976a8a9","observation_id":"88c42a83-1785-410c-8ab9-fb90274451a7","resolution":{"observed_at":"2026-08-10T20:35:13.676357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:35:13.660218Z","title":"Learning robust features using deep learning for automatic seizure detection,","venue":null,"work_id":"24a90f53-5be4-4752-852c-e7864c8bca51","year":2016},"citing_paper":{"arxiv_id":"2501.08057","last_updated":"2025-01-14T12:12:06Z","snapshot_observed_at":"2026-08-10T20:27:17.008602Z","submitted_at":"2025-01-14T12:12:06Z","title":"Optimizing Speech Multi-View Feature Fusion through Conditional Computation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T20:35:12.957265Z"},"links":{"citing_paper":"/paper/2501.08057"},"observation_digest":"sha256:04792d1e98351ef79d6e47ca89f353980d705b0d9c313c3762d9776843284c62","observation_id":"1937764e-8328-45c1-90e1-9d91f823195f","resolution":{"observed_at":"2026-08-10T20:35:13.664268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1508.01211","last_updated":"2015-08-20T00:38:43Z","snapshot_observed_at":"2026-08-08T05:51:42.766537Z","submitted_at":"2015-08-05T20:17:58Z","title":"Listen, Attend and Spell","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1508.01211","snapshot_observed_at":"2026-08-10T20:35:12.962138Z","title":"Listen, attend and spell,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.08057","last_updated":"2025-01-14T12:12:06Z","snapshot_observed_at":"2026-08-10T20:27:17.008602Z","submitted_at":"2025-01-14T12:12:06Z","title":"Optimizing Speech Multi-View Feature Fusion through Conditional Computation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T20:35:12.962138Z"},"links":{"cited_paper":"/paper/1508.01211","citing_paper":"/paper/2501.08057"},"observation_digest":"sha256:7b00f26427ed217aae5f9e422e013de0522235372fcee6239a34ecbfa487c69e","observation_id":"de5af010-494a-43ef-a812-c3d97c274977","resolution":{"observed_at":"2026-08-10T20:35:12.962138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-06T05:33:37.746688Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-08-10T20:35:12.967080Z","title":"wav2vec: Unsupervised pre-training for speech recognition,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2501.08057","last_updated":"2025-01-14T12:12:06Z","snapshot_observed_at":"2026-08-10T20:27:17.008602Z","submitted_at":"2025-01-14T12:12:06Z","title":"Optimizing Speech Multi-View Feature Fusion through Conditional Computation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T20:35:12.967080Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2501.08057"},"observation_digest":"sha256:12377f838edcfb33ae8f780f9e171da0d736a595a58ee3759dc37b72b6782b4e","observation_id":"dcc3f86b-bba6-49b1-bb64-2770c4ced7f2","resolution":{"observed_at":"2026-08-10T20:35:12.967080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:35:13.648355Z","title":"Data2vec: A general framework for self-supervised learning in speech, vision and language,","venue":null,"work_id":"2995638a-dd5e-4616-bfbf-4d8a923f91fd","year":2022},"citing_paper":{"arxiv_id":"2501.08057","last_updated":"2025-01-14T12:12:06Z","snapshot_observed_at":"2026-08-10T20:27:17.008602Z","submitted_at":"2025-01-14T12:12:06Z","title":"Optimizing Speech Multi-View Feature Fusion through Conditional Computation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T20:35:12.972165Z"},"links":{"citing_paper":"/paper/2501.08057"},"observation_digest":"sha256:4950e9cd368a1cee01b167c24cf6644636be4b00a4759a10bebcc9cd0b2ce9f7","observation_id":"1be994b9-d8e9-43f4-af09-481ad06a238a","resolution":{"observed_at":"2026-08-10T20:35:13.652416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:35:13.635797Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":"5107f942-73fe-45a3-936a-a106816f9126","year":2020},"citing_paper":{"arxiv_id":"2501.08057","last_updated":"2025-01-14T12:12:06Z","snapshot_observed_at":"2026-08-10T20:27:17.008602Z","submitted_at":"2025-01-14T12:12:06Z","title":"Optimizing Speech Multi-View Feature Fusion through Conditional Computation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T20:35:12.978136Z"},"links":{"citing_paper":"/paper/2501.08057"},"observation_digest":"sha256:9ad16522e64cf708b6b4ea6d290e463cc40d48d8fdf8c6ebe68a5a1488dd72c3","observation_id":"134a1727-a30e-4c74-9574-32c86366f7ce","resolution":{"observed_at":"2026-08-10T20:35:13.640340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:35:13.624215Z","title":"Hubert: Self- supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":"ae629103-3bee-4585-8b4b-669a38a98180","year":2021},"citing_paper":{"arxiv_id":"2501.08057","last_updated":"2025-01-14T12:12:06Z","snapshot_observed_at":"2026-08-10T20:27:17.008602Z","submitted_at":"2025-01-14T12:12:06Z","title":"Optimizing Speech Multi-View Feature Fusion through Conditional Computation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T20:35:12.983242Z"},"links":{"citing_paper":"/paper/2501.08057"},"observation_digest":"sha256:893b652472799bc8e62ac22ff8ad605cc83b917d00487e35f360378b788888ec","observation_id":"809aaec6-045b-47cc-a99c-3980a4e25ae2","resolution":{"observed_at":"2026-08-10T20:35:13.628277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:35:13.612371Z","title":"Exploration on HuBERT with Multiple Resolu- tions,","venue":null,"work_id":"67ffade5-b3e3-41dd-9fc3-502949a7e454","year":2023},"citing_paper":{"arxiv_id":"2501.08057","last_updated":"2025-01-14T12:12:06Z","snapshot_observed_at":"2026-08-10T20:27:17.008602Z","submitted_at":"2025-01-14T12:12:06Z","title":"Optimizing Speech Multi-View Feature Fusion through Conditional Computation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T20:35:12.988042Z"},"links":{"citing_paper":"/paper/2501.08057"},"observation_digest":"sha256:21f2f0d7d88a990f1fd86a365d4fc28f02a4ee94869bb3dfbae54e06036dcade","observation_id":"b4f68caa-92d2-4541-a491-63382220b722","resolution":{"observed_at":"2026-08-10T20:35:13.616277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02720","last_updated":"2024-01-30T08:52:12Z","snapshot_observed_at":"2026-08-10T13:00:38.181324Z","submitted_at":"2023-10-04T10:52:13Z","title":"Multi-resolution HuBERT: Multi-resolution Speech Self-Supervised Learning with Masked Unit Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02720","snapshot_observed_at":"2026-08-10T20:35:12.992523Z","title":"Multi-resolution HuBERT: Multi-resolution speech self-supervised learning with masked unit prediction,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.08057","last_updated":"2025-01-14T12:12:06Z","snapshot_observed_at":"2026-08-10T20:27:17.008602Z","submitted_at":"2025-01-14T12:12:06Z","title":"Optimizing Speech Multi-View Feature Fusion through Conditional Computation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T20:35:12.992523Z"},"links":{"cited_paper":"/paper/2310.02720","citing_paper":"/paper/2501.08057"},"observation_digest":"sha256:f301d5a999b6c20c5018718e6f6319242a6c937b1891fad80977e4abd35da06d","observation_id":"e9db1f10-40da-4977-beff-caa965cdb38f","resolution":{"observed_at":"2026-08-10T20:35:12.992523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.16083","last_updated":"2023-06-28T10:30:39Z","snapshot_observed_at":"2026-08-12T07:52:11.315476Z","submitted_at":"2023-06-28T10:30:39Z","title":"UnitSpeech: Speaker-adaptive Speech Synthesis with Untranscribed Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.16083","snapshot_observed_at":"2026-08-10T20:35:12.996937Z","title":"Unit- speech: Speaker-adaptive speech synthesis with untranscribed data,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.08057","last_updated":"2025-01-14T12:12:06Z","snapshot_observed_at":"2026-08-10T20:27:17.008602Z","submitted_at":"2025-01-14T12:12:06Z","title":"Optimizing Speech Multi-View Feature Fusion through Conditional Computation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T20:35:12.996937Z"},"links":{"cited_paper":"/paper/2306.16083","citing_paper":"/paper/2501.08057"},"observation_digest":"sha256:3cd9e93ccdfc3bbe4d973880e5f5e5bb9f6b1ac9452aeda6e9049fe41e522899","observation_id":"7b03d0e0-e681-4756-a5ba-ad0797c0c66a","resolution":{"observed_at":"2026-08-10T20:35:12.996937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11000","last_updated":"2023-05-19T14:41:16Z","snapshot_observed_at":"2026-08-07T10:56:05.622094Z","submitted_at":"2023-05-18T14:23:25Z","title":"SpeechGPT: Empowering Large Language Models with Intrinsic Cross-Modal Conversational Abilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11000","snapshot_observed_at":"2026-08-10T20:35:13.001744Z","title":"Speechgpt: Empowering large language models with intrinsic cross-modal conversational abilities,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.08057","last_updated":"2025-01-14T12:12:06Z","snapshot_observed_at":"2026-08-10T20:27:17.008602Z","submitted_at":"2025-01-14T12:12:06Z","title":"Optimizing Speech Multi-View Feature Fusion through Conditional Computation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T20:35:13.001744Z"},"links":{"cited_paper":"/paper/2305.11000","citing_paper":"/paper/2501.08057"},"observation_digest":"sha256:a1d5fc81959db26705bece54d4c7d1d2e9cfa8f7098878f9355c86437fb99fc4","observation_id":"79750105-313c-41cc-81e7-5be56738d061","resolution":{"observed_at":"2026-08-10T20:35:13.001744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:35:13.600690Z","title":"Multi- view information-bottleneck representation learning,","venue":null,"work_id":"eb96424f-485a-42cb-9909-6b547e4811dc","year":2021},"citing_paper":{"arxiv_id":"2501.08057","last_updated":"2025-01-14T12:12:06Z","snapshot_observed_at":"2026-08-10T20:27:17.008602Z","submitted_at":"2025-01-14T12:12:06Z","title":"Optimizing Speech Multi-View Feature Fusion through Conditional Computation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T20:35:13.007235Z"},"links":{"citing_paper":"/paper/2501.08057"},"observation_digest":"sha256:6e5fa2332741fadf9f87e409631c05f180a8c786dbe14a28b9557a95228edb9e","observation_id":"4ee0998a-0bc6-43dc-9c7c-0a006c6fc662","resolution":{"observed_at":"2026-08-10T20:35:13.604733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:35:13.584610Z","title":"Deep multi-view learning methods: A review,","venue":null,"work_id":"25df49a0-2ee5-4b07-b7d5-f597eb86d883","year":2021},"citing_paper":{"arxiv_id":"2501.08057","last_updated":"2025-01-14T12:12:06Z","snapshot_observed_at":"2026-08-10T20:27:17.008602Z","submitted_at":"2025-01-14T12:12:06Z","title":"Optimizing Speech Multi-View Feature Fusion through Conditional Computation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T20:35:13.011623Z"},"links":{"citing_paper":"/paper/2501.08057"},"observation_digest":"sha256:905e851a242543b038123ef2af2122b2d72a82b4b2476f1fcd77ef87fcdd34e3","observation_id":"97adc650-762e-429e-830a-ce6f1a778a6f","resolution":{"observed_at":"2026-08-10T20:35:13.589761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07987","last_updated":"2024-07-25T09:33:50Z","snapshot_observed_at":"2026-08-06T11:02:06.607024Z","submitted_at":"2024-05-13T17:58:30Z","title":"The Platonic Representation Hypothesis","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07987","snapshot_observed_at":"2026-08-10T20:35:13.016293Z","title":"The platonic representation hypothesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.08057","last_updated":"2025-01-14T12:12:06Z","snapshot_observed_at":"2026-08-10T20:27:17.008602Z","submitted_at":"2025-01-14T12:12:06Z","title":"Optimizing Speech Multi-View Feature Fusion through Conditional Computation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T20:35:13.016293Z"},"links":{"cited_paper":"/paper/2405.07987","citing_paper":"/paper/2501.08057"},"observation_digest":"sha256:041da615a407b529d9f8883dec2cc6e487cde4a9410711778af1de7f2cd3b5ee","observation_id":"3cf63879-175c-4448-8c8d-431e7a867dbe","resolution":{"observed_at":"2026-08-10T20:35:13.016293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:35:13.569596Z","title":"Combining Spectral and Self-Supervised Features for Low Resource Speech Recognition and Translation,","venue":null,"work_id":"09cbcbad-9bb8-4288-805d-ceffae48946c","year":2022},"citing_paper":{"arxiv_id":"2501.08057","last_updated":"2025-01-14T12:12:06Z","snapshot_observed_at":"2026-08-10T20:27:17.008602Z","submitted_at":"2025-01-14T12:12:06Z","title":"Optimizing Speech Multi-View Feature Fusion through Conditional Computation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T20:35:13.023101Z"},"links":{"citing_paper":"/paper/2501.08057"},"observation_digest":"sha256:941ce2c588c282e0222944009e1180cc8b53d02fa939e3eaa1d8039b280191fb","observation_id":"80e901f7-d97f-4080-a2ec-78a4f9ec1370","resolution":{"observed_at":"2026-08-10T20:35:13.574820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:35:13.554215Z","title":"Improving speech emotion recognition by fusing self-supervised learn- ing and spectral features via mixture of experts,","venue":null,"work_id":"d46bd6ae-5d51-4a62-b45e-a3c8ee611210","year":2024},"citing_paper":{"arxiv_id":"2501.08057","last_updated":"2025-01-14T12:12:06Z","snapshot_observed_at":"2026-08-10T20:27:17.008602Z","submitted_at":"2025-01-14T12:12:06Z","title":"Optimizing Speech Multi-View Feature Fusion through Conditional Computation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T20:35:13.028995Z"},"links":{"citing_paper":"/paper/2501.08057"},"observation_digest":"sha256:344f63caee453aa2cc25eadd2f194bb138d0002232ca968ae949fd484e0429bc","observation_id":"42892fa8-b830-4431-b653-a619d8cf2d38","resolution":{"observed_at":"2026-08-10T20:35:13.559020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:35:13.538928Z","title":"Deep learning of representations: Looking forward,","venue":null,"work_id":"e28bb9a9-0e44-4323-92ad-19c3ff641ce3","year":2013},"citing_paper":{"arxiv_id":"2501.08057","last_updated":"2025-01-14T12:12:06Z","snapshot_observed_at":"2026-08-10T20:27:17.008602Z","submitted_at":"2025-01-14T12:12:06Z","title":"Optimizing Speech Multi-View Feature Fusion through Conditional Computation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T20:35:13.035113Z"},"links":{"citing_paper":"/paper/2501.08057"},"observation_digest":"sha256:3478456240b1af27a33bfc23bb44526f372d850d793c7cb730397c7d5a44da9f","observation_id":"7db3994b-4a62-4b3c-a152-892cfc5cc83b","resolution":{"observed_at":"2026-08-10T20:35:13.544333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.10073","last_updated":"2020-02-14T20:49:40Z","snapshot_observed_at":"2026-07-06T08:31:23.192830Z","submitted_at":"2019-10-22T16:15:58Z","title":"Depth-Adaptive Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.10073","snapshot_observed_at":"2026-08-10T20:35:13.040015Z","title":"Depth- adaptive transformer,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2501.08057","last_updated":"2025-01-14T12:12:06Z","snapshot_observed_at":"2026-08-10T20:27:17.008602Z","submitted_at":"2025-01-14T12:12:06Z","title":"Optimizing Speech Multi-View Feature Fusion through Conditional Computation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T20:35:13.040015Z"},"links":{"cited_paper":"/paper/1910.10073","citing_paper":"/paper/2501.08057"},"observation_digest":"sha256:3a287219717d42aa070ffbcc8a1d1b467544532f1d21f2b55b3994f4a5e35b98","observation_id":"d1f92b65-ee65-4a44-b930-b9bf5021c6f9","resolution":{"observed_at":"2026-08-10T20:35:13.040015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16710","last_updated":"2024-10-18T04:02:31Z","snapshot_observed_at":"2026-08-08T01:15:44.293937Z","submitted_at":"2024-04-25T16:20:23Z","title":"LayerSkip: Enabling Early Exit Inference and Self-Speculative Decoding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16710","snapshot_observed_at":"2026-08-10T20:35:13.048303Z","title":"Layer skip: Enabling early exit inference and self-speculative decoding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.08057","last_updated":"2025-01-14T12:12:06Z","snapshot_observed_at":"2026-08-10T20:27:17.008602Z","submitted_at":"2025-01-14T12:12:06Z","title":"Optimizing Speech Multi-View Feature Fusion through Conditional Computation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T20:35:13.048303Z"},"links":{"cited_paper":"/paper/2404.16710","citing_paper":"/paper/2501.08057"},"observation_digest":"sha256:a817f5c85b849d8d9a62035ce7df946f084535ab80159a39989423e5e6aea7f4","observation_id":"5f92795d-8300-4ff3-a32a-b55de0f7c3a0","resolution":{"observed_at":"2026-08-10T20:35:13.048303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:35:13.519423Z","title":"Modeling task relationships in multi-task learning with multi- gate mixture-of-experts,","venue":null,"work_id":"983b6c7a-7054-4ab1-b343-6d8726827966","year":2018},"citing_paper":{"arxiv_id":"2501.08057","last_updated":"2025-01-14T12:12:06Z","snapshot_observed_at":"2026-08-10T20:27:17.008602Z","submitted_at":"2025-01-14T12:12:06Z","title":"Optimizing Speech Multi-View Feature Fusion through Conditional Computation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T20:35:13.054186Z"},"links":{"citing_paper":"/paper/2501.08057"},"observation_digest":"sha256:d5862677559a51e908a1c192a0b52a3599fb7a808535bea12c6c4f85d72c4956","observation_id":"1de2a624-7275-406c-99f7-68507eac3d18","resolution":{"observed_at":"2026-08-10T20:35:13.525266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.07689","last_updated":"2022-04-16T00:56:12Z","snapshot_observed_at":"2026-08-06T20:30:25.020976Z","submitted_at":"2022-04-16T00:56:12Z","title":"Sparsely Activated Mixture-of-Experts are Robust Multi-Task Learners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.07689","snapshot_observed_at":"2026-08-10T20:35:13.059024Z","title":"Sparsely activated mixture-of-experts are robust multi-task learners,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.08057","last_updated":"2025-01-14T12:12:06Z","snapshot_observed_at":"2026-08-10T20:27:17.008602Z","submitted_at":"2025-01-14T12:12:06Z","title":"Optimizing Speech Multi-View Feature Fusion through Conditional Computation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T20:35:13.059024Z"},"links":{"cited_paper":"/paper/2204.07689","citing_paper":"/paper/2501.08057"},"observation_digest":"sha256:8b35bbcd8f38587837bd6994585ba81d70680062a46c4680c2ffe13faa75dedf","observation_id":"263ec31d-b428-4805-8b60-79b344d77f15","resolution":{"observed_at":"2026-08-10T20:35:13.059024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.05752","last_updated":"2021-06-15T07:29:41Z","snapshot_observed_at":"2026-07-06T11:08:49.575854Z","submitted_at":"2021-05-12T16:09:53Z","title":"Stacked Acoustic-and-Textual Encoding: Integrating the Pre-trained Models into Speech Translation Encoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.05752","snapshot_observed_at":"2026-08-10T20:35:13.064469Z","title":"Stacked acoustic-and-textual encoding: Integrating the pre-trained models into speech translation encoders,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.08057","last_updated":"2025-01-14T12:12:06Z","snapshot_observed_at":"2026-08-10T20:27:17.008602Z","submitted_at":"2025-01-14T12:12:06Z","title":"Optimizing Speech Multi-View Feature Fusion through Conditional Computation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T20:35:13.064469Z"},"links":{"cited_paper":"/paper/2105.05752","citing_paper":"/paper/2501.08057"},"observation_digest":"sha256:079de85eb0a4b0f7a1720c82860d1071bbd41cf6e008f3e8d123f6c95b7c3339","observation_id":"fa28073f-17e4-43b5-b200-a7138ab9261d","resolution":{"observed_at":"2026-08-10T20:35:13.064469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:35:13.499096Z","title":"Soft Alignment of Modality Space for End-to- End Speech Translation,","venue":null,"work_id":"02b6c19f-2418-4256-8c2d-1f851c67c7bb","year":2024},"citing_paper":{"arxiv_id":"2501.08057","last_updated":"2025-01-14T12:12:06Z","snapshot_observed_at":"2026-08-10T20:27:17.008602Z","submitted_at":"2025-01-14T12:12:06Z","title":"Optimizing Speech Multi-View Feature Fusion through Conditional Computation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T20:35:13.069007Z"},"links":{"citing_paper":"/paper/2501.08057"},"observation_digest":"sha256:e763ee39981c5a73aab373ce2577d5ab4336fde4bb4e669134bf8998f5a070b6","observation_id":"83c81a68-fcf4-4208-8a2d-4c9dba5f3425","resolution":{"observed_at":"2026-08-10T20:35:13.505664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:35:13.073686Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.08057","last_updated":"2025-01-14T12:12:06Z","snapshot_observed_at":"2026-08-10T20:27:17.008602Z","submitted_at":"2025-01-14T12:12:06Z","title":"Optimizing Speech Multi-View Feature Fusion through Conditional Computation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T20:35:13.073686Z"},"links":{"citing_paper":"/paper/2501.08057"},"observation_digest":"sha256:e57abaedd57f8bfc896e145753d0800071ba793703682fb2ecbbf62b58045e5c","observation_id":"0c0b2c8b-78c2-4d45-8c40-a2ae4576bdef","resolution":{"observed_at":"2026-08-10T20:35:13.073686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:35:13.468494Z","title":"Progres- sive layered extraction (ple): A novel multi-task learning (mtl) model for personalized recommendations,","venue":null,"work_id":"bef0828e-d1dc-4bdf-ab15-9531e2e2ac26","year":2020},"citing_paper":{"arxiv_id":"2501.08057","last_updated":"2025-01-14T12:12:06Z","snapshot_observed_at":"2026-08-10T20:27:17.008602Z","submitted_at":"2025-01-14T12:12:06Z","title":"Optimizing Speech Multi-View Feature Fusion through Conditional Computation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T20:35:13.078447Z"},"links":{"citing_paper":"/paper/2501.08057"},"observation_digest":"sha256:58a402cb36439336a278f893facb35e0601a63e16c74f246de25e93c013a1318","observation_id":"c91f3c40-8959-479e-8e60-55284b580e68","resolution":{"observed_at":"2026-08-10T20:35:13.472636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:35:13.455293Z","title":"Gradient surgery for multi-task learning,","venue":null,"work_id":"9d2e9485-05c0-4535-b979-94306a724a6f","year":2020},"citing_paper":{"arxiv_id":"2501.08057","last_updated":"2025-01-14T12:12:06Z","snapshot_observed_at":"2026-08-10T20:27:17.008602Z","submitted_at":"2025-01-14T12:12:06Z","title":"Optimizing Speech Multi-View Feature Fusion through Conditional Computation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T20:35:13.085525Z"},"links":{"citing_paper":"/paper/2501.08057"},"observation_digest":"sha256:e04c21d99c507e36d2ddc571b9bcafbb5e2f7aa5c0ca929dd2acfc9298725b72","observation_id":"ae696b85-5208-455c-aa0f-73fe035f49be","resolution":{"observed_at":"2026-08-10T20:35:13.459433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:35:13.438925Z","title":"Must-c: a multilingual speech translation corpus,","venue":null,"work_id":"b8f23ba2-7130-4b04-857c-895f591ae982","year":2019},"citing_paper":{"arxiv_id":"2501.08057","last_updated":"2025-01-14T12:12:06Z","snapshot_observed_at":"2026-08-10T20:27:17.008602Z","submitted_at":"2025-01-14T12:12:06Z","title":"Optimizing Speech Multi-View Feature Fusion through Conditional Computation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T20:35:13.095399Z"},"links":{"citing_paper":"/paper/2501.08057"},"observation_digest":"sha256:ae110a3448ea0adf7492c71ddb777355fc6a43bf9c08c7a59b23b946f2dd80f9","observation_id":"713c1147-2693-4839-b9f0-74d40a04d96d","resolution":{"observed_at":"2026-08-10T20:35:13.445597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:35:13.421130Z","title":"Librispeech: an asr corpus based on public domain audio books,","venue":null,"work_id":"8f8d888e-7ffb-4cb1-b488-d06e14427f33","year":2015},"citing_paper":{"arxiv_id":"2501.08057","last_updated":"2025-01-14T12:12:06Z","snapshot_observed_at":"2026-08-10T20:27:17.008602Z","submitted_at":"2025-01-14T12:12:06Z","title":"Optimizing Speech Multi-View Feature Fusion through Conditional Computation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T20:35:13.101348Z"},"links":{"citing_paper":"/paper/2501.08057"},"observation_digest":"sha256:d0ea989955ae592e4e0385147157e4e55ccb8f99882f38d5bd00e88680269b0f","observation_id":"71a5f744-1695-4b27-8df8-d5357121a6c1","resolution":{"observed_at":"2026-08-10T20:35:13.427050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07650","last_updated":"2023-06-13T09:42:48Z","snapshot_observed_at":"2026-07-06T15:41:59.079694Z","submitted_at":"2023-06-13T09:42:48Z","title":"Modality Adaption or Regularization? A Case Study on End-to-End Speech Translation","version":1},"cited_work":{"arxiv_id":"2306.07650","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.07650","snapshot_observed_at":"2026-08-10T20:35:13.200494Z","title":"Modality Adaption or Regularization? A Case Study on End-to-End Speech Translation","venue":"cs.CL","work_id":"5da34ee9-ffe9-4a05-9d05-cb20262e76dd","year":2023},"citing_paper":{"arxiv_id":"2501.08057","last_updated":"2025-01-14T12:12:06Z","snapshot_observed_at":"2026-08-10T20:27:17.008602Z","submitted_at":"2025-01-14T12:12:06Z","title":"Optimizing Speech Multi-View Feature Fusion through Conditional Computation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T20:35:13.106571Z"},"links":{"cited_paper":"/paper/2306.07650","citing_paper":"/paper/2501.08057"},"observation_digest":"sha256:f3058a39be6cee64db9d76574f6e673aee1df36802937de1c14169550a3694f6","observation_id":"59eb1700-894c-4115-9694-734437d47877","resolution":{"observed_at":"2026-08-10T20:35:13.209587Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-10T20:35:13.113877Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.08057","last_updated":"2025-01-14T12:12:06Z","snapshot_observed_at":"2026-08-10T20:27:17.008602Z","submitted_at":"2025-01-14T12:12:06Z","title":"Optimizing Speech Multi-View Feature Fusion through Conditional Computation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T20:35:13.113877Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2501.08057"},"observation_digest":"sha256:02380492583959c1800e2c5e82dc624921d07cd7f49abd52b6a786136bc9fedd","observation_id":"0b0fa77c-ad3e-4681-a185-8a1832ed8f8f","resolution":{"observed_at":"2026-08-10T20:35:13.113877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.08771","last_updated":"2018-09-12T14:13:33Z","snapshot_observed_at":"2026-08-10T08:51:09.033778Z","submitted_at":"2018-04-23T22:54:55Z","title":"A Call for Clarity in Reporting BLEU Scores","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.08771","snapshot_observed_at":"2026-08-10T20:35:13.120441Z","title":"A call for clarity in reporting BLEU scores,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.08057","last_updated":"2025-01-14T12:12:06Z","snapshot_observed_at":"2026-08-10T20:27:17.008602Z","submitted_at":"2025-01-14T12:12:06Z","title":"Optimizing Speech Multi-View Feature Fusion through Conditional Computation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T20:35:13.120441Z"},"links":{"cited_paper":"/paper/1804.08771","citing_paper":"/paper/2501.08057"},"observation_digest":"sha256:7eb293d6c17ae1b162ef0855c18df0aef65d392ed1988f8d49a5c512a9778a2e","observation_id":"1d095de8-3b52-489a-81f0-adfc5bb1981d","resolution":{"observed_at":"2026-08-10T20:35:13.120441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.08057","last_updated":"2025-01-14T12:12:06Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-10T20:27:17.008602Z","submitted_at":"2025-01-14T12:12:06Z","title":"Optimizing Speech Multi-View Feature Fusion through Conditional Computation"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":1,"verified_fuzzy":17},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2501.08057."}