{"as_of":"2026-08-08T03:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9b467d560f278c040827845a7bc29c302fb619a6a184437c52cc1f0f81677bb8","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:39:48.043254Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:39:41.644202Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T12:39:49.151368Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-07T12:34:21.729257Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"cited_work":{"arxiv_id":"2505.24059","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.24059","snapshot_observed_at":"2026-08-07T12:39:49.151368Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","venue":"cs.LG","work_id":"9814cbdb-b33d-4922-b097-46d70125e24e","year":2025},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-07T12:34:21.729257Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:41.644202Z"},"links":{"cited_paper":"/paper/2505.24059","citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:6f0c126825bd51c082852a79d57a8fb68548d4bdb135ebe94eedd3461f5df2c1","observation_id":"4b43e443-4b31-4fb0-aec0-873a25c92896","resolution":{"observed_at":"2026-08-07T12:39:49.286208Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.24059/citation-record","integrity":"/paper/2505.24059/integrity","json":"/paper/2505.24059/citation-record.json","paper":"/paper/2505.24059"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:56.794208Z","title":"In speech production, individ- ual variability in both articulation and its consequent acoustics is robust [4, 5]","venue":null,"work_id":"6e37f2cd-046c-4dc3-ae98-4d021031c41f","year":null},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-07T12:34:21.729257Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:41.558755Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:4418acec01968abb49aba046c8352ddb95d41ba1cc664eae47c167cce9b35fe6","observation_id":"a03eef48-8f97-425e-931d-ecfed85ff136","resolution":{"observed_at":"2026-08-07T12:39:56.910034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-07T12:34:21.729257Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"cited_work":{"arxiv_id":"2505.24059","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.24059","snapshot_observed_at":"2026-08-07T12:39:49.151368Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","venue":"cs.LG","work_id":"9814cbdb-b33d-4922-b097-46d70125e24e","year":2025},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-07T12:34:21.729257Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:41.644202Z"},"links":{"cited_paper":"/paper/2505.24059","citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:6f0c126825bd51c082852a79d57a8fb68548d4bdb135ebe94eedd3461f5df2c1","observation_id":"4b43e443-4b31-4fb0-aec0-873a25c92896","resolution":{"observed_at":"2026-08-07T12:39:49.286208Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:56.338307Z","title":"Dataset We use a new single speaker rtMRI corpus with simultaneously recorded audio and video","venue":null,"work_id":"9155fcd8-75d4-43e2-a67f-1db93fcf075b","year":null},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-07T12:34:21.729257Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:41.990420Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:b7ffa032a6f7940b87e535bc375063776dedd2558a3649708c7b8d5097fdc429","observation_id":"19660cb0-be24-429e-ab9b-effb73b85fca","resolution":{"observed_at":"2026-08-07T12:39:56.432731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:55.907314Z","title":"Phoneme error rate (PER) The overall PER results on the held-out test set are presented in Table 1","venue":null,"work_id":"dc4a7ea4-146f-43a3-a0b0-c18bf13feeee","year":null},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-07T12:34:21.729257Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:42.226483Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:ef0dbc87d60e70e25c5ea79c4c1004a0812ec235b584e3ab1b941646cacd0416","observation_id":"303e5974-c565-4d3d-aa47-6264830f8626","resolution":{"observed_at":"2026-08-07T12:39:56.067956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:55.633071Z","title":null,"venue":null,"work_id":"373ebbf8-79db-44a8-84f4-ae77003835a1","year":null},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-07T12:34:21.729257Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:42.386227Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:fb64abb0b69385d15667eecf3a102653f7f8bc236ca43928635b42c7f07ea1c6","observation_id":"8bdbaa1d-acef-4eb8-a05f-8f629f3b9610","resolution":{"observed_at":"2026-08-07T12:39:55.692447Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:55.485999Z","title":null,"venue":null,"work_id":"0ddddc54-6c5f-4155-95c0-03c6a955e74c","year":null},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-07T12:34:21.729257Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:42.468817Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:cbb84f50da6dac7d2437e9ae63e1ac4ce7bf1f3f63e322add9fdffc09cb81689","observation_id":"4f9464f1-031f-4df4-aa14-49e5721d453c","resolution":{"observed_at":"2026-08-07T12:39:55.539004Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:54.346091Z","title":"The architecture of speech production and the role of the phoneme in speech processing,","venue":null,"work_id":"6180a0fc-f41f-422e-a0c8-747849c1623f","year":2014},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-07T12:34:21.729257Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:43.937557Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:0791c996036db3ee4e0bdadf9f53fcc3057b526f5b9c9e47e3b1f383d31fec08","observation_id":"b55612bd-f444-4527-91c0-4121046af81d","resolution":{"observed_at":"2026-08-07T12:39:54.456393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:54.074109Z","title":null,"venue":null,"work_id":"cbf91f90-8aed-47d6-8914-112f72121087","year":2018},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-07T12:34:21.729257Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:44.133282Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:633e476b34b63095a894f2af42a08b0d9c8bc17a7e6f53c7d1bb368fbcf11cc7","observation_id":"02634c6e-5d51-4923-8e6b-70a56bd6e2f3","resolution":{"observed_at":"2026-08-07T12:39:54.199624Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:55.282571Z","title":"Sensorimotor integration in speech processing: computational basis and neural organization,","venue":null,"work_id":"65051903-2a08-412c-9842-78dcf329042d","year":2011},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-07T12:34:21.729257Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:42.627165Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:75b745a67a20cfda4fe2c952f53ccc28e5174216d0536f6346f125c119397dc5","observation_id":"ad08ce4c-bade-4fbb-9f2a-e86bc7862945","resolution":{"observed_at":"2026-08-07T12:39:55.388476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:55.117113Z","title":"Perception drives production across sensory modalities: A network for sensorimotor integration of visual speech,","venue":null,"work_id":"1225f11a-78a9-480b-96c3-77c925055610","year":2016},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-07T12:34:21.729257Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:42.893417Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:5d26f5bf265e5f16e300430b14f5f6e8ea295c559c0fba3eb78c13b4a0cf95ce","observation_id":"cefcdd35-e84e-47e7-83a3-67e13141c8a9","resolution":{"observed_at":"2026-08-07T12:39:55.193380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:54.912559Z","title":"The role of temporal modulation in sensorimotor interaction,","venue":null,"work_id":"74c0e0d0-4bc5-4d27-911e-d488b85d8ff6","year":2019},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-07T12:34:21.729257Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:43.106505Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:c8297dcc930ff993e05cf8c19e09bdd2fb69af38f13c584fbb274d4b7d3a1eea","observation_id":"ba572b53-d737-4711-b1dc-fc85b808dfda","resolution":{"observed_at":"2026-08-07T12:39:54.996114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:54.715404Z","title":"Variability of articulator positions and formants across nine english vowels,","venue":null,"work_id":"cf562888-7688-42d7-8855-0f49a908905a","year":2018},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-07T12:34:21.729257Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:43.308671Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:f770e59e34e703169ce30094c6ae59308b6b1f4665d63adef93badd789037f8f","observation_id":"85e5706b-555a-4ae0-bd48-ce09cd3fa621","resolution":{"observed_at":"2026-08-07T12:39:54.823327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:54.539345Z","title":null,"venue":null,"work_id":"12a95bb6-da6a-45cb-a9b1-ce6e3de8fe66","year":2021},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-07T12:34:21.729257Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:43.525990Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:133019dd1ec9283769881b015dbe292bd6e5c476ccf6e7b3d6dccbbe25494cd4","observation_id":"28164159-cfd1-489b-9d53-4391d0aed9db","resolution":{"observed_at":"2026-08-07T12:39:54.596321Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:43.714834Z","title":"Articulatory phonology: An overview,","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-07T12:34:21.729257Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:43.714834Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:99c30430c614c74e460260b00b59e06f9877b81e428e83665f84e7cbd0686ab6","observation_id":"3583cc3e-bcdd-47fe-a774-a655e5c0234e","resolution":{"observed_at":"2026-08-07T12:39:43.714834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:52.941347Z","title":"Multimodal representations for syn- chronized speech and real-time mri video processing,","venue":null,"work_id":"351db2a4-e9d4-4f1e-b2cf-77fde042a2a4","year":1912},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-07T12:34:21.729257Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:45.396716Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:a6476bb9da3703642172a72d318749f3433759cdf2bb4629dfaf4928af58045f","observation_id":"1db0d81e-9b23-4164-93c8-43726580f67d","resolution":{"observed_at":"2026-08-07T12:39:53.064691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:52.792117Z","title":"Towards speech classification from acous- tic and vocal tract data in real-time mri,","venue":null,"work_id":"469c1cea-b408-47af-969b-604fa1532783","year":2024},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-07T12:34:21.729257Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:45.545477Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:f562fde3f83022196529d6a61273c666004a0aefb5400417e8eae8fff69775c0","observation_id":"2e3d5334-098b-416f-8c84-7c5c79b3c398","resolution":{"observed_at":"2026-08-07T12:39:52.867621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.02184","last_updated":"2022-03-13T01:52:28Z","snapshot_observed_at":"2026-08-07T00:15:34.035413Z","submitted_at":"2022-01-05T17:40:45Z","title":"Learning Audio-Visual Speech Representation by Masked Multimodal Cluster Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.02184","snapshot_observed_at":"2026-08-07T12:39:44.345646Z","title":"Learning audio-visual speech representation by masked multimodal cluster prediction,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-07T12:34:21.729257Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:44.345646Z"},"links":{"cited_paper":"/paper/2201.02184","citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:b2d11a155bfbff6b1a29bd491a94bcb51fa9e97e4bca2e75516f13fec0e43463","observation_id":"e7a1966a-fbb3-4274-88fc-a3c1116e54fb","resolution":{"observed_at":"2026-08-07T12:39:44.345646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12370","last_updated":"2024-09-19T00:08:28Z","snapshot_observed_at":"2026-08-05T14:02:40.654161Z","submitted_at":"2024-09-19T00:08:28Z","title":"Robust Audiovisual Speech Recognition Models with Mixture-of-Experts","version":1},"cited_work":{"arxiv_id":"2409.12370","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.12370","snapshot_observed_at":"2026-08-07T12:39:48.852053Z","title":"Robust Audiovisual Speech Recognition Models with Mixture-of-Experts","venue":"eess.AS","work_id":"fa13d460-f3d2-44bb-b585-6a8f4e1c12ef","year":2024},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-07T12:34:21.729257Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:44.552105Z"},"links":{"cited_paper":"/paper/2409.12370","citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:6bc496e65d2e0bc4b3929f54c16e50e62d4c8f93ce7293cc76a4d900bc007161","observation_id":"f2a4bde9-cf0a-4d2d-8385-60c6cee01e8c","resolution":{"observed_at":"2026-08-07T12:39:48.950065Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:53.775584Z","title":"Speech production real-time mri at 0.55 t,","venue":null,"work_id":"a8882ad9-e8dc-43e4-a552-e7903b8a0cad","year":2024},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-07T12:34:21.729257Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:44.741094Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:1d8a30a28559351c76afaea2c9a1a591a896d1a6ca8631293bccfa7032c1842a","observation_id":"002a3ab1-5feb-492e-a620-76fbaab3bf76","resolution":{"observed_at":"2026-08-07T12:39:53.935947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:53.405719Z","title":"A multispeaker dataset of raw and reconstructed speech production real-time mri video and 3d volumetric images,","venue":null,"work_id":"df14e203-21f6-42a1-8773-ec24537a7b0f","year":2021},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-07T12:34:21.729257Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:44.921151Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:a8b702dcd884b40e59242e76ce5a2280db67e0824ccae860e67c25ffae4f9f76","observation_id":"84caf0c9-50a7-4904-89ba-54b5dbe728e1","resolution":{"observed_at":"2026-08-07T12:39:53.599113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:56.578917Z","title":"The output of the Conformer is decoded by a single LSTM layer, with a final linear layer used for prediction","venue":null,"work_id":"ba5635b9-dd7b-4f88-9cc5-0aa6118a21dc","year":null},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-07T12:34:21.729257Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:41.818246Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:ce24b51acc1662ac5ef7965ef2e277560a92a8cc50a7325b8b33b0f4d15b5d56","observation_id":"943031f2-54a5-4935-baf7-120ab28b8497","resolution":{"observed_at":"2026-08-07T12:39:56.668434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.11089","last_updated":"2018-07-29T17:36:08Z","snapshot_observed_at":"2026-07-06T06:52:56.132722Z","submitted_at":"2018-07-29T17:36:08Z","title":"Towards Automatic Speech Identification from Vocal Tract Shape Dynamics in Real-time MRI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.11089","snapshot_observed_at":"2026-08-07T12:39:45.026461Z","title":"Towards automatic speech identification from vocal tract shape dynamics in real-time mri,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-07T12:34:21.729257Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:45.026461Z"},"links":{"cited_paper":"/paper/1807.11089","citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:d18cb9a2e79e6f9733bf50327d462fdd5d0346da2026ec4bb13857f931562605","observation_id":"53f86a46-9a4c-4b2a-b685-81efa2cfa5ac","resolution":{"observed_at":"2026-08-07T12:39:45.026461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:53.170814Z","title":"Cnn-based phoneme classifier from vocal tract mri learns embed- ding consistent with articulatory topology","venue":null,"work_id":"687eec15-8032-44a0-a442-077ad7a96a71","year":2019},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-07T12:34:21.729257Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:45.220360Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:74e96cbaac5461ffc5c07f42c527ad876ecfccd1b4f0d795976fa572fecd78e4","observation_id":"8f0f584e-2244-427e-894a-e5164b58361b","resolution":{"observed_at":"2026-08-07T12:39:53.277765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:50.376872Z","title":"Eval- uation of a novel 8-channel rx coil for speech production mri at 0.55 t,","venue":null,"work_id":"81686591-cf10-4c1f-b969-8f9fdcfa6b7c","year":2023},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-07T12:34:21.729257Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:46.700802Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:c6b99d2d7290b5f1bed03045639317f7624695cfb3dd4efc385768c3a27fa880","observation_id":"c7435ec9-7a19-48f8-8a38-cca29cc75173","resolution":{"observed_at":"2026-08-07T12:39:50.456383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:52.528968Z","title":"Direct articulatory observa- tion reveals phoneme recognition performance characteristics of a self-supervised speech model,","venue":null,"work_id":"62c344c6-c712-4e64-bdce-acb88b677761","year":2024},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-07T12:34:21.729257Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:45.684601Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:f735dcb1286e71e3cd15ac02c7acb2aba248f81a7ee636eb3a721d9a6f7331b0","observation_id":"3d723bf9-a38a-4dce-b296-52a9c168af75","resolution":{"observed_at":"2026-08-07T12:39:52.651440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:52.280326Z","title":"Usc-timit: A database of multimodal speech production data,","venue":null,"work_id":"37401be6-3910-47ed-9f04-9fc018288ee6","year":2013},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-07T12:34:21.729257Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:45.838539Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:e883c703fbda877870d3d6ef4edf35f8a98b95f86c9a349c781f641e748d0f27","observation_id":"4a4267c1-21c3-48f6-8d48-5aa5897810fa","resolution":{"observed_at":"2026-08-07T12:39:52.392791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:52.032512Z","title":"Database of volumetric and real-time vocal tract mri for speech science","venue":null,"work_id":"81beca22-0562-438e-b535-3542351b89b7","year":2017},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-07T12:34:21.729257Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:46.054670Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:39a511617ea6922796c3e2b6d3822d60c0a2d6ea1ca05333e3c47c75745c5f53","observation_id":"4a5597dc-eb9f-4ab4-835b-3445f4b1a323","resolution":{"observed_at":"2026-08-07T12:39:52.163254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:50.535481Z","title":"Characterization of inter-speaker articulatory variability: A two- level multi-speaker modelling approach based on mri data,","venue":null,"work_id":"4bb619b1-36b2-4820-b987-43a9fd6eea45","year":2019},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-07T12:34:21.729257Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:46.187469Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:a24c6e29d8aacb5a32736b03cf74935f694f44d636a8ab6b3e314f6a80dc03bf","observation_id":"93f597cf-99dd-42af-a453-18d0d01513ef","resolution":{"observed_at":"2026-08-07T12:39:50.879504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-07-06T09:20:55.416309Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-07T12:39:46.387249Z","title":"Conformer: Convolution- augmented transformer for speech recognition,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-07T12:34:21.729257Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:46.387249Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:503086a14d277fc8ec8fef5cd540bca9edd782df5250cd99db74fcdd05231c8b","observation_id":"61506fae-6150-4f64-9c98-12aa2c30bd3e","resolution":{"observed_at":"2026-08-07T12:39:46.387249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:46.480237Z","title":"Connectionist temporal classification: labelling unsegmented sequence data with recurrent neural networks,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-07T12:34:21.729257Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:46.480237Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:04ac32a75aa2bc2942db7d5af5573c3774ebd0602826ae546c1b488f0ee1e526","observation_id":"871471fd-e05a-40c1-99e4-0a104d85efe2","resolution":{"observed_at":"2026-08-07T12:39:46.480237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.11680","last_updated":"2021-09-23T22:50:32Z","snapshot_observed_at":"2026-08-02T00:37:53.191869Z","submitted_at":"2021-09-23T22:50:32Z","title":"Simple and Effective Zero-shot Cross-lingual Phoneme Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.11680","snapshot_observed_at":"2026-08-07T12:39:46.592923Z","title":"Simple and effective zero-shot cross-lingual phoneme recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-07T12:34:21.729257Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:46.592923Z"},"links":{"cited_paper":"/paper/2109.11680","citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:a76c0f5775507a2bb400014e1bf0dc326945c6f8c6d19141f4de23ebc198b7bb","observation_id":"6f715e8c-6636-4581-b5c9-a3e2626e3e08","resolution":{"observed_at":"2026-08-07T12:39:46.592923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.09723","last_updated":"2022-07-03T19:28:10Z","snapshot_observed_at":"2026-07-06T13:11:46.425668Z","submitted_at":"2022-05-19T17:34:18Z","title":"Robust and Efficient Medical Imaging with Self-Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.09723","snapshot_observed_at":"2026-08-07T12:39:47.585835Z","title":"Ro- bust and efficient medical imaging with self-supervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-07T12:34:21.729257Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:47.585835Z"},"links":{"cited_paper":"/paper/2205.09723","citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:42ca1a342ce23a0429607dd7b2b39c5567b545833cfdda98bd109814c6331ff7","observation_id":"e9410a79-ce06-4001-8534-f1eba9e98040","resolution":{"observed_at":"2026-08-07T12:39:47.585835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:50.079450Z","title":"State-of-the-art speech production mri protocol for new 0.55 tesla scanners,","venue":null,"work_id":"50dffc89-ab90-45ed-bd07-e1bff620ee80","year":2024},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-07T12:34:21.729257Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:46.766700Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:86cf02a82f655ab1eaea5aa08b8fd102338d489ad925701e507590a22a92b5b8","observation_id":"445e246d-f9f9-4650-8dd7-e3230c14340d","resolution":{"observed_at":"2026-08-07T12:39:50.243216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:49.721838Z","title":"Announcing the electro- magnetic articulography (day 1) subset of the mngu0 articulatory corpus,","venue":null,"work_id":"8fb18e43-caf3-42f5-ab51-6fbe6cbb78eb","year":2011},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-07T12:34:21.729257Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:46.910754Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:001085715fdbd0e39212505e1f3c1c20007e3d6a07de5304e41e29441e908b27","observation_id":"93c1d063-cc4a-4c4c-88a2-c60ffcfbd0fb","resolution":{"observed_at":"2026-08-07T12:39:49.890156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.12847","last_updated":"2020-09-06T14:32:59Z","snapshot_observed_at":"2026-07-06T09:31:50.012114Z","submitted_at":"2020-06-23T09:19:13Z","title":"Real Time Speech Enhancement in the Waveform Domain","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.12847","snapshot_observed_at":"2026-08-07T12:39:47.014834Z","title":"Real time speech enhancement in the waveform domain,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-07T12:34:21.729257Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:47.014834Z"},"links":{"cited_paper":"/paper/2006.12847","citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:d47d826877c19050011fcde9e7200f6da21cce7cca70a483f93122c54752dde3","observation_id":"75c526be-bcfc-442f-bfee-473c2513d850","resolution":{"observed_at":"2026-08-07T12:39:47.014834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:47.089969Z","title":"Wavlm: Large-scale self- supervised pre-training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-07T12:34:21.729257Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:47.089969Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:6d9ce72f7079d631a79af8f93b54544b3d925efd375fdda7b9c2c1fd3fdf9944","observation_id":"1808e0f1-00ca-4fce-bb7b-e83a42107629","resolution":{"observed_at":"2026-08-07T12:39:47.089969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11723","last_updated":"2023-07-21T03:12:13Z","snapshot_observed_at":"2026-08-05T09:22:50.877435Z","submitted_at":"2022-10-21T04:24:29Z","title":"Evidence of Vocal Tract Articulation in Self-Supervised Learning of Speech","version":3},"cited_work":{"arxiv_id":"2210.11723","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.11723","snapshot_observed_at":"2026-08-07T12:39:48.320375Z","title":"Evidence of Vocal Tract Articulation in Self-Supervised Learning of Speech","venue":"eess.AS","work_id":"233886fd-fc65-470d-80d6-ca680c557c9a","year":2022},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-07T12:34:21.729257Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:47.199046Z"},"links":{"cited_paper":"/paper/2210.11723","citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:4cdb25d5b1f710b8cee771eef2ac6e6776845a61115b877f603de1fc70fd2496","observation_id":"951f1270-1d31-4711-90cc-71a59945f422","resolution":{"observed_at":"2026-08-07T12:39:48.383512Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T12:39:47.361459Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-07T12:34:21.729257Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:47.361459Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:2d8ef767aefa7643b8c200e178035fcf90f663e6ce39f96edbe42530c3ddd326","observation_id":"4d4b0c77-17ab-4de1-82bb-8b7beb2f3203","resolution":{"observed_at":"2026-08-07T12:39:47.361459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05709","last_updated":"2020-07-01T00:09:08Z","snapshot_observed_at":"2026-08-02T19:54:26.138356Z","submitted_at":"2020-02-13T18:50:45Z","title":"A Simple Framework for Contrastive Learning of Visual Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05709","snapshot_observed_at":"2026-08-07T12:39:47.436332Z","title":"A sim- ple framework for contrastive learning of visual representations,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-07T12:34:21.729257Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:47.436332Z"},"links":{"cited_paper":"/paper/2002.05709","citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:175df87b151564ba28dff21865cf48bd9a8fa1a9097dbd4877fb689dec73497a","observation_id":"f2bc14b2-647d-4a89-8c33-86c79e04dbc2","resolution":{"observed_at":"2026-08-07T12:39:47.436332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:47.724939Z","title":"Visualizing data using t-sne","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-07T12:34:21.729257Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:47.724939Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:9ecd9e1d6ea44a4af231c86186add521524769814e0347a73d33f9cd7a7aa807","observation_id":"8a6cf77d-0e33-4af0-8982-9e0ea2a20e6d","resolution":{"observed_at":"2026-08-07T12:39:47.724939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:49.449288Z","title":"Toward articulatory- acoustic models for liquid approximants based on mri and epg data. part ii. the rhotics,","venue":null,"work_id":"7033e8f5-92b1-4e19-ad6f-9636114b67c5","year":1997},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-07T12:34:21.729257Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:47.898973Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:47b0144464c72994ef495044176408ce5ed637145ca49607f1e75b1a1abe78db","observation_id":"c9039109-fc06-40f7-9e0d-fc49b769315d","resolution":{"observed_at":"2026-08-07T12:39:49.529579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:48.043254Z","title":"Articulatory characterization of english liquid- final rimes,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-07T12:34:21.729257Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:48.043254Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:c887c3d1380140a33ea3f385a93bdd1499f3314fa23d279ced1be83acd25f49c","observation_id":"1251a66c-05b6-4b09-ad8a-62368c93a71e","resolution":{"observed_at":"2026-08-07T12:39:48.043254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:56.160843Z","title":"The number of Conformer layers was set to 3","venue":null,"work_id":"ee9b1b5b-ffcb-481f-80c5-215423f046fa","year":null},"citing_paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","snapshot_observed_at":"2026-08-07T12:34:21.729257Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition","version":1},"reference_index":256,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:42.111215Z"},"links":{"citing_paper":"/paper/2505.24059"},"observation_digest":"sha256:443d151052c4f233688cd9049957ca2249ead06083bca2cdfb94961ea52fa9db","observation_id":"c6434ec6-3f83-45d8-b41f-4669a6b8313b","resolution":{"observed_at":"2026-08-07T12:39:56.210483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.24059","last_updated":"2025-05-29T23:03:08Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T12:34:21.729257Z","submitted_at":"2025-05-29T23:03:08Z","title":"Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":3,"verified_fuzzy":23},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 1 inbound Pith citation observation for arXiv:2505.24059."}