{"as_of":"2026-08-07T21:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ce0eeff093fb05d3dad544a67f0706c5f189b23010e59af696b25e18e83b2f39","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:53:51.803073Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:53:48.450553Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T22:53:52.505268Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","snapshot_observed_at":"2026-08-06T22:47:50.545533Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","version":1},"cited_work":{"arxiv_id":"2506.20361","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.20361","snapshot_observed_at":"2026-08-06T22:53:52.505268Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","venue":"eess.AS","work_id":"e04ced98-4047-4248-ae87-691a2ff8ea83","year":2025},"citing_paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","snapshot_observed_at":"2026-08-06T22:47:50.545533Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:48.450553Z"},"links":{"cited_paper":"/paper/2506.20361","citing_paper":"/paper/2506.20361"},"observation_digest":"sha256:dc82a884c939518154d8c8de7b16358fab9a5df97168aefbd407d9b426cc5a2a","observation_id":"29e31935-0a1a-4314-8027-bc8c1e01f636","resolution":{"observed_at":"2026-08-06T22:53:52.613791Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.20361/citation-record","integrity":"/paper/2506.20361/integrity","json":"/paper/2506.20361/citation-record.json","paper":"/paper/2506.20361"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:56.354039Z","title":null,"venue":null,"work_id":"04a1ab9c-9bdc-4128-b149-e994f291eaf3","year":null},"citing_paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","snapshot_observed_at":"2026-08-06T22:47:50.545533Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:48.237549Z"},"links":{"citing_paper":"/paper/2506.20361"},"observation_digest":"sha256:c142e3de3353207c4bc57b4d4c2d6acf5821d0dfd19123af491f205541ce0a81","observation_id":"cae30958-580b-4a12-898d-bb35d334a24c","resolution":{"observed_at":"2026-08-06T22:53:56.440542Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:56.195118Z","title":null,"venue":null,"work_id":"c9961182-7624-433e-8a34-0bab5273159e","year":null},"citing_paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","snapshot_observed_at":"2026-08-06T22:47:50.545533Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:48.651613Z"},"links":{"citing_paper":"/paper/2506.20361"},"observation_digest":"sha256:d2e3f35938fe0f4806b96f98aa1ed710dc3788efc0f06a141a896b9a858442e4","observation_id":"24f8d8b4-f788-404d-b227-2091412a59d3","resolution":{"observed_at":"2026-08-06T22:53:56.252196Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:55.995974Z","title":"Dataset We analyzed the phonetic decodability window on two datasets separately","venue":null,"work_id":"3c427723-5f1b-4329-a6d1-453a90a2fe31","year":null},"citing_paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","snapshot_observed_at":"2026-08-06T22:47:50.545533Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:48.823441Z"},"links":{"citing_paper":"/paper/2506.20361"},"observation_digest":"sha256:7defae49c56f0c6634da2587b5b819fd9686ec0eda87982edb344aed32d4a8c5","observation_id":"c0134223-de03-4e42-b025-6ce6f5285cbb","resolution":{"observed_at":"2026-08-06T22:53:56.095836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:55.830597Z","title":null,"venue":null,"work_id":"28db9d78-6b58-43e8-9112-606ac7712e3d","year":null},"citing_paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","snapshot_observed_at":"2026-08-06T22:47:50.545533Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:49.013333Z"},"links":{"citing_paper":"/paper/2506.20361"},"observation_digest":"sha256:bb06010f1cc0b2d64bab4977c757e41b4adfe2347e301905cf6698e1cd345716","observation_id":"61bea0c4-4e63-4d3f-b9ac-cf73c541fca9","resolution":{"observed_at":"2026-08-06T22:53:55.892928Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:55.682661Z","title":"We found that A V-HuBERT’s encoding of speech temporal dynam- ics is dominated by its audio input","venue":null,"work_id":"78bad618-9805-4949-8da7-7426c962970a","year":null},"citing_paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","snapshot_observed_at":"2026-08-06T22:47:50.545533Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:49.188316Z"},"links":{"citing_paper":"/paper/2506.20361"},"observation_digest":"sha256:e31ee88d215046f7212eb8080692bf221d38bdb776a9460d32492b1e90974a39","observation_id":"7eae74aa-131c-4dc9-8a0f-c363e80322ef","resolution":{"observed_at":"2026-08-06T22:53:55.743362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","snapshot_observed_at":"2026-08-06T22:47:50.545533Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","version":1},"cited_work":{"arxiv_id":"2506.20361","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.20361","snapshot_observed_at":"2026-08-06T22:53:52.505268Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","venue":"eess.AS","work_id":"e04ced98-4047-4248-ae87-691a2ff8ea83","year":2025},"citing_paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","snapshot_observed_at":"2026-08-06T22:47:50.545533Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:48.450553Z"},"links":{"cited_paper":"/paper/2506.20361","citing_paper":"/paper/2506.20361"},"observation_digest":"sha256:dc82a884c939518154d8c8de7b16358fab9a5df97168aefbd407d9b426cc5a2a","observation_id":"29e31935-0a1a-4314-8027-bc8c1e01f636","resolution":{"observed_at":"2026-08-06T22:53:52.613791Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:55.499586Z","title":"We would like to thank Biao Zeng from University of South Wales and Hao Tang, Sharon Goldwater from ILCC, Univer- sity of Edinburgh for useful discussion","venue":null,"work_id":"348f7440-b51d-486d-90bb-588ca9a1a5ac","year":null},"citing_paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","snapshot_observed_at":"2026-08-06T22:47:50.545533Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:49.377704Z"},"links":{"citing_paper":"/paper/2506.20361"},"observation_digest":"sha256:18097eae806ebaf59db80ebc52ff56d7e932ad4cdf925c452d9d1a67388e8557","observation_id":"dc7c5188-171b-4f40-886a-d53c5020da7c","resolution":{"observed_at":"2026-08-06T22:53:55.556123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:55.330325Z","title":"Using artificial neural networks to ask ‘why’ questions of minds and brains,","venue":null,"work_id":"193cb1a9-285b-4587-bcec-fcde556b8c37","year":2023},"citing_paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","snapshot_observed_at":"2026-08-06T22:47:50.545533Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:49.498398Z"},"links":{"citing_paper":"/paper/2506.20361"},"observation_digest":"sha256:27f5d4b316e34d9cf29f67195c6bdec55bff8065d831746c7b81804688bd8110","observation_id":"64abd8f1-82eb-4fbe-abb1-9639bad530a5","resolution":{"observed_at":"2026-08-06T22:53:55.394127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:55.150878Z","title":"Parallel hierarchical encoding of linguistic representations in the human auditory cortex and recur- rent automatic speech recognition systems,","venue":null,"work_id":"24108fd9-dcd0-4abd-b051-b805e6ce40d9","year":2025},"citing_paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","snapshot_observed_at":"2026-08-06T22:47:50.545533Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:49.674523Z"},"links":{"citing_paper":"/paper/2506.20361"},"observation_digest":"sha256:48e58dbe54fe1d81f29f1ae9bb21a33e1ef1ee1ed175e6979b28512d5e4aacf2","observation_id":"b48a8210-51ec-4cc5-9f5f-21253ce644b2","resolution":{"observed_at":"2026-08-06T22:53:55.241297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:49.888090Z","title":"Hearing lips and seeing voices,","venue":null,"work_id":null,"year":1976},"citing_paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","snapshot_observed_at":"2026-08-06T22:47:50.545533Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:49.888090Z"},"links":{"citing_paper":"/paper/2506.20361"},"observation_digest":"sha256:1cddb7e0ce99c6c36ba3d7ada5d1143102d8d5382831919b61254930455edbf0","observation_id":"8ec8c1a4-95b3-4bb8-a244-04ffd366196b","resolution":{"observed_at":"2026-08-06T22:53:49.888090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:54.942015Z","title":"Multisensory integration: current issues from the perspective of the single neuron,","venue":null,"work_id":"ee0050bf-08aa-4cc8-904c-262d46dd6d9b","year":2008},"citing_paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","snapshot_observed_at":"2026-08-06T22:47:50.545533Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:50.029945Z"},"links":{"citing_paper":"/paper/2506.20361"},"observation_digest":"sha256:57bd78c8b8893d626549b8ba601118626dab5bcb96f6429ee637078d8f954837","observation_id":"8cc38be9-dce2-4cfe-aa45-8ac763842dd8","resolution":{"observed_at":"2026-08-06T22:53:55.026324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:54.762398Z","title":"Multimodal deep learning","venue":null,"work_id":"e1d16821-af4d-42a1-97a5-98822951643e","year":2011},"citing_paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","snapshot_observed_at":"2026-08-06T22:47:50.545533Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:50.185624Z"},"links":{"citing_paper":"/paper/2506.20361"},"observation_digest":"sha256:16ad4a348ff56d1dff5f7679f84a601f855065c2f2bc18b4205c7053a95133d6","observation_id":"0059e289-68da-490d-b5e5-6050a2e55bba","resolution":{"observed_at":"2026-08-06T22:53:54.856937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2411.05715","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:52.272668Z","title":"On the role of noise in audiovisual integration: Evidence from artificial neural networks that exhibit the McGurk effect,","venue":null,"work_id":"302375f1-1abf-4208-880b-da435a8f4b92","year":2024},"citing_paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","snapshot_observed_at":"2026-08-06T22:47:50.545533Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:50.297411Z"},"links":{"citing_paper":"/paper/2506.20361"},"observation_digest":"sha256:42a0b8fbfc4f0fa4212ef4d8969fc9a786b38405382b88ef3ad395350fb82373","observation_id":"b6c4587a-83bb-48dc-a28a-7e80954ebd17","resolution":{"observed_at":"2026-08-06T22:53:52.389153Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.02184","last_updated":"2022-03-13T01:52:28Z","snapshot_observed_at":"2026-08-07T00:15:34.035413Z","submitted_at":"2022-01-05T17:40:45Z","title":"Learning Audio-Visual Speech Representation by Masked Multimodal Cluster Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.02184","snapshot_observed_at":"2026-08-06T22:53:50.391701Z","title":"Learning audio-visual speech representation by masked multimodal cluster prediction,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","snapshot_observed_at":"2026-08-06T22:47:50.545533Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:50.391701Z"},"links":{"cited_paper":"/paper/2201.02184","citing_paper":"/paper/2506.20361"},"observation_digest":"sha256:e015d141b67043b380a16fded786e88e9149495e6a295d97c9585803145a3627","observation_id":"fd50aea4-84af-4bc9-8022-d12eb1547d04","resolution":{"observed_at":"2026-08-06T22:53:50.391701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:54.533184Z","title":"The natural statistics of audiovisual speech,","venue":null,"work_id":"5d966b08-7fca-4ad2-a62e-60205863cdd3","year":2009},"citing_paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","snapshot_observed_at":"2026-08-06T22:47:50.545533Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:50.483547Z"},"links":{"citing_paper":"/paper/2506.20361"},"observation_digest":"sha256:c42954aad06cde72b08cee9fd6f645f45bfd79c6610c0b8a26a87f0377cb4a37","observation_id":"28fdc799-899e-4acf-b4c6-6a96d44263e6","resolution":{"observed_at":"2026-08-06T22:53:54.662843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:54.282872Z","title":"Bimodal speech: early suppressive visual effects in human auditory cor- tex,","venue":null,"work_id":"a761a636-5de8-41b9-9bca-ea907d7b8c08","year":2004},"citing_paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","snapshot_observed_at":"2026-08-06T22:47:50.545533Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:50.593870Z"},"links":{"citing_paper":"/paper/2506.20361"},"observation_digest":"sha256:a95086ca41d4223d341aaa64d4aab4de3abca75ae490852d4c5b128425285341","observation_id":"71710634-2011-40e9-a40e-26b6ceaf68bf","resolution":{"observed_at":"2026-08-06T22:53:54.377216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:54.098964Z","title":"Visual speech speeds up the neural processing of auditory speech,","venue":null,"work_id":"6dc7c2d4-a804-4e77-9043-c2c569db28cc","year":2005},"citing_paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","snapshot_observed_at":"2026-08-06T22:47:50.545533Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:50.668168Z"},"links":{"citing_paper":"/paper/2506.20361"},"observation_digest":"sha256:9ffd948b683c78c275f09133e893e205e981a1a178cb6d412bb2510672013029","observation_id":"7fd2bde6-cde9-4a31-bc63-52dfa385c0da","resolution":{"observed_at":"2026-08-06T22:53:54.175482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:53.833977Z","title":"Asynchronicity between visual and auditory information in audiovisual speech: Evidence from four types of consonant- words/b/,/t/,/k/and/g,","venue":null,"work_id":"8b778702-9051-4a76-8f63-c0df079d9519","year":2024},"citing_paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","snapshot_observed_at":"2026-08-06T22:47:50.545533Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:50.739263Z"},"links":{"citing_paper":"/paper/2506.20361"},"observation_digest":"sha256:45102b3162526404a35700e8128bae49ac4b26977d0a8c9105c285781653116c","observation_id":"d470de32-c3e2-4f2a-9d10-d283a1e640c9","resolution":{"observed_at":"2026-08-06T22:53:53.994140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08237","last_updated":"2024-05-13T23:36:19Z","snapshot_observed_at":"2026-07-06T18:13:55.543513Z","submitted_at":"2024-05-13T23:36:19Z","title":"A predictive learning model can simulate temporal dynamics and context effects found in neural representations of continuous speech","version":1},"cited_work":{"arxiv_id":"2405.08237","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.08237","snapshot_observed_at":"2026-08-06T22:53:51.979127Z","title":"A predictive learning model can simulate temporal dynamics and context effects found in neural representations of continuous speech","venue":"cs.CL","work_id":"b3a994aa-8473-4821-8d67-fd018cb751d4","year":2024},"citing_paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","snapshot_observed_at":"2026-08-06T22:47:50.545533Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:50.840056Z"},"links":{"cited_paper":"/paper/2405.08237","citing_paper":"/paper/2506.20361"},"observation_digest":"sha256:4f53106668cca8b7f03d09badeabc136cbfa2157b81450d7c0e3bb93b27e5477","observation_id":"e307496b-1ff3-4266-ad1e-6a2c3f165244","resolution":{"observed_at":"2026-08-06T22:53:52.083800Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:53.599151Z","title":"Neural dynamics of phoneme sequences reveal position-invariant code for content and order,","venue":null,"work_id":"07db2f25-8e78-4eb9-bc06-78004344c186","year":2022},"citing_paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","snapshot_observed_at":"2026-08-06T22:47:50.545533Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:50.949106Z"},"links":{"citing_paper":"/paper/2506.20361"},"observation_digest":"sha256:b413cf631890c25d7304d96656e8880956425fa04da8e6185f209d45d1935333","observation_id":"38ebd5c8-3751-4a3f-8bd7-7411414dde71","resolution":{"observed_at":"2026-08-06T22:53:53.724658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:51.030814Z","title":"HuBERT: Self-supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","snapshot_observed_at":"2026-08-06T22:47:50.545533Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:51.030814Z"},"links":{"citing_paper":"/paper/2506.20361"},"observation_digest":"sha256:08a05e988213376d51968f12c39dd75c995ccb183498efeac4134286387e955a","observation_id":"123861fc-64e1-40ad-9645-3e6dc382826e","resolution":{"observed_at":"2026-08-06T22:53:51.030814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:51.105709Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","snapshot_observed_at":"2026-08-06T22:47:50.545533Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:51.105709Z"},"links":{"citing_paper":"/paper/2506.20361"},"observation_digest":"sha256:5ea20efb4d131b1f5ecb5514afc9b1ca0063eb7406ee5aadbcb0fd44673c32db","observation_id":"d15b4bb8-4347-45bc-9b1a-8b7614b2d6f7","resolution":{"observed_at":"2026-08-06T22:53:51.105709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:53.324273Z","title":"Dynamic encoding of acoustic features in neural responses to continuous speech,","venue":null,"work_id":"54e43892-40fa-43d1-8988-61d82ab4c86e","year":2017},"citing_paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","snapshot_observed_at":"2026-08-06T22:47:50.545533Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:51.187054Z"},"links":{"citing_paper":"/paper/2506.20361"},"observation_digest":"sha256:0ab7799a9e33ef713ec1f1df18377f248791ad797633c9a5d01fab60d7d4f8ab","observation_id":"22583bb2-f733-4bba-b601-d0c22e9abf22","resolution":{"observed_at":"2026-08-06T22:53:53.448903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-06T22:53:51.262919Z","title":"Representation learning with contrastive predictive coding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","snapshot_observed_at":"2026-08-06T22:47:50.545533Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:51.262919Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2506.20361"},"observation_digest":"sha256:32efcfc1890fa32f11390e287e74bd335f0ec49d09988ebaf798d1b182a6a0bb","observation_id":"e5c540e0-211b-4e72-91e0-98f4ac694089","resolution":{"observed_at":"2026-08-06T22:53:51.262919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:53.108301Z","title":"Montreal forced aligner: Trainable text-speech align- ment using Kaldi","venue":null,"work_id":"d46a3334-b592-444f-9ea2-232805d4e19c","year":2017},"citing_paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","snapshot_observed_at":"2026-08-06T22:47:50.545533Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:51.369421Z"},"links":{"citing_paper":"/paper/2506.20361"},"observation_digest":"sha256:9a37f6ed8715b6ac1bd74c7f4af0a7028a04bf37b4fa8082156e9190fedbdf05","observation_id":"f4d1bdad-7f83-49d2-89a1-2787d06aa1af","resolution":{"observed_at":"2026-08-06T22:53:53.205875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:52.912100Z","title":"Prosodylab-aligner: A tool for forced alignment of laboratory speech,","venue":null,"work_id":"5b28a33a-57fb-4f54-b54d-309c8f5064ed","year":2011},"citing_paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","snapshot_observed_at":"2026-08-06T22:47:50.545533Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:51.485127Z"},"links":{"citing_paper":"/paper/2506.20361"},"observation_digest":"sha256:e31039a0bbacd03b01670118b9440195e1921eea7d52998268a54e5df6c75503","observation_id":"1fb8ac9e-8336-43ee-b842-f7e5a04fb035","resolution":{"observed_at":"2026-08-06T22:53:52.994338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:52.716573Z","title":"An audio- visual corpus for speech perception and automatic speech recog- nition,","venue":null,"work_id":"91af5793-8aa9-4a41-a823-bf7e1c94db3a","year":2006},"citing_paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","snapshot_observed_at":"2026-08-06T22:47:50.545533Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:51.637293Z"},"links":{"citing_paper":"/paper/2506.20361"},"observation_digest":"sha256:f32db47776120986b68556e67b0703e80fedbb45e228c8da25cbc377c008210f","observation_id":"216414d2-5e51-46c8-94e4-9dcd976e5bcb","resolution":{"observed_at":"2026-08-06T22:53:52.804935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.00496","last_updated":"2018-10-28T14:29:46Z","snapshot_observed_at":"2026-07-06T06:58:51.877372Z","submitted_at":"2018-09-03T08:38:34Z","title":"LRS3-TED: a large-scale dataset for visual speech recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.00496","snapshot_observed_at":"2026-08-06T22:53:51.803073Z","title":"LRS3-TED: a large-scale dataset for visual speech recognition,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","snapshot_observed_at":"2026-08-06T22:47:50.545533Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:51.803073Z"},"links":{"cited_paper":"/paper/1809.00496","citing_paper":"/paper/2506.20361"},"observation_digest":"sha256:55cc81d2feea87ebef9da718aa134c47b5f41107ee620318d28eeaa58c6abedc","observation_id":"a70d74ae-21d5-4051-92ac-96d592074ef8","resolution":{"observed_at":"2026-08-06T22:53:51.803073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.20361","last_updated":"2025-06-25T12:23:12Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-06T22:47:50.545533Z","submitted_at":"2025-06-25T12:23:12Z","title":"The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":3,"verified_fuzzy":16},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 1 inbound Pith citation observation for arXiv:2506.20361."}