{"as_of":"2026-08-17T20:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4fef1c4ec088880008a5c8421bef4063fa4702e03c1848c40e6bf24dc39707c0","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":4,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":4,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:02:14.699358Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":4,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.00628","last_updated":"2023-03-07T16:41:01Z","snapshot_observed_at":"2026-08-16T15:51:40.199718Z","submitted_at":"2023-03-01T16:31:01Z","title":"MuAViC: A Multilingual Audio-Visual Corpus for Robust Speech Recognition and Robust Speech-to-Text Translation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00628","snapshot_observed_at":"2026-08-16T00:02:14.699358Z","title":"Muavic: A multilingual audio-visual corpus for robust speech recognition and robust speech-to-text translation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-17T11:54:24.959699Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.699358Z"},"links":{"cited_paper":"/paper/2303.00628","citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:3aaa6ee2619c6daaa571636cf7b5b9af3f8a8faa57e4d5d0e5c1efe9ab52ebcc","observation_id":"c6b12aa4-1e3a-49f9-98c3-f0fe336b05b8","resolution":{"observed_at":"2026-08-16T00:02:14.699358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00628","last_updated":"2023-03-07T16:41:01Z","snapshot_observed_at":"2026-08-16T15:51:40.199718Z","submitted_at":"2023-03-01T16:31:01Z","title":"MuAViC: A Multilingual Audio-Visual Corpus for Robust Speech Recognition and Robust Speech-to-Text Translation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00628","snapshot_observed_at":"2026-08-05T17:33:56.409986Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16188","last_updated":"2025-08-27T19:49:56Z","snapshot_observed_at":"2026-08-16T13:50:39.724461Z","submitted_at":"2025-08-22T08:08:45Z","title":"Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:56.409986Z"},"links":{"cited_paper":"/paper/2303.00628","citing_paper":"/paper/2508.16188"},"observation_digest":"sha256:655b8f601bcf9d4d08065f5dd50e2f61c66db08218aa80c70936b656637b11d6","observation_id":"5555e9ba-1fed-44de-8d26-972ac3a39424","resolution":{"observed_at":"2026-08-05T17:33:56.409986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00628","last_updated":"2023-03-07T16:41:01Z","snapshot_observed_at":"2026-08-16T15:51:40.199718Z","submitted_at":"2023-03-01T16:31:01Z","title":"MuAViC: A Multilingual Audio-Visual Corpus for Robust Speech Recognition and Robust Speech-to-Text Translation","version":2},"cited_work":{"arxiv_id":"2303.00628","doi":"10.48550/arxiv.2303.00628","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00628","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muavic: A multilingual audio-visual corpus for robust speech recogni- tion and robust speech-to-text translation,","venue":"arXiv (Cornell University)","work_id":"92bd9b7d-c4ed-4fb3-8458-c15681be0c4d","year":2023},"citing_paper":{"arxiv_id":"2604.05591","last_updated":"2026-04-07T08:35:53Z","snapshot_observed_at":"2026-08-15T23:59:38.314541Z","submitted_at":"2026-04-07T08:35:53Z","title":"AI-Driven Modular Services for Accessible Multilingual Education in Immersive Extended Reality Settings: Integrating Speech Processing, Translation, and Sign Language Rendering","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-10T18:52:07.311159Z"},"links":{"cited_paper":"/paper/2303.00628","citing_paper":"/paper/2604.05591"},"observation_digest":"sha256:8005c9543a03d4b5ed30de27f607d0aff5aa7b55fb1fc320882609bd59510a02","observation_id":"0151aa58-f0af-4f09-9bb3-d82cbb25e648","resolution":{"observed_at":"2026-05-10T19:00:45.771279Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00628","last_updated":"2023-03-07T16:41:01Z","snapshot_observed_at":"2026-08-16T15:51:40.199718Z","submitted_at":"2023-03-01T16:31:01Z","title":"MuAViC: A Multilingual Audio-Visual Corpus for Robust Speech Recognition and Robust Speech-to-Text Translation","version":2},"cited_work":{"arxiv_id":"2303.00628","doi":"10.48550/arxiv.2303.00628","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00628","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muavic: A multilingual audio-visual corpus for robust speech recogni- tion and robust speech-to-text translation,","venue":"arXiv (Cornell University)","work_id":"92bd9b7d-c4ed-4fb3-8458-c15681be0c4d","year":2023},"citing_paper":{"arxiv_id":"2606.05763","last_updated":"2026-06-04T06:44:54Z","snapshot_observed_at":"2026-08-12T19:52:32.863521Z","submitted_at":"2026-06-04T06:44:54Z","title":"M2S-AVSR: Modality-aware Multi-view Self-supervised Representation for Robust Audio-Visual Speech Recognition","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-27T23:58:21.046264Z"},"links":{"cited_paper":"/paper/2303.00628","citing_paper":"/paper/2606.05763"},"observation_digest":"sha256:86d138ba5e48c57939b720b9dd09a2bec5edf4fcaa56a54167a98f0613eb58fd","observation_id":"9e948f86-f625-42e7-b73a-1b2b2a22dcca","resolution":{"observed_at":"2026-07-02T15:17:07.862567Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2303.00628/citation-record","integrity":"/paper/2303.00628/integrity","json":"/paper/2303.00628/citation-record.json","paper":"/paper/2303.00628"},"outbound":[],"paper":{"arxiv_id":"2303.00628","last_updated":"2023-03-07T16:41:01Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T15:51:40.199718Z","submitted_at":"2023-03-01T16:31:01Z","title":"MuAViC: A Multilingual Audio-Visual Corpus for Robust Speech Recognition and Robust Speech-to-Text Translation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 4 inbound Pith citation observations for arXiv:2303.00628."}