{"as_of":"2026-08-08T14:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9412b26086ae0e4705ae90c6de5788589acdc1c1a698981f1979aa69613f2a74","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:50:36.199609Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:50:33.692524Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T12:50:36.461320Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"cited_work":{"arxiv_id":"2505.23379","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23379","snapshot_observed_at":"2026-08-07T12:50:36.461320Z","title":"Vision-Integrated High-Quality Neural Speech Coding","venue":"eess.AS","work_id":"2877a45d-0c90-445a-a452-69fe2577c2d3","year":2025},"citing_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:33.692524Z"},"links":{"cited_paper":"/paper/2505.23379","citing_paper":"/paper/2505.23379"},"observation_digest":"sha256:e847eb84f242cb0162d2f25f7ddf300f9fd65a3e9fb4a2abb043d4cac6c3e144","observation_id":"4fbb2ba6-3512-4f00-9f03-ff89b0e0c602","resolution":{"observed_at":"2026-08-07T12:50:36.534950Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.23379/citation-record","integrity":"/paper/2505.23379/integrity","json":"/paper/2505.23379/citation-record.json","paper":"/paper/2505.23379"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"cited_work":{"arxiv_id":"2505.23379","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23379","snapshot_observed_at":"2026-08-07T12:50:36.461320Z","title":"Vision-Integrated High-Quality Neural Speech Coding","venue":"eess.AS","work_id":"2877a45d-0c90-445a-a452-69fe2577c2d3","year":2025},"citing_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:33.692524Z"},"links":{"cited_paper":"/paper/2505.23379","citing_paper":"/paper/2505.23379"},"observation_digest":"sha256:e847eb84f242cb0162d2f25f7ddf300f9fd65a3e9fb4a2abb043d4cac6c3e144","observation_id":"4fbb2ba6-3512-4f00-9f03-ff89b0e0c602","resolution":{"observed_at":"2026-08-07T12:50:36.534950Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:40.187402Z","title":"Overview As shown in Figure 1, VNSC consists of a speech coding mod- ule, an image analysis-synthesis module and a feature fusion module","venue":null,"work_id":"8f39e0e7-ccbc-4945-ab74-2b65fad333b4","year":null},"citing_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:33.772725Z"},"links":{"citing_paper":"/paper/2505.23379"},"observation_digest":"sha256:c9d82608665869c8da9b7dab35ead3d9831cc6dc8f802c70d8c40ad2b7dc4197","observation_id":"d6a41dc8-bbb7-4387-8cf5-a2c5edfb9303","resolution":{"observed_at":"2026-08-07T12:50:40.297099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:39.998037Z","title":null,"venue":null,"work_id":"2138ba9b-7909-4815-a7f8-f4ceeea241f1","year":null},"citing_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:33.838446Z"},"links":{"citing_paper":"/paper/2505.23379"},"observation_digest":"sha256:0d8652025e3c2830896e2088c826d38b6c40b4f58fdcaea4486e57b5744a437e","observation_id":"25c20d15-83cc-4562-a600-fb73f8e5d5a4","resolution":{"observed_at":"2026-08-07T12:50:40.079579Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:39.825853Z","title":null,"venue":null,"work_id":"f7709663-1140-4b39-9d7d-7a1ce484d0b4","year":null},"citing_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:33.954738Z"},"links":{"citing_paper":"/paper/2505.23379"},"observation_digest":"sha256:efd2e0e148fb7f6ba455bd2fbd3204511311c74cf38200becb8b362991153eae","observation_id":"98a283bd-3523-440a-b593-dedb784c6c8a","resolution":{"observed_at":"2026-08-07T12:50:39.938610Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:39.617963Z","title":"VNSC is built upon the speech-modal MDCTCodec, with visual information extracted from lip images flowing into the speech coding process","venue":null,"work_id":"ecab8e2c-eef7-411b-9e50-203ff4dfbb24","year":null},"citing_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:34.058108Z"},"links":{"citing_paper":"/paper/2505.23379"},"observation_digest":"sha256:6b9f35c68c137575687d6a325f8e569950a7fa276c662857e6de147c1cece123","observation_id":"250044a9-f627-49dd-a427-5d32286a1307","resolution":{"observed_at":"2026-08-07T12:50:39.716689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:39.436306Z","title":"Recommendation G.711: Pulse code modulation (PCM) of voice frequencies,","venue":null,"work_id":"c2ed2bbe-5744-4335-90c7-479d9c09159b","year":1988},"citing_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:34.158951Z"},"links":{"citing_paper":"/paper/2505.23379"},"observation_digest":"sha256:70515a1ea8295c341548f05c9ac25d4c9eb99898a3d5d56e0f245b5d5e84e906","observation_id":"b63097c6-e681-49e1-87d4-7735c2a88809","resolution":{"observed_at":"2026-08-07T12:50:39.517538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:39.203775Z","title":"Recommendation G.723: Speech coders for multimedia communications: dual-rate coder (5.3/6.3 kbps),","venue":null,"work_id":"c68e4cdc-bff9-4c09-8033-a91cbce25624","year":1996},"citing_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:34.228261Z"},"links":{"citing_paper":"/paper/2505.23379"},"observation_digest":"sha256:c1a31a270b3a82164df505f4aa1e6ae3a7aca263b49b9823213e85b12311d09a","observation_id":"09ef0972-0153-4e21-96e7-9c8649d87c8c","resolution":{"observed_at":"2026-08-07T12:50:39.303607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:39.045481Z","title":"Recommendation g.726: 40, 32, 24, and 16 kbps adap- tive differential pulse code modulation (ADPCM),","venue":null,"work_id":"db608c80-bc4e-4098-a24f-0f9e49e7d2da","year":1990},"citing_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:34.314412Z"},"links":{"citing_paper":"/paper/2505.23379"},"observation_digest":"sha256:3206ad8367393f5660a298531248c252529878237b0de2129c5a20387a825575","observation_id":"511bda03-b79d-4c90-acbf-19c4e09ddf7c","resolution":{"observed_at":"2026-08-07T12:50:39.132658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:38.923813Z","title":"Recommendation G.729: Coding of speech at 8 kbps using conjugate-structure algebraic-code-excited linear prediction (CS-ACELP),","venue":null,"work_id":"5e73fba0-b161-4bac-aca4-0555bdb0d343","year":1996},"citing_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:34.388617Z"},"links":{"citing_paper":"/paper/2505.23379"},"observation_digest":"sha256:0b2d88007b82ab2f4d2256f88a7462982d010a36f113e39177eb291acced0d85","observation_id":"deecb13e-b03e-47be-aa0d-0ddfc3c2cb34","resolution":{"observed_at":"2026-08-07T12:50:38.977607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:34.461142Z","title":"SoundStream: An end-to-end neural audio codec,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:34.461142Z"},"links":{"citing_paper":"/paper/2505.23379"},"observation_digest":"sha256:eb1973d289abb209c43032cd7d31c3d16019c8c6f7a6d8c94df10955b9cb1c59","observation_id":"31808cef-cef9-4d63-beca-2c361bb3c11d","resolution":{"observed_at":"2026-08-07T12:50:34.461142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:38.753538Z","title":"A review of vector quantization tech- niques,","venue":null,"work_id":"8c5081ee-ac12-4ff2-88cd-3b6ee11a7fbb","year":2006},"citing_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:34.548372Z"},"links":{"citing_paper":"/paper/2505.23379"},"observation_digest":"sha256:df0af6c237fe197b91bf3e19d5c639e780974a017cc23d599d2aaeebccf42dd5","observation_id":"5091cf6c-f157-4820-8046-c2724f6058c4","resolution":{"observed_at":"2026-08-07T12:50:38.841316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:34.631712Z","title":"High fidelity neural audio compression,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:34.631712Z"},"links":{"citing_paper":"/paper/2505.23379"},"observation_digest":"sha256:9f4d08f1a747d4078da4d3a2f69dd404821765869e5272910fb006d09eddd482","observation_id":"52c5127c-ac04-4d30-9de3-ce38584d7de3","resolution":{"observed_at":"2026-08-07T12:50:34.631712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02765","last_updated":"2023-05-07T09:22:04Z","snapshot_observed_at":"2026-08-06T10:45:04.364170Z","submitted_at":"2023-05-04T12:11:13Z","title":"HiFi-Codec: Group-residual Vector quantization for High Fidelity Audio Codec","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02765","snapshot_observed_at":"2026-08-07T12:50:34.712516Z","title":"HiFi- Codec: Group-residual vector quantization for high fidelity audio codec,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:34.712516Z"},"links":{"cited_paper":"/paper/2305.02765","citing_paper":"/paper/2505.23379"},"observation_digest":"sha256:89e6da3107d64c6de92e5fae54f5d6aa2bc6f4ffc5b15bc4131d0aa3bc8541a7","observation_id":"cb3a9791-83df-42c5-b990-e4fc8f7d12cd","resolution":{"observed_at":"2026-08-07T12:50:34.712516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:34.799104Z","title":"APCodec: A neural audio codec with parallel amplitude and phase spec- trum encoding and decoding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:34.799104Z"},"links":{"citing_paper":"/paper/2505.23379"},"observation_digest":"sha256:9f4fa59568485625aa003f38567df189a2fb9b53bd0d332b24d1c740e817b419","observation_id":"8551fd59-4311-4472-a9fa-9bd0a5ed5f46","resolution":{"observed_at":"2026-08-07T12:50:34.799104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:38.522142Z","title":"Mdctcodec: A lightweight mdct-based neural audio codec towards high sampling rate and low bitrate scenarios,","venue":null,"work_id":"fe9fc15f-cb33-405c-af13-619fac63ada5","year":2024},"citing_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:34.902677Z"},"links":{"citing_paper":"/paper/2505.23379"},"observation_digest":"sha256:e587b8c49cb3c725d01a92847e10e793300f1949fa5c8d6fff3c375473ac88aa","observation_id":"aa39616b-e0e7-4ed1-827d-2321e6f97fc5","resolution":{"observed_at":"2026-08-07T12:50:38.627209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:35.013098Z","title":"DM-Codec: Distilling multimodal representations for speech tokenization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:35.013098Z"},"links":{"citing_paper":"/paper/2505.23379"},"observation_digest":"sha256:43d3fb9a684a9328fe137efe77cac3747382084414df2b66958f241576c9684a","observation_id":"f84ec758-6146-4190-922d-4311a50b54c1","resolution":{"observed_at":"2026-08-07T12:50:35.013098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:38.355550Z","title":"The conversation: Deep audio-visual speech enhancement,","venue":null,"work_id":"31888bb9-0fc6-40cb-ae33-b900c5a8ced4","year":2018},"citing_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:35.070455Z"},"links":{"citing_paper":"/paper/2505.23379"},"observation_digest":"sha256:2041f2d4a760bad33f1f6c539ce679bfc461b898215f2eee87bffa3f38c04768","observation_id":"cf1d0463-7a56-4f46-87d5-20177b1622bf","resolution":{"observed_at":"2026-08-07T12:50:38.440004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:38.144100Z","title":"Vsegan: Visual speech enhancement generative adversarial net- work,","venue":null,"work_id":"05b71144-a2d2-470d-bc1d-e51e69019db8","year":2022},"citing_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:35.180640Z"},"links":{"citing_paper":"/paper/2505.23379"},"observation_digest":"sha256:8f4e8c0172fcdcda743415749dbee033f507b1d1969fbf54586c176b4c2404b2","observation_id":"2c7aecbf-bb65-4c15-890d-12399e068b1e","resolution":{"observed_at":"2026-08-07T12:50:38.250109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:37.993126Z","title":"Incorporating ultra- sound tongue images for audio-visual speech enhancement,","venue":null,"work_id":"a9bc37a3-1f16-4037-b6f2-df7dea247cac","year":2024},"citing_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:35.288448Z"},"links":{"citing_paper":"/paper/2505.23379"},"observation_digest":"sha256:9b84bb98aef17f9652f55c593876394a7f8193a870f7b8f8fbc49026c765d83f","observation_id":"56d598f4-c43e-4b42-8d91-b09d2cb635e2","resolution":{"observed_at":"2026-08-07T12:50:38.053040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:37.803952Z","title":"Improving visual speech enhancement network by learning audio-visual affinity with multi-head attention,","venue":null,"work_id":"d06e8a59-70be-4f5b-a10e-00bca9139f6a","year":2022},"citing_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:35.366485Z"},"links":{"citing_paper":"/paper/2505.23379"},"observation_digest":"sha256:14fb19199e95774e8acbbfded38f93d512c36efad9d7f022659a9dab339a9019","observation_id":"a31dba6f-16c4-422e-b95e-deba50925826","resolution":{"observed_at":"2026-08-07T12:50:37.910741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:37.639410Z","title":"TaL: a synchronised multi-speaker corpus of ultrasound tongue imaging, audio, and lip videos,","venue":null,"work_id":"1bdd0e84-a069-49a7-ba38-fedc713f1a07","year":2021},"citing_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:35.413134Z"},"links":{"citing_paper":"/paper/2505.23379"},"observation_digest":"sha256:2a22091b2460427e5e966772c0910d649a79b015a0744433ff4c1a0eb76b6d31","observation_id":"fd840dd6-135b-4e53-a130-f89dff2afe3d","resolution":{"observed_at":"2026-08-07T12:50:37.731528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:37.459313Z","title":"Deep audio-visual speech recognition,","venue":null,"work_id":"342cad3e-a810-409d-a382-11caebc465c3","year":2018},"citing_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:35.521183Z"},"links":{"citing_paper":"/paper/2505.23379"},"observation_digest":"sha256:e17197f0ef86c61166ccb2910606a1e2ad728fd811bd20fa90aa9202895315f6","observation_id":"5e24414c-2326-4c23-9d60-a652e68831ae","resolution":{"observed_at":"2026-08-07T12:50:37.563871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:35.615922Z","title":"ConvNeXt v2: Co-designing and scaling convnets with masked autoencoders,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:35.615922Z"},"links":{"citing_paper":"/paper/2505.23379"},"observation_digest":"sha256:02cdd05bc1e9206847161c84175529bb5b2b8bec1736cc52bd54088f6c3ad73b","observation_id":"da2cc957-4803-4b3f-b84b-4bd11fc504d5","resolution":{"observed_at":"2026-08-07T12:50:35.615922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-07-06T05:01:27.910364Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-07T12:50:35.712227Z","title":"Gaussian error linear units (gelus),","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:35.712227Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2505.23379"},"observation_digest":"sha256:f0843a981248d63adb78679785abf41c161a5def0a8be0b8360d857f55a585eb","observation_id":"1ae59075-736a-471a-88ad-726a3c42d508","resolution":{"observed_at":"2026-08-07T12:50:35.712227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:37.245067Z","title":"Converting video formats with ffmpeg,","venue":null,"work_id":"d562e9fb-622b-4c26-966e-cf3db4bef467","year":2006},"citing_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:35.835330Z"},"links":{"citing_paper":"/paper/2505.23379"},"observation_digest":"sha256:c5deec896268496d4027dce4fb32c9fbf7150609c2b648a4035d6413460f1447","observation_id":"53a7abad-c408-4b81-b797-fbde56d063a0","resolution":{"observed_at":"2026-08-07T12:50:37.330103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:37.009023Z","title":"Decoupled weight decay regulariza- tion,","venue":null,"work_id":"59192a43-fddd-4cb7-bdf8-1243f097cbb4","year":2018},"citing_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:35.961443Z"},"links":{"citing_paper":"/paper/2505.23379"},"observation_digest":"sha256:69cf5bfa3c6965562416c1ec2c559f7e69bc5bc6444567eefe9aad4f38345f05","observation_id":"b4f915c7-eaa2-4678-bab0-e134a6df0b8c","resolution":{"observed_at":"2026-08-07T12:50:37.107644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:36.813850Z","title":"P. 862.2: Wideband extension to recom- mendation P. 862 for the assessment of wideband telephone networks and speech codecs,","venue":null,"work_id":"a5b91674-9f95-417a-a716-ac22b81794f5","year":2007},"citing_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:36.014763Z"},"links":{"citing_paper":"/paper/2505.23379"},"observation_digest":"sha256:09a8ac233ff102cf7bf90894f5c3e7879c6645b466be6141fdd26790943c868f","observation_id":"2b135383-6ef9-4d95-9d66-31f8f24ec55b","resolution":{"observed_at":"2026-08-07T12:50:36.921223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:36.646104Z","title":"Evaluation of objective measures for speech enhancement,","venue":null,"work_id":"729785ad-bde0-476d-9fdf-517bd1da2d0e","year":2008},"citing_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:36.121916Z"},"links":{"citing_paper":"/paper/2505.23379"},"observation_digest":"sha256:1b653920eb3645414bbd8a0b64b86f9e2928c39fba9fde0d0d9d552fd06178e5","observation_id":"42100a44-3988-456e-b4d4-04bc84b8c6f0","resolution":{"observed_at":"2026-08-07T12:50:36.696296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:36.199609Z","title":"A short- time objective intelligibility measure for time-frequency weighted noisy speech,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:36.199609Z"},"links":{"citing_paper":"/paper/2505.23379"},"observation_digest":"sha256:92e303e06c1c3f2f38f367edb7898c6fafc1983e42d0b9b1c1e81f9600d7621d","observation_id":"66c807d6-df42-4ff4-870e-d991b8c967a8","resolution":{"observed_at":"2026-08-07T12:50:36.199609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":18},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 1 inbound Pith citation observation for arXiv:2505.23379."}