{"as_of":"2026-08-10T23:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d3565d8a9d87d78ede80b0ceece17d47850c2c190f804ef72931bf19577deeb5","coverage":[{"denominator":18,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T11:50:50.392316Z","state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.02244/citation-record","integrity":"/paper/2509.02244/integrity","json":"/paper/2509.02244/citation-record.json","paper":"/paper/2509.02244"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:50:52.555121Z","title":"Neural discrete representation learning,","venue":null,"work_id":"547d7245-ae4e-4cc9-aeec-4ebc092b3720","year":2017},"citing_paper":{"arxiv_id":"2509.02244","last_updated":"2025-09-02T12:14:41Z","snapshot_observed_at":"2026-08-09T02:23:51.891834Z","submitted_at":"2025-09-02T12:14:41Z","title":"Spectrogram Patch Codec: A 2D Block-Quantized VQ-VAE and HiFi-GAN for Neural Speech Coding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T11:50:49.341139Z"},"links":{"citing_paper":"/paper/2509.02244"},"observation_digest":"sha256:9102bd5720407f2dbe13aa681b57b831829a1d9915998b05d85cddf75a272c0b","observation_id":"d2cf5de8-1dba-402d-bcb0-01407f30ac70","resolution":{"observed_at":"2026-08-05T11:50:52.606017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:50:52.459339Z","title":"SoundStream: An end-to-end neural audio codec,","venue":null,"work_id":"f8a3411c-5c25-4494-a77f-d1708f36e3cc","year":2021},"citing_paper":{"arxiv_id":"2509.02244","last_updated":"2025-09-02T12:14:41Z","snapshot_observed_at":"2026-08-09T02:23:51.891834Z","submitted_at":"2025-09-02T12:14:41Z","title":"Spectrogram Patch Codec: A 2D Block-Quantized VQ-VAE and HiFi-GAN for Neural Speech Coding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T11:50:49.428516Z"},"links":{"citing_paper":"/paper/2509.02244"},"observation_digest":"sha256:3de85aa48ea7e3a063ecf8f9052dfdc218bc3c6be79d36e1a0836cd465bb960b","observation_id":"65926053-d08f-469a-a0f4-906b566b4a8a","resolution":{"observed_at":"2026-08-05T11:50:52.480296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:50:52.318720Z","title":"High fidelity neural audio compression,","venue":null,"work_id":"717787f4-a932-4f0c-85d2-0840db825745","year":2022},"citing_paper":{"arxiv_id":"2509.02244","last_updated":"2025-09-02T12:14:41Z","snapshot_observed_at":"2026-08-09T02:23:51.891834Z","submitted_at":"2025-09-02T12:14:41Z","title":"Spectrogram Patch Codec: A 2D Block-Quantized VQ-VAE and HiFi-GAN for Neural Speech Coding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T11:50:49.499451Z"},"links":{"citing_paper":"/paper/2509.02244"},"observation_digest":"sha256:2cd65d8a8e789bd665c55834e23d51c51a25d035e832bc2e1b218a4196366e58","observation_id":"89f5cd4c-fb74-4c9b-8c47-940728ece6e0","resolution":{"observed_at":"2026-08-05T11:50:52.386337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:50:52.156133Z","title":"HiFi-GAN: Generative adversarial networks for efficient and high-fidelity speech synthesis,","venue":null,"work_id":"2e7ac5e1-ab89-45bf-bc2f-077adc4eac2b","year":2020},"citing_paper":{"arxiv_id":"2509.02244","last_updated":"2025-09-02T12:14:41Z","snapshot_observed_at":"2026-08-09T02:23:51.891834Z","submitted_at":"2025-09-02T12:14:41Z","title":"Spectrogram Patch Codec: A 2D Block-Quantized VQ-VAE and HiFi-GAN for Neural Speech Coding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T11:50:49.555872Z"},"links":{"citing_paper":"/paper/2509.02244"},"observation_digest":"sha256:49cbc9d9aebf1fe96902aa2ad90db526548346f6fb9e87729e985798e9c04717","observation_id":"4eb65872-99cd-4aa7-bfa8-4011293aba59","resolution":{"observed_at":"2026-08-05T11:50:52.219292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-05T11:50:49.589283Z","title":"Autoregressive model beats diffusion: Llama for scalable image generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02244","last_updated":"2025-09-02T12:14:41Z","snapshot_observed_at":"2026-08-09T02:23:51.891834Z","submitted_at":"2025-09-02T12:14:41Z","title":"Spectrogram Patch Codec: A 2D Block-Quantized VQ-VAE and HiFi-GAN for Neural Speech Coding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T11:50:49.589283Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2509.02244"},"observation_digest":"sha256:a6ae49ec1e4ccb62350be64a7ab28cc3782930a7458374585b4ce764903dc87b","observation_id":"1070d45d-1166-4164-9c6a-df32a3652513","resolution":{"observed_at":"2026-08-05T11:50:49.589283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:50:51.993924Z","title":"High-fidelity audio compres- sion with improved R VQGAN,","venue":null,"work_id":"8206e7ac-5eea-4adc-ae12-795df436c7ad","year":2023},"citing_paper":{"arxiv_id":"2509.02244","last_updated":"2025-09-02T12:14:41Z","snapshot_observed_at":"2026-08-09T02:23:51.891834Z","submitted_at":"2025-09-02T12:14:41Z","title":"Spectrogram Patch Codec: A 2D Block-Quantized VQ-VAE and HiFi-GAN for Neural Speech Coding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T11:50:49.649947Z"},"links":{"citing_paper":"/paper/2509.02244"},"observation_digest":"sha256:a279da3a70d20f13c4927f9112091167f2485eaf42cd9ec54b29a6dab454c5d2","observation_id":"db0079f9-5b75-4b5b-ae63-0ff8d7c60929","resolution":{"observed_at":"2026-08-05T11:50:52.065845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14411","last_updated":"2024-10-18T12:24:05Z","snapshot_observed_at":"2026-08-10T14:03:18.097569Z","submitted_at":"2024-10-18T12:24:05Z","title":"SNAC: Multi-Scale Neural Audio Codec","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14411","snapshot_observed_at":"2026-08-05T11:50:49.710979Z","title":"SNAC: Multi-scale neural audio codec,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02244","last_updated":"2025-09-02T12:14:41Z","snapshot_observed_at":"2026-08-09T02:23:51.891834Z","submitted_at":"2025-09-02T12:14:41Z","title":"Spectrogram Patch Codec: A 2D Block-Quantized VQ-VAE and HiFi-GAN for Neural Speech Coding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T11:50:49.710979Z"},"links":{"cited_paper":"/paper/2410.14411","citing_paper":"/paper/2509.02244"},"observation_digest":"sha256:f6cf508750a48246596ae4a96fedcaa16d6424417cbb85b0bf41e9ad13e306b5","observation_id":"02591f40-cde9-4569-866a-f6f4f33ded76","resolution":{"observed_at":"2026-08-05T11:50:49.710979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:50:51.883289Z","title":"An algorithm for predicting the intelligibility of time-frequency weighted noisy speech,","venue":null,"work_id":"af7d6159-95b0-4e49-8b20-05705d4500f7","year":2011},"citing_paper":{"arxiv_id":"2509.02244","last_updated":"2025-09-02T12:14:41Z","snapshot_observed_at":"2026-08-09T02:23:51.891834Z","submitted_at":"2025-09-02T12:14:41Z","title":"Spectrogram Patch Codec: A 2D Block-Quantized VQ-VAE and HiFi-GAN for Neural Speech Coding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T11:50:49.772704Z"},"links":{"citing_paper":"/paper/2509.02244"},"observation_digest":"sha256:5138c8742ed4003bafe029ad01aea1e5522e3088c6e1b30f85d526c95d2a7aa6","observation_id":"71fe0acd-ac48-4968-ae20-4a231a8e5f7e","resolution":{"observed_at":"2026-08-05T11:50:51.932478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:50:51.751817Z","title":"Mel-cepstral distance measure for objective speech quality assessment,","venue":null,"work_id":"26ea523e-269f-4860-ae9b-dce50b535263","year":null},"citing_paper":{"arxiv_id":"2509.02244","last_updated":"2025-09-02T12:14:41Z","snapshot_observed_at":"2026-08-09T02:23:51.891834Z","submitted_at":"2025-09-02T12:14:41Z","title":"Spectrogram Patch Codec: A 2D Block-Quantized VQ-VAE and HiFi-GAN for Neural Speech Coding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T11:50:49.833192Z"},"links":{"citing_paper":"/paper/2509.02244"},"observation_digest":"sha256:fa86b2d12d930bf0b123aa4614daadd7f01fa066d82f7d1b276bec00127fea75","observation_id":"7c030fc2-b2bc-4501-a68d-d832bcf25019","resolution":{"observed_at":"2026-08-05T11:50:51.838717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:50:51.455313Z","title":"Perceptual evaluation of speech quality (PESQ): A new method for speech quality assessment of telephone networks and codecs,","venue":null,"work_id":"5f92d361-9aa1-43fd-a9a1-e10a9385171f","year":null},"citing_paper":{"arxiv_id":"2509.02244","last_updated":"2025-09-02T12:14:41Z","snapshot_observed_at":"2026-08-09T02:23:51.891834Z","submitted_at":"2025-09-02T12:14:41Z","title":"Spectrogram Patch Codec: A 2D Block-Quantized VQ-VAE and HiFi-GAN for Neural Speech Coding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T11:50:49.961380Z"},"links":{"citing_paper":"/paper/2509.02244"},"observation_digest":"sha256:9bb2c9ff2cb5185c325e786ac5689de566d0ae0415bcfe337e41565e2f746e16","observation_id":"59d0caa9-e3a1-42e0-8855-f2c4aa46a326","resolution":{"observed_at":"2026-08-05T11:50:51.541929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:50:51.200858Z","title":"ViSQOL v3: An open source production ready objective speech and audio metric,","venue":null,"work_id":"2dd79515-1690-4ea0-9283-ab235e22932b","year":2020},"citing_paper":{"arxiv_id":"2509.02244","last_updated":"2025-09-02T12:14:41Z","snapshot_observed_at":"2026-08-09T02:23:51.891834Z","submitted_at":"2025-09-02T12:14:41Z","title":"Spectrogram Patch Codec: A 2D Block-Quantized VQ-VAE and HiFi-GAN for Neural Speech Coding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T11:50:50.077984Z"},"links":{"citing_paper":"/paper/2509.02244"},"observation_digest":"sha256:7d65aaec8495d7e82edb5e641338297bb0019e131a1f840bffb55110d14d7852","observation_id":"d8fcdbfb-4a6f-4e56-92fa-b3bc3acf73b8","resolution":{"observed_at":"2026-08-05T11:50:51.263369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:50:51.074467Z","title":"The unreasonable effectiveness of deep features as a perceptual metric,","venue":null,"work_id":"b77d466d-19f5-44a5-ac30-e11e4c903268","year":2018},"citing_paper":{"arxiv_id":"2509.02244","last_updated":"2025-09-02T12:14:41Z","snapshot_observed_at":"2026-08-09T02:23:51.891834Z","submitted_at":"2025-09-02T12:14:41Z","title":"Spectrogram Patch Codec: A 2D Block-Quantized VQ-VAE and HiFi-GAN for Neural Speech Coding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T11:50:50.137582Z"},"links":{"citing_paper":"/paper/2509.02244"},"observation_digest":"sha256:2be4634038cc859f56710dc0ab06b73113cddf867e5da383c386501c7ee29ba6","observation_id":"c4108cf5-c94c-48bb-9a0e-95a91082cd22","resolution":{"observed_at":"2026-08-05T11:50:51.126235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:50:50.946157Z","title":"Image-to-image translation with conditional adversarial networks,","venue":null,"work_id":"0ed26b04-beeb-4a3d-97ab-f327d1eb7478","year":2017},"citing_paper":{"arxiv_id":"2509.02244","last_updated":"2025-09-02T12:14:41Z","snapshot_observed_at":"2026-08-09T02:23:51.891834Z","submitted_at":"2025-09-02T12:14:41Z","title":"Spectrogram Patch Codec: A 2D Block-Quantized VQ-VAE and HiFi-GAN for Neural Speech Coding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T11:50:50.203290Z"},"links":{"citing_paper":"/paper/2509.02244"},"observation_digest":"sha256:5554ef49a731ecc317833f642a7d6bc9a4fda7749f13f6fcf928a289e1f1e681","observation_id":"b97f2344-f6fd-4591-96bf-06838ff4710a","resolution":{"observed_at":"2026-08-05T11:50:51.006832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:50:50.800874Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":"c1d12fe7-ce0b-4606-a2df-b6eaa4118774","year":2019},"citing_paper":{"arxiv_id":"2509.02244","last_updated":"2025-09-02T12:14:41Z","snapshot_observed_at":"2026-08-09T02:23:51.891834Z","submitted_at":"2025-09-02T12:14:41Z","title":"Spectrogram Patch Codec: A 2D Block-Quantized VQ-VAE and HiFi-GAN for Neural Speech Coding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T11:50:50.245881Z"},"links":{"citing_paper":"/paper/2509.02244"},"observation_digest":"sha256:b4a4421512f02d0e2f9bd7682b2c26cb7a127322e3dfbd7ead4945628da50679","observation_id":"01f5461e-82f8-4810-859f-bdade55b9aa0","resolution":{"observed_at":"2026-08-05T11:50:50.882508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:50:50.657990Z","title":"SGDR: Stochastic gradient descent with warm restarts,","venue":null,"work_id":"88cc3be3-41c2-40d7-90e4-247b4f1ff520","year":2017},"citing_paper":{"arxiv_id":"2509.02244","last_updated":"2025-09-02T12:14:41Z","snapshot_observed_at":"2026-08-09T02:23:51.891834Z","submitted_at":"2025-09-02T12:14:41Z","title":"Spectrogram Patch Codec: A 2D Block-Quantized VQ-VAE and HiFi-GAN for Neural Speech Coding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T11:50:50.329020Z"},"links":{"citing_paper":"/paper/2509.02244"},"observation_digest":"sha256:580fffb3e001abf67e45b238639078d7d7e7ba5345d304550f8cbeb469cdb40e","observation_id":"11652d8f-f2ca-4a20-a946-3829d52c9098","resolution":{"observed_at":"2026-08-05T11:50:50.730816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.01448","last_updated":"2023-04-04T01:44:24Z","snapshot_observed_at":"2026-08-05T05:35:57.132274Z","submitted_at":"2023-04-04T01:44:24Z","title":"TorchAudio-Squim: Reference-less Speech Quality and Intelligibility measures in TorchAudio","version":1},"cited_work":{"arxiv_id":"2304.01448","doi":null,"metadata_source":"pith","pith_arxiv_id":"2304.01448","snapshot_observed_at":"2026-08-05T11:50:50.487582Z","title":"TorchAudio-Squim: Reference-less Speech Quality and Intelligibility measures in TorchAudio","venue":"eess.AS","work_id":"8e2b20be-9aea-4087-9e9a-4a853bb9f8db","year":2023},"citing_paper":{"arxiv_id":"2509.02244","last_updated":"2025-09-02T12:14:41Z","snapshot_observed_at":"2026-08-09T02:23:51.891834Z","submitted_at":"2025-09-02T12:14:41Z","title":"Spectrogram Patch Codec: A 2D Block-Quantized VQ-VAE and HiFi-GAN for Neural Speech Coding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T11:50:50.392316Z"},"links":{"cited_paper":"/paper/2304.01448","citing_paper":"/paper/2509.02244"},"observation_digest":"sha256:32c1a512a7d56b0b702d88bb6c2059843b4f966325d9affd506e9fc5a5132b95","observation_id":"c03006e0-d17a-44c1-a537-e86ab6b2fed5","resolution":{"observed_at":"2026-08-05T11:50:50.544420Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:50:51.617375Z","title":null,"venue":null,"work_id":"381de3b3-7ef8-4241-9b77-156f67071f98","year":null},"citing_paper":{"arxiv_id":"2509.02244","last_updated":"2025-09-02T12:14:41Z","snapshot_observed_at":"2026-08-09T02:23:51.891834Z","submitted_at":"2025-09-02T12:14:41Z","title":"Spectrogram Patch Codec: A 2D Block-Quantized VQ-VAE and HiFi-GAN for Neural Speech Coding","version":1},"reference_index":1993,"source":"pdf_text","source_observed_at":"2026-08-05T11:50:49.893700Z"},"links":{"citing_paper":"/paper/2509.02244"},"observation_digest":"sha256:5fdfedd380aaadbf1c99a6b7e444a668738603c29deb5c612c208c453062b498","observation_id":"8804c597-9bde-482c-ba24-f992a2438e59","resolution":{"observed_at":"2026-08-05T11:50:51.678352Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:50:51.322928Z","title":null,"venue":null,"work_id":"656aed51-6856-4ef2-919e-917a075b7cd0","year":null},"citing_paper":{"arxiv_id":"2509.02244","last_updated":"2025-09-02T12:14:41Z","snapshot_observed_at":"2026-08-09T02:23:51.891834Z","submitted_at":"2025-09-02T12:14:41Z","title":"Spectrogram Patch Codec: A 2D Block-Quantized VQ-VAE and HiFi-GAN for Neural Speech Coding","version":1},"reference_index":2001,"source":"pdf_text","source_observed_at":"2026-08-05T11:50:50.024314Z"},"links":{"citing_paper":"/paper/2509.02244"},"observation_digest":"sha256:6b314b5050a3411c6d1b882132e53695ac37381403862e4fcff0817a0c396c45","observation_id":"9d66726e-bbf5-434c-a1c9-dfcc74b042f0","resolution":{"observed_at":"2026-08-05T11:50:51.384271Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.02244","last_updated":"2025-09-02T12:14:41Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-09T02:23:51.891834Z","submitted_at":"2025-09-02T12:14:41Z","title":"Spectrogram Patch Codec: A 2D Block-Quantized VQ-VAE and HiFi-GAN for Neural Speech Coding"},"reference_resolution":{"displayed":18,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":4,"verified_exact":1,"verified_fuzzy":13},"total_outbound_references":18},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 18 of 18 outbound references and 0 inbound Pith citation observations for arXiv:2509.02244."}