{"as_of":"2026-08-21T13:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7fc6c5ae2b2f1b3df7bcfeadf7da601813d19ce73d3e06b421a4da63be4009ed","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:47:34.547644Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.12701/citation-record","integrity":"/paper/2507.12701/integrity","json":"/paper/2507.12701/citation-record.json","paper":"/paper/2507.12701"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:47:35.701474Z","title":"Coding of moving pictures and associated audio for digital storage media at up to about 1.5 Mbit/s,","venue":null,"work_id":"d8a28567-8c04-42a2-a19b-3072a5f3994e","year":1993},"citing_paper":{"arxiv_id":"2507.12701","last_updated":"2025-07-17T00:32:07Z","snapshot_observed_at":"2026-08-14T18:23:35.830620Z","submitted_at":"2025-07-17T00:32:07Z","title":"Task-Specific Audio Coding for Machines: Machine-Learned Latent Features Are Codes for That Machine","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T16:47:34.217892Z"},"links":{"citing_paper":"/paper/2507.12701"},"observation_digest":"sha256:cbdbcc8eff9f2ec98109c3f3dbc977420db57f631e52ed7ed84a48651ffec02d","observation_id":"e05d1be0-f57d-4a1c-a314-e71762ec6225","resolution":{"observed_at":"2026-08-06T16:47:35.709633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:47:35.677899Z","title":"Perceptual coding of digital audio,","venue":null,"work_id":"7d1fc2d3-9321-45fe-b2c4-dbb8ee7d33a5","year":2000},"citing_paper":{"arxiv_id":"2507.12701","last_updated":"2025-07-17T00:32:07Z","snapshot_observed_at":"2026-08-14T18:23:35.830620Z","submitted_at":"2025-07-17T00:32:07Z","title":"Task-Specific Audio Coding for Machines: Machine-Learned Latent Features Are Codes for That Machine","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T16:47:34.225241Z"},"links":{"citing_paper":"/paper/2507.12701"},"observation_digest":"sha256:cb1dd58704eee04895c2fdf559005b25ffb92dafc980d7afcdab5ffc4490a7bf","observation_id":"c57fff88-fe11-4378-ab9f-1d934bd27c80","resolution":{"observed_at":"2026-08-06T16:47:35.685195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:47:35.659752Z","title":"Information technology — Generic coding of moving pictures and associated audio information — Part 7: Advanced Audio Coding (AAC),","venue":null,"work_id":"2e067cfe-b516-42d9-a164-28b5b1f7cee8","year":2006},"citing_paper":{"arxiv_id":"2507.12701","last_updated":"2025-07-17T00:32:07Z","snapshot_observed_at":"2026-08-14T18:23:35.830620Z","submitted_at":"2025-07-17T00:32:07Z","title":"Task-Specific Audio Coding for Machines: Machine-Learned Latent Features Are Codes for That Machine","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T16:47:34.232621Z"},"links":{"citing_paper":"/paper/2507.12701"},"observation_digest":"sha256:6e70fe34943030dd2d9b8139f6b308f34c10c59efe51b132d3726b14fa820b5a","observation_id":"6ef6c5b8-1d40-42db-87e7-fe6a8095beab","resolution":{"observed_at":"2026-08-06T16:47:35.664427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:47:35.643533Z","title":null,"venue":null,"work_id":"5e7233bf-ff76-47c6-84a7-83a7d5464655","year":2010},"citing_paper":{"arxiv_id":"2507.12701","last_updated":"2025-07-17T00:32:07Z","snapshot_observed_at":"2026-08-14T18:23:35.830620Z","submitted_at":"2025-07-17T00:32:07Z","title":"Task-Specific Audio Coding for Machines: Machine-Learned Latent Features Are Codes for That Machine","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T16:47:34.239275Z"},"links":{"citing_paper":"/paper/2507.12701"},"observation_digest":"sha256:a7e8f370df688b9d76d8c9d742ddb3977afa2b7749885f79ddd34bed688e076d","observation_id":"7f22afc4-49f3-45a9-b4f1-bf5701bd6753","resolution":{"observed_at":"2026-08-06T16:47:35.647701Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:47:35.628282Z","title":"Transport of unified speech and audio coding (USAC),","venue":null,"work_id":"68b11714-f5e5-4e42-84d4-ad55b4cefa6b","year":2009},"citing_paper":{"arxiv_id":"2507.12701","last_updated":"2025-07-17T00:32:07Z","snapshot_observed_at":"2026-08-14T18:23:35.830620Z","submitted_at":"2025-07-17T00:32:07Z","title":"Task-Specific Audio Coding for Machines: Machine-Learned Latent Features Are Codes for That Machine","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T16:47:34.252746Z"},"links":{"citing_paper":"/paper/2507.12701"},"observation_digest":"sha256:8ffb83238722511faf59a487373d646830fb986305aa8d0de7f2a662979aae79","observation_id":"1159c6d4-77ed-4a5b-9a52-03da087611ef","resolution":{"observed_at":"2026-08-06T16:47:35.632890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:47:35.611115Z","title":"Wideband coding of speech at around 16 kbit/s using Adaptive Multi-Rate Wideband (AMR-WB),","venue":null,"work_id":"c3fc7bf4-3060-4ec9-96a5-60866a41a643","year":2003},"citing_paper":{"arxiv_id":"2507.12701","last_updated":"2025-07-17T00:32:07Z","snapshot_observed_at":"2026-08-14T18:23:35.830620Z","submitted_at":"2025-07-17T00:32:07Z","title":"Task-Specific Audio Coding for Machines: Machine-Learned Latent Features Are Codes for That Machine","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T16:47:34.260419Z"},"links":{"citing_paper":"/paper/2507.12701"},"observation_digest":"sha256:7688d6b4e6ccb14cc897b8ae34548c155eda863f841f44f00745d7dddee19f78","observation_id":"c6418288-cb28-4892-9901-8d686fc1ac84","resolution":{"observed_at":"2026-08-06T16:47:35.617702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:47:35.589351Z","title":"Soundstream: An end-to-end neural audio codec,","venue":null,"work_id":"352b4b05-6d29-4153-87e6-01a3e7a3654e","year":2022},"citing_paper":{"arxiv_id":"2507.12701","last_updated":"2025-07-17T00:32:07Z","snapshot_observed_at":"2026-08-14T18:23:35.830620Z","submitted_at":"2025-07-17T00:32:07Z","title":"Task-Specific Audio Coding for Machines: Machine-Learned Latent Features Are Codes for That Machine","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T16:47:34.270443Z"},"links":{"citing_paper":"/paper/2507.12701"},"observation_digest":"sha256:9bfbbc4e4e12914f459eb02c79544deacca038d7c8661ada8ec08b3b92a48ecd","observation_id":"7f6a9b25-7d7f-4d33-a966-316e8f9af772","resolution":{"observed_at":"2026-08-06T16:47:35.594997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:47:35.574324Z","title":"High- fidelity audio compression with improved RVQGAN,","venue":null,"work_id":"cfa91dd4-5936-4cc4-8a89-e32d9e998051","year":2023},"citing_paper":{"arxiv_id":"2507.12701","last_updated":"2025-07-17T00:32:07Z","snapshot_observed_at":"2026-08-14T18:23:35.830620Z","submitted_at":"2025-07-17T00:32:07Z","title":"Task-Specific Audio Coding for Machines: Machine-Learned Latent Features Are Codes for That Machine","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T16:47:34.278330Z"},"links":{"citing_paper":"/paper/2507.12701"},"observation_digest":"sha256:48aa4c4867b991da07b288576771e1fa8c783a80b135acee509baee18f36fe75","observation_id":"510b628d-434c-410a-b9f7-c4c717881847","resolution":{"observed_at":"2026-08-06T16:47:35.579123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:47:35.559297Z","title":"High fidelity neural audio compression,","venue":null,"work_id":"9529ae94-5e4c-4885-952e-2b342581ed01","year":2023},"citing_paper":{"arxiv_id":"2507.12701","last_updated":"2025-07-17T00:32:07Z","snapshot_observed_at":"2026-08-14T18:23:35.830620Z","submitted_at":"2025-07-17T00:32:07Z","title":"Task-Specific Audio Coding for Machines: Machine-Learned Latent Features Are Codes for That Machine","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T16:47:34.289979Z"},"links":{"citing_paper":"/paper/2507.12701"},"observation_digest":"sha256:13dee8b9310be4747f65cba0916857f207378649e1a4138005c1ab2efc43620d","observation_id":"0eb1a529-ce78-43e6-8d2f-f00b100db5a4","resolution":{"observed_at":"2026-08-06T16:47:35.564050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:47:35.543029Z","title":"On generative spoken language modeling from raw audio,","venue":null,"work_id":"7622fe97-f433-405c-874c-0b4f2eb03588","year":2021},"citing_paper":{"arxiv_id":"2507.12701","last_updated":"2025-07-17T00:32:07Z","snapshot_observed_at":"2026-08-14T18:23:35.830620Z","submitted_at":"2025-07-17T00:32:07Z","title":"Task-Specific Audio Coding for Machines: Machine-Learned Latent Features Are Codes for That Machine","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T16:47:34.306932Z"},"links":{"citing_paper":"/paper/2507.12701"},"observation_digest":"sha256:0b7b09dff0d442ea74176f4d9157020e970e4f9056a2ef24e5bc1fe9901bd8e4","observation_id":"f8a58082-9d87-49a1-88f6-feca5b91fb02","resolution":{"observed_at":"2026-08-06T16:47:35.548035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03751","last_updated":"2025-08-07T13:29:43Z","snapshot_observed_at":"2026-08-16T13:13:34.592774Z","submitted_at":"2024-10-01T21:48:12Z","title":"Recent Advances in Speech Language Models: A Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03751","snapshot_observed_at":"2026-08-06T16:47:34.319918Z","title":"Recent advances in speech language models: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12701","last_updated":"2025-07-17T00:32:07Z","snapshot_observed_at":"2026-08-14T18:23:35.830620Z","submitted_at":"2025-07-17T00:32:07Z","title":"Task-Specific Audio Coding for Machines: Machine-Learned Latent Features Are Codes for That Machine","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T16:47:34.319918Z"},"links":{"cited_paper":"/paper/2410.03751","citing_paper":"/paper/2507.12701"},"observation_digest":"sha256:bed58b65e5bbe2bcba1fb9aeb3620a0a4b12dbecaf8af37c5ee8749adfd07a6d","observation_id":"1020d1a2-ec69-4a76-8428-208b2c7a54f9","resolution":{"observed_at":"2026-08-06T16:47:34.319918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-06T16:47:34.327894Z","title":"Neural codec language models are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12701","last_updated":"2025-07-17T00:32:07Z","snapshot_observed_at":"2026-08-14T18:23:35.830620Z","submitted_at":"2025-07-17T00:32:07Z","title":"Task-Specific Audio Coding for Machines: Machine-Learned Latent Features Are Codes for That Machine","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T16:47:34.327894Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2507.12701"},"observation_digest":"sha256:4f4b3a91bb4d9f907e46eabafbe368aa74de9c836fd2e7b9a1a764583b3c66b8","observation_id":"8f4ed98d-0a48-4640-9c92-26b69045f1cb","resolution":{"observed_at":"2026-08-06T16:47:34.327894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-19T21:51:01.237503Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-06T16:47:34.333552Z","title":"Beats: Audio pre-training with acoustic tokenizers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12701","last_updated":"2025-07-17T00:32:07Z","snapshot_observed_at":"2026-08-14T18:23:35.830620Z","submitted_at":"2025-07-17T00:32:07Z","title":"Task-Specific Audio Coding for Machines: Machine-Learned Latent Features Are Codes for That Machine","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T16:47:34.333552Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2507.12701"},"observation_digest":"sha256:36f0790afa06fb95e00fd460feb7791d02e5de454fb47bcd937dfbd5521eb062","observation_id":"043fba0e-52af-41da-b7cc-98f402ff4421","resolution":{"observed_at":"2026-08-06T16:47:34.333552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:47:35.522213Z","title":"Genhancer: High-fidelity speech enhancement via generative modeling on discrete codec tokens,","venue":null,"work_id":"310b1a0b-7a9f-4fa7-a8f1-ad394c990905","year":2024},"citing_paper":{"arxiv_id":"2507.12701","last_updated":"2025-07-17T00:32:07Z","snapshot_observed_at":"2026-08-14T18:23:35.830620Z","submitted_at":"2025-07-17T00:32:07Z","title":"Task-Specific Audio Coding for Machines: Machine-Learned Latent Features Are Codes for That Machine","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T16:47:34.342970Z"},"links":{"citing_paper":"/paper/2507.12701"},"observation_digest":"sha256:d30a61e804ef18d4ca903d75a4acf4a4f75497eee457ee685c9c521f13d26711","observation_id":"4e34957c-1ceb-4d70-b4c9-16f019091cb8","resolution":{"observed_at":"2026-08-06T16:47:35.527111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:47:35.494605Z","title":"DASB - discrete audio and speech benchmark,","venue":null,"work_id":"6b20fe8b-15ff-4dee-98db-8f4d7f27c1cb","year":2024},"citing_paper":{"arxiv_id":"2507.12701","last_updated":"2025-07-17T00:32:07Z","snapshot_observed_at":"2026-08-14T18:23:35.830620Z","submitted_at":"2025-07-17T00:32:07Z","title":"Task-Specific Audio Coding for Machines: Machine-Learned Latent Features Are Codes for That Machine","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T16:47:34.356802Z"},"links":{"citing_paper":"/paper/2507.12701"},"observation_digest":"sha256:c22b81206f9fe44e5f70a8647ba252c958e590368b8ba56d3b9bae93b690ed5f","observation_id":"6ea1f007-59cb-4cd6-896b-6d3b6259e43e","resolution":{"observed_at":"2026-08-06T16:47:35.501155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:47:35.475825Z","title":"Codec-SUPERB: An in-depth analysis of sound codec models,","venue":null,"work_id":"29d4723a-b69c-4cb6-81ec-03a28177d256","year":2024},"citing_paper":{"arxiv_id":"2507.12701","last_updated":"2025-07-17T00:32:07Z","snapshot_observed_at":"2026-08-14T18:23:35.830620Z","submitted_at":"2025-07-17T00:32:07Z","title":"Task-Specific Audio Coding for Machines: Machine-Learned Latent Features Are Codes for That Machine","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T16:47:34.363383Z"},"links":{"citing_paper":"/paper/2507.12701"},"observation_digest":"sha256:79c0a235d33ae0f7b79105d62ed45d6b91a38fc0c5582086d926fb9be109bb0a","observation_id":"c7ab352b-78ba-48df-bd07-39ad6491af26","resolution":{"observed_at":"2026-08-06T16:47:35.480555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:47:35.458760Z","title":"Psychoacoustic calibration of loss functions for efficient end-to-end neural audio coding,","venue":null,"work_id":"daf421f1-4ae1-4efe-b57b-bf4f333497a6","year":2020},"citing_paper":{"arxiv_id":"2507.12701","last_updated":"2025-07-17T00:32:07Z","snapshot_observed_at":"2026-08-14T18:23:35.830620Z","submitted_at":"2025-07-17T00:32:07Z","title":"Task-Specific Audio Coding for Machines: Machine-Learned Latent Features Are Codes for That Machine","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T16:47:34.369792Z"},"links":{"citing_paper":"/paper/2507.12701"},"observation_digest":"sha256:81ed9d1338aabb0c35b982b3e7f8892e769cf8dc039604274a2baee3914ff74e","observation_id":"a11635cd-9e6c-4118-bbd9-3ab0ce5900ec","resolution":{"observed_at":"2026-08-06T16:47:35.463353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:47:35.442530Z","title":"Use Cases and Requirements on Audio Coding for Machines,","venue":null,"work_id":"5231c02f-295f-4311-96a0-17340019e429","year":null},"citing_paper":{"arxiv_id":"2507.12701","last_updated":"2025-07-17T00:32:07Z","snapshot_observed_at":"2026-08-14T18:23:35.830620Z","submitted_at":"2025-07-17T00:32:07Z","title":"Task-Specific Audio Coding for Machines: Machine-Learned Latent Features Are Codes for That Machine","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T16:47:34.377310Z"},"links":{"citing_paper":"/paper/2507.12701"},"observation_digest":"sha256:35016b54ba402e352c069c83ac921b9e2a0ec37199ef584a80014079dd199efc","observation_id":"b665b452-329f-400e-80c4-8725c3fdb52e","resolution":{"observed_at":"2026-08-06T16:47:35.447378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:47:35.422539Z","title":"Wav2vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":"5088f029-f530-42ef-953a-19daadd3a0e2","year":2020},"citing_paper":{"arxiv_id":"2507.12701","last_updated":"2025-07-17T00:32:07Z","snapshot_observed_at":"2026-08-14T18:23:35.830620Z","submitted_at":"2025-07-17T00:32:07Z","title":"Task-Specific Audio Coding for Machines: Machine-Learned Latent Features Are Codes for That Machine","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T16:47:34.387291Z"},"links":{"citing_paper":"/paper/2507.12701"},"observation_digest":"sha256:b5e8b642a4553094c19a297c230ccaa2d9f4199ad944e0a238214e1a8aad06dc","observation_id":"8fdddbbe-5f6a-4b1e-9352-8e0b1a191095","resolution":{"observed_at":"2026-08-06T16:47:35.427853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:47:35.391827Z","title":"WavLM: Large-Scale Self-Supervised Pre- Training for Full Stack Speech Processing,","venue":null,"work_id":"cc59f9b8-7ee8-4cfd-9f8a-e852ee5a8dda","year":2022},"citing_paper":{"arxiv_id":"2507.12701","last_updated":"2025-07-17T00:32:07Z","snapshot_observed_at":"2026-08-14T18:23:35.830620Z","submitted_at":"2025-07-17T00:32:07Z","title":"Task-Specific Audio Coding for Machines: Machine-Learned Latent Features Are Codes for That Machine","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T16:47:34.396185Z"},"links":{"citing_paper":"/paper/2507.12701"},"observation_digest":"sha256:b54f22b8f3310e366a4da15f4d30a04468010a360c24474999e9662d0e84fc32","observation_id":"81511d27-0e1c-4929-941d-9431cf8627a8","resolution":{"observed_at":"2026-08-06T16:47:35.398831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:47:35.371224Z","title":"HuBERT: Self-Supervised Speech Representation Learn- ing by Masked Prediction of Hidden Units,","venue":null,"work_id":"f27bf0f7-0ff5-4902-8aa8-4f76ffb502e9","year":2021},"citing_paper":{"arxiv_id":"2507.12701","last_updated":"2025-07-17T00:32:07Z","snapshot_observed_at":"2026-08-14T18:23:35.830620Z","submitted_at":"2025-07-17T00:32:07Z","title":"Task-Specific Audio Coding for Machines: Machine-Learned Latent Features Are Codes for That Machine","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T16:47:34.404133Z"},"links":{"citing_paper":"/paper/2507.12701"},"observation_digest":"sha256:753cfd3240289bd4a5d587c43b066426b8f76da6f309d91e5bf6110d8222bd25","observation_id":"85b9efd9-cc6b-41f0-b4b2-1c5a834d7b4c","resolution":{"observed_at":"2026-08-06T16:47:35.377321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08528","last_updated":"2026-04-07T06:11:20Z","snapshot_observed_at":"2026-08-14T11:32:49.145887Z","submitted_at":"2025-04-11T13:40:53Z","title":"On The Landscape of Spoken Language Models: A Comprehensive Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08528","snapshot_observed_at":"2026-08-06T16:47:34.411297Z","title":"On The Landscape of Spoken Language Models: A Comprehensive Survey,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.12701","last_updated":"2025-07-17T00:32:07Z","snapshot_observed_at":"2026-08-14T18:23:35.830620Z","submitted_at":"2025-07-17T00:32:07Z","title":"Task-Specific Audio Coding for Machines: Machine-Learned Latent Features Are Codes for That Machine","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T16:47:34.411297Z"},"links":{"cited_paper":"/paper/2504.08528","citing_paper":"/paper/2507.12701"},"observation_digest":"sha256:998c69339c8567f33de2a9bbbbd61b8c405d5430f007056f44d451d6e1287428","observation_id":"1d009556-cb30-448a-874c-b356a720a89d","resolution":{"observed_at":"2026-08-06T16:47:34.411297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13236","last_updated":"2024-02-20T18:50:25Z","snapshot_observed_at":"2026-08-20T12:20:52.955680Z","submitted_at":"2024-02-20T18:50:25Z","title":"Towards audio language modeling -- an overview","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13236","snapshot_observed_at":"2026-08-06T16:47:34.416786Z","title":"Towards audio language modeling–an overview,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12701","last_updated":"2025-07-17T00:32:07Z","snapshot_observed_at":"2026-08-14T18:23:35.830620Z","submitted_at":"2025-07-17T00:32:07Z","title":"Task-Specific Audio Coding for Machines: Machine-Learned Latent Features Are Codes for That Machine","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T16:47:34.416786Z"},"links":{"cited_paper":"/paper/2402.13236","citing_paper":"/paper/2507.12701"},"observation_digest":"sha256:6da1fae75213755e376c829f681cc773236055cc4382dc14dfc57732e6e4c2b1","observation_id":"cd07aad6-6f2d-4474-86e0-6e737ebc5f75","resolution":{"observed_at":"2026-08-06T16:47:34.416786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:47:35.353388Z","title":"Espnet-codec: Comprehensive training and evaluation of neural codecs for audio, music, and speech,","venue":null,"work_id":"ee9d4950-25c4-4b84-b943-7065ebcc78c9","year":2024},"citing_paper":{"arxiv_id":"2507.12701","last_updated":"2025-07-17T00:32:07Z","snapshot_observed_at":"2026-08-14T18:23:35.830620Z","submitted_at":"2025-07-17T00:32:07Z","title":"Task-Specific Audio Coding for Machines: Machine-Learned Latent Features Are Codes for That Machine","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T16:47:34.425224Z"},"links":{"citing_paper":"/paper/2507.12701"},"observation_digest":"sha256:222a5b2863b8fcccae1f3f479ea6b4337548cb4b0975823b02d52630d7f2abca","observation_id":"75dac727-9f6e-494d-bb76-e45bfc695a1d","resolution":{"observed_at":"2026-08-06T16:47:35.359143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:47:34.433023Z","title":"Recent advances in discrete speech tokens: A review,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.12701","last_updated":"2025-07-17T00:32:07Z","snapshot_observed_at":"2026-08-14T18:23:35.830620Z","submitted_at":"2025-07-17T00:32:07Z","title":"Task-Specific Audio Coding for Machines: Machine-Learned Latent Features Are Codes for That Machine","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T16:47:34.433023Z"},"links":{"citing_paper":"/paper/2507.12701"},"observation_digest":"sha256:d5119dfad70775a6afea024ca3bd5f396531a97099bed951b7e335910e1ca681","observation_id":"4657b274-b7aa-448d-a999-6e5d63708f00","resolution":{"observed_at":"2026-08-06T16:47:34.433023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-08-10T17:49:50.848957Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-06T16:47:34.441012Z","title":"CosyV oice: A scalable multilingual zero-shot text-to- speech synthesizer based on supervised semantic tokens,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12701","last_updated":"2025-07-17T00:32:07Z","snapshot_observed_at":"2026-08-14T18:23:35.830620Z","submitted_at":"2025-07-17T00:32:07Z","title":"Task-Specific Audio Coding for Machines: Machine-Learned Latent Features Are Codes for That Machine","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T16:47:34.441012Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2507.12701"},"observation_digest":"sha256:58285ef214756884fcee584695e43e7be82d1630e9cac7011ea46273955ac568","observation_id":"cf72a923-a0b3-4a98-9304-994cf0b10da3","resolution":{"observed_at":"2026-08-06T16:47:34.441012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:47:35.334950Z","title":"Soft-to-hard vector quantization for end- to-end learning compressible representations,","venue":null,"work_id":"df77a5fa-99c2-4989-b32d-9635517204e6","year":2017},"citing_paper":{"arxiv_id":"2507.12701","last_updated":"2025-07-17T00:32:07Z","snapshot_observed_at":"2026-08-14T18:23:35.830620Z","submitted_at":"2025-07-17T00:32:07Z","title":"Task-Specific Audio Coding for Machines: Machine-Learned Latent Features Are Codes for That Machine","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T16:47:34.448780Z"},"links":{"citing_paper":"/paper/2507.12701"},"observation_digest":"sha256:90f67b484b0983b97e50d11efd95cb39de1ddbb434e4648a4a96674291d76368","observation_id":"c1ef2cfe-5b93-4277-bd28-1ed48173e823","resolution":{"observed_at":"2026-08-06T16:47:35.340504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.06546","last_updated":"2023-10-26T22:17:49Z","snapshot_observed_at":"2026-08-17T04:17:14.863621Z","submitted_at":"2023-06-11T00:13:00Z","title":"High-Fidelity Audio Compression with Improved RVQGAN","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.06546","snapshot_observed_at":"2026-08-06T16:47:34.455589Z","title":"High- fidelity audio compression with improved RVQGAN,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12701","last_updated":"2025-07-17T00:32:07Z","snapshot_observed_at":"2026-08-14T18:23:35.830620Z","submitted_at":"2025-07-17T00:32:07Z","title":"Task-Specific Audio Coding for Machines: Machine-Learned Latent Features Are Codes for That Machine","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T16:47:34.455589Z"},"links":{"cited_paper":"/paper/2306.06546","citing_paper":"/paper/2507.12701"},"observation_digest":"sha256:e29ab740afaf63d676583b8f602f3b7dd6834af1d8601c70ec903073ff0aa8f5","observation_id":"72e08b84-24df-4c1c-8c9d-fa09d208c4c9","resolution":{"observed_at":"2026-08-06T16:47:34.455589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:47:35.319780Z","title":"Open-Source Conversational AI with SpeechBrain 1.0,","venue":null,"work_id":"279e4541-697c-4dbe-9ac6-bbb89cc3c18d","year":2024},"citing_paper":{"arxiv_id":"2507.12701","last_updated":"2025-07-17T00:32:07Z","snapshot_observed_at":"2026-08-14T18:23:35.830620Z","submitted_at":"2025-07-17T00:32:07Z","title":"Task-Specific Audio Coding for Machines: Machine-Learned Latent Features Are Codes for That Machine","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T16:47:34.465735Z"},"links":{"citing_paper":"/paper/2507.12701"},"observation_digest":"sha256:bb4dab37bb68ab2713a2099022c9cc36552d17753dd1419b906c5e8b1aaee549","observation_id":"c31d9f80-9e71-4757-9be5-2e0e7f74bf09","resolution":{"observed_at":"2026-08-06T16:47:35.323980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:47:35.302371Z","title":"SentencePiece: A simple and language independent subword tokenizer and detokenizer for neural text processing,","venue":null,"work_id":"b8ac404b-5efb-4a61-9b53-ca89dc8763aa","year":2018},"citing_paper":{"arxiv_id":"2507.12701","last_updated":"2025-07-17T00:32:07Z","snapshot_observed_at":"2026-08-14T18:23:35.830620Z","submitted_at":"2025-07-17T00:32:07Z","title":"Task-Specific Audio Coding for Machines: Machine-Learned Latent Features Are Codes for That Machine","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T16:47:34.476912Z"},"links":{"citing_paper":"/paper/2507.12701"},"observation_digest":"sha256:7448721d0d32cbf6040a8e70192d83925c3334a820680d93244e1cba2225010d","observation_id":"838bf84b-ba99-4906-ad4c-64ad2fea8aaa","resolution":{"observed_at":"2026-08-06T16:47:35.308340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:47:35.283307Z","title":"Connectionist temporal classification: labelling unsegmented sequence data with recurrent neural networks,","venue":null,"work_id":"1bcc606f-032f-4b8a-a97f-922287c62693","year":2006},"citing_paper":{"arxiv_id":"2507.12701","last_updated":"2025-07-17T00:32:07Z","snapshot_observed_at":"2026-08-14T18:23:35.830620Z","submitted_at":"2025-07-17T00:32:07Z","title":"Task-Specific Audio Coding for Machines: Machine-Learned Latent Features Are Codes for That Machine","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T16:47:34.482583Z"},"links":{"citing_paper":"/paper/2507.12701"},"observation_digest":"sha256:f495a911aab9a7763d745df31a8619f20f6725723a9b8a131f3117ceb43b1f4d","observation_id":"a687cba7-7102-444b-9465-3df1d94b3b99","resolution":{"observed_at":"2026-08-06T16:47:35.288120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-17T19:26:44.032537Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-06T16:47:34.491317Z","title":"Adam: A method for stochastic optimization,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.12701","last_updated":"2025-07-17T00:32:07Z","snapshot_observed_at":"2026-08-14T18:23:35.830620Z","submitted_at":"2025-07-17T00:32:07Z","title":"Task-Specific Audio Coding for Machines: Machine-Learned Latent Features Are Codes for That Machine","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T16:47:34.491317Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2507.12701"},"observation_digest":"sha256:0dc93c4f635582f15b8d66ed57f38ad55f56d3deecf20c26baacb20cbcbeadee","observation_id":"deb6a0f7-6850-4e71-8426-9851b84598c5","resolution":{"observed_at":"2026-08-06T16:47:34.491317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:47:35.265499Z","title":"Neural discrete representation learning,","venue":null,"work_id":"390c2cf3-7396-4e39-94e8-15fa6afee4c5","year":2017},"citing_paper":{"arxiv_id":"2507.12701","last_updated":"2025-07-17T00:32:07Z","snapshot_observed_at":"2026-08-14T18:23:35.830620Z","submitted_at":"2025-07-17T00:32:07Z","title":"Task-Specific Audio Coding for Machines: Machine-Learned Latent Features Are Codes for That Machine","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T16:47:34.499160Z"},"links":{"citing_paper":"/paper/2507.12701"},"observation_digest":"sha256:f02f2d72cc016d39a5b20d11d8d2e5d88c448fc3a13c70a3a3aac94d76e51339","observation_id":"54e571bb-0bb1-49ae-b79b-8fc6c20b32e7","resolution":{"observed_at":"2026-08-06T16:47:35.271598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.07143","last_updated":"2020-08-10T13:50:24Z","snapshot_observed_at":"2026-08-16T12:49:35.884517Z","submitted_at":"2020-05-14T17:02:15Z","title":"ECAPA-TDNN: Emphasized Channel Attention, Propagation and Aggregation in TDNN Based Speaker Verification","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.07143","snapshot_observed_at":"2026-08-06T16:47:34.504325Z","title":"ECAPA-TDNN: Emphasized channel attention, propagation and aggregation in tdnn based speaker verification,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.12701","last_updated":"2025-07-17T00:32:07Z","snapshot_observed_at":"2026-08-14T18:23:35.830620Z","submitted_at":"2025-07-17T00:32:07Z","title":"Task-Specific Audio Coding for Machines: Machine-Learned Latent Features Are Codes for That Machine","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T16:47:34.504325Z"},"links":{"cited_paper":"/paper/2005.07143","citing_paper":"/paper/2507.12701"},"observation_digest":"sha256:24c4e617ee392e10eaac76b2e88d12a0b8c33f7e827434836d0bc82013806ff3","observation_id":"86daef6c-ebb6-4f87-bf39-5e8a3b91619b","resolution":{"observed_at":"2026-08-06T16:47:34.504325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:47:35.241685Z","title":"Margin matters: Towards more discriminative deep neural network embeddings for speaker recognition,","venue":null,"work_id":"f6646657-1e74-4516-8981-a9e864078859","year":2019},"citing_paper":{"arxiv_id":"2507.12701","last_updated":"2025-07-17T00:32:07Z","snapshot_observed_at":"2026-08-14T18:23:35.830620Z","submitted_at":"2025-07-17T00:32:07Z","title":"Task-Specific Audio Coding for Machines: Machine-Learned Latent Features Are Codes for That Machine","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T16:47:34.513344Z"},"links":{"citing_paper":"/paper/2507.12701"},"observation_digest":"sha256:2982bcd75ac2ed3e0e3d40c4d88c1f71e02994d41ba09039af93510570a63ba9","observation_id":"fc5e078c-aa78-487d-9439-bad35fb30ec4","resolution":{"observed_at":"2026-08-06T16:47:35.247324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11127","last_updated":"2026-05-31T18:23:52Z","snapshot_observed_at":"2026-08-16T15:38:38.818961Z","submitted_at":"2023-04-21T17:02:38Z","title":"Tree-Structured Parzen Estimator: Understanding Its Algorithm Components and Their Roles for Better Empirical Performance","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11127","snapshot_observed_at":"2026-08-06T16:47:34.518459Z","title":"Tree-structured parzen estimator: Understanding its algorithm components and their roles for better empirical performance,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12701","last_updated":"2025-07-17T00:32:07Z","snapshot_observed_at":"2026-08-14T18:23:35.830620Z","submitted_at":"2025-07-17T00:32:07Z","title":"Task-Specific Audio Coding for Machines: Machine-Learned Latent Features Are Codes for That Machine","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T16:47:34.518459Z"},"links":{"cited_paper":"/paper/2304.11127","citing_paper":"/paper/2507.12701"},"observation_digest":"sha256:23aa14355b47392d7092085b5a29ac55fb21cae28e0117e45683c0ce9bcf8c2a","observation_id":"50eab455-7d61-4804-a6d5-03131e0ddebb","resolution":{"observed_at":"2026-08-06T16:47:34.518459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:47:34.524437Z","title":"Epistimio/orion: Asynchronous Distributed Hyperparameter Optimization,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12701","last_updated":"2025-07-17T00:32:07Z","snapshot_observed_at":"2026-08-14T18:23:35.830620Z","submitted_at":"2025-07-17T00:32:07Z","title":"Task-Specific Audio Coding for Machines: Machine-Learned Latent Features Are Codes for That Machine","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T16:47:34.524437Z"},"links":{"citing_paper":"/paper/2507.12701"},"observation_digest":"sha256:f1bfccf71bea8275e441f98550856b78b93ba5b0038611fef6025d9cc27f1a98","observation_id":"9272234c-50ba-4d72-8c31-116f2b91e964","resolution":{"observed_at":"2026-08-06T16:47:34.524437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:47:35.220986Z","title":"Librispeech: An ASR corpus based on public domain audio books,","venue":null,"work_id":"129df315-1164-452e-a8d9-d8b564f41ff9","year":2015},"citing_paper":{"arxiv_id":"2507.12701","last_updated":"2025-07-17T00:32:07Z","snapshot_observed_at":"2026-08-14T18:23:35.830620Z","submitted_at":"2025-07-17T00:32:07Z","title":"Task-Specific Audio Coding for Machines: Machine-Learned Latent Features Are Codes for That Machine","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T16:47:34.533482Z"},"links":{"citing_paper":"/paper/2507.12701"},"observation_digest":"sha256:a02b1a64e2c527a03827f9b6c5bc70945053f226b0f4ee35855b10560f20b71e","observation_id":"400aa906-b170-4a38-9fc8-0a9f90aa1525","resolution":{"observed_at":"2026-08-06T16:47:35.226449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:47:34.539614Z","title":"A Dataset and Taxonomy for Urban Sound Research,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.12701","last_updated":"2025-07-17T00:32:07Z","snapshot_observed_at":"2026-08-14T18:23:35.830620Z","submitted_at":"2025-07-17T00:32:07Z","title":"Task-Specific Audio Coding for Machines: Machine-Learned Latent Features Are Codes for That Machine","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T16:47:34.539614Z"},"links":{"citing_paper":"/paper/2507.12701"},"observation_digest":"sha256:01f0fd67622de0c582e7036079162b0252631fe0ec7e81c3bb3012a05d240ed7","observation_id":"66ded77e-b425-4be8-991e-7bfe7f3c03b5","resolution":{"observed_at":"2026-08-06T16:47:34.539614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:47:35.195197Z","title":"On the information rate of speech communication,","venue":null,"work_id":"c356dedd-72e4-4111-a491-54d35088d5ad","year":2017},"citing_paper":{"arxiv_id":"2507.12701","last_updated":"2025-07-17T00:32:07Z","snapshot_observed_at":"2026-08-14T18:23:35.830620Z","submitted_at":"2025-07-17T00:32:07Z","title":"Task-Specific Audio Coding for Machines: Machine-Learned Latent Features Are Codes for That Machine","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T16:47:34.547644Z"},"links":{"citing_paper":"/paper/2507.12701"},"observation_digest":"sha256:1dad52da6d2686610ee1af85bde2aae31d2167334197d40d9d1098428135592f","observation_id":"043f7027-c9c0-4c7e-86d3-df74a0518779","resolution":{"observed_at":"2026-08-06T16:47:35.204457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.12701","last_updated":"2025-07-17T00:32:07Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-14T18:23:35.830620Z","submitted_at":"2025-07-17T00:32:07Z","title":"Task-Specific Audio Coding for Machines: Machine-Learned Latent Features Are Codes for That Machine"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":0,"verified_fuzzy":26},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2507.12701."}