{"as_of":"2026-08-09T03:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5f4da3f1a97dff72248ffe2fcc763f8ebc025651256e43207358cbfda988a584","coverage":[{"denominator":19,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T08:35:26.635591Z","state":"measured"},{"denominator":19,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":19,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.21075/citation-record","integrity":"/paper/2607.21075/integrity","json":"/paper/2607.21075/citation-record.json","paper":"/paper/2607.21075"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.04051","last_updated":"2024-07-11T02:08:35Z","snapshot_observed_at":"2026-08-06T00:42:36.144034Z","submitted_at":"2024-07-04T16:49:02Z","title":"FunAudioLLM: Voice Understanding and Generation Foundation Models for Natural Interaction Between Humans and LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04051","snapshot_observed_at":"2026-08-01T08:35:24.303130Z","title":"Funaudiollm: V oice understanding and gener- ation foundation models for natural interaction between humans and llms.arXiv preprint arXiv:2407.04051, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21075","last_updated":"2026-07-25T09:14:28Z","snapshot_observed_at":"2026-08-06T08:39:08.267709Z","submitted_at":"2026-07-23T09:08:04Z","title":"VibeVoice-ASR-BitNet Technical Report","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T08:35:24.303130Z"},"links":{"cited_paper":"/paper/2407.04051","citing_paper":"/paper/2607.21075"},"observation_digest":"sha256:5739e6371176e67b24314ebe5844f6c1c6304186676c9cd0c5a2a15c93ea6a67","observation_id":"c881bfa8-3f41-4b36-9c0a-7396fdb13330","resolution":{"observed_at":"2026-08-01T08:35:24.303130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.11596","last_updated":"2023-10-25T03:52:07Z","snapshot_observed_at":"2026-07-06T16:09:09.018523Z","submitted_at":"2023-08-22T17:44:18Z","title":"SeamlessM4T: Massively Multilingual & Multimodal Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.11596","snapshot_observed_at":"2026-08-01T08:35:24.427968Z","title":"Seamlessm4t: Massively multilingual & multimodal machine translation.arXiv preprint arXiv:2308.11596, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21075","last_updated":"2026-07-25T09:14:28Z","snapshot_observed_at":"2026-08-06T08:39:08.267709Z","submitted_at":"2026-07-23T09:08:04Z","title":"VibeVoice-ASR-BitNet Technical Report","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T08:35:24.427968Z"},"links":{"cited_paper":"/paper/2308.11596","citing_paper":"/paper/2607.21075"},"observation_digest":"sha256:ff6b0da69a79367ff3c6de7fb88f2507d424a806a9d732134501831734598456","observation_id":"2efa2cfe-0e1f-41d5-831c-57aad2eb3907","resolution":{"observed_at":"2026-08-01T08:35:24.427968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-01T08:35:24.573957Z","title":"Qwen-audio: Advancing universal audio understanding via unified large-scale audio-language models.arXiv preprint arXiv:2311.07919, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21075","last_updated":"2026-07-25T09:14:28Z","snapshot_observed_at":"2026-08-06T08:39:08.267709Z","submitted_at":"2026-07-23T09:08:04Z","title":"VibeVoice-ASR-BitNet Technical Report","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T08:35:24.573957Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2607.21075"},"observation_digest":"sha256:ace05f43478d364fb7177a65941eda1c9a746de66737ede8757676a9ee448f3f","observation_id":"d47fc793-c20f-4b56-9afb-8325becddb1f","resolution":{"observed_at":"2026-08-01T08:35:24.573957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:35:24.717412Z","title":"Funasr: A fundamental end-to-end speech recognition toolkit.Proceedings of Interspeech, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21075","last_updated":"2026-07-25T09:14:28Z","snapshot_observed_at":"2026-08-06T08:39:08.267709Z","submitted_at":"2026-07-23T09:08:04Z","title":"VibeVoice-ASR-BitNet Technical Report","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T08:35:24.717412Z"},"links":{"citing_paper":"/paper/2607.21075"},"observation_digest":"sha256:c8bed834025436154b586a21e990b982abf47eb78b13acd93fe12a77e15b4e09","observation_id":"a5ae4d5b-df21-46ce-9c26-200233c7cd28","resolution":{"observed_at":"2026-08-01T08:35:24.717412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:35:24.823469Z","title":"ggml: Tensor library for machine learning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21075","last_updated":"2026-07-25T09:14:28Z","snapshot_observed_at":"2026-08-06T08:39:08.267709Z","submitted_at":"2026-07-23T09:08:04Z","title":"VibeVoice-ASR-BitNet Technical Report","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T08:35:24.823469Z"},"links":{"citing_paper":"/paper/2607.21075"},"observation_digest":"sha256:6a7d9b5b0c1d3399455fb89bcc8df52901c820ce3f79878a41562064b066967f","observation_id":"b54182d0-99fe-4e19-80eb-78058514636f","resolution":{"observed_at":"2026-08-01T08:35:24.823469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:35:24.912361Z","title":"llama.cpp: Llm inference in c/c++, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21075","last_updated":"2026-07-25T09:14:28Z","snapshot_observed_at":"2026-08-06T08:39:08.267709Z","submitted_at":"2026-07-23T09:08:04Z","title":"VibeVoice-ASR-BitNet Technical Report","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T08:35:24.912361Z"},"links":{"citing_paper":"/paper/2607.21075"},"observation_digest":"sha256:c5138555dd4ea614d08f3009b788f48d0159527a79a676c60d67cb987927f29d","observation_id":"12a97a17-d87b-4694-9864-54c6e7eef40a","resolution":{"observed_at":"2026-08-01T08:35:24.912361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:35:24.985405Z","title":"Whisper.cpp: Port of openai’s whisper model in c/c++, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21075","last_updated":"2026-07-25T09:14:28Z","snapshot_observed_at":"2026-08-06T08:39:08.267709Z","submitted_at":"2026-07-23T09:08:04Z","title":"VibeVoice-ASR-BitNet Technical Report","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T08:35:24.985405Z"},"links":{"citing_paper":"/paper/2607.21075"},"observation_digest":"sha256:a4e393f82feaadab535fc3bf1cdd2e8121e88bba844743dd3238bb7c603070e2","observation_id":"7f90c268-7f06-46dd-a195-d388461742b9","resolution":{"observed_at":"2026-08-01T08:35:24.985405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1211.3711","last_updated":"2012-11-14T19:25:21Z","snapshot_observed_at":"2026-07-06T02:59:58.238741Z","submitted_at":"2012-11-14T19:25:21Z","title":"Sequence Transduction with Recurrent Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1211.3711","snapshot_observed_at":"2026-08-01T08:35:25.089911Z","title":"Sequence transduction with recurrent neural networks.arXiv preprint arXiv:1211.3711, 2012","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.21075","last_updated":"2026-07-25T09:14:28Z","snapshot_observed_at":"2026-08-06T08:39:08.267709Z","submitted_at":"2026-07-23T09:08:04Z","title":"VibeVoice-ASR-BitNet Technical Report","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T08:35:25.089911Z"},"links":{"cited_paper":"/paper/1211.3711","citing_paper":"/paper/2607.21075"},"observation_digest":"sha256:e4fb58235447ac6f19ba061c4e95caf7383bf171ca1819705371deed056499b9","observation_id":"782f0b43-fa22-44c7-9e4a-b37b00f5857e","resolution":{"observed_at":"2026-08-01T08:35:25.089911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:35:25.160433Z","title":"Connectionist temporal classification: Labelling unsegmented sequence data with recurrent neural networks","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.21075","last_updated":"2026-07-25T09:14:28Z","snapshot_observed_at":"2026-08-06T08:39:08.267709Z","submitted_at":"2026-07-23T09:08:04Z","title":"VibeVoice-ASR-BitNet Technical Report","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T08:35:25.160433Z"},"links":{"citing_paper":"/paper/2607.21075"},"observation_digest":"sha256:41664f98f6e9f82a0acd590cd19232622d88e2096dc7e5078fd473f95f214ac5","observation_id":"881b040f-2207-492a-8f5c-9587ed9d8183","resolution":{"observed_at":"2026-08-01T08:35:25.160433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:35:25.317043Z","title":"Conformer: Convolution- augmented transformer for speech recognition.Proceedings of Interspeech, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.21075","last_updated":"2026-07-25T09:14:28Z","snapshot_observed_at":"2026-08-06T08:39:08.267709Z","submitted_at":"2026-07-23T09:08:04Z","title":"VibeVoice-ASR-BitNet Technical Report","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T08:35:25.317043Z"},"links":{"citing_paper":"/paper/2607.21075"},"observation_digest":"sha256:397df8e031a6b904c3e3dcc7ee46550a43188f717ec390dc15337afbd40c7946","observation_id":"4d19ee28-8b87-4499-9526-b8ce0e7ce155","resolution":{"observed_at":"2026-08-01T08:35:25.317043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:35:25.456146Z","title":"A convnet for the 2020s.Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21075","last_updated":"2026-07-25T09:14:28Z","snapshot_observed_at":"2026-08-06T08:39:08.267709Z","submitted_at":"2026-07-23T09:08:04Z","title":"VibeVoice-ASR-BitNet Technical Report","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T08:35:25.456146Z"},"links":{"citing_paper":"/paper/2607.21075"},"observation_digest":"sha256:5b0bfc018e3ad9f93ed3df6a51210d3b1616c1212e873336adea74be987c355e","observation_id":"4b92c9bc-2d63-4a25-a4ea-a23b9e883498","resolution":{"observed_at":"2026-08-01T08:35:25.456146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17764","last_updated":"2024-02-27T18:56:19Z","snapshot_observed_at":"2026-08-03T00:59:01.026576Z","submitted_at":"2024-02-27T18:56:19Z","title":"The Era of 1-bit LLMs: All Large Language Models are in 1.58 Bits","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17764","snapshot_observed_at":"2026-08-01T08:35:25.612348Z","title":"The era of 1-bit llms: All large language models are in 1.58 bits.arXiv preprint arXiv:2402.17764, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21075","last_updated":"2026-07-25T09:14:28Z","snapshot_observed_at":"2026-08-06T08:39:08.267709Z","submitted_at":"2026-07-23T09:08:04Z","title":"VibeVoice-ASR-BitNet Technical Report","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T08:35:25.612348Z"},"links":{"cited_paper":"/paper/2402.17764","citing_paper":"/paper/2607.21075"},"observation_digest":"sha256:2c5ca27b77b768ac9a26e9a451af8d6774025de7894b9f1c4d727d97a43fcc1f","observation_id":"5fc3c17c-e495-4a2e-a2f7-757e08f1c24a","resolution":{"observed_at":"2026-08-01T08:35:25.612348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:35:25.752081Z","title":"Parakeet: A family of large, powerful, and multilingual asr models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21075","last_updated":"2026-07-25T09:14:28Z","snapshot_observed_at":"2026-08-06T08:39:08.267709Z","submitted_at":"2026-07-23T09:08:04Z","title":"VibeVoice-ASR-BitNet Technical Report","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T08:35:25.752081Z"},"links":{"citing_paper":"/paper/2607.21075"},"observation_digest":"sha256:8e04b7076383a141b4b1b388d8852e9d3113213708fbf100f6116c1caeaa7b17","observation_id":"987df382-4cb4-41fe-964f-774ef39277ed","resolution":{"observed_at":"2026-08-01T08:35:25.752081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:35:25.904817Z","title":"Vibevoice-asr technical report.arXiv preprint arXiv:2601.18184, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21075","last_updated":"2026-07-25T09:14:28Z","snapshot_observed_at":"2026-08-06T08:39:08.267709Z","submitted_at":"2026-07-23T09:08:04Z","title":"VibeVoice-ASR-BitNet Technical Report","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T08:35:25.904817Z"},"links":{"citing_paper":"/paper/2607.21075"},"observation_digest":"sha256:bc21e592180cb2e8b058ce28892cf9bde19a9cd43cbd25de6428bb2684c9ce07","observation_id":"2f434ebf-cbd3-4087-b46a-24b3ea6b1464","resolution":{"observed_at":"2026-08-01T08:35:25.904817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:35:26.083688Z","title":"Scaling speech technology to 1,000+ languages.Journal of Machine Learning Research, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21075","last_updated":"2026-07-25T09:14:28Z","snapshot_observed_at":"2026-08-06T08:39:08.267709Z","submitted_at":"2026-07-23T09:08:04Z","title":"VibeVoice-ASR-BitNet Technical Report","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T08:35:26.083688Z"},"links":{"citing_paper":"/paper/2607.21075"},"observation_digest":"sha256:1e4da87e801bca8e7959461d7865096925251b13931cec85cd62f789baa4cf89","observation_id":"145bfcce-48bd-4f3c-8525-daac8ac795b7","resolution":{"observed_at":"2026-08-01T08:35:26.083688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:35:26.264480Z","title":"Robust speech recognition via large-scale weak supervision.Proceedings of the International Conference on Machine Learning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21075","last_updated":"2026-07-25T09:14:28Z","snapshot_observed_at":"2026-08-06T08:39:08.267709Z","submitted_at":"2026-07-23T09:08:04Z","title":"VibeVoice-ASR-BitNet Technical Report","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T08:35:26.264480Z"},"links":{"citing_paper":"/paper/2607.21075"},"observation_digest":"sha256:af5fff3b4480c22b467b7d7a807295b8742d5c1b8e3ca64bd778aa618bb2ac0a","observation_id":"bbc96177-3759-4c53-85a3-55497b5666e2","resolution":{"observed_at":"2026-08-01T08:35:26.264480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-01T08:35:26.407263Z","title":"Qwen2.5 technical report.arXiv preprint arXiv:2412.15115, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21075","last_updated":"2026-07-25T09:14:28Z","snapshot_observed_at":"2026-08-06T08:39:08.267709Z","submitted_at":"2026-07-23T09:08:04Z","title":"VibeVoice-ASR-BitNet Technical Report","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T08:35:26.407263Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2607.21075"},"observation_digest":"sha256:0e82d3ce0d81b4dbf719ba83327204fff89a40f9e527d8832caa24ef8961ee6c","observation_id":"db484dfb-ae97-4c75-9b1c-f1e3c4a42082","resolution":{"observed_at":"2026-08-01T08:35:26.407263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:35:26.519696Z","title":"Zipformer: A faster and better encoder for automatic speech recognition.Proceedings of ICLR, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21075","last_updated":"2026-07-25T09:14:28Z","snapshot_observed_at":"2026-08-06T08:39:08.267709Z","submitted_at":"2026-07-23T09:08:04Z","title":"VibeVoice-ASR-BitNet Technical Report","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T08:35:26.519696Z"},"links":{"citing_paper":"/paper/2607.21075"},"observation_digest":"sha256:2fb906f2eee7a443ee262f69e419c21ffb7e4a3b1a4c1fac0420045e01ce7d71","observation_id":"853a6b48-96bb-4c06-8d2f-20ae574dc49d","resolution":{"observed_at":"2026-08-01T08:35:26.519696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15608","last_updated":"2024-10-22T13:55:26Z","snapshot_observed_at":"2026-08-02T09:49:40.772270Z","submitted_at":"2024-10-21T03:13:20Z","title":"Moonshine: Speech Recognition for Live Transcription and Voice Commands","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15608","snapshot_observed_at":"2026-08-01T08:35:26.635591Z","title":"Moonshine: Speech recognition for live transcription and voice commands.arXiv preprint arXiv:2410.15608, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21075","last_updated":"2026-07-25T09:14:28Z","snapshot_observed_at":"2026-08-06T08:39:08.267709Z","submitted_at":"2026-07-23T09:08:04Z","title":"VibeVoice-ASR-BitNet Technical Report","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T08:35:26.635591Z"},"links":{"cited_paper":"/paper/2410.15608","citing_paper":"/paper/2607.21075"},"observation_digest":"sha256:e09e6966aadc8e9b6e48aedb213700ff132dd494b840f7730db17f5bf8f33785","observation_id":"435c9810-bbab-4d84-a9db-f7c84a64cfab","resolution":{"observed_at":"2026-08-01T08:35:26.635591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.21075","last_updated":"2026-07-25T09:14:28Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-06T08:39:08.267709Z","submitted_at":"2026-07-23T09:08:04Z","title":"VibeVoice-ASR-BitNet Technical Report"},"reference_resolution":{"displayed":19,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":19},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 19 of 19 outbound references and 0 inbound Pith citation observations for arXiv:2607.21075."}