{"as_of":"2026-08-06T22:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bc372af4fd419b662f84dc9ba7a434c13f517e52c13d857025857817e435244c","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T16:37:24.396537Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.26410/citation-record","integrity":"/paper/2607.26410/integrity","json":"/paper/2607.26410/citation-record.json","paper":"/paper/2607.26410"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.19457","last_updated":"2026-02-14T11:42:30Z","snapshot_observed_at":"2026-08-06T03:52:41.836315Z","submitted_at":"2025-07-25T17:42:32Z","title":"GEPA: Reflective Prompt Evolution Can Outperform Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.19457","snapshot_observed_at":"2026-08-01T16:37:24.132795Z","title":"Gepa: Reflective prompt evolution can outperform reinforcement learning.arXiv preprint arXiv:2507.19457, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.132795Z"},"links":{"cited_paper":"/paper/2507.19457","citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:42cc101ad1bad2bf2f75347dedfe9baf3e135f572aad86d62e5abfe7652235e1","observation_id":"aaf56af3-0908-473b-b7f0-d6bb8ee556cd","resolution":{"observed_at":"2026-08-01T16:37:24.132795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:37:24.138996Z","title":"Bringing contextual information to google speech recognition","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.138996Z"},"links":{"citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:a5207dadf51dac6e2c66eb4c8cd98210879f81654ea43e7a3313bcbaa7623387","observation_id":"8ccd3b20-999a-4b55-9786-cab5e26c4be4","resolution":{"observed_at":"2026-08-01T16:37:24.138996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:37:24.143907Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.143907Z"},"links":{"citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:0ae258daeeefa1572a3d9592d52db1c143f0413b6e864a4ffdf027943ddacf69","observation_id":"3461982e-59d1-4325-ab0b-8ca4d5d00424","resolution":{"observed_at":"2026-08-01T16:37:24.143907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:37:24.148371Z","title":"Brown, Benjamin Mann, Nick Ryder, Melanie Subbiah, Jared Kaplan, Prafulla Dhariwal, Arvind Neelakantan, Pranav Shyam, et al","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.148371Z"},"links":{"citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:f3dc8860f846ff56807ad28726cb4b9d2279645914389978b4a679d62f94d99c","observation_id":"d694f629-a56a-4990-86ba-a501dc257181","resolution":{"observed_at":"2026-08-01T16:37:24.148371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:37:24.153284Z","title":"Text-only adaptation in llm-based asr through text denoising.arXiv preprint arXiv:2601.20900, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.153284Z"},"links":{"citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:2174d6e1ea7aad07f9fbbf8ebf9d01051f1d7ff9764b50aa4185cd921ae71cc4","observation_id":"07f83cb1-9511-46ff-b4aa-655e95e629f8","resolution":{"observed_at":"2026-08-01T16:37:24.153284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:37:24.157509Z","title":"HyPoradise: An open baseline for generative speech recognition with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.157509Z"},"links":{"citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:a203b431552b78a04843e10ef68f727b53cfe92379b68f4e485be0a262c854d0","observation_id":"065a9479-034a-445a-a55d-a38bcd3b7ec6","resolution":{"observed_at":"2026-08-01T16:37:24.157509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-01T16:37:24.162267Z","title":"Moshi: a speech-text foundation model for real-time dialogue.arXiv preprint arXiv:2410.00037, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.162267Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:64c4e4713021fb505f9baf3b64be93ccfdb5a8900d01f6496fc4fde6dc8e1a57","observation_id":"27475754-cec9-40d5-996f-e4ef759b8482","resolution":{"observed_at":"2026-08-01T16:37:24.162267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:37:24.166387Z","title":"Lipger: Visually-conditioned generative error correction for robust automatic speech recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.166387Z"},"links":{"citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:29d2b55a72b3c4c88b786184f8021c5614c4408e81a0a4a5f0df5c27156c9146","observation_id":"20912ae0-15f5-4a0d-846f-2cfeee225fed","resolution":{"observed_at":"2026-08-01T16:37:24.166387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:37:24.170554Z","title":"Words and voices: episodic traces in spoken word identification and recognition memory.Journal of experimental psychology: Learning, memory, and cognition, 22(5):1166, 1996","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.170554Z"},"links":{"citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:2f6e0d3396b9ee05508d3398cac0990ee52f5ecd54996d3d8b4004058b2885c5","observation_id":"b78b7b3f-a79f-4e78-b60e-5dfa5910f0cc","resolution":{"observed_at":"2026-08-01T16:37:24.170554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:37:24.174413Z","title":"Conformer: Convolution-augmented transformer for speech recognition","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.174413Z"},"links":{"citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:e18e24c6c230b2c1f883a356b95712996b376c8302b88cb35938cc0bae2269d0","observation_id":"59d3e9b6-1e04-437e-8999-b489dd4b93af","resolution":{"observed_at":"2026-08-01T16:37:24.174413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:37:24.178316Z","title":"The sapir-whorf hypothesis.Language in culture, 4:92–105, 1954","venue":null,"work_id":null,"year":1954},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.178316Z"},"links":{"citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:2eeb45272b8d4f1dfc8f097626665da8edf52204dd60325bd87c3c9c540a02da","observation_id":"74716500-4813-4c5f-838b-bef3fe97579d","resolution":{"observed_at":"2026-08-01T16:37:24.178316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:37:24.182179Z","title":"Let’s fuse step by step: A generative fusion decoding algorithm with llms for robust and instruction-aware asr and ocr","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.182179Z"},"links":{"citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:46c72749e8f94c9131c96d01cd42109515c3a8da565aa5aaa6e537610b6a1fe5","observation_id":"8dda4e6a-72d0-4a4f-8498-25ef102bd7a5","resolution":{"observed_at":"2026-08-01T16:37:24.182179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:37:24.186304Z","title":"HuBERT: Self-supervised speech representation learning by masked prediction of hidden units.IEEE/ACM Transactions on Audio, Speech, and Language Processing, 29:3451–3460, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.186304Z"},"links":{"citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:b6b3845de84b6bb8caccfa5001895deb0be89a115f6e62c4b25201f111c81262","observation_id":"4f7d2f51-dac6-49eb-b430-a80a0f6d00c4","resolution":{"observed_at":"2026-08-01T16:37:24.186304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:37:24.190225Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.190225Z"},"links":{"citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:21222fe6d68f91de30cf36daccce490d63c722f144d505a9c2bfd485051831bb","observation_id":"3a23f3fe-b598-48f1-bf9b-e232856ab499","resolution":{"observed_at":"2026-08-01T16:37:24.190225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:37:24.194118Z","title":"Scaling up deliberation for multilingual asr","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.194118Z"},"links":{"citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:e3d78e82f3b96c40e0c78020ffb33cacdf24cf8f42abf9d1c199446377fdf43f","observation_id":"0e37dfb7-6e7d-4fd6-bdc9-5e934c9f1c60","resolution":{"observed_at":"2026-08-01T16:37:24.194118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:37:24.197901Z","title":"Chain-of-thought prompting for speech translation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.197901Z"},"links":{"citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:e2fde3daa0e4515a981e455d25d48a634ab3c910d2607ba0bd8f276420c5bd40","observation_id":"a2ad02d0-90cf-4c3d-a9dd-500ad38aa435","resolution":{"observed_at":"2026-08-01T16:37:24.197901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:37:24.202529Z","title":"Subjective comparison and evaluation of speech enhancement algorithms","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.202529Z"},"links":{"citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:3ee6c64f8b18bc2ede8889afec5719188ef1b1248573e441330b17f2a34a0c3d","observation_id":"6891f0df-8a3b-4213-98ee-8370ff360f2c","resolution":{"observed_at":"2026-08-01T16:37:24.202529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:37:24.206425Z","title":"Large language models are efficient learners of noise-robust speech recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.206425Z"},"links":{"citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:f80369ccd861049b0c970c93a9d0902bc1f57f0971df2c4569dc9b6a7de64a86","observation_id":"bfa8f024-9373-4744-ae7b-124af05e5ed4","resolution":{"observed_at":"2026-08-01T16:37:24.206425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:37:24.210422Z","title":"GenTranslate: Large language models are generative multilingual speech and machine translators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.210422Z"},"links":{"citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:1c26346eec119fcde94eb1fc998825d8d41a6b2963fe8f2cd112abe746f2b533","observation_id":"dc3a39b5-7cb1-4473-bfb2-7a03b2de8fce","resolution":{"observed_at":"2026-08-01T16:37:24.210422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.09186","last_updated":"2026-06-08T08:23:02Z","snapshot_observed_at":"2026-08-03T19:07:48.191877Z","submitted_at":"2026-06-08T08:23:02Z","title":"DuplexOmni: Real-Time Listening, Seeing, Thinking, and Speaking for Full-Duplex Interaction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.09186","snapshot_observed_at":"2026-08-01T16:37:24.214630Z","title":"Huang et al","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.214630Z"},"links":{"cited_paper":"/paper/2606.09186","citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:4859393086963d00a0bfe4f3b57612efffa58d2db7cad78224fcbfacacdc9e0c","observation_id":"89b5d4f3-5ebc-40ac-b54e-9fcb33ce1ef0","resolution":{"observed_at":"2026-08-01T16:37:24.214630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:37:24.219368Z","title":"Evaluating open-source asr systems: Performance across diverse audio conditions and error correction methods","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.219368Z"},"links":{"citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:b33fb2ab93098c3ed49391556c173568c57944a5b50b86b0bc5fc9558b3bc4bc","observation_id":"00af5936-5fdb-4d80-9076-05c9b61f9c98","resolution":{"observed_at":"2026-08-01T16:37:24.219368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:37:24.223494Z","title":"Contextual RNN-T for open domain ASR","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.223494Z"},"links":{"citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:416e568dd8653dbc566688118c9844a606f34d4e285a19d4bb25cfed0ca0733d","observation_id":"3867057d-38b2-445a-87ae-604f78390873","resolution":{"observed_at":"2026-08-01T16:37:24.223494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:37:24.227749Z","title":"Language, Speech and Communication","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.227749Z"},"links":{"citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:2c6b73f414526521adaafdd2de2b1e4b04765344ebeac1aa4aa361e97f819126","observation_id":"b4a305c3-4c14-4fde-95a3-359500ca9ae0","resolution":{"observed_at":"2026-08-01T16:37:24.227749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:37:24.231756Z","title":"Two heads are better than one: Audio-visual speech error correction with dual hypotheses","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.231756Z"},"links":{"citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:9f69a0c6beca38de1977d90a0638c72fe6bfe45e3585c7f601329d3de576c7b0","observation_id":"2f933df7-0693-4681-81df-88eee78d2331","resolution":{"observed_at":"2026-08-01T16:37:24.231756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:37:24.235664Z","title":"Semantic distance: A new metric for ASR performance analysis towards spoken language understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.235664Z"},"links":{"citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:3a12f1f8e98eaae0dba5dd343949f7977a2e3d5ee9e02878570a885d08f9cf42","observation_id":"0c20d1e4-5b1b-4885-844f-537575bb3d94","resolution":{"observed_at":"2026-08-01T16:37:24.235664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.29534","last_updated":"2026-06-28T17:57:41Z","snapshot_observed_at":"2026-07-07T00:03:31.715960Z","submitted_at":"2026-06-28T17:57:41Z","title":"Preference-ASR: A Preference-Aware Test Set for Benchmarking ASR in the Era of Speech LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.29534","snapshot_observed_at":"2026-08-01T16:37:24.239501Z","title":"Preference-asr: A preference-aware test set for benchmarking asr in the era of speech llms.arXiv preprint arXiv:2606.29534, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.239501Z"},"links":{"cited_paper":"/paper/2606.29534","citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:9fab040000e07d7ca762e576bdaa712c4f86478b77850f1329f19c067893e7ea","observation_id":"e52b8d79-183e-4cf1-894a-2fcd6af005f9","resolution":{"observed_at":"2026-08-01T16:37:24.239501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:37:24.243702Z","title":"Interaction models: A scalable approach to human-ai collabora- tion.Thinking Machines Lab: Connectionism, May 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.243702Z"},"links":{"citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:79109bc6a70faeb863aaface788924127e57f44155928bba46795cc7b902a4ae","observation_id":"113fa126-2834-4a4f-8613-0649d816cd4b","resolution":{"observed_at":"2026-08-01T16:37:24.243702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.13392","last_updated":"2026-06-11T14:23:41Z","snapshot_observed_at":"2026-08-06T06:40:14.278655Z","submitted_at":"2026-06-11T14:23:41Z","title":"MiniMax Sparse Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.13392","snapshot_observed_at":"2026-08-01T16:37:24.248029Z","title":"MiniMax sparse attention.arXiv preprint arXiv:2606.13392, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.248029Z"},"links":{"cited_paper":"/paper/2606.13392","citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:338dcfc4e633961b9a17a84ae3ddad28ef4602a1aae77419b95144e2e8218537","observation_id":"22d06815-a0ce-4217-8d19-4078087f5db7","resolution":{"observed_at":"2026-08-01T16:37:24.248029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:37:24.252759Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.252759Z"},"links":{"citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:9c93531fe4101e20a97f9fca3a549bc96f52aef007a653649f86bc66c608d83f","observation_id":"bef6a746-b4a6-472b-8ce5-5bbfcf9c7256","resolution":{"observed_at":"2026-08-01T16:37:24.252759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:37:24.256835Z","title":"FastCorrect: Fast error correction with edit alignment for automatic speech recognition","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.256835Z"},"links":{"citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:eb8c9749630b83f9962b38452f55fb5ba9a41fff7bb3a5eaf922409894d3fdcd","observation_id":"24b3fdb6-fae2-44a9-8843-ab912977895f","resolution":{"observed_at":"2026-08-01T16:37:24.256835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:37:24.260749Z","title":"The power of scale for parameter-efficient prompt tuning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.260749Z"},"links":{"citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:64c38e57d962d3257ed28a44402bdbf42cd74b589ce2018ef6026e5cd0a8c356","observation_id":"4af70134-b8e9-4d5b-9e69-f541aa34e855","resolution":{"observed_at":"2026-08-01T16:37:24.260749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:37:24.264731Z","title":"Investigating asr error correction with large language model and multilingual 1-best hypotheses","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.264731Z"},"links":{"citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:6d03bc8d15a238957fefa97611b4e0cf88b70d316be2182732e062f7d1ca4ea2","observation_id":"96fa0818-26d1-4c76-9bf4-bf30f1185d31","resolution":{"observed_at":"2026-08-01T16:37:24.264731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2021-1758","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rethinking evaluation in ASR: Are our models robust enough? InProc","venue":null,"work_id":"d01bf14a-9e57-4bdb-b371-1f6810af8fbe","year":2021},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.268826Z"},"links":{"citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:1517321045c7eebcd0eb8d562132c0c2779007fb89465072a840f5a0cf3b7cc7","observation_id":"583c4361-df41-4434-ae9e-38058de937bf","resolution":{"observed_at":"2026-08-01T16:39:07.709045Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:37:24.273275Z","title":"Neko: Cross-modality post-recognition error correction with tasks-guided mixture-of-experts language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.273275Z"},"links":{"citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:2ca862cee92709661bee3bb7898b53db7032c16e74d47d753c1f0a082640b505","observation_id":"a279c5b1-6523-49d4-8190-9e393675b228","resolution":{"observed_at":"2026-08-01T16:37:24.273275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00456","last_updated":"2023-10-10T09:45:13Z","snapshot_observed_at":"2026-07-06T14:57:17.114660Z","submitted_at":"2023-03-01T12:32:34Z","title":"N-best T5: Robust ASR Error Correction using Multiple Input Hypotheses and Constrained Decoding Space","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00456","snapshot_observed_at":"2026-08-01T16:37:24.277296Z","title":"N-best t5: Robust asr error correction using multiple input hypotheses and constrained decoding space.arXiv preprint arXiv:2303.00456, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.277296Z"},"links":{"cited_paper":"/paper/2303.00456","citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:bf1f633b62e75ca981db62b22f1c091e0358ff93f646beb945900d72a85f405f","observation_id":"46b4055d-fd60-450f-b238-122cf2b88aee","resolution":{"observed_at":"2026-08-01T16:37:24.277296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:37:24.282117Z","title":"Typicality effects on memory for voice: Implications for earwitness testimony.Applied Cognitive Psychology, 25(1):29–34, 2011","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.282117Z"},"links":{"citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:7f9124c971efd9937805a8ba89fc7109b159fa921f3525de3845bf4d4721303c","observation_id":"83179833-5be6-4cd1-a3dc-c7817b560147","resolution":{"observed_at":"2026-08-01T16:37:24.282117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.25158","last_updated":"2026-06-04T12:51:52Z","snapshot_observed_at":"2026-08-06T10:33:38.415457Z","submitted_at":"2026-03-26T08:26:38Z","title":"Trace2Skill: Distill Trajectory-Local Lessons into Transferable Agent Skills","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.25158","snapshot_observed_at":"2026-08-01T16:37:24.286644Z","title":"Trace2skill: Distill trajectory-local lessons into transferable agent skills.arXiv preprint arXiv:2603.25158, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.286644Z"},"links":{"cited_paper":"/paper/2603.25158","citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:48d306625254e1be40aedacad4c8d062643b1a80fd7fc736d0f51f535d6267e0","observation_id":"e5524955-731e-4e8a-895a-6623f4e2ee95","resolution":{"observed_at":"2026-08-01T16:37:24.286644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:37:24.291191Z","title":"Long-term memory for unfamiliar voices.The Journal of the Acoustical Society of America, 85(2):913–925, 1989","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.291191Z"},"links":{"citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:c59b061b7c82c3b45a8166f2bc68127d7fe1f08e494120df0248b58115b83428","observation_id":"aee61dff-fc88-41e1-8859-652290aab18f","resolution":{"observed_at":"2026-08-01T16:37:24.291191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:37:24.295465Z","title":"Sainath, Rohit Prabhavalkar, Anjuli Kannan, and Ding Zhao","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.295465Z"},"links":{"citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:f857f3753bd05534fa4cd270d2ac758213754d8d1fbe8824436de8accefcc654","observation_id":"57f84aa3-5ca5-437a-a601-4ec402a47ac3","resolution":{"observed_at":"2026-08-01T16:37:24.295465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:37:24.299615Z","title":"Less is more: Accurate speech recognition & translation without web-scale data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.299615Z"},"links":{"citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:012662bcaaab383b088768e225471661ca11607d6b53eda3410856f2250dc069","observation_id":"ce5f10c9-3d89-450f-b309-6e579f78d280","resolution":{"observed_at":"2026-08-01T16:37:24.299615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-01T16:37:24.303661Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.303661Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:178fe80984cdf1fc4a540199abf69bfc253ec96674c048d42f5dbe4356f10ea5","observation_id":"bd1a3348-bf53-4931-8fa7-1a6026897380","resolution":{"observed_at":"2026-08-01T16:37:24.303661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:37:24.307961Z","title":null,"venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.307961Z"},"links":{"citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:2c9090cf4ad9c94c21a7f5cada1604eb4fb559fd3302e2c65ea722f97aff3e75","observation_id":"fd4e9969-d628-4015-bbea-180467378d9d","resolution":{"observed_at":"2026-08-01T16:37:24.307961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:37:24.312091Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.312091Z"},"links":{"citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:3b50ea3e7c8f1e6751659358738eb17b37113a9fca357f9de430339bccb2ab61","observation_id":"d7b1c692-eac7-434b-b97f-885a305d1de4","resolution":{"observed_at":"2026-08-01T16:37:24.312091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:37:24.316031Z","title":"Whispering LLaMA: A cross-modal generative error correction framework for speech recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.316031Z"},"links":{"citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:b450bd309f6b92d27a497d388941c35534aae2db699e4b07bdf091d938de19d6","observation_id":"077198d2-65a2-46ea-b632-a0c96f460bfc","resolution":{"observed_at":"2026-08-01T16:37:24.316031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:37:24.320281Z","title":"Sentence-bert: Sentence embeddings using siamese bert-networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.320281Z"},"links":{"citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:a2a5279a7c74c829b34368d1f03b4f2fd6534b926de284c0502ef5a832d55111","observation_id":"2e4ad00a-23de-43a4-b356-90ba8bf1e061","resolution":{"observed_at":"2026-08-01T16:37:24.320281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:37:24.324366Z","title":"Fast conformer with linearly scalable attention for efficient speech recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.324366Z"},"links":{"citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:271603b763f1f427979b4ad7f92dbb2e2f23198193502e84b3eba64ad61f7f05","observation_id":"845d37c5-b8b0-484f-8cd5-c69b008851b3","resolution":{"observed_at":"2026-08-01T16:37:24.324366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:37:24.328822Z","title":"Nguyen, and Katrin Kirchhoff","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.328822Z"},"links":{"citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:456e353b4a638d168aa8e2b704ce424cbc35cedc670e7c496e578fa5d6bdeeed","observation_id":"70f70d70-95b0-41ed-95f9-f9c897b46af8","resolution":{"observed_at":"2026-08-01T16:37:24.328822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:37:24.333588Z","title":"The effects of voice and visible speaker change on memory for spoken words.Journal of Memory and Language, 34(5):665–685, 1995","venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.333588Z"},"links":{"citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:785c0222f723f7e3d51bc3960a5a685cc3b11f4e34e1ef7417a3d0b189a2f9e0","observation_id":"71d7e1cb-fe47-40df-a5f0-2759e3b58596","resolution":{"observed_at":"2026-08-01T16:37:24.333588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:37:24.337785Z","title":"Dialog act modeling for automatic tagging and recognition of conversational speech.Computational Linguisitics, 26(3):339, 2000","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.337785Z"},"links":{"citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:f223d0bc85109938f22d415730c6ebb84564581de61b4db5ddade43589a1928d","observation_id":"70c9d561-2872-45a4-9eca-e29d952b0316","resolution":{"observed_at":"2026-08-01T16:37:24.337785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:37:24.342441Z","title":"WER we are and WER we think we are","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.342441Z"},"links":{"citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:c160bf47cf4e2f53ed3efef92313afd54ce8eebc475525324133b70dbe1faf0c","observation_id":"551bee93-2e5b-4c72-ade8-c932bc51bbe5","resolution":{"observed_at":"2026-08-01T16:37:24.342441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:37:24.346467Z","title":"Salmonn: Towards generic hearing abilities for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.346467Z"},"links":{"citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:f58f73955642c497830908ce7e7ab3fc57ec94978a149706612524ec222eea38","observation_id":"2e78cfaa-e8ee-4a7a-81f6-cdb36ffd8e67","resolution":{"observed_at":"2026-08-01T16:37:24.346467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:37:24.350593Z","title":"Interaction models: A scalable approach to human-AI collaboration, May 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.350593Z"},"links":{"citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:3bbb657b2182e2934d08fd0e17350f129f260fdde37c278177097766a3b1ea30","observation_id":"ed815807-3c00-4f7d-907f-57c99e76a297","resolution":{"observed_at":"2026-08-01T16:37:24.350593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:37:24.354772Z","title":"Leveraging llms for post-ocr correction of historical newspapers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.354772Z"},"links":{"citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:3755c8f46af8970f0f1c26edeeeb872db43036dc7839c7f2c74727ef3ab948ca","observation_id":"cf218351-4c69-4227-a54f-feefa21a5451","resolution":{"observed_at":"2026-08-01T16:37:24.354772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.09413","last_updated":"2026-05-18T16:18:39Z","snapshot_observed_at":"2026-08-05T07:58:44.170651Z","submitted_at":"2026-01-14T12:06:50Z","title":"Speech-Hands: A Self-Reflection Voice Agentic Approach to Speech Recognition and Audio Reasoning with Omni Perception","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.09413","snapshot_observed_at":"2026-08-01T16:37:24.358711Z","title":"Speech-hands: A self-reflection voice agentic approach to speech recognition and audio reasoning with omni perception","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.358711Z"},"links":{"cited_paper":"/paper/2601.09413","citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:14eb345fdfabc97c49e2c5a63b99a1b0c0539f96c68750be9cea924954be9851","observation_id":"12a5a23d-35a5-45f7-b2e4-5991921249b6","resolution":{"observed_at":"2026-08-01T16:37:24.358711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.28480","last_updated":"2026-05-27T13:39:14Z","snapshot_observed_at":"2026-08-05T07:57:19.273326Z","submitted_at":"2026-05-27T13:39:14Z","title":"Audio-Mind: An Auditable Agentic Framework for Audio Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.28480","snapshot_observed_at":"2026-08-01T16:37:24.362798Z","title":"Audio-mind: An auditable agentic framework for audio understanding.arXiv preprint arXiv:2605.28480, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.362798Z"},"links":{"cited_paper":"/paper/2605.28480","citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:d3f9fe45fcf389e21b539c3e56ade6c6c1da797a13a8d1a156a838fac9c06e32","observation_id":"b931952c-42e1-4b70-a83b-9a03bd5b5a6c","resolution":{"observed_at":"2026-08-01T16:37:24.362798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.25990","last_updated":"2026-06-24T16:03:38Z","snapshot_observed_at":"2026-07-07T00:00:21.918469Z","submitted_at":"2026-06-24T16:03:38Z","title":"SpeechEQ: Benchmarking Emotional Intelligence Quotient in Socially Aware Voice Conversational Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.25990","snapshot_observed_at":"2026-08-01T16:37:24.367012Z","title":"Speecheq: Benchmarking emotional intelligence quotient in socially aware voice conversational models.arXiv preprint arXiv:2606.25990, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.367012Z"},"links":{"cited_paper":"/paper/2606.25990","citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:225225239f3a17ec25fb62ca0d5228e2252ffcd462c7dcb4b532d53f50bf7764","observation_id":"c3cd97e2-d91c-4957-bb7a-71159b7c7b44","resolution":{"observed_at":"2026-08-01T16:37:24.367012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:37:24.371144Z","title":"Generative speech recognition error correction with large language models and task-activating prompting","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.371144Z"},"links":{"citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:77f5789e53f4b3b5b26a49baa96a2c085c4703b73e6f5798ff0b01dc96af29e4","observation_id":"024b5c21-90a2-48ce-b60b-7b75ec15f51d","resolution":{"observed_at":"2026-08-01T16:37:24.371144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:37:24.375189Z","title":"Large language models as optimizers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.375189Z"},"links":{"citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:1b4b414c0b8975367b72c084b1532669e889d1c268c3aee290fb1578a7abf424","observation_id":"ff0518b6-a4bf-4af2-8623-41b031b56655","resolution":{"observed_at":"2026-08-01T16:37:24.375189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.23904","last_updated":"2026-05-25T17:58:16Z","snapshot_observed_at":"2026-08-05T06:54:08.846880Z","submitted_at":"2026-05-22T17:59:50Z","title":"SkillOpt: Executive Strategy for Self-Evolving Agent Skills","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.23904","snapshot_observed_at":"2026-08-01T16:37:24.379151Z","title":"SkillOpt: Executive strategy for self-evolving agent skills.arXiv preprint arXiv:2605.23904, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.379151Z"},"links":{"cited_paper":"/paper/2605.23904","citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:ab91e5d9d4bc77d6481b463a8cf59e48be32b1f1cd5f4b045eca3289cb90397e","observation_id":"7610b86e-b951-443d-b697-4723d06c2c3d","resolution":{"observed_at":"2026-08-01T16:37:24.379151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:37:24.383680Z","title":"Covoger: A multilingual multitask benchmark for speech-to-text generative error correction with large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.383680Z"},"links":{"citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:2449578286e5b2786f8296f410546fcce4112d77daa8582b0c5cf099993e9eb0","observation_id":"b784d6f9-8749-48ba-9644-8727eba72c83","resolution":{"observed_at":"2026-08-01T16:37:24.383680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:37:24.388102Z","title":"Mms-llama: Efficient llm-based audio-visual speech recognition with minimal multimodal speech tokens","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.388102Z"},"links":{"citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:add608331bd30beffe0bb07666862a522c50bc3dd00ba1ebc956e280b8d1ef2a","observation_id":"1864157d-29fb-41c2-80fb-d38345acbfca","resolution":{"observed_at":"2026-08-01T16:37:24.388102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07496","last_updated":"2024-06-11T17:32:21Z","snapshot_observed_at":"2026-07-06T18:29:04.294349Z","submitted_at":"2024-06-11T17:32:21Z","title":"TextGrad: Automatic \"Differentiation\" via Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07496","snapshot_observed_at":"2026-08-01T16:37:24.392157Z","title":"differentiation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.392157Z"},"links":{"cited_paper":"/paper/2406.07496","citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:dd6a182ee1a38e39307df63fe6f5b3088d03e68cde447a0108c3eb4463f4fd80","observation_id":"c6129d73-60b1-4f3a-a232-df6e7c4f939f","resolution":{"observed_at":"2026-08-01T16:37:24.392157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:37:24.396537Z","title":"strictly greater","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-01T16:37:24.396537Z"},"links":{"citing_paper":"/paper/2607.26410"},"observation_digest":"sha256:87dca893da621f32c89e66b317314d4cc02ebf23b66047178537646375ea9454","observation_id":"59929868-c901-47ac-a894-95058e5566d8","resolution":{"observed_at":"2026-08-01T16:37:24.396537Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.26410","last_updated":"2026-07-29T02:42:56Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-03T19:09:06.764457Z","submitted_at":"2026-07-29T02:42:56Z","title":"Voice Memory for Agentic Speech Recognition"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":61,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 0 inbound Pith citation observations for arXiv:2607.26410."}