{"as_of":"2026-08-08T03:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:06e4390bdb0082119dda0ded456d3f8f4a7ee9abdd9e68304f002bc10e397528","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:11:48.666663Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.00267/citation-record","integrity":"/paper/2506.00267/integrity","json":"/paper/2506.00267/citation-record.json","paper":"/paper/2506.00267"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T12:11:46.217794Z","title":"Llama 2: Open foundation and fine-tuned chat models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-07T12:06:43.965548Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:46.217794Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:9875b77950e0079244242791a547271180122350b243d787fda1469a660473a2","observation_id":"20d2571b-8058-4693-9321-3ff0d70de7f0","resolution":{"observed_at":"2026-08-07T12:11:46.217794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T12:11:46.264067Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-07T12:06:43.965548Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:46.264067Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:f7aeeb9f89f94a3814b19e57c4059eb78062d2d82201d08e8c66af3fddbbfa48","observation_id":"a10d61bd-a6b4-4a14-93bd-853225f79f54","resolution":{"observed_at":"2026-08-07T12:11:46.264067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:51.340152Z","title":"Prompted llms as chatbot modules for long open-domain conversation,","venue":null,"work_id":"de2ece4b-684a-4866-8978-b915563ab190","year":2025},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-07T12:06:43.965548Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:46.337326Z"},"links":{"citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:9dc8586237d3f1c0f36cdf2c8ca74f76928e7090d5ed1d72bda0595a266c9b55","observation_id":"a5aa4fb5-fcd4-47e0-b9a3-ca9464af18d7","resolution":{"observed_at":"2026-08-07T12:11:51.412743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:51.195041Z","title":"Soulchat: Improving llms’ empathy, listening, and comfort abilities through fine-tuning with multi-turn empathy conversations,","venue":null,"work_id":"910a2d6e-8000-41fe-a094-5b8b0e4f74b2","year":2023},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-07T12:06:43.965548Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:46.400788Z"},"links":{"citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:3295291ebb5199166e27c391e87170207e2b84d5effefa8a8bf1b1018daa0136","observation_id":"68702bf0-4fe6-483d-8b5a-193ef597904d","resolution":{"observed_at":"2026-08-07T12:11:51.256684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13276","last_updated":"2024-09-23T22:54:05Z","snapshot_observed_at":"2026-07-06T17:33:00.716054Z","submitted_at":"2024-02-17T09:39:46Z","title":"When LLMs Meets Acoustic Landmarks: An Efficient Approach to Integrate Speech into Large Language Models for Depression Detection","version":2},"cited_work":{"arxiv_id":"2402.13276","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.13276","snapshot_observed_at":"2026-08-07T12:11:49.215323Z","title":"When LLMs Meets Acoustic Landmarks: An Efficient Approach to Integrate Speech into Large Language Models for Depression Detection","venue":"eess.AS","work_id":"632ed622-e735-4e27-9c27-dc764376c0ae","year":2024},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-07T12:06:43.965548Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:46.473021Z"},"links":{"cited_paper":"/paper/2402.13276","citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:53d93487b9616a56ca87c6b3552505b288e6931bc3c348eddbb45d1881eda64e","observation_id":"01af7eaa-2dc5-47ca-9f3f-43e76e4097e7","resolution":{"observed_at":"2026-08-07T12:11:49.271166Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-07T12:11:46.554818Z","title":"Qwen-audio: Advancing universal audio understanding via unified large-scale audio-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-07T12:06:43.965548Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:46.554818Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:708fd7505cc1406c30f631c9409cd92ccacf0baead3e89609fac39b63d7db8af","observation_id":"8f8ffbc0-0994-4e5b-8f1d-117c528aabbc","resolution":{"observed_at":"2026-08-07T12:11:46.554818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-07T12:11:46.607323Z","title":"Cosyvoice: A scalable multilingual zero-shot text-to-speech synthesizer based on supervised semantic tokens,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-07T12:06:43.965548Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:46.607323Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:ea67aac2500c26a879be03b63a66f7d67b8f8294c28e716da75bad7b4d2b1f59","observation_id":"12be38bd-e5b4-4212-8fc6-b77c2f511ef0","resolution":{"observed_at":"2026-08-07T12:11:46.607323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-07T06:02:40.568271Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-07T12:11:46.665649Z","title":"Cosyvoice 2: Scalable streaming speech synthesis with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-07T12:06:43.965548Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:46.665649Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:d600b0c1f9becec431ebcaf330f944ea002342329f5689f2cc19627b5b89f778","observation_id":"585a613a-78b9-4a1a-a340-eb7e9c2aa412","resolution":{"observed_at":"2026-08-07T12:11:46.665649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:46.738062Z","title":"Librispeech: an asr corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-07T12:06:43.965548Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:46.738062Z"},"links":{"citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:5fc33c47b22cb9c838e8d293e6181538cd2364921dbb9bd147ddb86518bc7726","observation_id":"b25e6881-bafd-4cab-9324-aa2c04069ef6","resolution":{"observed_at":"2026-08-07T12:11:46.738062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-07T15:49:16.814852Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-07T12:11:46.821940Z","title":"Gigaspeech: An evolving, multi- domain asr corpus with 10,000 hours of transcribed audio,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-07T12:06:43.965548Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:46.821940Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:d2a942f7c56174ac17b2c098c13d7120835734af5e78bea4d1c8cce69c1333c3","observation_id":"b9409cea-226f-4a71-8934-78f224063019","resolution":{"observed_at":"2026-08-07T12:11:46.821940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:51.036278Z","title":"Switchboard: Telephone speech corpus for research and development,","venue":null,"work_id":"ea84a10c-252a-4f90-b194-b1c1636931fa","year":1992},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-07T12:06:43.965548Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:46.894202Z"},"links":{"citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:cc0391faa09323679de93d1cc4fc9fbb6db7ee8aa865fc48f7f790e5f02636d8","observation_id":"def633c0-3a31-4809-b760-03aabdc36b7c","resolution":{"observed_at":"2026-08-07T12:11:51.104579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:46.962247Z","title":"Speechgpt: Empowering large language models with intrinsic cross- modal conversational abilities,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-07T12:06:43.965548Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:46.962247Z"},"links":{"citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:3d64363c29d5402ddb69ad5d7ce86b548a3fe8f0b8b16d65ff7533005f4703a4","observation_id":"ebbbb0b5-1a56-43d1-8e08-a6798db13e8f","resolution":{"observed_at":"2026-08-07T12:11:46.962247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:50.885363Z","title":"Generative spoken dialogue language modeling,","venue":null,"work_id":"8061ac90-7de1-402b-9e1f-35387c1f8d74","year":2023},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-07T12:06:43.965548Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:47.029630Z"},"links":{"citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:649d68a07326f9a45f5c9affa2c6db5c1c7164261bfa527c7578a5bdb8e76504","observation_id":"ee7048ed-e1d4-4086-98f8-c0cb7c5203c9","resolution":{"observed_at":"2026-08-07T12:11:50.946083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:47.095650Z","title":"Audi- olm: a language modeling approach to audio generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-07T12:06:43.965548Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:47.095650Z"},"links":{"citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:8630b813076e1eee70685cbf95f55e0649998b3c74564b232c8aef3813c7109f","observation_id":"b0be04b9-5e03-4012-bf34-8f2746fd085a","resolution":{"observed_at":"2026-08-07T12:11:47.095650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:50.733218Z","title":"On gener- ative spoken language modeling from raw audio,","venue":null,"work_id":"37eab5b3-df44-4d69-a345-44fd7dca2810","year":2021},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-07T12:06:43.965548Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:47.191571Z"},"links":{"citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:f375ff9c57c10abe4a7dd7f9977772d5711442b27ea87ec5c1aecde0bacf745f","observation_id":"6a76a570-96a6-487f-bebe-f838a94c974f","resolution":{"observed_at":"2026-08-07T12:11:50.794228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-07T12:11:47.225110Z","title":"Moshi: a speech-text foundation model for real-time dialogue,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-07T12:06:43.965548Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:47.225110Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:c496e8adf5364adbeeaf4e79c835e533b61eef399c059346900416196f7f4f02","observation_id":"98b52e29-d426-4844-84cf-f880bbf562d9","resolution":{"observed_at":"2026-08-07T12:11:47.225110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:50.545857Z","title":"Callhome american english transcripts,","venue":null,"work_id":"808ce7ac-fce4-4cff-8ca0-d207f9ef5683","year":1997},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-07T12:06:43.965548Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:47.243341Z"},"links":{"citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:81fc10c17d78e2561ab990e917930d7b98a7b6f5212a723d41b44af79a950cd3","observation_id":"1c4e6eae-9825-44c4-9fa3-70505062d41b","resolution":{"observed_at":"2026-08-07T12:11:50.639637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:50.392902Z","title":"Santa barbara corpus of spoken american english,","venue":null,"work_id":"e3ece995-a442-451c-89b7-feb9df17c73f","year":2000},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-07T12:06:43.965548Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:47.322984Z"},"links":{"citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:b1968713006ce9bf8be049734c5a29368a67433a2a1619c3aff7a5a2e0d98506","observation_id":"21adb551-327c-41e2-8348-237c749781a7","resolution":{"observed_at":"2026-08-07T12:11:50.464850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:50.177213Z","title":"The hcrc map task corpus,","venue":null,"work_id":"1c7e46c5-410b-4def-93cd-3c8424763f87","year":1991},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-07T12:06:43.965548Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:47.375416Z"},"links":{"citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:bc788ca1d50d7ce1819ae2933519adcd547b587e005456cbf0d3fdd10262e435","observation_id":"f58fb5a0-5858-49e1-8d2f-4cc00fd0c9fe","resolution":{"observed_at":"2026-08-07T12:11:50.263251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:50.037035Z","title":"The casual conversations v2 dataset,","venue":null,"work_id":"782e2fa4-36cc-4e9e-b417-98b3ed86556e","year":2023},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-07T12:06:43.965548Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:47.439037Z"},"links":{"citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:6fdb72099d87091b03aeed79ae81cb36dc0ff829b469b975d58d37db6e1911bc","observation_id":"eac548f5-d474-48af-8544-dd4a6551dcd3","resolution":{"observed_at":"2026-08-07T12:11:50.101839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:49.887413Z","title":"Scalable spontaneous speech dataset (SSSD): Crowdsourcing data collection to promote dialogue research,","venue":null,"work_id":"c2755e18-0ed6-44d7-bcb9-a58028c01f52","year":2025},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-07T12:06:43.965548Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:47.530317Z"},"links":{"citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:fb4e3f4da571700d3263dd93cd2c6f756529327ef419fa0bd19fb238c7526acc","observation_id":"a4d735f0-0d94-4c9b-b4b3-7b003aef0fac","resolution":{"observed_at":"2026-08-07T12:11:49.961062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:47.595510Z","title":"Silero models: pre-trained enterprise-grade stt / tts models and benchmarks,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-07T12:06:43.965548Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:47.595510Z"},"links":{"citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:023c5882c39b0e27d9eb6472852aa26efe7c7762c28dc41a1b4574886809620c","observation_id":"93663259-1ebd-45fb-abfb-c9c63adfee40","resolution":{"observed_at":"2026-08-07T12:11:47.595510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T12:11:47.662234Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-07T12:06:43.965548Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:47.662234Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:74bf7014453511a08e2d2ae5a33f63d177b742c6ba78cd0f1d3c1e8499f9b9aa","observation_id":"fe169053-4210-4de0-8198-e5079bc077c8","resolution":{"observed_at":"2026-08-07T12:11:47.662234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:49.719498Z","title":"Whisperx: Time-accurate speech transcription of long-form audio,","venue":null,"work_id":"25d49d9d-fd7e-4719-bfaa-7f1b827d8438","year":2023},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-07T12:06:43.965548Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:47.716069Z"},"links":{"citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:d3551479b708cbfde880ed1855105395cea0735692a405e718442b8679f49c00","observation_id":"c6d6d965-b0d1-4d6d-a4aa-b65e52633e82","resolution":{"observed_at":"2026-08-07T12:11:49.803665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.11596","last_updated":"2023-10-25T03:52:07Z","snapshot_observed_at":"2026-07-06T16:09:09.018523Z","submitted_at":"2023-08-22T17:44:18Z","title":"SeamlessM4T: Massively Multilingual & Multimodal Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.11596","snapshot_observed_at":"2026-08-07T12:11:47.792349Z","title":"Seamlessm4t: Massively multilingual & multimodal machine translation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-07T12:06:43.965548Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:47.792349Z"},"links":{"cited_paper":"/paper/2308.11596","citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:fb8085808d29e626c190b38aa2c24a6f88849347db47ae600104711bad015b9b","observation_id":"f5e0fc51-7c8e-4be7-92e2-c25b8c34c624","resolution":{"observed_at":"2026-08-07T12:11:47.792349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.11477","last_updated":"2020-10-22T06:09:10Z","snapshot_observed_at":"2026-08-07T05:13:16.889179Z","submitted_at":"2020-06-20T02:35:02Z","title":"wav2vec 2.0: A Framework for Self-Supervised Learning of Speech Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.11477","snapshot_observed_at":"2026-08-07T12:11:47.894977Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-07T12:06:43.965548Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:47.894977Z"},"links":{"cited_paper":"/paper/2006.11477","citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:d4605a6da7eca79795f3035ec1a203f4a8588542bdeaaac37862746d5c09de9e","observation_id":"2a408a6f-7572-4d92-9c5c-cfc9a5a95e59","resolution":{"observed_at":"2026-08-07T12:11:47.894977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:49.584769Z","title":"pyannote.audio 2.1 speaker diarization pipeline: principle, benchmark, and recipe,","venue":null,"work_id":"46144549-6a24-4cb7-a126-feb2dff4af02","year":2023},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-07T12:06:43.965548Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:47.969722Z"},"links":{"citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:958b47eac8f35760c32c8b1c7db951d41a36f9831e091509f12a935d1663747b","observation_id":"f8027b9e-d990-41c2-9b85-4cd0b71ccdc4","resolution":{"observed_at":"2026-08-07T12:11:49.643117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:48.053460Z","title":"Powerset multi-class cross entropy loss for neural speaker diarization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-07T12:06:43.965548Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:48.053460Z"},"links":{"citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:c13e6541df5effc8be1baeb4014ff6b6e731ee7290dde06077a365f2e2d99b8a","observation_id":"dd6ac9b8-915a-453e-a378-98b7b56aca07","resolution":{"observed_at":"2026-08-07T12:11:48.053460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:49.411743Z","title":"End-to-End Neural Speaker Diarization with Permutation-free Objec- tives,","venue":null,"work_id":"4978aff6-4f18-41c4-9236-fe50bfb7af47","year":2019},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-07T12:06:43.965548Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:48.390178Z"},"links":{"citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:98054b962ff131550afd9659665116bbbc89223c1e1ebc2c42a32379e7c9997c","observation_id":"93064c8b-ec03-4c01-b10b-2f179de41d11","resolution":{"observed_at":"2026-08-07T12:11:49.495203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04410","last_updated":"2021-10-08T23:49:42Z","snapshot_observed_at":"2026-08-06T03:08:15.868993Z","submitted_at":"2021-10-08T23:49:42Z","title":"TitaNet: Neural Model for speaker representation with 1D Depth-wise separable convolutions and global context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04410","snapshot_observed_at":"2026-08-07T12:11:48.497846Z","title":"Titanet: Neural model for speaker representation with 1d depth-wise separable convolutions and global context,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-07T12:06:43.965548Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:48.497846Z"},"links":{"cited_paper":"/paper/2110.04410","citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:ec42cdfb7424a2eaa4a00ca5fe4976cfa4b923a8a01e8954b2be7de4c77d7819","observation_id":"4d4c8745-b6ff-4949-98cc-6fd0a86d2b12","resolution":{"observed_at":"2026-08-07T12:11:48.497846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.13886","last_updated":"2021-02-11T19:53:58Z","snapshot_observed_at":"2026-08-05T16:46:31.718115Z","submitted_at":"2020-10-26T20:26:05Z","title":"MarbleNet: Deep 1D Time-Channel Separable Convolutional Neural Network for Voice Activity Detection","version":2},"cited_work":{"arxiv_id":"2010.13886","doi":null,"metadata_source":"pith","pith_arxiv_id":"2010.13886","snapshot_observed_at":"2026-08-07T12:11:48.868568Z","title":"MarbleNet: Deep 1D Time-Channel Separable Convolutional Neural Network for Voice Activity Detection","venue":"eess.AS","work_id":"a16915eb-fa34-4d57-9bfe-d9de64e2b1d1","year":2020},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-07T12:06:43.965548Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:48.666663Z"},"links":{"cited_paper":"/paper/2010.13886","citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:8e73212b4ea267369c899130fee17e02646ff3354b58d7f2ca2648b30b58c5bd","observation_id":"b51f5b80-4fd2-4e5b-aff6-46b514b89da9","resolution":{"observed_at":"2026-08-07T12:11:49.008646Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.09577","last_updated":"2019-09-14T03:51:46Z","snapshot_observed_at":"2026-08-03T18:17:55.398298Z","submitted_at":"2019-09-14T03:51:46Z","title":"NeMo: a toolkit for building AI applications using Neural Modules","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.09577","snapshot_observed_at":"2026-08-07T12:11:48.308009Z","title":"Available: http://arxiv.org/abs/1909.09577","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-07T12:06:43.965548Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:48.308009Z"},"links":{"cited_paper":"/paper/1909.09577","citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:32eee2b661bd5caf3bbe01e1135a398d783f48f34870ed4f849ef2c0f83cfd86","observation_id":"e119618a-71ac-450a-aeb4-c03b60e10a78","resolution":{"observed_at":"2026-08-07T12:11:48.308009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T12:06:43.965548Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":2,"verified_fuzzy":13},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 0 inbound Pith citation observations for arXiv:2506.00267."}