{"as_of":"2026-08-08T09:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:757c7796012c1e616a1f98fe3bf67447cd571b0fd7d163f2b6fb22b4cddfa014","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-25T00:59:00.525481Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:32:27.969261Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-05-25T01:00:09.574967Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1907.05337","last_updated":"2019-07-09T00:23:22Z","snapshot_observed_at":"2026-08-02T04:08:05.825191Z","submitted_at":"2019-07-09T00:23:22Z","title":"Joint Speech Recognition and Speaker Diarization via Sequence Transduction","version":1},"cited_work":{"arxiv_id":"1907.05337","doi":null,"metadata_source":"pith","pith_arxiv_id":"1907.05337","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Joint Speech Recognition and Speaker Diarization via Sequence Transduction","venue":"cs.CL","work_id":"405acfa8-d943-4659-9e07-0613892d7dbe","year":2019},"citing_paper":{"arxiv_id":"1907.05337","last_updated":"2019-07-09T00:23:22Z","snapshot_observed_at":"2026-08-02T04:08:05.825191Z","submitted_at":"2019-07-09T00:23:22Z","title":"Joint Speech Recognition and Speaker Diarization via Sequence Transduction","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-25T00:59:00.525481Z"},"links":{"cited_paper":"/paper/1907.05337","citing_paper":"/paper/1907.05337"},"observation_digest":"sha256:6b9684ca0b1d3997d36dec99f9440b0c8904bb740f844ddf7eadf7918f5f82e9","observation_id":"df2148e4-efbe-47bf-9f6a-169c1c4e18ba","resolution":{"observed_at":"2026-05-25T01:00:09.578155Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.05337","last_updated":"2019-07-09T00:23:22Z","snapshot_observed_at":"2026-08-02T04:08:05.825191Z","submitted_at":"2019-07-09T00:23:22Z","title":"Joint Speech Recognition and Speaker Diarization via Sequence Transduction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.05337","snapshot_observed_at":"2026-08-07T04:32:27.969261Z","title":"Joint speech recognition and speaker diarization via sequence transduction,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-08T01:37:13.414267Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:27.969261Z"},"links":{"cited_paper":"/paper/1907.05337","citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:0f34cfc6ecab47f53f3cd2505ad8a5a2e89523eb19b1b1c53ed4d8bd29771196","observation_id":"d9b4c47a-ad4d-405a-b808-72a72c24843f","resolution":{"observed_at":"2026-08-07T04:32:27.969261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.05337","last_updated":"2019-07-09T00:23:22Z","snapshot_observed_at":"2026-08-02T04:08:05.825191Z","submitted_at":"2019-07-09T00:23:22Z","title":"Joint Speech Recognition and Speaker Diarization via Sequence Transduction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.05337","snapshot_observed_at":"2026-08-07T04:15:56.818718Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.11344","last_updated":"2025-06-12T22:31:02Z","snapshot_observed_at":"2026-08-08T01:37:11.339142Z","submitted_at":"2025-06-12T22:31:02Z","title":"Do We Still Need Audio? Rethinking Speaker Diarization with a Text-Based Approach Using Multiple Prediction Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:56.818718Z"},"links":{"cited_paper":"/paper/1907.05337","citing_paper":"/paper/2506.11344"},"observation_digest":"sha256:6a1439e2c16c3943834c7f7c041a1ba8dcb435335a7b46d531cfb026ab32e27e","observation_id":"80d5c565-14c0-4f84-9a26-578fc0102d5e","resolution":{"observed_at":"2026-08-07T04:15:56.818718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.05337","last_updated":"2019-07-09T00:23:22Z","snapshot_observed_at":"2026-08-02T04:08:05.825191Z","submitted_at":"2019-07-09T00:23:22Z","title":"Joint Speech Recognition and Speaker Diarization via Sequence Transduction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.05337","snapshot_observed_at":"2026-08-05T15:27:29.255358Z","title":"Joint speech recognition and speaker diarization via sequence transduction,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2508.19856","last_updated":"2025-08-27T13:16:31Z","snapshot_observed_at":"2026-08-05T15:27:28.932842Z","submitted_at":"2025-08-27T13:16:31Z","title":"TokenVerse++: Towards Flexible Multitask Learning with Dynamic Task Activation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T15:27:29.255358Z"},"links":{"cited_paper":"/paper/1907.05337","citing_paper":"/paper/2508.19856"},"observation_digest":"sha256:83a3609bd08aaa267dc09fc55eaebc0c861d82de51622111b7ccd1c76f873f34","observation_id":"612daea9-4d17-4202-b167-cc2aa4c16239","resolution":{"observed_at":"2026-08-05T15:27:29.255358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/1907.05337/citation-record","integrity":"/paper/1907.05337/integrity","json":"/paper/1907.05337/citation-record.json","paper":"/paper/1907.05337"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1907.05337","last_updated":"2019-07-09T00:23:22Z","snapshot_observed_at":"2026-08-02T04:08:05.825191Z","submitted_at":"2019-07-09T00:23:22Z","title":"Joint Speech Recognition and Speaker Diarization via Sequence Transduction","version":1},"cited_work":{"arxiv_id":"1907.05337","doi":null,"metadata_source":"pith","pith_arxiv_id":"1907.05337","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Joint Speech Recognition and Speaker Diarization via Sequence Transduction","venue":"cs.CL","work_id":"405acfa8-d943-4659-9e07-0613892d7dbe","year":2019},"citing_paper":{"arxiv_id":"1907.05337","last_updated":"2019-07-09T00:23:22Z","snapshot_observed_at":"2026-08-02T04:08:05.825191Z","submitted_at":"2019-07-09T00:23:22Z","title":"Joint Speech Recognition and Speaker Diarization via Sequence Transduction","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-25T00:59:00.525481Z"},"links":{"cited_paper":"/paper/1907.05337","citing_paper":"/paper/1907.05337"},"observation_digest":"sha256:6b9684ca0b1d3997d36dec99f9440b0c8904bb740f844ddf7eadf7918f5f82e9","observation_id":"df2148e4-efbe-47bf-9f6a-169c1c4e18ba","resolution":{"observed_at":"2026-05-25T01:00:09.578155Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Problem Formulation and Proposed Solution Many machine learning tasks can be expressed as mapping an input sequence into an output sequence","venue":null,"work_id":"bcd08f11-8a5d-4142-9a48-ac68dd6f5448","year":null},"citing_paper":{"arxiv_id":"1907.05337","last_updated":"2019-07-09T00:23:22Z","snapshot_observed_at":"2026-08-02T04:08:05.825191Z","submitted_at":"2019-07-09T00:23:22Z","title":"Joint Speech Recognition and Speaker Diarization via Sequence Transduction","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-25T00:59:00.525481Z"},"links":{"citing_paper":"/paper/1907.05337"},"observation_digest":"sha256:a55ca3db2537e83ca2a49fc65f64e23f4f41b8f4fa6a1535b257f09709085f30","observation_id":"dd1d165d-6cab-4e0b-89f6-5acb1a9381b2","resolution":{"observed_at":"2026-05-25T01:00:10.300720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"1e4e8f2e-5bd7-41f7-8364-21d5c7e577cb","year":null},"citing_paper":{"arxiv_id":"1907.05337","last_updated":"2019-07-09T00:23:22Z","snapshot_observed_at":"2026-08-02T04:08:05.825191Z","submitted_at":"2019-07-09T00:23:22Z","title":"Joint Speech Recognition and Speaker Diarization via Sequence Transduction","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-25T00:59:00.525481Z"},"links":{"citing_paper":"/paper/1907.05337"},"observation_digest":"sha256:a95863c75872a5c5bb7d391f71e7f614248b0b652de379a978cfbf52b0d988ad","observation_id":"d88a58d1-b5af-475b-8a69-feb4e749a31c","resolution":{"observed_at":"2026-05-25T01:00:10.362086Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"15a25d0d-7fc9-4ddb-a20a-2d82135fbd96","year":null},"citing_paper":{"arxiv_id":"1907.05337","last_updated":"2019-07-09T00:23:22Z","snapshot_observed_at":"2026-08-02T04:08:05.825191Z","submitted_at":"2019-07-09T00:23:22Z","title":"Joint Speech Recognition and Speaker Diarization via Sequence Transduction","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-25T00:59:00.525481Z"},"links":{"citing_paper":"/paper/1907.05337"},"observation_digest":"sha256:4bfa1d375392b5ff2dd535f85927c0519ac44d248546ce92f689a6e45622460e","observation_id":"7993a0b8-0a36-4f24-a645-d9ff7c842276","resolution":{"observed_at":"2026-05-25T01:00:10.240446Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b1ca051f-4233-441f-8a74-4e71488ba33d","year":null},"citing_paper":{"arxiv_id":"1907.05337","last_updated":"2019-07-09T00:23:22Z","snapshot_observed_at":"2026-08-02T04:08:05.825191Z","submitted_at":"2019-07-09T00:23:22Z","title":"Joint Speech Recognition and Speaker Diarization via Sequence Transduction","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-25T00:59:00.525481Z"},"links":{"citing_paper":"/paper/1907.05337"},"observation_digest":"sha256:147e12a287dd76fb04f8a6ae1417f840fddcb714256cc716b43f1d44ae035782","observation_id":"29d16264-0740-4a61-bd05-4d6862a3a615","resolution":{"observed_at":"2026-05-25T01:00:10.381972Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"cf61aea7-6e5d-4674-a728-2d2a49a91fc1","year":null},"citing_paper":{"arxiv_id":"1907.05337","last_updated":"2019-07-09T00:23:22Z","snapshot_observed_at":"2026-08-02T04:08:05.825191Z","submitted_at":"2019-07-09T00:23:22Z","title":"Joint Speech Recognition and Speaker Diarization via Sequence Transduction","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-25T00:59:00.525481Z"},"links":{"citing_paper":"/paper/1907.05337"},"observation_digest":"sha256:0441c4391c51ca81352007b805437460fbde314a7849d57eaf82b7c876973be0","observation_id":"97e3ca92-1e81-4f84-bc05-55482e9c14ab","resolution":{"observed_at":"2026-05-25T01:00:10.228658Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"49853f19-2fae-4782-bde8-c0cc8478a192","year":null},"citing_paper":{"arxiv_id":"1907.05337","last_updated":"2019-07-09T00:23:22Z","snapshot_observed_at":"2026-08-02T04:08:05.825191Z","submitted_at":"2019-07-09T00:23:22Z","title":"Joint Speech Recognition and Speaker Diarization via Sequence Transduction","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-25T00:59:00.525481Z"},"links":{"citing_paper":"/paper/1907.05337"},"observation_digest":"sha256:c8b526e48aec3dcae5f0649a8012054369e8e63620e25a3d64b7f107c705f8a9","observation_id":"98cd67ce-d600-4ad2-b90a-5ac506107060","resolution":{"observed_at":"2026-05-25T01:00:10.236456Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"We demonstrated the performance of our approach by evaluating it on a large corpus of clinical conversa- tions between physicians and patients","venue":null,"work_id":"d30f53a1-b2f7-40be-885a-e96fe2761884","year":null},"citing_paper":{"arxiv_id":"1907.05337","last_updated":"2019-07-09T00:23:22Z","snapshot_observed_at":"2026-08-02T04:08:05.825191Z","submitted_at":"2019-07-09T00:23:22Z","title":"Joint Speech Recognition and Speaker Diarization via Sequence Transduction","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-25T00:59:00.525481Z"},"links":{"citing_paper":"/paper/1907.05337"},"observation_digest":"sha256:8515a604baa1ac66ef49d6d89e291e4c64e3c207c1d9193559a645efea3ff5db","observation_id":"d3f6adbc-08e1-4b4d-8dc7-68c887a5b5a9","resolution":{"observed_at":"2026-05-25T01:00:10.292305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7c99cf43-9713-4622-8fb6-bd67f8ce8d73","year":null},"citing_paper":{"arxiv_id":"1907.05337","last_updated":"2019-07-09T00:23:22Z","snapshot_observed_at":"2026-08-02T04:08:05.825191Z","submitted_at":"2019-07-09T00:23:22Z","title":"Joint Speech Recognition and Speaker Diarization via Sequence Transduction","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-25T00:59:00.525481Z"},"links":{"citing_paper":"/paper/1907.05337"},"observation_digest":"sha256:8fb27cb4ca81dda0309646ed563c1eb5bfb91bb6b5414ab3ede3ab8f081f8ad4","observation_id":"07b88adf-565a-46cb-a228-2d068797be7f","resolution":{"observed_at":"2026-05-25T01:00:10.366683Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An overview of auto- matic speaker diarization systems","venue":null,"work_id":"8303ad23-4f08-42da-be84-f096a517ec16","year":2006},"citing_paper":{"arxiv_id":"1907.05337","last_updated":"2019-07-09T00:23:22Z","snapshot_observed_at":"2026-08-02T04:08:05.825191Z","submitted_at":"2019-07-09T00:23:22Z","title":"Joint Speech Recognition and Speaker Diarization via Sequence Transduction","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-25T00:59:00.525481Z"},"links":{"citing_paper":"/paper/1907.05337"},"observation_digest":"sha256:475ade988cb878a5fcff4de0763dd66a24967600582a85d3bfc1e703b84a5864","observation_id":"175393fa-3556-4888-ad78-2b18e7e2507a","resolution":{"observed_at":"2026-05-25T01:00:10.375332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Speaker diarization: A review of recent research","venue":null,"work_id":"66881b88-9ae5-4bcc-8bb9-f5198feeb7d8","year":2012},"citing_paper":{"arxiv_id":"1907.05337","last_updated":"2019-07-09T00:23:22Z","snapshot_observed_at":"2026-08-02T04:08:05.825191Z","submitted_at":"2019-07-09T00:23:22Z","title":"Joint Speech Recognition and Speaker Diarization via Sequence Transduction","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-25T00:59:00.525481Z"},"links":{"citing_paper":"/paper/1907.05337"},"observation_digest":"sha256:d4158513253846506da6c8fb19129d998675356fbfcdbb4d1eb880361a747fc0","observation_id":"5e9e5dc7-7e68-4d98-a67c-e79a4aedee57","resolution":{"observed_at":"2026-05-25T01:00:10.378649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A robust speaker clustering algo- rithm","venue":null,"work_id":"efdf8c72-f2ba-4e52-9acb-17df1acc2295","year":2003},"citing_paper":{"arxiv_id":"1907.05337","last_updated":"2019-07-09T00:23:22Z","snapshot_observed_at":"2026-08-02T04:08:05.825191Z","submitted_at":"2019-07-09T00:23:22Z","title":"Joint Speech Recognition and Speaker Diarization via Sequence Transduction","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-25T00:59:00.525481Z"},"links":{"citing_paper":"/paper/1907.05337"},"observation_digest":"sha256:79035cc9274b433f3a8cb80e53efb54a57ba15cb644cce956c2071004a9cbd5e","observation_id":"e92e4095-589b-462b-a11f-c7b73fd89946","resolution":{"observed_at":"2026-05-25T01:00:10.350458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multistage speaker diarization of broadcast news","venue":null,"work_id":"2bfde310-b3d4-451f-a46b-972eb23f5c76","year":2006},"citing_paper":{"arxiv_id":"1907.05337","last_updated":"2019-07-09T00:23:22Z","snapshot_observed_at":"2026-08-02T04:08:05.825191Z","submitted_at":"2019-07-09T00:23:22Z","title":"Joint Speech Recognition and Speaker Diarization via Sequence Transduction","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-25T00:59:00.525481Z"},"links":{"citing_paper":"/paper/1907.05337"},"observation_digest":"sha256:d8c93c4b3063e56edefc2fc4d1287598ca138967db9fd23076ccf5e728be4f8c","observation_id":"23ca0396-8c5c-4579-b7e9-b1e22ac3d0ae","resolution":{"observed_at":"2026-05-25T01:00:10.334842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Speaker diarization with PLDA i-vector scoring and unsupervised calibration","venue":null,"work_id":"97913f3b-1359-4b7e-91c9-f27d3e820a16","year":2014},"citing_paper":{"arxiv_id":"1907.05337","last_updated":"2019-07-09T00:23:22Z","snapshot_observed_at":"2026-08-02T04:08:05.825191Z","submitted_at":"2019-07-09T00:23:22Z","title":"Joint Speech Recognition and Speaker Diarization via Sequence Transduction","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-25T00:59:00.525481Z"},"links":{"citing_paper":"/paper/1907.05337"},"observation_digest":"sha256:969582d062eb2990bfcb1920b2b01ccdb10dccac5aa93586a9968c0ded40b508","observation_id":"8fd2b52d-a994-4177-ba77-294dc10d82d6","resolution":{"observed_at":"2026-05-25T01:00:10.287755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Speaker diarization using deep neural network embeddings","venue":null,"work_id":"d62eef97-7d0a-4dea-a74f-6a5f5df06fff","year":2017},"citing_paper":{"arxiv_id":"1907.05337","last_updated":"2019-07-09T00:23:22Z","snapshot_observed_at":"2026-08-02T04:08:05.825191Z","submitted_at":"2019-07-09T00:23:22Z","title":"Joint Speech Recognition and Speaker Diarization via Sequence Transduction","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-25T00:59:00.525481Z"},"links":{"citing_paper":"/paper/1907.05337"},"observation_digest":"sha256:4e6517568fbdaf4e75b9e7e3b9925b9a9ad8512569682e4ba643c1bbbd2b227f","observation_id":"e487747d-1160-474c-b7ad-dbc58b25a482","resolution":{"observed_at":"2026-05-25T01:00:10.393043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Speaker diarization with LSTM","venue":null,"work_id":"c5cf877e-42af-4d56-a4e5-a1f7bf1c764c","year":2018},"citing_paper":{"arxiv_id":"1907.05337","last_updated":"2019-07-09T00:23:22Z","snapshot_observed_at":"2026-08-02T04:08:05.825191Z","submitted_at":"2019-07-09T00:23:22Z","title":"Joint Speech Recognition and Speaker Diarization via Sequence Transduction","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-25T00:59:00.525481Z"},"links":{"citing_paper":"/paper/1907.05337"},"observation_digest":"sha256:6a4b50a42fae81182cd13a8e78d8346692e4f4a818b2e77b0a1fd424451ba213","observation_id":"bea5c21e-eceb-46a1-9788-309e58dfb63e","resolution":{"observed_at":"2026-05-25T01:00:10.338336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"X-vectors: Robust DNN embeddings for speaker recogni- tion","venue":null,"work_id":"8d7d6db7-7913-4643-a82c-8e16bd861f5d","year":2018},"citing_paper":{"arxiv_id":"1907.05337","last_updated":"2019-07-09T00:23:22Z","snapshot_observed_at":"2026-08-02T04:08:05.825191Z","submitted_at":"2019-07-09T00:23:22Z","title":"Joint Speech Recognition and Speaker Diarization via Sequence Transduction","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-25T00:59:00.525481Z"},"links":{"citing_paper":"/paper/1907.05337"},"observation_digest":"sha256:bf97599d9633b652f1a5dbc728228bc147a908d98629de05073dda4f7170b1dd","observation_id":"fc8682a6-ce90-476f-9257-60ca9c24f8b0","resolution":{"observed_at":"2026-05-25T01:00:10.358453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diarization is hard: Some experiences and lessons learned for the JHU team in the inaugural DIHARD chal- lenge","venue":null,"work_id":"12ab4f07-6b62-4a09-931c-594ac0e69775","year":2018},"citing_paper":{"arxiv_id":"1907.05337","last_updated":"2019-07-09T00:23:22Z","snapshot_observed_at":"2026-08-02T04:08:05.825191Z","submitted_at":"2019-07-09T00:23:22Z","title":"Joint Speech Recognition and Speaker Diarization via Sequence Transduction","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-25T00:59:00.525481Z"},"links":{"citing_paper":"/paper/1907.05337"},"observation_digest":"sha256:e3a941ddffd4eda9e56112ba46b884e74fdd1109ab4dfcf0fbfc31953b3e4830","observation_id":"8f3d676e-8def-4d48-82c4-8756d3ccabc1","resolution":{"observed_at":"2026-05-25T01:00:10.371970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tristounet: Triplet loss for speaker turn embedding","venue":null,"work_id":"303e2772-a07e-4b05-ab1c-13d9634c2355","year":2017},"citing_paper":{"arxiv_id":"1907.05337","last_updated":"2019-07-09T00:23:22Z","snapshot_observed_at":"2026-08-02T04:08:05.825191Z","submitted_at":"2019-07-09T00:23:22Z","title":"Joint Speech Recognition and Speaker Diarization via Sequence Transduction","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-25T00:59:00.525481Z"},"links":{"citing_paper":"/paper/1907.05337"},"observation_digest":"sha256:9e4e2dce5a4b22c52bfe8fc7c977490b4f52e0849b998369a2887c1bbdf30a76","observation_id":"8805d2e1-9e96-4d0e-b8a6-5d50f4562c44","resolution":{"observed_at":"2026-05-25T01:00:10.389529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04719","last_updated":"2019-02-19T16:30:55Z","snapshot_observed_at":"2026-07-06T07:07:18.903603Z","submitted_at":"2018-10-10T19:21:44Z","title":"Fully Supervised Speaker Diarization","version":7},"cited_work":{"arxiv_id":"1810.04719","doi":null,"metadata_source":"pith","pith_arxiv_id":"1810.04719","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fully Supervised Speaker Diarization","venue":"eess.AS","work_id":"ff57f114-ac59-4eac-9043-4fe1922ef89a","year":2018},"citing_paper":{"arxiv_id":"1907.05337","last_updated":"2019-07-09T00:23:22Z","snapshot_observed_at":"2026-08-02T04:08:05.825191Z","submitted_at":"2019-07-09T00:23:22Z","title":"Joint Speech Recognition and Speaker Diarization via Sequence Transduction","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-25T00:59:00.525481Z"},"links":{"cited_paper":"/paper/1810.04719","citing_paper":"/paper/1907.05337"},"observation_digest":"sha256:856b672c03c9de2c8624b48368f05e3b6a06cb3d9b2bfe5cc648ea54776ab79c","observation_id":"7d2a9063-ea67-4c88-84bb-a4d65a32540a","resolution":{"observed_at":"2026-05-25T01:00:09.565790Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Speaker di- arization from speech transcripts","venue":null,"work_id":"c1622ad8-2582-43dc-ac4a-625a8468798f","year":2004},"citing_paper":{"arxiv_id":"1907.05337","last_updated":"2019-07-09T00:23:22Z","snapshot_observed_at":"2026-08-02T04:08:05.825191Z","submitted_at":"2019-07-09T00:23:22Z","title":"Joint Speech Recognition and Speaker Diarization via Sequence Transduction","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-25T00:59:00.525481Z"},"links":{"citing_paper":"/paper/1907.05337"},"observation_digest":"sha256:09aa14752e084406156f279da94efd15863e969f7f019994d8f14e9b25899132","observation_id":"cc1057fd-5d2d-46d6-97cc-be24bc01a83a","resolution":{"observed_at":"2026-05-25T01:00:10.385332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multimodal speaker segmentation and diarization using lexical and acoustic cues via sequence to se- quence neural networks","venue":null,"work_id":"787b54ec-c8ef-4413-b51f-c96395ca112d","year":2018},"citing_paper":{"arxiv_id":"1907.05337","last_updated":"2019-07-09T00:23:22Z","snapshot_observed_at":"2026-08-02T04:08:05.825191Z","submitted_at":"2019-07-09T00:23:22Z","title":"Joint Speech Recognition and Speaker Diarization via Sequence Transduction","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-25T00:59:00.525481Z"},"links":{"citing_paper":"/paper/1907.05337"},"observation_digest":"sha256:0a783ebd3e330aec6077e52b2a2cff95750fd7562ec2fa5788cfaef6873a194e","observation_id":"7ec0a56b-c577-4a66-be1c-ac97361682bc","resolution":{"observed_at":"2026-05-25T01:00:10.354194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The use of recurrent neural networks in continuous speech recognition","venue":null,"work_id":"dc1dd283-9941-4094-aca3-ef20b6f8f189","year":1996},"citing_paper":{"arxiv_id":"1907.05337","last_updated":"2019-07-09T00:23:22Z","snapshot_observed_at":"2026-08-02T04:08:05.825191Z","submitted_at":"2019-07-09T00:23:22Z","title":"Joint Speech Recognition and Speaker Diarization via Sequence Transduction","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-25T00:59:00.525481Z"},"links":{"citing_paper":"/paper/1907.05337"},"observation_digest":"sha256:e950f00fba329dd1ca5ade02fba869d9c367f5cf3982755b4323f8425f9037b0","observation_id":"42913212-c0ef-4597-b76e-e529b5aecee3","resolution":{"observed_at":"2026-05-25T01:00:10.273558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Connectionist temporal classiﬁcation: labelling unsegmented se- quence data with recurrent neural networks","venue":null,"work_id":"d5576c73-5d2a-4a5d-9b33-f0016dc165b2","year":2006},"citing_paper":{"arxiv_id":"1907.05337","last_updated":"2019-07-09T00:23:22Z","snapshot_observed_at":"2026-08-02T04:08:05.825191Z","submitted_at":"2019-07-09T00:23:22Z","title":"Joint Speech Recognition and Speaker Diarization via Sequence Transduction","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-25T00:59:00.525481Z"},"links":{"citing_paper":"/paper/1907.05337"},"observation_digest":"sha256:d165849917effa4557320de97a97ba864d7f48e30bcc398668db39073aa0651d","observation_id":"f178c1d3-fdcf-4ecd-b75e-b7e18570297d","resolution":{"observed_at":"2026-05-25T01:00:10.277767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sequence transduction with recurrent neural net- works","venue":null,"work_id":"ae9d7e9f-6e80-452a-b859-16dfc4f93631","year":2012},"citing_paper":{"arxiv_id":"1907.05337","last_updated":"2019-07-09T00:23:22Z","snapshot_observed_at":"2026-08-02T04:08:05.825191Z","submitted_at":"2019-07-09T00:23:22Z","title":"Joint Speech Recognition and Speaker Diarization via Sequence Transduction","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-25T00:59:00.525481Z"},"links":{"citing_paper":"/paper/1907.05337"},"observation_digest":"sha256:8823633dc6c6566dc58d74d5d0b722c8b7539f1761a51258e9cd96c539732f05","observation_id":"bf21111b-9427-4ff4-b75b-b0132871c77a","resolution":{"observed_at":"2026-05-25T01:00:10.282214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Speech recognition with deep recurrent neural networks","venue":null,"work_id":"f412e2ab-5aef-4614-94c6-8b5675a179cd","year":2013},"citing_paper":{"arxiv_id":"1907.05337","last_updated":"2019-07-09T00:23:22Z","snapshot_observed_at":"2026-08-02T04:08:05.825191Z","submitted_at":"2019-07-09T00:23:22Z","title":"Joint Speech Recognition and Speaker Diarization via Sequence Transduction","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-25T00:59:00.525481Z"},"links":{"citing_paper":"/paper/1907.05337"},"observation_digest":"sha256:1b8ba9b5642d937b06b8c55b369e59b12bb657aae46c203e204a5d45bdf2064a","observation_id":"197d9a67-66ea-442a-80cc-916a7cfb3806","resolution":{"observed_at":"2026-05-25T01:00:10.232528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.06621","last_updated":"2018-11-15T23:09:44Z","snapshot_observed_at":"2026-07-06T07:15:05.322404Z","submitted_at":"2018-11-15T23:09:44Z","title":"Streaming End-to-end Speech Recognition For Mobile Devices","version":1},"cited_work":{"arxiv_id":"1811.06621","doi":null,"metadata_source":"pith","pith_arxiv_id":"1811.06621","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Streaming End-to-end Speech Recognition For Mobile Devices","venue":"cs.CL","work_id":"60ced464-eca2-4025-9647-74f13b8fd1c4","year":2018},"citing_paper":{"arxiv_id":"1907.05337","last_updated":"2019-07-09T00:23:22Z","snapshot_observed_at":"2026-08-02T04:08:05.825191Z","submitted_at":"2019-07-09T00:23:22Z","title":"Joint Speech Recognition and Speaker Diarization via Sequence Transduction","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-25T00:59:00.525481Z"},"links":{"cited_paper":"/paper/1811.06621","citing_paper":"/paper/1907.05337"},"observation_digest":"sha256:9beb61947a2390870a82ac3b164f65e379e76629510b413421fe5f9849152b31","observation_id":"6eb82b7c-d5fa-4d52-a9cc-cd65ea5ee047","resolution":{"observed_at":"2026-05-25T01:00:09.571824Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In- datacenter performance analysis of a tensor processing unit","venue":null,"work_id":"1c25b9c1-9ffc-4e47-81fd-b36b1feacf1c","year":2017},"citing_paper":{"arxiv_id":"1907.05337","last_updated":"2019-07-09T00:23:22Z","snapshot_observed_at":"2026-08-02T04:08:05.825191Z","submitted_at":"2019-07-09T00:23:22Z","title":"Joint Speech Recognition and Speaker Diarization via Sequence Transduction","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-25T00:59:00.525481Z"},"links":{"citing_paper":"/paper/1907.05337"},"observation_digest":"sha256:9667c7bfede127393526436ea55b04a95479a6f9b6074f4a1391b1d8729c96a5","observation_id":"eacc9491-ce87-4ba4-a3cd-4c130cd3a670","resolution":{"observed_at":"2026-05-25T01:00:10.342565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improving the efﬁciency of forward-backward algorithm using batched computation in tensorﬂow","venue":null,"work_id":"e6a94762-154c-4369-84cb-a69b20d320bc","year":2017},"citing_paper":{"arxiv_id":"1907.05337","last_updated":"2019-07-09T00:23:22Z","snapshot_observed_at":"2026-08-02T04:08:05.825191Z","submitted_at":"2019-07-09T00:23:22Z","title":"Joint Speech Recognition and Speaker Diarization via Sequence Transduction","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-25T00:59:00.525481Z"},"links":{"citing_paper":"/paper/1907.05337"},"observation_digest":"sha256:8ec1fa27d1cf761111ead3d46ea4135e571e308108b7b33bf24da2216a7909f2","observation_id":"c5f8e694-5f06-469f-a95c-4dae748b3ed5","resolution":{"observed_at":"2026-05-25T01:00:10.327322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efﬁcient implementation of recurrent neu- ral network transducer in tensorﬂow","venue":null,"work_id":"f2d4e223-1b24-46b4-b43c-6ec7e756b2db","year":2018},"citing_paper":{"arxiv_id":"1907.05337","last_updated":"2019-07-09T00:23:22Z","snapshot_observed_at":"2026-08-02T04:08:05.825191Z","submitted_at":"2019-07-09T00:23:22Z","title":"Joint Speech Recognition and Speaker Diarization via Sequence Transduction","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-25T00:59:00.525481Z"},"links":{"citing_paper":"/paper/1907.05337"},"observation_digest":"sha256:cdca3ed68b9030dd9ff5717130f56c74aebdc3a62edb282c0d5906a70f099dd1","observation_id":"04feb0f1-01c7-4c3c-b3ac-b1108f51d59b","resolution":{"observed_at":"2026-05-25T01:00:10.305342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Neural speech recognizer: Acoustic-to-word LSTM model for large vocabulary speech recognition","venue":null,"work_id":"708dfbde-0f0d-4b36-81dc-3507db38fd3f","year":2017},"citing_paper":{"arxiv_id":"1907.05337","last_updated":"2019-07-09T00:23:22Z","snapshot_observed_at":"2026-08-02T04:08:05.825191Z","submitted_at":"2019-07-09T00:23:22Z","title":"Joint Speech Recognition and Speaker Diarization via Sequence Transduction","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-25T00:59:00.525481Z"},"links":{"citing_paper":"/paper/1907.05337"},"observation_digest":"sha256:6ba50321928ca97ddbe38c4b1a839b55e8c4619a2ce39460b08b899e12c04d48","observation_id":"f513f50c-df4a-451d-af65-857af8e9acf2","resolution":{"observed_at":"2026-05-25T01:00:10.396781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Morfessor 2.0: Python implementation and extensions for morfessor base- line","venue":null,"work_id":"694bf6c0-b933-483c-b028-d40f3fe33fd8","year":2013},"citing_paper":{"arxiv_id":"1907.05337","last_updated":"2019-07-09T00:23:22Z","snapshot_observed_at":"2026-08-02T04:08:05.825191Z","submitted_at":"2019-07-09T00:23:22Z","title":"Joint Speech Recognition and Speaker Diarization via Sequence Transduction","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-25T00:59:00.525481Z"},"links":{"citing_paper":"/paper/1907.05337"},"observation_digest":"sha256:47543757a5a4dfec2fbe8b2ff8aa54f1c7be85e922a5d34af3214bf1ce541d69","observation_id":"9ec9e717-29f6-49a8-94b9-7bdfed362b15","resolution":{"observed_at":"2026-05-25T01:00:10.323290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Phoneme recognition using time-delay neural networks","venue":null,"work_id":"118c5457-864f-4c1e-bed2-9155a49af64f","year":1995},"citing_paper":{"arxiv_id":"1907.05337","last_updated":"2019-07-09T00:23:22Z","snapshot_observed_at":"2026-08-02T04:08:05.825191Z","submitted_at":"2019-07-09T00:23:22Z","title":"Joint Speech Recognition and Speaker Diarization via Sequence Transduction","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-25T00:59:00.525481Z"},"links":{"citing_paper":"/paper/1907.05337"},"observation_digest":"sha256:a464c362f88c73862b759f1b61e4ca6216e2657f469a1e45751a4f2b88d95d02","observation_id":"ddc453d7-d7fe-4be0-8c52-ea030f679765","resolution":{"observed_at":"2026-05-25T01:00:10.296298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reducing the computational complexity for whole word models","venue":null,"work_id":"a51004ce-282c-41fb-9f70-a766c6db8037","year":2017},"citing_paper":{"arxiv_id":"1907.05337","last_updated":"2019-07-09T00:23:22Z","snapshot_observed_at":"2026-08-02T04:08:05.825191Z","submitted_at":"2019-07-09T00:23:22Z","title":"Joint Speech Recognition and Speaker Diarization via Sequence Transduction","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-25T00:59:00.525481Z"},"links":{"citing_paper":"/paper/1907.05337"},"observation_digest":"sha256:dece0d01493269df1ec79e833b582ec4084df145ee98960053379ee12b59352a","observation_id":"77f9fa79-f727-49da-9c24-555afded2daa","resolution":{"observed_at":"2026-05-25T01:00:10.331126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Long short-term memory","venue":null,"work_id":"a37850a7-0c15-4df4-803b-98b4c8686fd4","year":1997},"citing_paper":{"arxiv_id":"1907.05337","last_updated":"2019-07-09T00:23:22Z","snapshot_observed_at":"2026-08-02T04:08:05.825191Z","submitted_at":"2019-07-09T00:23:22Z","title":"Joint Speech Recognition and Speaker Diarization via Sequence Transduction","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-25T00:59:00.525481Z"},"links":{"citing_paper":"/paper/1907.05337"},"observation_digest":"sha256:a2d0abc825c1e3cff855b42c62d445c97b8437a3422ee0a1395abace0680c68e","observation_id":"b0b87f38-9eb6-403b-9f69-ff41a168d1d7","resolution":{"observed_at":"2026-05-25T01:00:10.346710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Adam: A method for stochastic opti- mization","venue":null,"work_id":"e350cdda-e137-4553-9a89-8835323d0407","year":2015},"citing_paper":{"arxiv_id":"1907.05337","last_updated":"2019-07-09T00:23:22Z","snapshot_observed_at":"2026-08-02T04:08:05.825191Z","submitted_at":"2019-07-09T00:23:22Z","title":"Joint Speech Recognition and Speaker Diarization via Sequence Transduction","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-25T00:59:00.525481Z"},"links":{"citing_paper":"/paper/1907.05337"},"observation_digest":"sha256:02db35e95c463e5c7644e38a7fbf5736003ab9e6f3f06a2c8ccbc428d8111700","observation_id":"86aae55a-6dbc-4151-b93a-d76934d4abf6","resolution":{"observed_at":"2026-05-25T01:00:10.268808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The Rich Transcription Fall 2003 (RT-03F) Evalu- ation Plan","venue":null,"work_id":"cba0a56f-cfc6-4b9e-9bcc-31127d7a9b92","year":2003},"citing_paper":{"arxiv_id":"1907.05337","last_updated":"2019-07-09T00:23:22Z","snapshot_observed_at":"2026-08-02T04:08:05.825191Z","submitted_at":"2019-07-09T00:23:22Z","title":"Joint Speech Recognition and Speaker Diarization via Sequence Transduction","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-25T00:59:00.525481Z"},"links":{"citing_paper":"/paper/1907.05337"},"observation_digest":"sha256:bf96b8bd365ec837c6ce5700df814e7104969037212b69af3ca836af4de2ca88","observation_id":"9cbfc75a-8ef7-479f-9943-34efdec55b15","resolution":{"observed_at":"2026-05-25T01:00:10.244402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Feature learn- ing with raw-waveform cldnns for voice activity detection","venue":null,"work_id":"2d537f4e-1e2e-468d-a339-e22025ed8348","year":2016},"citing_paper":{"arxiv_id":"1907.05337","last_updated":"2019-07-09T00:23:22Z","snapshot_observed_at":"2026-08-02T04:08:05.825191Z","submitted_at":"2019-07-09T00:23:22Z","title":"Joint Speech Recognition and Speaker Diarization via Sequence Transduction","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-25T00:59:00.525481Z"},"links":{"citing_paper":"/paper/1907.05337"},"observation_digest":"sha256:81b77d0d7d96384d7a7f26b04fe2902096a9d8a01acd7637efe667d24981610d","observation_id":"345aaecc-4234-4cd8-b7af-20877cdb534e","resolution":{"observed_at":"2026-05-25T01:00:10.310789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"End-to- end text-dependent speaker veriﬁcation","venue":null,"work_id":"3b411467-2f5e-4867-8440-ca519fc5098e","year":2016},"citing_paper":{"arxiv_id":"1907.05337","last_updated":"2019-07-09T00:23:22Z","snapshot_observed_at":"2026-08-02T04:08:05.825191Z","submitted_at":"2019-07-09T00:23:22Z","title":"Joint Speech Recognition and Speaker Diarization via Sequence Transduction","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-25T00:59:00.525481Z"},"links":{"citing_paper":"/paper/1907.05337"},"observation_digest":"sha256:8e631204f7bdd1260bc133483609a034b193185b21d2410deff94c49e4d21e0c","observation_id":"2d39334c-f8b3-4a0e-befd-0d94e98cd608","resolution":{"observed_at":"2026-05-25T01:00:10.314975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"V oxceleb2: Deep speaker recognition","venue":null,"work_id":"2311092d-c240-4ca0-ae5a-2e3b22c38340","year":2018},"citing_paper":{"arxiv_id":"1907.05337","last_updated":"2019-07-09T00:23:22Z","snapshot_observed_at":"2026-08-02T04:08:05.825191Z","submitted_at":"2019-07-09T00:23:22Z","title":"Joint Speech Recognition and Speaker Diarization via Sequence Transduction","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-25T00:59:00.525481Z"},"links":{"citing_paper":"/paper/1907.05337"},"observation_digest":"sha256:c81f5149faa98c21c04858e7f769423b72521c2ae243d822ed78293d50d15b3e","observation_id":"7f4a7fb6-5a2c-4945-8ac6-00b760f5b051","resolution":{"observed_at":"2026-05-25T01:00:10.318901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"1907.05337","last_updated":"2019-07-09T00:23:22Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-02T04:08:05.825191Z","submitted_at":"2019-07-09T00:23:22Z","title":"Joint Speech Recognition and Speaker Diarization via Sequence Transduction"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":3,"verified_fuzzy":31},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 4 inbound Pith citation observations for arXiv:1907.05337."}