{"as_of":"2026-08-06T06:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2bdcb295af31d78b1414e1455f892d35d826ef8da25bffad48cad59f54ce94d1","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T12:49:51.849785Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T12:07:39.817307Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T23:19:03.363492Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2601.01554","last_updated":"2026-07-17T03:41:37Z","snapshot_observed_at":"2026-08-03T16:43:04.399919Z","submitted_at":"2026-01-04T15:01:10Z","title":"MOSS Transcribe Diarize Technical Report","version":7},"cited_work":{"arxiv_id":"2601.01554","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2601.01554","snapshot_observed_at":"2026-07-09T02:19:49.762568Z","title":"MOSS transcribe diarize: Accurate transcription with speaker diarization,","venue":null,"work_id":"426f7c74-e265-445b-8cf0-8327df63663f","year":2026},"citing_paper":{"arxiv_id":"2604.22467","last_updated":"2026-04-24T11:43:25Z","snapshot_observed_at":"2026-07-31T06:13:14.722604Z","submitted_at":"2026-04-24T11:43:25Z","title":"DM-ASR: Diarization-aware Multi-speaker ASR with Large Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-08T09:18:53.285951Z"},"links":{"cited_paper":"/paper/2601.01554","citing_paper":"/paper/2604.22467"},"observation_digest":"sha256:f78da7ef7e3ba67bc243a6badb7170543b2e76ad48abff340982124a51cf4b07","observation_id":"c16340d9-16ca-4317-88b6-b50f734ed571","resolution":{"observed_at":"2026-07-09T02:19:49.762568Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.01554","last_updated":"2026-07-17T03:41:37Z","snapshot_observed_at":"2026-08-03T16:43:04.399919Z","submitted_at":"2026-01-04T15:01:10Z","title":"MOSS Transcribe Diarize Technical Report","version":7},"cited_work":{"arxiv_id":"2601.01554","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2601.01554","snapshot_observed_at":"2026-07-09T02:19:49.762568Z","title":"MOSS transcribe diarize: Accurate transcription with speaker diarization,","venue":null,"work_id":"426f7c74-e265-445b-8cf0-8327df63663f","year":2026},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-08-06T05:21:57.539739Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"cited_paper":"/paper/2601.01554","citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:5f54a26229428e868af1a7eb4a446105524485036ddb36a36a82102b661f6374","observation_id":"c031f99c-4eee-4423-9a11-79cc20a86d16","resolution":{"observed_at":"2026-07-09T02:19:49.762568Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.01554","last_updated":"2026-07-17T03:41:37Z","snapshot_observed_at":"2026-08-03T16:43:04.399919Z","submitted_at":"2026-01-04T15:01:10Z","title":"MOSS Transcribe Diarize Technical Report","version":7},"cited_work":{"arxiv_id":"2601.01554","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2601.01554","snapshot_observed_at":"2026-07-09T02:19:49.762568Z","title":"MOSS transcribe diarize: Accurate transcription with speaker diarization,","venue":null,"work_id":"426f7c74-e265-445b-8cf0-8327df63663f","year":2026},"citing_paper":{"arxiv_id":"2606.13095","last_updated":"2026-06-11T09:25:14Z","snapshot_observed_at":"2026-08-03T16:38:10.837573Z","submitted_at":"2026-06-11T09:25:14Z","title":"Balancing ASR and diarization in end-to-end LLMs for multi-talker speech recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T06:04:34.129424Z"},"links":{"cited_paper":"/paper/2601.01554","citing_paper":"/paper/2606.13095"},"observation_digest":"sha256:32b5bfab33df2a43e23f92fc13607598b0d933cd444e6512602522ca92e192bf","observation_id":"83791a05-7fb8-4424-8bbf-857493c59606","resolution":{"observed_at":"2026-07-09T02:19:49.762568Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.01554","last_updated":"2026-07-17T03:41:37Z","snapshot_observed_at":"2026-08-03T16:43:04.399919Z","submitted_at":"2026-01-04T15:01:10Z","title":"MOSS Transcribe Diarize Technical Report","version":7},"cited_work":{"arxiv_id":"2601.01554","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2601.01554","snapshot_observed_at":"2026-07-09T02:19:49.762568Z","title":"MOSS transcribe diarize: Accurate transcription with speaker diarization,","venue":null,"work_id":"426f7c74-e265-445b-8cf0-8327df63663f","year":2026},"citing_paper":{"arxiv_id":"2606.18134","last_updated":"2026-06-16T16:34:35Z","snapshot_observed_at":"2026-08-04T12:43:30.343741Z","submitted_at":"2026-06-16T16:34:35Z","title":"Grounding Spoken LLMs in Multi-Speaker Audio via Diarization Conditioning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T22:39:09.967750Z"},"links":{"cited_paper":"/paper/2601.01554","citing_paper":"/paper/2606.18134"},"observation_digest":"sha256:9233145c31417aa1209f470a742bdabbe5d04a00973943b49c109bbe0cee92e7","observation_id":"3a7f2bc8-d5bd-4b2c-8836-e560af80486b","resolution":{"observed_at":"2026-07-09T02:19:49.762568Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.01554","last_updated":"2026-07-17T03:41:37Z","snapshot_observed_at":"2026-08-03T16:43:04.399919Z","submitted_at":"2026-01-04T15:01:10Z","title":"MOSS Transcribe Diarize Technical Report","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.01554","snapshot_observed_at":"2026-07-14T12:07:39.817307Z","title":"Moss transcribe diarize technical report,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10387","last_updated":"2026-07-11T16:34:25Z","snapshot_observed_at":"2026-08-04T21:35:45.262625Z","submitted_at":"2026-07-11T16:34:25Z","title":"GigaChat Audio: Time-aware Large Audio Language Model","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-14T12:07:39.817307Z"},"links":{"cited_paper":"/paper/2601.01554","citing_paper":"/paper/2607.10387"},"observation_digest":"sha256:a10bc158929a9eabddd17afbcb994b41408c90bdbe92a54bd6e64ead2872be98","observation_id":"956adcb4-f2cb-4e1f-991c-50c6418120c3","resolution":{"observed_at":"2026-07-14T12:07:39.817307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2601.01554/citation-record","integrity":"/paper/2601.01554/integrity","json":"/paper/2601.01554/citation-record.json","paper":"/paper/2601.01554"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.00747","last_updated":"2023-07-11T17:07:19Z","snapshot_observed_at":"2026-08-05T09:31:41.634301Z","submitted_at":"2023-03-01T18:59:13Z","title":"WhisperX: Time-Accurate Speech Transcription of Long-Form Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00747","snapshot_observed_at":"2026-08-03T12:49:49.594090Z","title":"Whisperx: Time-accurate speech transcription of long-form audio","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.01554","last_updated":"2026-07-17T03:41:37Z","snapshot_observed_at":"2026-08-03T16:43:04.399919Z","submitted_at":"2026-01-04T15:01:10Z","title":"MOSS Transcribe Diarize Technical Report","version":7},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T12:49:49.594090Z"},"links":{"cited_paper":"/paper/2303.00747","citing_paper":"/paper/2601.01554"},"observation_digest":"sha256:2885a9a409a17ac4fb09972dce3fa1465e4cc337a69066ecb40fe7600e1a2e37","observation_id":"42cb439c-8ddc-40a9-b932-859f225b9d11","resolution":{"observed_at":"2026-08-03T12:49:49.594090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:49:49.630792Z","title":"Pyannote.audio: neural building blocks for speaker diarization","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.01554","last_updated":"2026-07-17T03:41:37Z","snapshot_observed_at":"2026-08-03T16:43:04.399919Z","submitted_at":"2026-01-04T15:01:10Z","title":"MOSS Transcribe Diarize Technical Report","version":7},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T12:49:49.630792Z"},"links":{"citing_paper":"/paper/2601.01554"},"observation_digest":"sha256:31b9198351035f6f1d0b2619d7d96f5bf179270ee175da038b8fb70267424a21","observation_id":"067aece8-d695-45e0-ae5e-06ac08f32994","resolution":{"observed_at":"2026-08-03T12:49:49.630792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:49:49.703260Z","title":"The ami meeting corpus: A pre-announcement","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2601.01554","last_updated":"2026-07-17T03:41:37Z","snapshot_observed_at":"2026-08-03T16:43:04.399919Z","submitted_at":"2026-01-04T15:01:10Z","title":"MOSS Transcribe Diarize Technical Report","version":7},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T12:49:49.703260Z"},"links":{"citing_paper":"/paper/2601.01554"},"observation_digest":"sha256:520ea87818566915a2641f224346af0b6f6a1dfe3de5480e284f516ff720b670","observation_id":"6dea2322-2d44-4ca5-8590-bddba16ce66c","resolution":{"observed_at":"2026-08-03T12:49:49.703260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:49:49.749861Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.01554","last_updated":"2026-07-17T03:41:37Z","snapshot_observed_at":"2026-08-03T16:43:04.399919Z","submitted_at":"2026-01-04T15:01:10Z","title":"MOSS Transcribe Diarize Technical Report","version":7},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T12:49:49.749861Z"},"links":{"citing_paper":"/paper/2601.01554"},"observation_digest":"sha256:91a6519fe842fd9f547869a864309ee795fb8670a50a2e8fefc31440ffe7159e","observation_id":"0694c304-05df-4846-a266-05e98b75860c","resolution":{"observed_at":"2026-08-03T12:49:49.749861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18211","last_updated":"2024-11-27T10:45:40Z","snapshot_observed_at":"2026-07-06T19:57:51.125083Z","submitted_at":"2024-11-27T10:45:40Z","title":"TimeMarker: A Versatile Video-LLM for Long and Short Video Understanding with Superior Temporal Localization Ability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18211","snapshot_observed_at":"2026-08-03T12:49:49.871069Z","title":"Timemarker: A versatile video-llm for long and short video understanding with superior temporal localization ability","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.01554","last_updated":"2026-07-17T03:41:37Z","snapshot_observed_at":"2026-08-03T16:43:04.399919Z","submitted_at":"2026-01-04T15:01:10Z","title":"MOSS Transcribe Diarize Technical Report","version":7},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T12:49:49.871069Z"},"links":{"cited_paper":"/paper/2411.18211","citing_paper":"/paper/2601.01554"},"observation_digest":"sha256:08deca25159fe743d310f59b468ff6666798d2f313a8c7d1c3f3f5b836a80592","observation_id":"2c0f0358-b194-4b02-b27d-d509d06188f5","resolution":{"observed_at":"2026-08-03T12:49:49.871069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-03T12:49:50.056919Z","title":"Qwen-audio: Advancing universal audio understanding via unified large-scale audio-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.01554","last_updated":"2026-07-17T03:41:37Z","snapshot_observed_at":"2026-08-03T16:43:04.399919Z","submitted_at":"2026-01-04T15:01:10Z","title":"MOSS Transcribe Diarize Technical Report","version":7},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T12:49:50.056919Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2601.01554"},"observation_digest":"sha256:24eb848cdf745281db74f2b59a2988cbaf9dedb39615463b78c235afaf3a15cb","observation_id":"938d5d20-137b-438b-92bb-7c6fc392fde4","resolution":{"observed_at":"2026-08-03T12:49:50.056919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:49:50.210239Z","title":"AISHELL-4: An open source dataset for speech enhancement, separation, recognition and speaker diarization in conference scenario","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.01554","last_updated":"2026-07-17T03:41:37Z","snapshot_observed_at":"2026-08-03T16:43:04.399919Z","submitted_at":"2026-01-04T15:01:10Z","title":"MOSS Transcribe Diarize Technical Report","version":7},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T12:49:50.210239Z"},"links":{"citing_paper":"/paper/2601.01554"},"observation_digest":"sha256:471063f8ae96897e884804f354df5c5b0144d53ceb9aef9f5045fc597fe58951","observation_id":"eaf5114c-d9a4-43ef-baa9-573290076e85","resolution":{"observed_at":"2026-08-03T12:49:50.210239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:49:50.358730Z","title":"End-to-end neural speaker diarization with self-attention","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2601.01554","last_updated":"2026-07-17T03:41:37Z","snapshot_observed_at":"2026-08-03T16:43:04.399919Z","submitted_at":"2026-01-04T15:01:10Z","title":"MOSS Transcribe Diarize Technical Report","version":7},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T12:49:50.358730Z"},"links":{"citing_paper":"/paper/2601.01554"},"observation_digest":"sha256:dfbe5fc55912d1742f6a6eceb98247ffe9e216d3a19ce8fdcd580e82ad2542ed","observation_id":"2f8090ef-0180-44f1-a70c-00850c8157d8","resolution":{"observed_at":"2026-08-03T12:49:50.358730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:49:50.517796Z","title":"The icsi meeting corpus","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2601.01554","last_updated":"2026-07-17T03:41:37Z","snapshot_observed_at":"2026-08-03T16:43:04.399919Z","submitted_at":"2026-01-04T15:01:10Z","title":"MOSS Transcribe Diarize Technical Report","version":7},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T12:49:50.517796Z"},"links":{"citing_paper":"/paper/2601.01554"},"observation_digest":"sha256:07e1c5a678dfc28baf4bc02a245e9cf0e7a4327f6f63ccd28d8820afdd98027a","observation_id":"7e6fb4fc-c6ea-49ea-8cf6-e1b5c4f08327","resolution":{"observed_at":"2026-08-03T12:49:50.517796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:49:50.661043Z","title":"Serialized output training for end-to-end overlapping speech recognition","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.01554","last_updated":"2026-07-17T03:41:37Z","snapshot_observed_at":"2026-08-03T16:43:04.399919Z","submitted_at":"2026-01-04T15:01:10Z","title":"MOSS Transcribe Diarize Technical Report","version":7},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T12:49:50.661043Z"},"links":{"citing_paper":"/paper/2601.01554"},"observation_digest":"sha256:f1cc86219b10df918ebd5c6d755eafd1bbdfb20b0e429d2fe3ff9bcf958449a1","observation_id":"31092241-eebc-4311-935d-ffd325c13f13","resolution":{"observed_at":"2026-08-03T12:49:50.661043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:49:50.777521Z","title":"From simulated mixtures to simulated conversations as training data for neural diarization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.01554","last_updated":"2026-07-17T03:41:37Z","snapshot_observed_at":"2026-08-03T16:43:04.399919Z","submitted_at":"2026-01-04T15:01:10Z","title":"MOSS Transcribe Diarize Technical Report","version":7},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T12:49:50.777521Z"},"links":{"citing_paper":"/paper/2601.01554"},"observation_digest":"sha256:a73e9f0fb24f6a00859888d3e4f7010827228367ef535fec829ade1d8ff858c5","observation_id":"61fe783c-c228-4bd6-844c-6fc7fd63dca8","resolution":{"observed_at":"2026-08-03T12:49:50.777521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:49:50.884954Z","title":"Levenshtein","venue":null,"work_id":null,"year":1966},"citing_paper":{"arxiv_id":"2601.01554","last_updated":"2026-07-17T03:41:37Z","snapshot_observed_at":"2026-08-03T16:43:04.399919Z","submitted_at":"2026-01-04T15:01:10Z","title":"MOSS Transcribe Diarize Technical Report","version":7},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T12:49:50.884954Z"},"links":{"citing_paper":"/paper/2601.01554"},"observation_digest":"sha256:e3e8988274a9c18dc1ac1e721871423cc2d7529d4c3137ee5d6e618d9bf66f26","observation_id":"152a581f-4627-4d58-968b-b5c2b9a59f32","resolution":{"observed_at":"2026-08-03T12:49:50.884954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:49:51.022176Z","title":"Montreal forced aligner: A trainable text-speech alignment system","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2601.01554","last_updated":"2026-07-17T03:41:37Z","snapshot_observed_at":"2026-08-03T16:43:04.399919Z","submitted_at":"2026-01-04T15:01:10Z","title":"MOSS Transcribe Diarize Technical Report","version":7},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T12:49:51.022176Z"},"links":{"citing_paper":"/paper/2601.01554"},"observation_digest":"sha256:38fa65ac5638d426b581368fde62f23f27e9d9fa11ac03561469be23481fc2c6","observation_id":"c4ee19bc-f34d-4c68-a5a1-e7cf26ed7185","resolution":{"observed_at":"2026-08-03T12:49:51.022176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:49:51.143941Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.01554","last_updated":"2026-07-17T03:41:37Z","snapshot_observed_at":"2026-08-03T16:43:04.399919Z","submitted_at":"2026-01-04T15:01:10Z","title":"MOSS Transcribe Diarize Technical Report","version":7},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T12:49:51.143941Z"},"links":{"citing_paper":"/paper/2601.01554"},"observation_digest":"sha256:45fc35b6d574c1211e3fd992aa74af73719497b51c1fe5a93b9fd361e0e6dd23","observation_id":"394aad98-ec97-490e-b5ca-9c09da050ff6","resolution":{"observed_at":"2026-08-03T12:49:51.143941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:49:51.215298Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.01554","last_updated":"2026-07-17T03:41:37Z","snapshot_observed_at":"2026-08-03T16:43:04.399919Z","submitted_at":"2026-01-04T15:01:10Z","title":"MOSS Transcribe Diarize Technical Report","version":7},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T12:49:51.215298Z"},"links":{"citing_paper":"/paper/2601.01554"},"observation_digest":"sha256:112fbb1cc8bfdb8b7808a993601fd6f7bee63e3fdfc993299a0b2d80d2fccd47","observation_id":"23dc1063-51ed-4618-baae-cdf9f4306937","resolution":{"observed_at":"2026-08-03T12:49:51.215298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:49:51.300528Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.01554","last_updated":"2026-07-17T03:41:37Z","snapshot_observed_at":"2026-08-03T16:43:04.399919Z","submitted_at":"2026-01-04T15:01:10Z","title":"MOSS Transcribe Diarize Technical Report","version":7},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T12:49:51.300528Z"},"links":{"citing_paper":"/paper/2601.01554"},"observation_digest":"sha256:77396e83cc034f543de0458ea4170974ed65114eebe76a529ac2124499115287","observation_id":"6dfc0ed7-2352-46f4-ad63-69e67442f542","resolution":{"observed_at":"2026-08-03T12:49:51.300528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:49:51.399679Z","title":"Train short, infer long: Speech-llm enables zero- shot streamable joint asr and diarization on long audio","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.01554","last_updated":"2026-07-17T03:41:37Z","snapshot_observed_at":"2026-08-03T16:43:04.399919Z","submitted_at":"2026-01-04T15:01:10Z","title":"MOSS Transcribe Diarize Technical Report","version":7},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T12:49:51.399679Z"},"links":{"citing_paper":"/paper/2601.01554"},"observation_digest":"sha256:f1cfc30127f037b592a9924a0e1291514224f78e8fd25080b1c234f335337f0d","observation_id":"511e6b07-de34-4c5b-acce-d578aae04e1c","resolution":{"observed_at":"2026-08-03T12:49:51.399679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:49:51.494444Z","title":"X-vectors: Robust dnn embeddings for speaker recognition","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2601.01554","last_updated":"2026-07-17T03:41:37Z","snapshot_observed_at":"2026-08-03T16:43:04.399919Z","submitted_at":"2026-01-04T15:01:10Z","title":"MOSS Transcribe Diarize Technical Report","version":7},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T12:49:51.494444Z"},"links":{"citing_paper":"/paper/2601.01554"},"observation_digest":"sha256:47b6d0dc48c5bc68622836e6f5c83f1accc396ace3da99179b8dad46c428401e","observation_id":"baa9dd3c-36aa-4476-9450-3f69b1b8eb9d","resolution":{"observed_at":"2026-08-03T12:49:51.494444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13289","last_updated":"2024-04-08T06:12:52Z","snapshot_observed_at":"2026-08-02T21:51:36.809095Z","submitted_at":"2023-10-20T05:41:57Z","title":"SALMONN: Towards Generic Hearing Abilities for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13289","snapshot_observed_at":"2026-08-03T12:49:51.562851Z","title":"Salmonn: T owards generic hearing abilities for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.01554","last_updated":"2026-07-17T03:41:37Z","snapshot_observed_at":"2026-08-03T16:43:04.399919Z","submitted_at":"2026-01-04T15:01:10Z","title":"MOSS Transcribe Diarize Technical Report","version":7},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T12:49:51.562851Z"},"links":{"cited_paper":"/paper/2310.13289","citing_paper":"/paper/2601.01554"},"observation_digest":"sha256:502d085d323c961c7e3eaa92914e1d47bdccc02b2b0790f3e916169bb51fdc29","observation_id":"ef4877bf-2f9a-403b-991d-dbc37df16664","resolution":{"observed_at":"2026-08-03T12:49:51.562851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:49:51.599482Z","title":"Wang et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.01554","last_updated":"2026-07-17T03:41:37Z","snapshot_observed_at":"2026-08-03T16:43:04.399919Z","submitted_at":"2026-01-04T15:01:10Z","title":"MOSS Transcribe Diarize Technical Report","version":7},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T12:49:51.599482Z"},"links":{"citing_paper":"/paper/2601.01554"},"observation_digest":"sha256:6b3bfcaaee8892e0f08de6624611e9748c8ef76be6d1baf83d353268ce47f23c","observation_id":"b14172fb-6ba3-4c3c-b0bd-afe046228234","resolution":{"observed_at":"2026-08-03T12:49:51.599482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:49:51.739851Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.01554","last_updated":"2026-07-17T03:41:37Z","snapshot_observed_at":"2026-08-03T16:43:04.399919Z","submitted_at":"2026-01-04T15:01:10Z","title":"MOSS Transcribe Diarize Technical Report","version":7},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T12:49:51.739851Z"},"links":{"citing_paper":"/paper/2601.01554"},"observation_digest":"sha256:4bdad686d5855c03c13695e23d9fa623c13f26a1e9d5cf110ed17ec83e537bd6","observation_id":"2edd7df7-ec02-4127-8efc-b1deba10863d","resolution":{"observed_at":"2026-08-03T12:49:51.739851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:49:51.849785Z","title":"Speechgpt: Empow- ering large language models with intrinsic cross-modal conversational abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.01554","last_updated":"2026-07-17T03:41:37Z","snapshot_observed_at":"2026-08-03T16:43:04.399919Z","submitted_at":"2026-01-04T15:01:10Z","title":"MOSS Transcribe Diarize Technical Report","version":7},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T12:49:51.849785Z"},"links":{"citing_paper":"/paper/2601.01554"},"observation_digest":"sha256:61e355d8a5168baabef57378107f37ac0000f93124c2a2e67ae79dc17583c409","observation_id":"4ce3c9b1-4159-4cfb-a349-c5e50394cb19","resolution":{"observed_at":"2026-08-03T12:49:51.849785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2601.01554","last_updated":"2026-07-17T03:41:37Z","latest_version":7,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-03T16:43:04.399919Z","submitted_at":"2026-01-04T15:01:10Z","title":"MOSS Transcribe Diarize Technical Report"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 5 inbound Pith citation observations for arXiv:2601.01554."}