{"as_of":"2026-08-06T13:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ad492b3603fae12f4166e2cce247a36aec3f05c989cd2890d0cbdd8682118d21","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T12:04:50.483329Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T18:27:10.422343Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.10368","last_updated":"2026-06-09T03:27:30Z","snapshot_observed_at":"2026-07-06T23:49:37.345711Z","submitted_at":"2026-06-09T03:27:30Z","title":"Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation","version":1},"cited_work":{"arxiv_id":"2606.10368","doi":"10.48550/arxiv.2606.10368","metadata_source":"pith","pith_arxiv_id":"2606.10368","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation","venue":"cs.SD","work_id":"ab3fb142-8d07-4806-9cca-3c27ac8ac1ae","year":2026},"citing_paper":{"arxiv_id":"2606.08810","last_updated":"2026-06-15T19:27:43Z","snapshot_observed_at":"2026-08-02T08:52:28.875995Z","submitted_at":"2026-06-07T20:00:33Z","title":"Continuous Language Diffusion as a Decoder-Interface Problem","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-27T18:27:10.422343Z"},"links":{"cited_paper":"/paper/2606.10368","citing_paper":"/paper/2606.08810"},"observation_digest":"sha256:5faa7b689916bc248a35abb0fc264f2d643808eb54da2b08f498c8a000699094","observation_id":"73d7854d-9053-48c5-b156-189c349dc451","resolution":{"observed_at":"2026-07-02T23:07:27.066481Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.10368","last_updated":"2026-06-09T03:27:30Z","snapshot_observed_at":"2026-07-06T23:49:37.345711Z","submitted_at":"2026-06-09T03:27:30Z","title":"Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation","version":1},"cited_work":{"arxiv_id":"2606.10368","doi":"10.48550/arxiv.2606.10368","metadata_source":"pith","pith_arxiv_id":"2606.10368","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation","venue":"cs.SD","work_id":"ab3fb142-8d07-4806-9cca-3c27ac8ac1ae","year":2026},"citing_paper":{"arxiv_id":"2606.08810","last_updated":"2026-06-15T19:27:43Z","snapshot_observed_at":"2026-08-02T08:52:28.875995Z","submitted_at":"2026-06-07T20:00:33Z","title":"Continuous Language Diffusion as a Decoder-Interface Problem","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-27T18:27:10.422343Z"},"links":{"cited_paper":"/paper/2606.10368","citing_paper":"/paper/2606.08810"},"observation_digest":"sha256:9b0449c342edc232480b8415526322ea9fd5c42a136ae4dd94d2ea6585c7120d","observation_id":"a0bf6bc0-a788-498d-b7c4-1a2d3b5df3f1","resolution":{"observed_at":"2026-06-27T18:31:07.845388Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2606.10368/citation-record","integrity":"/paper/2606.10368/integrity","json":"/paper/2606.10368/citation-record.json","paper":"/paper/2606.10368"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T12:04:50.483329Z","title":"D.; Ho, J.; Tarlow, D.; and van den Berg, R","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.10368","last_updated":"2026-06-09T03:27:30Z","snapshot_observed_at":"2026-07-06T23:49:37.345711Z","submitted_at":"2026-06-09T03:27:30Z","title":"Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-06-27T12:04:50.483329Z"},"links":{"citing_paper":"/paper/2606.10368"},"observation_digest":"sha256:84941c4b830a2f09e7dec86607b689e9edf4ff088131ece31e212a1d36276ad1","observation_id":"eed0431e-a90f-4f89-942b-d2be5ab38cdc","resolution":{"observed_at":"2026-06-27T12:04:50.483329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07677","last_updated":"2022-10-14T10:01:43Z","snapshot_observed_at":"2026-07-06T14:05:13.880250Z","submitted_at":"2022-10-14T10:01:43Z","title":"TransFusion: Transcribing Speech with Multinomial Diffusion","version":1},"cited_work":{"arxiv_id":"2210.07677","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2210.07677","snapshot_observed_at":"2026-07-03T07:27:44.918243Z","title":null,"venue":null,"work_id":"5aa4c680-494b-483a-a3ca-95fe881e4c8f","year":2022},"citing_paper":{"arxiv_id":"2606.10368","last_updated":"2026-06-09T03:27:30Z","snapshot_observed_at":"2026-07-06T23:49:37.345711Z","submitted_at":"2026-06-09T03:27:30Z","title":"Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-27T12:04:50.483329Z"},"links":{"cited_paper":"/paper/2210.07677","citing_paper":"/paper/2606.10368"},"observation_digest":"sha256:f6729b1dc99b3bc835ad7cd74f582d19f0860f37f6e308c58223d89a809fc418","observation_id":"6f78013a-d651-4cec-8e2f-400764c23311","resolution":{"observed_at":"2026-07-03T07:27:44.919728Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.11795","last_updated":"2023-07-21T08:39:15Z","snapshot_observed_at":"2026-07-06T15:57:04.900537Z","submitted_at":"2023-07-21T08:39:15Z","title":"Prompting Large Language Models with Speech Recognition Abilities","version":1},"cited_work":{"arxiv_id":"2307.11795","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.11795","snapshot_observed_at":"2026-07-03T07:27:44.926350Z","title":"arXiv preprint arXiv:2307.11795 , year=","venue":null,"work_id":"e008b9a4-101a-436f-a6ae-e8d400851cd6","year":2023},"citing_paper":{"arxiv_id":"2606.10368","last_updated":"2026-06-09T03:27:30Z","snapshot_observed_at":"2026-07-06T23:49:37.345711Z","submitted_at":"2026-06-09T03:27:30Z","title":"Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-27T12:04:50.483329Z"},"links":{"cited_paper":"/paper/2307.11795","citing_paper":"/paper/2606.10368"},"observation_digest":"sha256:72be0b72315b30c676b8a780301849961fd999032c3cf555802144e5195c3533","observation_id":"557aa51b-f847-4547-ab6e-a4b8b4f70542","resolution":{"observed_at":"2026-07-03T07:27:44.927640Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.06548","last_updated":"2026-05-07T16:44:56Z","snapshot_observed_at":"2026-08-04T07:00:09.042412Z","submitted_at":"2026-05-07T16:44:56Z","title":"Continuous Latent Diffusion Language Model","version":1},"cited_work":{"arxiv_id":"2605.06548","doi":"10.48550/arxiv.2605.06548","metadata_source":"pith","pith_arxiv_id":"2605.06548","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Continuous Latent Diffusion Language Model","venue":"cs.CL","work_id":"5f19a694-f3ea-4efa-bf6e-ac012b4c2e27","year":2026},"citing_paper":{"arxiv_id":"2606.10368","last_updated":"2026-06-09T03:27:30Z","snapshot_observed_at":"2026-07-06T23:49:37.345711Z","submitted_at":"2026-06-09T03:27:30Z","title":"Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-27T12:04:50.483329Z"},"links":{"cited_paper":"/paper/2605.06548","citing_paper":"/paper/2606.10368"},"observation_digest":"sha256:1a5a8da2864c0eb0f8fceac33b8c696765a015f91e7df1ff4116b69d1fcda0b9","observation_id":"9a660ae8-f036-47e5-b791-8b64ca1e19f4","resolution":{"observed_at":"2026-07-03T07:27:44.965510Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":"2207.12598","doi":"10.1109/cvpr52733.2024.02494","metadata_source":"pith","pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Classifier-Free Diffusion Guidance","venue":"cs.LG","work_id":"acf2c588-c088-4a6c-938e-150ad7c666d7","year":2022},"citing_paper":{"arxiv_id":"2606.10368","last_updated":"2026-06-09T03:27:30Z","snapshot_observed_at":"2026-07-06T23:49:37.345711Z","submitted_at":"2026-06-09T03:27:30Z","title":"Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-27T12:04:50.483329Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2606.10368"},"observation_digest":"sha256:6cfbfc74af9574b113131e95f758b537959012d4fb3ed59fb65b93f4c7d38f6b","observation_id":"4ae65cdf-290b-4a4e-86c9-ab96894a1099","resolution":{"observed_at":"2026-07-03T07:27:44.967712Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.10938","last_updated":"2026-06-26T03:16:31Z","snapshot_observed_at":"2026-07-06T23:22:52.369277Z","submitted_at":"2026-05-11T17:59:29Z","title":"ELF: Embedded Language Flows","version":2},"cited_work":{"arxiv_id":"2605.10938","doi":"10.48550/arxiv.2605.10938","metadata_source":"pith","pith_arxiv_id":"2605.10938","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"ELF: Embedded Language Flows","venue":"cs.CL","work_id":"ac23aed7-56a6-4484-a213-8450a834a983","year":2026},"citing_paper":{"arxiv_id":"2606.10368","last_updated":"2026-06-09T03:27:30Z","snapshot_observed_at":"2026-07-06T23:49:37.345711Z","submitted_at":"2026-06-09T03:27:30Z","title":"Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-27T12:04:50.483329Z"},"links":{"cited_paper":"/paper/2605.10938","citing_paper":"/paper/2606.10368"},"observation_digest":"sha256:84c2f245013586b605214cfce2eea2599f2362db8362c8963a94e1d8565ff92a","observation_id":"eb47829e-7c1e-4950-a247-1b97655aebfe","resolution":{"observed_at":"2026-07-03T07:27:44.960405Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07048","last_updated":"2026-06-09T07:22:42Z","snapshot_observed_at":"2026-08-05T22:23:25.931700Z","submitted_at":"2025-08-09T17:20:54Z","title":"Whisfusion: Parallel ASR Decoding with Masked Diffusion","version":2},"cited_work":{"arxiv_id":"2508.07048","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.07048","snapshot_observed_at":"2026-07-03T07:27:44.956979Z","title":"Whisfusion: Paral- lel ASR Decoding via a Diffusion Transformer","venue":"cs.SD","work_id":"5788151b-96f6-48ff-a72a-6c19b3c634c9","year":2025},"citing_paper":{"arxiv_id":"2606.10368","last_updated":"2026-06-09T03:27:30Z","snapshot_observed_at":"2026-07-06T23:49:37.345711Z","submitted_at":"2026-06-09T03:27:30Z","title":"Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-27T12:04:50.483329Z"},"links":{"cited_paper":"/paper/2508.07048","citing_paper":"/paper/2606.10368"},"observation_digest":"sha256:11c5d5c030090bbd4fbb199c47671244abcb6c1861548ec5b7d16c8de45406ce","observation_id":"9343785d-3109-4dab-94d9-14735fc82308","resolution":{"observed_at":"2026-07-03T07:27:44.958180Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12787","last_updated":"2024-10-16T17:59:02Z","snapshot_observed_at":"2026-07-06T19:34:46.714277Z","submitted_at":"2024-10-16T17:59:02Z","title":"The Curse of Multi-Modalities: Evaluating Hallucinations of Large Multimodal Models across Language, Visual, and Audio","version":1},"cited_work":{"arxiv_id":"2410.12787","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.12787","snapshot_observed_at":"2026-07-04T19:20:06.441655Z","title":"The curse of multi-modalities: Evaluating hallucinations of large multimodal models across language, visual, and audio","venue":null,"work_id":"6d0e2ec6-1001-4f21-aa0f-536eda860043","year":2024},"citing_paper":{"arxiv_id":"2606.10368","last_updated":"2026-06-09T03:27:30Z","snapshot_observed_at":"2026-07-06T23:49:37.345711Z","submitted_at":"2026-06-09T03:27:30Z","title":"Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-27T12:04:50.483329Z"},"links":{"cited_paper":"/paper/2410.12787","citing_paper":"/paper/2606.10368"},"observation_digest":"sha256:4617f2e4ed9be555e5f9b1c79e683be4d81dceb6cd84eba5daf64e97cc33ff85","observation_id":"af26b459-ad70-4ae0-926e-665a5b91c5a1","resolution":{"observed_at":"2026-07-03T07:27:44.948394Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":"2210.02747","doi":"10.1038/s41467-024-47656-z","metadata_source":"pith","pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flow Matching for Generative Modeling","venue":"cs.LG","work_id":"6edb71c4-5d64-40af-a394-9757ea051a36","year":2022},"citing_paper":{"arxiv_id":"2606.10368","last_updated":"2026-06-09T03:27:30Z","snapshot_observed_at":"2026-07-06T23:49:37.345711Z","submitted_at":"2026-06-09T03:27:30Z","title":"Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-27T12:04:50.483329Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2606.10368"},"observation_digest":"sha256:9de66d02790b89011e7d838255dc27ebcd7cc8f44c44e66ec4b09c17fe788dc4","observation_id":"e0c3d23d-ec70-4054-8a10-e679534f9dbc","resolution":{"observed_at":"2026-07-03T07:27:44.955627Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"crossref_status_cache"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T12:04:50.483329Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10368","last_updated":"2026-06-09T03:27:30Z","snapshot_observed_at":"2026-07-06T23:49:37.345711Z","submitted_at":"2026-06-09T03:27:30Z","title":"Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-27T12:04:50.483329Z"},"links":{"citing_paper":"/paper/2606.10368"},"observation_digest":"sha256:29980bf18399efcb5a84d66750a1189b2553ef07db37ef430324851ed545bf8c","observation_id":"7646612b-42a2-47cf-a2d8-61476aca2dbe","resolution":{"observed_at":"2026-06-27T12:04:50.483329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08846","last_updated":"2024-02-13T23:25:04Z","snapshot_observed_at":"2026-08-06T09:11:01.697195Z","submitted_at":"2024-02-13T23:25:04Z","title":"An Embarrassingly Simple Approach for LLM with Strong ASR Capacity","version":1},"cited_work":{"arxiv_id":"2402.08846","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.08846","snapshot_observed_at":"2026-07-10T20:37:34.440026Z","title":"An embarrassingly simple approach for LLM with strong ASR capacity","venue":"cs.CL","work_id":"d0cf5313-bc88-4f8f-9a2c-9012a25a93dd","year":2024},"citing_paper":{"arxiv_id":"2606.10368","last_updated":"2026-06-09T03:27:30Z","snapshot_observed_at":"2026-07-06T23:49:37.345711Z","submitted_at":"2026-06-09T03:27:30Z","title":"Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-27T12:04:50.483329Z"},"links":{"cited_paper":"/paper/2402.08846","citing_paper":"/paper/2606.10368"},"observation_digest":"sha256:c26234bf1d8fa4a4bf343d2a4e848016ec9bf89fb53bd38212aad4ddfb13cd3e","observation_id":"ea183f7d-918b-4e36-970f-7b983777c7f2","resolution":{"observed_at":"2026-07-03T07:27:44.951000Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T12:04:50.483329Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10368","last_updated":"2026-06-09T03:27:30Z","snapshot_observed_at":"2026-07-06T23:49:37.345711Z","submitted_at":"2026-06-09T03:27:30Z","title":"Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-27T12:04:50.483329Z"},"links":{"citing_paper":"/paper/2606.10368"},"observation_digest":"sha256:11e8daad97ee53d98b7f4bf8482e0e1619dabc45c87e85ac6532054ac3adbb24","observation_id":"8ca6e48f-af70-47fe-bfd7-a6de0398ca18","resolution":{"observed_at":"2026-06-27T12:04:50.483329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T12:04:50.483329Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.10368","last_updated":"2026-06-09T03:27:30Z","snapshot_observed_at":"2026-07-06T23:49:37.345711Z","submitted_at":"2026-06-09T03:27:30Z","title":"Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-27T12:04:50.483329Z"},"links":{"citing_paper":"/paper/2606.10368"},"observation_digest":"sha256:e3dfcbc280621c8a6758de21d039c31044dafe4c8a14f63af0d421a8ab77bab0","observation_id":"8501cc49-74c5-4f43-8816-9fb3b662bbdb","resolution":{"observed_at":"2026-06-27T12:04:50.483329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":"2212.04356","doi":"10.48550/arxiv.2212.04356","metadata_source":"pith","pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","venue":"eess.AS","work_id":"ed5fbefe-24bf-436f-98c1-68e9114360bf","year":2022},"citing_paper":{"arxiv_id":"2606.10368","last_updated":"2026-06-09T03:27:30Z","snapshot_observed_at":"2026-07-06T23:49:37.345711Z","submitted_at":"2026-06-09T03:27:30Z","title":"Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-27T12:04:50.483329Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2606.10368"},"observation_digest":"sha256:8ae05c6ebfa976ca13953d97510af878f0e7b6a114dc3a93e6b32d44f452bb1e","observation_id":"244afa04-8b7b-4edb-afc3-c30304b88345","resolution":{"observed_at":"2026-07-03T07:27:44.943022Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-03T20:38:04.271886+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T20:38:04.271886+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.10683","last_updated":"2023-09-19T15:14:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-23T17:37:36Z","title":"Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer","version":4},"cited_work":{"arxiv_id":"1910.10683","doi":"10.18653/v1/2020.acl-main.259","metadata_source":"pith","pith_arxiv_id":"1910.10683","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer","venue":"cs.LG","work_id":"50e3b368-0243-4726-8186-233869802ad1","year":2019},"citing_paper":{"arxiv_id":"2606.10368","last_updated":"2026-06-09T03:27:30Z","snapshot_observed_at":"2026-07-06T23:49:37.345711Z","submitted_at":"2026-06-09T03:27:30Z","title":"Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-27T12:04:50.483329Z"},"links":{"cited_paper":"/paper/1910.10683","citing_paper":"/paper/2606.10368"},"observation_digest":"sha256:1fa8a077f2c51a35f62f2d80889199d9574cc1569eaf4b7838e03842d87a8731","observation_id":"436fa945-165d-42df-8e00-c1dbdc6cefc3","resolution":{"observed_at":"2026-07-03T07:27:44.932389Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T12:04:50.483329Z","title":"S.; Arriola, M.; Schiff, Y.; Gokaslan, A.; Marroquin, E.; Chiu, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10368","last_updated":"2026-06-09T03:27:30Z","snapshot_observed_at":"2026-07-06T23:49:37.345711Z","submitted_at":"2026-06-09T03:27:30Z","title":"Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-27T12:04:50.483329Z"},"links":{"citing_paper":"/paper/2606.10368"},"observation_digest":"sha256:5a5b3a0839cb9874626032885c709fdf685cdab0e6b7b7b82602666925e963e9","observation_id":"b1952000-53c2-4d73-a9c5-e08f287f3a68","resolution":{"observed_at":"2026-06-27T12:04:50.483329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.11596","last_updated":"2023-10-25T03:52:07Z","snapshot_observed_at":"2026-07-06T16:09:09.018523Z","submitted_at":"2023-08-22T17:44:18Z","title":"SeamlessM4T: Massively Multilingual & Multimodal Machine Translation","version":3},"cited_work":{"arxiv_id":"2308.11596","doi":"10.48550/arxiv.2308.11596","metadata_source":"arxiv_reference","pith_arxiv_id":"2308.11596","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"C.; Dale, D.; Dong, N.; Duquenne, P.-A.; Elsahar, H.; Gong, H.; Heffernan, K.; Hoffman, J.; et al","venue":"arXiv (Cornell University)","work_id":"9b58185d-8084-4802-9271-58d052a5af84","year":2023},"citing_paper":{"arxiv_id":"2606.10368","last_updated":"2026-06-09T03:27:30Z","snapshot_observed_at":"2026-07-06T23:49:37.345711Z","submitted_at":"2026-06-09T03:27:30Z","title":"Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-27T12:04:50.483329Z"},"links":{"cited_paper":"/paper/2308.11596","citing_paper":"/paper/2606.10368"},"observation_digest":"sha256:e49078c4a536881ab64459695035e8e15ca09ea0cde746f2c8bb75ec765aa98b","observation_id":"46bb7418-2aad-4f87-bfb2-c54f06791340","resolution":{"observed_at":"2026-07-03T07:27:44.963055Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T12:04:50.483329Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10368","last_updated":"2026-06-09T03:27:30Z","snapshot_observed_at":"2026-07-06T23:49:37.345711Z","submitted_at":"2026-06-09T03:27:30Z","title":"Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-27T12:04:50.483329Z"},"links":{"citing_paper":"/paper/2606.10368"},"observation_digest":"sha256:6a1ae448bd0d209651fbe6917dae2aa66b4e7a2e3d90e3c9e1bbc74637fbcfcb","observation_id":"e39b7bde-9dcd-4893-ae80-8826df64c100","resolution":{"observed_at":"2026-06-27T12:04:50.483329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.10310","last_updated":"2020-10-24T06:07:01Z","snapshot_observed_at":"2026-08-01T17:44:35.425095Z","submitted_at":"2020-07-20T17:53:35Z","title":"CoVoST 2 and Massively Multilingual Speech-to-Text Translation","version":3},"cited_work":{"arxiv_id":"2007.10310","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2007.10310","snapshot_observed_at":"2026-07-04T20:30:07.211214Z","title":"Covost 2 and massively multilingual speech-to-text translation","venue":null,"work_id":"6c9bffaf-0bd1-4fa9-ac70-56e01e042f08","year":2007},"citing_paper":{"arxiv_id":"2606.10368","last_updated":"2026-06-09T03:27:30Z","snapshot_observed_at":"2026-07-06T23:49:37.345711Z","submitted_at":"2026-06-09T03:27:30Z","title":"Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-27T12:04:50.483329Z"},"links":{"cited_paper":"/paper/2007.10310","citing_paper":"/paper/2606.10368"},"observation_digest":"sha256:d526f039e6b45aa8ce58d7bc5fa6189c73493312ac44f2899c68874dd2aaa203","observation_id":"0fe00fc5-ce71-417a-ac73-62988a0f86e5","resolution":{"observed_at":"2026-07-03T07:27:44.945646Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-06T09:02:37.213294Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"cited_work":{"arxiv_id":"2508.17863","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.17863","snapshot_observed_at":"2026-07-03T07:27:44.920929Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spo- ken Language Understanding in SpeechLLMs","venue":null,"work_id":"955ccaa6-1a25-4412-b5ca-1a601446917d","year":2025},"citing_paper":{"arxiv_id":"2606.10368","last_updated":"2026-06-09T03:27:30Z","snapshot_observed_at":"2026-07-06T23:49:37.345711Z","submitted_at":"2026-06-09T03:27:30Z","title":"Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-27T12:04:50.483329Z"},"links":{"cited_paper":"/paper/2508.17863","citing_paper":"/paper/2606.10368"},"observation_digest":"sha256:9632f76f43dd793ef969a6cd14e99df2d06f8840ff7ff6f7bd9c24a76c0fa675","observation_id":"3667a07c-94e2-4be2-8936-8432bcc774f9","resolution":{"observed_at":"2026-07-03T07:27:44.922554Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10552","last_updated":"2025-08-14T11:44:52Z","snapshot_observed_at":"2026-08-05T20:24:54.460180Z","submitted_at":"2025-08-14T11:44:52Z","title":"When Language Overrules: Revealing Text Dominance in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2508.10552","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10552","snapshot_observed_at":"2026-07-04T11:59:50.274843Z","title":"When language overrules: Modality imbalance in vlms","venue":null,"work_id":"beb44eef-1d39-40a7-98b3-80a16cfe93bb","year":2025},"citing_paper":{"arxiv_id":"2606.10368","last_updated":"2026-06-09T03:27:30Z","snapshot_observed_at":"2026-07-06T23:49:37.345711Z","submitted_at":"2026-06-09T03:27:30Z","title":"Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-27T12:04:50.483329Z"},"links":{"cited_paper":"/paper/2508.10552","citing_paper":"/paper/2606.10368"},"observation_digest":"sha256:a4a5a7584e56e1672a7c5679c98816e8a63efaee940d3dbffabc89ddaa8a76b9","observation_id":"0557267d-94f2-42bf-8900-6dedf3e3b4ab","resolution":{"observed_at":"2026-07-03T07:27:44.940714Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":"2503.20215","doi":"10.48550/arxiv.2503.20215","metadata_source":"pith","pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-Omni Technical Report","venue":"cs.CL","work_id":"438f105c-fa9b-44aa-ad52-43acb8045cda","year":2025},"citing_paper":{"arxiv_id":"2606.10368","last_updated":"2026-06-09T03:27:30Z","snapshot_observed_at":"2026-07-06T23:49:37.345711Z","submitted_at":"2026-06-09T03:27:30Z","title":"Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-27T12:04:50.483329Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2606.10368"},"observation_digest":"sha256:ba9ea2e1eb76be68f13a9eb0b1248caf2e339ebfd02b102f61bf2c5f783541c3","observation_id":"2d5430d1-1a77-47c6-b1ea-3a32dd9c1dc1","resolution":{"observed_at":"2026-07-03T07:27:44.935145Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:44.887499+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:44.887499+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.17765","last_updated":"2025-09-22T13:26:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-22T13:26:24Z","title":"Qwen3-Omni Technical Report","version":1},"cited_work":{"arxiv_id":"2509.17765","doi":"10.48550/arxiv.2509.17765","metadata_source":"pith","pith_arxiv_id":"2509.17765","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-Omni Technical Report","venue":"cs.CL","work_id":"ae43e594-8bab-4471-b6af-92a300f6a048","year":2025},"citing_paper":{"arxiv_id":"2606.10368","last_updated":"2026-06-09T03:27:30Z","snapshot_observed_at":"2026-07-06T23:49:37.345711Z","submitted_at":"2026-06-09T03:27:30Z","title":"Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-27T12:04:50.483329Z"},"links":{"cited_paper":"/paper/2509.17765","citing_paper":"/paper/2606.10368"},"observation_digest":"sha256:1a10ec9a00746a7d798dd125d6f74534d7d960873e75cdac892eb007f0836f71","observation_id":"78d114cd-c851-4025-8393-fc58bbcc7d7a","resolution":{"observed_at":"2026-07-03T07:27:44.929821Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00800","last_updated":"2024-09-01T18:29:45Z","snapshot_observed_at":"2026-07-06T19:08:57.415038Z","submitted_at":"2024-09-01T18:29:45Z","title":"Comparing Discrete and Continuous Space LLMs for Speech Recognition","version":1},"cited_work":{"arxiv_id":"2409.00800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.00800","snapshot_observed_at":"2026-07-03T07:27:44.923721Z","title":null,"venue":null,"work_id":"aca74839-5be6-47e9-ab15-33a54474415f","year":2024},"citing_paper":{"arxiv_id":"2606.10368","last_updated":"2026-06-09T03:27:30Z","snapshot_observed_at":"2026-07-06T23:49:37.345711Z","submitted_at":"2026-06-09T03:27:30Z","title":"Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-06-27T12:04:50.483329Z"},"links":{"cited_paper":"/paper/2409.00800","citing_paper":"/paper/2606.10368"},"observation_digest":"sha256:03dbc2b8a4afcb684656d401f3df28b2d4efe350b6ea46eafff6f6688c5dcef0","observation_id":"34d1e018-43e1-48ea-a0a7-07fd4f3b0c90","resolution":{"observed_at":"2026-07-03T07:27:44.925129Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.13963","last_updated":"2023-09-26T11:09:25Z","snapshot_observed_at":"2026-07-06T16:23:10.371062Z","submitted_at":"2023-09-25T08:57:07Z","title":"Connecting Speech Encoder and Large Language Model for ASR","version":2},"cited_work":{"arxiv_id":"2309.13963","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.13963","snapshot_observed_at":"2026-07-03T07:27:44.952065Z","title":"arXiv preprint arXiv:2309.13963 , year=","venue":null,"work_id":"f43d4d9c-6510-4e8d-a0bd-ecb2c555153b","year":2023},"citing_paper":{"arxiv_id":"2606.10368","last_updated":"2026-06-09T03:27:30Z","snapshot_observed_at":"2026-07-06T23:49:37.345711Z","submitted_at":"2026-06-09T03:27:30Z","title":"Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-27T12:04:50.483329Z"},"links":{"cited_paper":"/paper/2309.13963","citing_paper":"/paper/2606.10368"},"observation_digest":"sha256:e24b7b5df33e8951896f1d4e80b29fbfbfaf1f92c68eff7f5927cd1b4968e3a7","observation_id":"ce16f5cc-2fe7-4e71-9cd8-be813efbbd8a","resolution":{"observed_at":"2026-07-03T07:27:44.953338Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.10368","last_updated":"2026-06-09T03:27:30Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-07-06T23:49:37.345711Z","submitted_at":"2026-06-09T03:27:30Z","title":"Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":6,"verified_exact":18,"verified_fuzzy":0},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 2 inbound Pith citation observations for arXiv:2606.10368."}