{"as_of":"2026-08-04T10:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3836d2b76b92e22ee3570f118e47871cd089f2e0bb9877aeaa55105dfbe10042","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":49,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T12:02:01.060858Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T20:27:36.606337Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-07-10T20:27:36.606337Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2509.08031","last_updated":"2026-05-11T14:29:23Z","snapshot_observed_at":"2026-07-06T22:27:15.482704Z","submitted_at":"2025-09-09T15:30:40Z","title":"AU-Harness: An Open-Source Toolkit for Holistic Evaluation of Audio LLMs","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:01.257126Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2509.08031"},"observation_digest":"sha256:111954e2aee907dec52247fe86f21404650e0b93b7482b219d8f33616e3cfd86","observation_id":"662da643-4ff2-4908-b0df-431df5ff5a86","resolution":{"observed_at":"2026-05-18T18:11:43.160420Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-07-10T20:27:36.606337Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2509.14804","last_updated":"2025-09-18T09:59:55Z","snapshot_observed_at":"2026-08-02T01:27:09.355801Z","submitted_at":"2025-09-18T09:59:55Z","title":"Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-18T16:27:37.596817Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2509.14804"},"observation_digest":"sha256:e03a059cc8d552ab9a1e0bad77ab89d4ceb4df0d96597c82bcc11f2bd0b23915","observation_id":"1cd5ced8-1692-4beb-8b08-f654536cbb5a","resolution":{"observed_at":"2026-05-18T16:31:37.256969Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-07-10T20:27:36.606337Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2510.00626","last_updated":"2026-04-26T15:50:39Z","snapshot_observed_at":"2026-07-06T22:31:20.110402Z","submitted_at":"2025-10-01T07:59:45Z","title":"When Silence Matters: The Impact of Irrelevant Audio on Text Reasoning in Large Audio-Language Models","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-18T11:08:08.916893Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2510.00626"},"observation_digest":"sha256:adf4f88471bc3b26c99534b034b045d8955bc019090b3444e1a83e95588192bc","observation_id":"a0e3317c-5ce5-44cf-9647-e5ce27401e88","resolution":{"observed_at":"2026-05-18T11:11:17.928697Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-07-10T20:27:36.606337Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2512.01512","last_updated":"2026-04-13T14:21:57Z","snapshot_observed_at":"2026-07-30T01:31:44.078208Z","submitted_at":"2025-12-01T10:39:12Z","title":"MCAT: Scaling Many-to-Many Speech-to-Text Translation with MLLMs to 70 Languages","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-17T03:15:04.685150Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2512.01512"},"observation_digest":"sha256:9b5aacb1195c8564b32316c87e442f7e85c25ce5d44c3aa4760c68ada94230ca","observation_id":"0f6ce27a-0879-40da-ba58-40b297daf860","resolution":{"observed_at":"2026-05-17T03:18:57.194337Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-07-10T20:27:36.606337Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2512.16378","last_updated":"2026-04-25T20:42:51Z","snapshot_observed_at":"2026-08-02T18:57:30.783881Z","submitted_at":"2025-12-18T10:21:14Z","title":"Hearing to Translate: The Effectiveness of Speech Modality Integration into LLMs","version":4},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-16T21:49:21.785096Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2512.16378"},"observation_digest":"sha256:1c7af7d33cc33ed38e3ba64a1860ea2243754b0fe6a2267cb1cc8a364552ec1a","observation_id":"aedec695-5e30-49da-8b5f-1e495ca7d192","resolution":{"observed_at":"2026-05-16T21:51:17.744592Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-08-03T12:02:01.060858Z","title":"H., Ehrenberg, A., Lo, A., Denoix, C., Barreau, C., Lample, G., Delignon, J.-M., Chandu, K","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.06199","last_updated":"2026-06-01T03:39:22Z","snapshot_observed_at":"2026-08-03T12:01:57.439695Z","submitted_at":"2026-01-08T07:46:03Z","title":"FastSLM: Hierarchical Temporal Abstraction for Efficient Long-Form Speech Adaptation","version":3},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-03T12:02:01.060858Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2601.06199"},"observation_digest":"sha256:55da1c010704394e07d9d838bfa31c8284b342a3227c8af4eb3f1930826ae62a","observation_id":"6f2c17ec-f531-4595-844d-f988b6c02138","resolution":{"observed_at":"2026-08-03T12:02:01.060858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-07-10T20:27:36.606337Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2601.09270","last_updated":"2026-04-13T14:09:14Z","snapshot_observed_at":"2026-07-31T23:52:34.110469Z","submitted_at":"2026-01-14T08:05:16Z","title":"MCGA: A Multi-task Classical Chinese Literary Genre Audio Corpus","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T14:30:46.664861Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2601.09270"},"observation_digest":"sha256:2d7180f313e4e46b6038dddf834ab0436aa30bba0097006170939e007bd3a09f","observation_id":"7fee6458-3f1a-4934-a8fb-d11077dcf17f","resolution":{"observed_at":"2026-05-16T14:31:01.948157Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-08-03T01:17:47.177241Z","title":"org/CorpusID:266933314","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.10230","last_updated":"2026-07-22T23:43:02Z","snapshot_observed_at":"2026-08-04T04:26:36.974625Z","submitted_at":"2026-02-10T19:19:52Z","title":"Encode Once, Decode Never: Reusing Audio LM Internals for Efficient Temporal Localization","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T01:17:47.177241Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2602.10230"},"observation_digest":"sha256:7f0350c106b6f62cab8a470cd1281f465c5508bae71d4c12d49c02cd3517d910","observation_id":"6f18f1dd-31ad-4a52-824c-bc3794f08c4b","resolution":{"observed_at":"2026-08-03T01:17:47.177241Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-07-10T20:27:36.606337Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2602.11298","last_updated":"2026-04-06T15:18:26Z","snapshot_observed_at":"2026-07-06T22:45:34.674215Z","submitted_at":"2026-02-11T19:17:10Z","title":"Voxtral Realtime","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-16T02:12:16.230433Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2602.11298"},"observation_digest":"sha256:5e6f8c395b85167754664868d61d85bf3c0eb580339adf419d3ccce758cd54ab","observation_id":"ead7a03c-a489-4e31-909e-3f4ffdf8286e","resolution":{"observed_at":"2026-05-16T02:17:07.534451Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-07-15T13:58:09.323985Z","title":"V oxtral,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.06193","last_updated":"2026-06-22T08:34:44Z","snapshot_observed_at":"2026-07-15T13:58:09.128155Z","submitted_at":"2026-03-06T12:04:12Z","title":"Whisper-CD: Accurate Long-Form Speech Recognition using Multi-Negative Contrastive Decoding","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-15T13:58:09.323985Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2603.06193"},"observation_digest":"sha256:37eb46ba19e797c6965c8658be8e1196fde43fd52f4cb9a4273d8fbb4bc4395f","observation_id":"30e63df0-e21b-49e6-987d-3d7423224a24","resolution":{"observed_at":"2026-07-15T13:58:09.323985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-07-10T20:27:36.606337Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2603.25551","last_updated":"2026-04-06T15:20:14Z","snapshot_observed_at":"2026-07-06T22:50:41.736941Z","submitted_at":"2026-03-26T15:23:34Z","title":"Voxtral TTS","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-15T00:38:42.441340Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2603.25551"},"observation_digest":"sha256:12360021bd00f6de0b475aba0d1fd9f37bbbfeefef2f194e1a19f256bb179d69","observation_id":"1ed46d8e-0b15-47c3-a503-5d2f63050ffb","resolution":{"observed_at":"2026-05-15T00:39:35.904186Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-07-10T20:27:36.606337Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2604.03995","last_updated":"2026-04-05T06:32:08Z","snapshot_observed_at":"2026-07-06T22:53:01.835843Z","submitted_at":"2026-04-05T06:32:08Z","title":"A Systematic Study of Cross-Modal Typographic Attacks on Audio-Visual Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-13T17:34:10.089555Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2604.03995"},"observation_digest":"sha256:0841bdfc0d15a809d7765ee797a06177be07f9286eed3d4ffcf7b8f3f2d790b3","observation_id":"5ce1c60b-9d74-46cb-a146-1d958d5f5268","resolution":{"observed_at":"2026-05-13T17:38:02.912734Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-07-10T20:27:36.606337Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2604.08003","last_updated":"2026-04-09T09:07:52Z","snapshot_observed_at":"2026-07-06T22:57:13.745326Z","submitted_at":"2026-04-09T09:07:52Z","title":"Rethinking Entropy Allocation in LLM-based ASR: Understanding the Dynamics between Speech Encoders and LLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T18:06:50.408402Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2604.08003"},"observation_digest":"sha256:13e14b16ca13b0c5c46a10b7839316073b01f61d864067794033bac28c2827cf","observation_id":"ee50c181-d1bb-48e4-8ade-7d783804a987","resolution":{"observed_at":"2026-05-11T05:30:57.273062Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-07-10T20:27:36.606337Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2604.14493","last_updated":"2026-04-19T17:58:49Z","snapshot_observed_at":"2026-07-06T23:02:13.885476Z","submitted_at":"2026-04-16T00:04:32Z","title":"Pushing the Limits of On-Device Streaming ASR: A Compact, High-Accuracy English Model for Low-Latency Inference","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T12:04:25.418910Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2604.14493"},"observation_digest":"sha256:eea0339e401b1419d3b3aa0938b87c374cea80a509c14219a97fa203daee0a10","observation_id":"80077c05-c593-4017-a3fc-d8b955e24824","resolution":{"observed_at":"2026-05-10T12:05:21.947631Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-07-12T20:09:57.922788Z","title":"V oxtral,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.14603","last_updated":"2026-06-29T06:44:20Z","snapshot_observed_at":"2026-07-12T20:09:54.804124Z","submitted_at":"2026-04-16T04:21:32Z","title":"A Synonymous Variational Perspective on the Rate-Distortion-Perception Tradeoff","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-12T20:09:57.922788Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2604.14603"},"observation_digest":"sha256:0aec20ee27a51ac84ebfa7b6ef2daef6f220dbdfd4ae9f6e3901ea75490c3428","observation_id":"90b0e157-88b6-4957-bf2c-41ebed10af62","resolution":{"observed_at":"2026-07-12T20:09:57.922788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-07-10T20:27:36.606337Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2604.14604","last_updated":"2026-04-16T04:22:11Z","snapshot_observed_at":"2026-08-01T20:57:25.785838Z","submitted_at":"2026-04-16T04:22:11Z","title":"Hijacking Large Audio-Language Models via Context-Agnostic and Imperceptible Auditory Prompt Injection","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T11:32:10.126062Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2604.14604"},"observation_digest":"sha256:afc6231c284df79965ac5398758b1b137fecad151df523d365994d8160988c8f","observation_id":"fd193cf0-bba9-4e8f-8dc3-90a2dbfc38af","resolution":{"observed_at":"2026-05-10T11:35:18.928382Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-07-10T20:27:36.606337Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2604.18105","last_updated":"2026-06-18T09:00:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T11:21:06Z","title":"NIM4-ASR: Towards Efficient, Robust, and Customizable Real-Time LLM-Based ASR","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T03:48:14.211240Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2604.18105"},"observation_digest":"sha256:75a13ff2c29a71c3465cd9d2a063d50395930fae613d7300031a068c787982d2","observation_id":"b62a8db8-b7fa-4358-8b82-bd05cd3a6147","resolution":{"observed_at":"2026-05-11T12:21:05.956205Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-07-10T20:27:36.606337Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2604.18105","last_updated":"2026-06-18T09:00:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T11:21:06Z","title":"NIM4-ASR: Towards Efficient, Robust, and Customizable Real-Time LLM-Based ASR","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-05T13:15:50.794969Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2604.18105"},"observation_digest":"sha256:acdaa837ce4e43379ea68b5beb875f13135eb783a20db0206b81758399d530b9","observation_id":"eb5755be-f0df-4074-9c12-38e2410bcec6","resolution":{"observed_at":"2026-07-05T13:21:06.288305Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-07-10T20:27:36.606337Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2604.19565","last_updated":"2026-04-21T15:18:10Z","snapshot_observed_at":"2026-08-03T00:43:32.245770Z","submitted_at":"2026-04-21T15:18:10Z","title":"Detecting Hallucinations in SpeechLLMs at Inference Time Using Attention Maps","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-10T01:56:44.270045Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2604.19565"},"observation_digest":"sha256:dffa9ec199301d5f890fec166977e5b507da7c82bfecfebacc7d6f0b3a7a92de","observation_id":"256912e3-6864-4baf-9ea3-8de8e581005e","resolution":{"observed_at":"2026-05-11T13:21:04.863844Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-07-10T20:27:36.606337Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2604.24401","last_updated":"2026-04-27T12:25:18Z","snapshot_observed_at":"2026-07-06T23:10:24.992210Z","submitted_at":"2026-04-27T12:25:18Z","title":"All That Glitters Is Not Audio: Rethinking Text Priors and Audio Reliance in Audio-Language Evaluation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-07T17:39:38.234052Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2604.24401"},"observation_digest":"sha256:4dc79cbfae945c15defbd668ae261100b6c0a5c32edc3f0dda25b5fda3b5ab49","observation_id":"4b0de199-c1d6-4d80-96d5-4d692b1707f5","resolution":{"observed_at":"2026-05-11T23:16:36.207134Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-07-10T20:27:36.606337Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2604.25591","last_updated":"2026-04-28T12:56:22Z","snapshot_observed_at":"2026-07-06T23:11:25.757664Z","submitted_at":"2026-04-28T12:56:22Z","title":"Walking Through Uncertainty: An Empirical Study of Uncertainty Estimation for Audio-Aware Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-07T14:29:18.348031Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2604.25591"},"observation_digest":"sha256:a97ef32f4d6ea4b20c194cf0e01897fc61ee1b8d762b6dcadc040bbc439a1ce7","observation_id":"cddb048c-95c5-4ca8-89b1-7f2772e7c382","resolution":{"observed_at":"2026-05-12T00:46:12.313110Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-07-10T20:27:36.606337Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2605.17370","last_updated":"2026-05-19T04:10:37Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T10:27:52Z","title":"CBT-Audio: Evaluating Audio Language Models for Patient-Side Distress Intensity Estimation in CBT Session Recordings","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-20T13:25:09.024054Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2605.17370"},"observation_digest":"sha256:100f8e7a0945aae20464f850163d9794219cc4babe730455f0423c5ba580097a","observation_id":"60e21894-abda-4684-9f83-0ce4229d7933","resolution":{"observed_at":"2026-05-20T13:28:19.127591Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-07-10T20:27:36.606337Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2605.20414","last_updated":"2026-05-25T03:05:12Z","snapshot_observed_at":"2026-07-06T23:30:58.549353Z","submitted_at":"2026-05-19T19:10:30Z","title":"PlanRAG-Audio: Planning and Retrieval Augmented Generation for Long-form Audio Understanding","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T17:56:38.345335Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2605.20414"},"observation_digest":"sha256:5db463d7002cc67fc6347491408bbb0705c58d2b30d721ae584d4e22ba24b5ed","observation_id":"d3e0dafa-6f9e-4827-918a-b1b55040a066","resolution":{"observed_at":"2026-06-30T18:04:58.390433Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-07-10T20:27:36.606337Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2606.00168","last_updated":"2026-05-29T12:40:16Z","snapshot_observed_at":"2026-08-01T01:44:25.824777Z","submitted_at":"2026-05-29T12:40:16Z","title":"RealityTest: How People Probe AI Identity and Whether Models Disclose It","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-28T22:22:43.432328Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2606.00168"},"observation_digest":"sha256:a0212480f268a504bc860fa95058508255fda047252613c54fdd8786a3397341","observation_id":"d0f92b36-1701-424a-996a-d33d1a2d8f79","resolution":{"observed_at":"2026-07-01T19:36:08.724825Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-07-10T20:27:36.606337Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2606.01483","last_updated":"2026-05-31T22:54:57Z","snapshot_observed_at":"2026-07-06T23:42:02.762832Z","submitted_at":"2026-05-31T22:54:57Z","title":"MURMUR: An Efficient Inference System for Long-Form ASR","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-28T17:06:02.978205Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2606.01483"},"observation_digest":"sha256:5de237037b1a44225da65baff5b4f81055def6f9f086e9d305de3e854b5976fd","observation_id":"bbdcde03-ba1e-4cec-ae6b-f9221912c4b9","resolution":{"observed_at":"2026-06-28T17:12:25.096494Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-07-10T20:27:36.606337Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2606.03241","last_updated":"2026-06-02T07:01:33Z","snapshot_observed_at":"2026-08-02T16:55:35.001949Z","submitted_at":"2026-06-02T07:01:33Z","title":"Benchmarking Speech-to-Speech Translation Models","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-06-28T10:34:10.510906Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2606.03241"},"observation_digest":"sha256:d51d4abb44f5a4a2eb8c89e0a72f0eea97fea1fa5622264a6a6ddff228ecc6eb","observation_id":"7584a4a5-0da4-48d6-8531-a78848bbc4cc","resolution":{"observed_at":"2026-07-02T02:46:29.444473Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-07-10T20:27:36.606337Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2606.06037","last_updated":"2026-06-08T08:49:38Z","snapshot_observed_at":"2026-08-03T09:38:32.203749Z","submitted_at":"2026-06-04T11:31:38Z","title":"SpeechJBB: Probing Safety Alignment and Comprehension in Large Audio Language Models under Code-Switched Speech","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T23:44:42.188662Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2606.06037"},"observation_digest":"sha256:ea992fca11b5b69bf2a605b54f4556beae8ca6a477fd05c09e32793786b8a0ae","observation_id":"a0d2211e-f890-4faf-950f-365b3c96cbf4","resolution":{"observed_at":"2026-07-02T15:37:06.724970Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-07-10T20:27:36.606337Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2606.06177","last_updated":"2026-06-04T13:52:21Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T13:52:21Z","title":"Ouvia: A User-centered Framework for Measuring Usability of Speech Translation in Real-World Communication Scenarios","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-28T01:11:56.037674Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2606.06177"},"observation_digest":"sha256:2ec95929cad2ab846012a013f9dc58259ca05106323677b3532e832a44cb6c27","observation_id":"aafcd460-72a7-47fd-8edf-415cf5d7ba2e","resolution":{"observed_at":"2026-07-02T13:36:59.045645Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-07-10T20:27:36.606337Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2606.06211","last_updated":"2026-06-04T14:20:11Z","snapshot_observed_at":"2026-08-03T17:35:55.231811Z","submitted_at":"2026-06-04T14:20:11Z","title":"FiLM-Based Speaker Conditioning of a SpeechLLM for Pathological Speech Recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T01:58:13.871771Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2606.06211"},"observation_digest":"sha256:7e8aaa89e7f7c6286dfcdca676194e4dfb085ceb09bc6a8b6eb7b1de88413107","observation_id":"d44d6b97-d702-4272-b6db-bac2e0c8b265","resolution":{"observed_at":"2026-07-02T12:36:57.087582Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-07-10T20:27:36.606337Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2606.08194","last_updated":"2026-06-06T14:24:05Z","snapshot_observed_at":"2026-08-02T20:27:06.280658Z","submitted_at":"2026-06-06T14:24:05Z","title":"GlobeAudio: A Multilingual Multicultural Benchmark for Naturalistic Evaluation of Large Audio-Language Models","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-06-27T19:51:59.265579Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2606.08194"},"observation_digest":"sha256:b67b6b4a3357210534810cd21f9e804059068c954f1e950476ffd78affc8a0b1","observation_id":"b6a6fc55-6346-4ddd-a7b6-aaa034707fd8","resolution":{"observed_at":"2026-07-02T21:17:24.526077Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-07-10T20:27:36.606337Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2606.09335","last_updated":"2026-06-08T11:03:25Z","snapshot_observed_at":"2026-08-01T20:01:48.973165Z","submitted_at":"2026-06-08T11:03:25Z","title":"Factors affecting ASR performance: A study using state of the art ASR models in Indic Languages","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T15:10:03.282212Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2606.09335"},"observation_digest":"sha256:a07178d2c2d09e8df54b29fcbe636611c0b2069e44c71b060a605de26eeb045a","observation_id":"1dd1ca22-5f05-4303-a152-1a539f8dad00","resolution":{"observed_at":"2026-07-03T03:37:35.489322Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-07-10T20:27:36.606337Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2606.13464","last_updated":"2026-06-11T15:18:32Z","snapshot_observed_at":"2026-08-04T09:38:56.632070Z","submitted_at":"2026-06-11T15:18:32Z","title":"Ontology Memory-Augmented ASR Correction for Long Text-Speech Interleaved Conversations","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-27T07:06:13.658919Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2606.13464"},"observation_digest":"sha256:812ca29b7a5ca04fe92278aa4913c2ff75840d437f23c19474e6046a21270d82","observation_id":"e1e30ead-2568-4317-951a-3ec879112b81","resolution":{"observed_at":"2026-06-27T07:10:41.472377Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-07-10T20:27:36.606337Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2606.14784","last_updated":"2026-06-18T08:18:44Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-10T11:08:21Z","title":"LLM-Based Synthetic Ground Truth Generation for Audio-Based Emotion Classification via In-Context Learning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T08:13:38.489672Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2606.14784"},"observation_digest":"sha256:c44ec85f748880b38e5548ba0e5a05058cb0d4885e4a3cc69927b51db649c53c","observation_id":"6725bc1e-3f7f-4e9a-9927-0a6805a368f8","resolution":{"observed_at":"2026-07-03T13:18:13.111737Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-07-10T20:27:36.606337Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2606.18134","last_updated":"2026-06-16T16:34:35Z","snapshot_observed_at":"2026-07-06T23:53:36.096914Z","submitted_at":"2026-06-16T16:34:35Z","title":"Grounding Spoken LLMs in Multi-Speaker Audio via Diarization Conditioning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-26T22:39:09.967750Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2606.18134"},"observation_digest":"sha256:c924411126d5ce9eb8e9dec5189a4553056b1801e1c56c9fb371b3b997c2d454","observation_id":"40abd6fa-fb90-4d9c-aa60-a7a9a732fbf9","resolution":{"observed_at":"2026-07-03T23:19:03.351616Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-07-10T20:27:36.606337Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2606.19157","last_updated":"2026-06-24T04:32:31Z","snapshot_observed_at":"2026-07-06T23:54:27.624372Z","submitted_at":"2026-06-17T14:59:37Z","title":"IndicContextEval: A Benchmark for Evaluating Context Utilisation in Audio Large Language Models Across 8 Indic Languages","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-26T19:14:26.452851Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2606.19157"},"observation_digest":"sha256:9dfaf5e123ea9f927237e31bae934164c36e8535d971a91a6a50233d84f69a98","observation_id":"d77aea3a-6b1f-445a-a6fd-03536a02d0bc","resolution":{"observed_at":"2026-07-04T02:49:24.345552Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-07-10T20:27:36.606337Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2606.21408","last_updated":"2026-06-19T13:20:16Z","snapshot_observed_at":"2026-07-06T23:56:26.805329Z","submitted_at":"2026-06-19T13:20:16Z","title":"Vaani Benchmark V1.0: An Inclusive Multimodal Benchmark Dataset for Hindi","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-26T13:07:37.187581Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2606.21408"},"observation_digest":"sha256:e56a050b80ed324060a634b6f084056953baa490bdb5164f6a22040c5f823c75","observation_id":"bf1f3ad5-679f-4774-ab11-7bdcb3f241b0","resolution":{"observed_at":"2026-07-04T07:39:39.279437Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-07-10T20:27:36.606337Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2606.25391","last_updated":"2026-06-24T04:42:57Z","snapshot_observed_at":"2026-08-02T09:48:07.276963Z","submitted_at":"2026-06-24T04:42:57Z","title":"From Sounds to Scenes: A Benchmark for Evaluating Context-Aware Auditory Scene Understanding in Large Audio Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-25T20:36:24.901454Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2606.25391"},"observation_digest":"sha256:ddda5761bb2808ff1a9dc63d6ec2390b8c575990f6aacb716b7f91e265628c29","observation_id":"d8fea7a4-5eef-4f8c-8b54-d05aaf81e144","resolution":{"observed_at":"2026-07-04T20:10:07.978640Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-07-10T20:27:36.606337Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2606.26968","last_updated":"2026-06-25T12:40:39Z","snapshot_observed_at":"2026-07-31T01:20:28.481331Z","submitted_at":"2026-06-25T12:40:39Z","title":"RedVox: Safety and Fairness Gaps in Speech Models Across Languages","version":1},"reference_index":126,"source":"arxiv_source","source_observed_at":"2026-06-26T04:37:00.399470Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2606.26968"},"observation_digest":"sha256:64d7fe7e80af0cefc3e3b0ae30187a873d6772da3d9c81f61f6cc2604af1737e","observation_id":"d2974562-cdae-4ac4-9b9b-b750ba3a5404","resolution":{"observed_at":"2026-07-04T13:59:52.910091Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-07-10T20:27:36.606337Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2607.01733","last_updated":"2026-07-02T05:42:01Z","snapshot_observed_at":"2026-07-07T00:07:13.555571Z","submitted_at":"2026-07-02T05:42:01Z","title":"Rethinking Speech-LLM Integration for ASR: Effective Joint Speech-Text Training by Interleaving","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-03T15:17:52.966144Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2607.01733"},"observation_digest":"sha256:54ed931434157f647765c1be8cafa27ac6d1fdaa099430e239b56f2c90af2b6c","observation_id":"fe7dcb65-5b71-4ae1-8988-2dca377b95f5","resolution":{"observed_at":"2026-07-03T15:18:32.663262Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-07-12T04:08:13.798171Z","title":"V oxtral,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03207","last_updated":"2026-07-03T11:23:43Z","snapshot_observed_at":"2026-08-01T21:03:41.857459Z","submitted_at":"2026-07-03T11:23:43Z","title":"S-DiverSe: Spanish Diverse Speech","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-12T04:08:13.798171Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2607.03207"},"observation_digest":"sha256:2e3a590654d273d4426b078f6fa22ad13752454ac47ead6e4a9df2ec3594e809","observation_id":"58468181-dd03-488c-b1e6-6a5ecce3a2d3","resolution":{"observed_at":"2026-07-12T04:08:13.798171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-07-10T20:27:36.606337Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-07-11T07:46:45.098798Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":1},"reference_index":234,"source":"arxiv_source","source_observed_at":"2026-07-07T23:59:38.702609Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:b9579ff29c0a8072c5adb996b1ee7a0445d6d5ab6d0263fd9fe24f4f07bc13b1","observation_id":"16a04cd9-a983-4ec9-a239-ed53e31d7c02","resolution":{"observed_at":"2026-07-08T00:04:22.545770Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-07-11T07:46:49.059192Z","title":"arXiv preprint arXiv:2507.13264 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-07-11T07:46:45.098798Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":2},"reference_index":234,"source":"arxiv_source","source_observed_at":"2026-07-11T07:46:49.059192Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:18d5879c790a50cfcab0aa46418b0885ba7dd3e676014fc80e67839842db58e1","observation_id":"f1cf07ff-4252-4e63-9d6d-39b3b03ac91f","resolution":{"observed_at":"2026-07-11T07:46:49.059192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-07-10T20:27:36.606337Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-07-11T23:18:39.457617Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:0292276a1c35f70fb04b4101a335af9f21720ca65cb3822b1ba3a3a830688db5","observation_id":"3db9f10c-f72e-4a63-802f-e476e6864eec","resolution":{"observed_at":"2026-07-10T20:27:36.607654Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-07-14T12:07:39.817307Z","title":"V oxtral,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10387","last_updated":"2026-07-11T16:34:25Z","snapshot_observed_at":"2026-07-16T23:18:21.145855Z","submitted_at":"2026-07-11T16:34:25Z","title":"GigaChat Audio: Time-aware Large Audio Language Model","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-14T12:07:39.817307Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2607.10387"},"observation_digest":"sha256:2353393544a5098907109ab58289eadfb9ddbc459867014dfde06161b958d2f7","observation_id":"382579c1-70e4-4e99-9485-5309bbe4cacb","resolution":{"observed_at":"2026-07-14T12:07:39.817307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-08-02T05:20:01.370603Z","title":"V oxtral,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-02T11:29:40.513819Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T05:20:01.370603Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:0f2010d87c45a67a2fd94f2c83b0c62e1d0a1b1556b663d9f9e74c90106cd162","observation_id":"608bbfa2-db29-48f0-b7a6-465c09ffa510","resolution":{"observed_at":"2026-08-02T05:20:01.370603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-08-02T05:08:03.719567Z","title":"V oxtral,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13477","last_updated":"2026-07-15T06:10:53Z","snapshot_observed_at":"2026-08-02T05:08:02.664448Z","submitted_at":"2026-07-15T06:10:53Z","title":"Auditing Protocol-Level Shortcuts in Large Audio Language Model Judges for Speech Evaluation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T05:08:03.719567Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2607.13477"},"observation_digest":"sha256:32cbf432a9204781d953ce1ed5609cc437f0945ac8ddde9e8f246a39490c5a7f","observation_id":"eee421ae-6f81-4633-954c-6d145337df2e","resolution":{"observed_at":"2026-08-02T05:08:03.719567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-08-01T18:42:01.682549Z","title":"V oxtral,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17230","last_updated":"2026-07-19T12:49:35Z","snapshot_observed_at":"2026-08-01T18:42:01.141926Z","submitted_at":"2026-07-19T12:49:35Z","title":"Robust Summarization of Doctor-Patient Conversations: TalTech Systems for the Beyond Transcription Challenge","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T18:42:01.682549Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2607.17230"},"observation_digest":"sha256:1dd6126fec51caf7e67e13c76a3ea1c27beb18103b7fd76fd8c0e59e1f377a57","observation_id":"8e8acb12-a731-4957-b1d3-2163a6c723c3","resolution":{"observed_at":"2026-08-01T18:42:01.682549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-08-01T16:57:11.564423Z","title":"V oxtral,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17812","last_updated":"2026-07-20T10:59:15Z","snapshot_observed_at":"2026-08-01T16:57:08.740216Z","submitted_at":"2026-07-20T10:59:15Z","title":"ESCUCHA: A Spanish Speech Benchmark for Heterogeneous Acoustic Conditions","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T16:57:11.564423Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2607.17812"},"observation_digest":"sha256:c43c379c5075c69365764d16564c6facdaf663fafd38c3fa99f63131d4b5f1f6","observation_id":"9ccec7c0-c125-411f-809c-446281cc4a93","resolution":{"observed_at":"2026-08-01T16:57:11.564423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-08-01T07:12:17.795578Z","title":"arXiv preprint arXiv:2507.13264 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-03T11:55:30.881091Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":186,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:17.795578Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:8db38444135d1c352ca8af86b3205b6e1c646fc5ae2d15b2c7c6a76e22b6780e","observation_id":"f66feb1f-3887-4922-a1bb-388b081b4484","resolution":{"observed_at":"2026-08-01T07:12:17.795578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.13264/citation-record","integrity":"/paper/2507.13264/integrity","json":"/paper/2507.13264/citation-record.json","paper":"/paper/2507.13264"},"outbound":[],"paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 49 inbound Pith citation observations for arXiv:2507.13264."}