{"as_of":"2026-08-19T10:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a112f7db43f779d3eac949c498bdfc43efff109a66c28d10ab49e6b6a729dff0","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T14:27:27.353817Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T14:35:02.484377Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T14:44:45.645532Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.12009","last_updated":"2025-03-30T02:39:14Z","snapshot_observed_at":"2026-08-17T13:24:14.277154Z","submitted_at":"2024-12-16T17:36:02Z","title":"SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval","version":2},"cited_work":{"arxiv_id":"2412.12009","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.12009","snapshot_observed_at":"2026-06-30T14:44:45.645532Z","title":"Speechprune: Context-aware token pruning for speech information retrieval,","venue":null,"work_id":"18c785ff-312a-4372-b0c1-57ceabaab162","year":2024},"citing_paper":{"arxiv_id":"2605.24144","last_updated":"2026-05-22T19:06:22Z","snapshot_observed_at":"2026-08-18T23:05:06.423504Z","submitted_at":"2026-05-22T19:06:22Z","title":"EVA: Accelerating LLM Decoding via an Efficient Vector Quantization Architecture","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-30T14:35:02.484377Z"},"links":{"cited_paper":"/paper/2412.12009","citing_paper":"/paper/2605.24144"},"observation_digest":"sha256:de82d3195560af0ac09ab79ed77dc427415b781efe3fc3fe26e5864f371c4d74","observation_id":"27cbed04-321f-4d1b-b206-b87602c53b06","resolution":{"observed_at":"2026-06-30T14:44:45.647323Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.12009/citation-record","integrity":"/paper/2412.12009/integrity","json":"/paper/2412.12009/citation-record.json","paper":"/paper/2412.12009"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:27:27.207916Z","title":"A survey on speech large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12009","last_updated":"2025-03-30T02:39:14Z","snapshot_observed_at":"2026-08-17T13:24:14.277154Z","submitted_at":"2024-12-16T17:36:02Z","title":"SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T14:27:27.207916Z"},"links":{"citing_paper":"/paper/2412.12009"},"observation_digest":"sha256:3b4f71cec0b3da4ced390407e0de9e336e15edfe43eb9c3352b2058e552a8c49","observation_id":"6cfb7fff-0c53-459d-ad20-d62b262953a2","resolution":{"observed_at":"2026-08-11T14:27:27.207916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-08-14T01:27:16.843576Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-11T14:27:27.214993Z","title":"Qwen2-audio technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12009","last_updated":"2025-03-30T02:39:14Z","snapshot_observed_at":"2026-08-17T13:24:14.277154Z","submitted_at":"2024-12-16T17:36:02Z","title":"SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T14:27:27.214993Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2412.12009"},"observation_digest":"sha256:5dbab785981f3da2282bbed7b3551c1684d24305619a436e00400a6ea1e6be76","observation_id":"615b9647-943e-49d8-96ce-4193edc48367","resolution":{"observed_at":"2026-08-11T14:27:27.214993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02678","last_updated":"2024-10-03T17:04:48Z","snapshot_observed_at":"2026-08-19T07:46:42.192670Z","submitted_at":"2024-10-03T17:04:48Z","title":"Distilling an End-to-End Voice Assistant Without Instruction Training Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02678","snapshot_observed_at":"2026-08-11T14:27:27.223349Z","title":"Distilling an end-to-end voice assistant without instruction training data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12009","last_updated":"2025-03-30T02:39:14Z","snapshot_observed_at":"2026-08-17T13:24:14.277154Z","submitted_at":"2024-12-16T17:36:02Z","title":"SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T14:27:27.223349Z"},"links":{"cited_paper":"/paper/2410.02678","citing_paper":"/paper/2412.12009"},"observation_digest":"sha256:66d79771251c77b592caa63717cce93027b9bbd3c11e6f2d5d820f85555513ac","observation_id":"91cc5029-1500-4b98-b8c1-4dd268680a26","resolution":{"observed_at":"2026-08-11T14:27:27.223349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:27:27.943936Z","title":"SpeechGPT: Empowering large language models with intrinsic cross-modal conversational abilities,","venue":null,"work_id":"8b7c6734-466a-4c8a-b4b9-6acf2eaea907","year":2023},"citing_paper":{"arxiv_id":"2412.12009","last_updated":"2025-03-30T02:39:14Z","snapshot_observed_at":"2026-08-17T13:24:14.277154Z","submitted_at":"2024-12-16T17:36:02Z","title":"SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T14:27:27.229904Z"},"links":{"citing_paper":"/paper/2412.12009"},"observation_digest":"sha256:7e8fefb086bd7bb8f146529f2fcec54467af76cc54b0643b03e03fc2c90a0cec","observation_id":"d991f7e9-421f-42e6-b482-c0a6254c6d7d","resolution":{"observed_at":"2026-08-11T14:27:27.949943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:27:27.927131Z","title":"AnyGPT: Unified multimodal LLM with discrete sequence modeling,","venue":null,"work_id":"1cf91170-e948-403b-8b54-45132cd8e947","year":2024},"citing_paper":{"arxiv_id":"2412.12009","last_updated":"2025-03-30T02:39:14Z","snapshot_observed_at":"2026-08-17T13:24:14.277154Z","submitted_at":"2024-12-16T17:36:02Z","title":"SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T14:27:27.237231Z"},"links":{"citing_paper":"/paper/2412.12009"},"observation_digest":"sha256:12474a264cce66e61c327c996653d54d1beae87cb6b2d74d4750d65764c32418","observation_id":"8682b50a-fe3b-4c59-b3e9-6671b498d8e7","resolution":{"observed_at":"2026-08-11T14:27:27.932649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:27:27.909490Z","title":"Dynamic-SUPERB phase-2: A collaboratively expanding benchmark for measuring the capabilities of spoken language models with 180 tasks,","venue":null,"work_id":"7de311ba-d4f7-4716-8078-6b7b35aed93a","year":2025},"citing_paper":{"arxiv_id":"2412.12009","last_updated":"2025-03-30T02:39:14Z","snapshot_observed_at":"2026-08-17T13:24:14.277154Z","submitted_at":"2024-12-16T17:36:02Z","title":"SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T14:27:27.242211Z"},"links":{"citing_paper":"/paper/2412.12009"},"observation_digest":"sha256:6159834a4cb383c83ac34ab0d465358b4de977af24b9cafaaf56915de89e38e9","observation_id":"37b91436-91f8-4d47-b7f1-c354d36ba71e","resolution":{"observed_at":"2026-08-11T14:27:27.914804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:27:27.892977Z","title":"MMAU: A massive multi-task audio understanding and reasoning benchmark,","venue":null,"work_id":"0910c9d6-4e56-43a8-a927-5645b2e194f4","year":2025},"citing_paper":{"arxiv_id":"2412.12009","last_updated":"2025-03-30T02:39:14Z","snapshot_observed_at":"2026-08-17T13:24:14.277154Z","submitted_at":"2024-12-16T17:36:02Z","title":"SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T14:27:27.248819Z"},"links":{"citing_paper":"/paper/2412.12009"},"observation_digest":"sha256:45232fff0b37a9ff7a5bbe0b91f9848bb26fb3513a023ac45096d569be172694","observation_id":"6334cba9-d4d5-421f-ba93-fbbb90c882ac","resolution":{"observed_at":"2026-08-11T14:27:27.898104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16020","last_updated":"2025-05-06T00:52:19Z","snapshot_observed_at":"2026-08-19T06:44:38.018743Z","submitted_at":"2024-06-23T05:40:26Z","title":"AudioBench: A Universal Benchmark for Audio Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16020","snapshot_observed_at":"2026-08-11T14:27:27.254326Z","title":"Audiobench: A universal benchmark for audio large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12009","last_updated":"2025-03-30T02:39:14Z","snapshot_observed_at":"2026-08-17T13:24:14.277154Z","submitted_at":"2024-12-16T17:36:02Z","title":"SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T14:27:27.254326Z"},"links":{"cited_paper":"/paper/2406.16020","citing_paper":"/paper/2412.12009"},"observation_digest":"sha256:226fc9bbd3d9401554ec5dd2bd848026f8c7af4aa6dbdb1e83f0353287746850","observation_id":"6b5f935f-5e54-4c99-b575-ea8ef3f15a60","resolution":{"observed_at":"2026-08-11T14:27:27.254326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:27:27.874093Z","title":"On the com- putational complexity of self-attention,","venue":null,"work_id":"23bf58df-f1a1-4ad9-bc77-ef1b313e0a1f","year":2023},"citing_paper":{"arxiv_id":"2412.12009","last_updated":"2025-03-30T02:39:14Z","snapshot_observed_at":"2026-08-17T13:24:14.277154Z","submitted_at":"2024-12-16T17:36:02Z","title":"SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T14:27:27.259908Z"},"links":{"citing_paper":"/paper/2412.12009"},"observation_digest":"sha256:43425b124645ce9c974d6437481123f2fb2a4891c8937d6379ac5ff2f2a1828a","observation_id":"16451f2e-2264-436d-ac06-90a331ddb238","resolution":{"observed_at":"2026-08-11T14:27:27.880027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:27:27.265395Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12009","last_updated":"2025-03-30T02:39:14Z","snapshot_observed_at":"2026-08-17T13:24:14.277154Z","submitted_at":"2024-12-16T17:36:02Z","title":"SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T14:27:27.265395Z"},"links":{"citing_paper":"/paper/2412.12009"},"observation_digest":"sha256:bc36ff48b433243e2bd24351a45f9f7a5aeb5c6effd9e9cfb4c495a09e38a70e","observation_id":"2c3b74b5-599f-4d8e-9ca8-18781f522004","resolution":{"observed_at":"2026-08-11T14:27:27.265395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:27:27.271000Z","title":"Llava-prumerge: Adaptive token reduction for efficient large multimodal models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12009","last_updated":"2025-03-30T02:39:14Z","snapshot_observed_at":"2026-08-17T13:24:14.277154Z","submitted_at":"2024-12-16T17:36:02Z","title":"SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T14:27:27.271000Z"},"links":{"citing_paper":"/paper/2412.12009"},"observation_digest":"sha256:c64726e19b0dde6802be41e48fdf14c96939554912ea8c420647be691cf3c4dd","observation_id":"5c4387b6-9496-468d-a057-55d8aa83cdfa","resolution":{"observed_at":"2026-08-11T14:27:27.271000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:27:27.847365Z","title":"Styletts 2: Towards human-level text-to-speech through style diffusion and adversarial training with large speech language models,","venue":null,"work_id":"7304c6f1-a214-472d-803b-fbd8dc938d43","year":2023},"citing_paper":{"arxiv_id":"2412.12009","last_updated":"2025-03-30T02:39:14Z","snapshot_observed_at":"2026-08-17T13:24:14.277154Z","submitted_at":"2024-12-16T17:36:02Z","title":"SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T14:27:27.278405Z"},"links":{"citing_paper":"/paper/2412.12009"},"observation_digest":"sha256:26ad53c8d5c4426bd56ca3f7d33d7ea7bd7e6705173547e2b817e23550317e92","observation_id":"6eaf1794-7992-4709-9582-56a9c0f65cae","resolution":{"observed_at":"2026-08-11T14:27:27.852739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:27:27.830247Z","title":"LibriTTS: A corpus derived from librispeech for text- to-speech,","venue":null,"work_id":"45344a5c-fc57-4e84-9a84-0fa5952db3e4","year":2019},"citing_paper":{"arxiv_id":"2412.12009","last_updated":"2025-03-30T02:39:14Z","snapshot_observed_at":"2026-08-17T13:24:14.277154Z","submitted_at":"2024-12-16T17:36:02Z","title":"SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T14:27:27.284337Z"},"links":{"citing_paper":"/paper/2412.12009"},"observation_digest":"sha256:ce30ba87e1536fd25bec3ea8ca4644e4af9dfc7c367730fea62e6ffac68efcd5","observation_id":"eb8cfd2f-580e-4966-b0fb-99ea0702f51a","resolution":{"observed_at":"2026-08-11T14:27:27.835898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:27:27.813635Z","title":"Utmos: Utokyo-sarulab system for voicemos challenge 2022,","venue":null,"work_id":"1c86f2f2-3bcc-48df-81f9-4bfacaaa0814","year":2022},"citing_paper":{"arxiv_id":"2412.12009","last_updated":"2025-03-30T02:39:14Z","snapshot_observed_at":"2026-08-17T13:24:14.277154Z","submitted_at":"2024-12-16T17:36:02Z","title":"SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T14:27:27.289656Z"},"links":{"citing_paper":"/paper/2412.12009"},"observation_digest":"sha256:16ff65843870156ec1a48ea93de92ac2459dcc81883b81c76446847f0576510b","observation_id":"88fff4b9-643f-40ef-a897-f37563c920ba","resolution":{"observed_at":"2026-08-11T14:27:27.819049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:27:27.797943Z","title":"Listen, think, and understand,","venue":null,"work_id":"07b16cf0-21b3-4a5a-95b4-9561d79ed7e7","year":2024},"citing_paper":{"arxiv_id":"2412.12009","last_updated":"2025-03-30T02:39:14Z","snapshot_observed_at":"2026-08-17T13:24:14.277154Z","submitted_at":"2024-12-16T17:36:02Z","title":"SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T14:27:27.295112Z"},"links":{"citing_paper":"/paper/2412.12009"},"observation_digest":"sha256:e72cdbc5fd8612dc5fbf029956bb2b66dbbe642608cb2a95667d2a46fbe1bcd4","observation_id":"fec33ec5-9763-4267-9c15-a26c18fe8eab","resolution":{"observed_at":"2026-08-11T14:27:27.802854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:27:27.780592Z","title":"SALMONN: Towards generic hearing abilities for large language models,","venue":null,"work_id":"6634acab-1657-49f5-bb0b-e9a007e5e2b3","year":2024},"citing_paper":{"arxiv_id":"2412.12009","last_updated":"2025-03-30T02:39:14Z","snapshot_observed_at":"2026-08-17T13:24:14.277154Z","submitted_at":"2024-12-16T17:36:02Z","title":"SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T14:27:27.301158Z"},"links":{"citing_paper":"/paper/2412.12009"},"observation_digest":"sha256:9de9f5633f52f2e729f16921194db83c79bf3ee2508e25ad4da42fb32daf46a7","observation_id":"b96a12fb-37fc-4f2e-b0ec-67f5581f292c","resolution":{"observed_at":"2026-08-11T14:27:27.786330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-08-16T13:52:57.510888Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-11T14:27:27.306355Z","title":"Speechverse: A large-scale generalizable audio language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12009","last_updated":"2025-03-30T02:39:14Z","snapshot_observed_at":"2026-08-17T13:24:14.277154Z","submitted_at":"2024-12-16T17:36:02Z","title":"SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T14:27:27.306355Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2412.12009"},"observation_digest":"sha256:78df83f3f0bdc1d62de7bb0b343b6944ef8f1a9edfe776ec153b4d3c654714b7","observation_id":"07045fb6-57ee-4793-9e2e-aee6c25e3365","resolution":{"observed_at":"2026-08-11T14:27:27.306355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:27:27.763450Z","title":"Attention is all you need,","venue":null,"work_id":"8bb84ae4-ab86-4774-90f4-15268678f21a","year":2017},"citing_paper":{"arxiv_id":"2412.12009","last_updated":"2025-03-30T02:39:14Z","snapshot_observed_at":"2026-08-17T13:24:14.277154Z","submitted_at":"2024-12-16T17:36:02Z","title":"SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T14:27:27.317192Z"},"links":{"citing_paper":"/paper/2412.12009"},"observation_digest":"sha256:2cb92d3b73118157578c26481aa33f925a88ec6767e6d3601c108de419c462c9","observation_id":"29a50415-014b-4365-94d0-4dc07d53b2a1","resolution":{"observed_at":"2026-08-11T14:27:27.768934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:27:27.745144Z","title":"Transformer quality in linear time,","venue":null,"work_id":"101961fc-3f9e-4716-a6cf-7675e0aaf027","year":2022},"citing_paper":{"arxiv_id":"2412.12009","last_updated":"2025-03-30T02:39:14Z","snapshot_observed_at":"2026-08-17T13:24:14.277154Z","submitted_at":"2024-12-16T17:36:02Z","title":"SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T14:27:27.322853Z"},"links":{"citing_paper":"/paper/2412.12009"},"observation_digest":"sha256:0c86474cc6aacef7d0eea184e22681b53e1ec5b8ed5b8b4f017d0b5c7d0c7695","observation_id":"cf0e7d12-b0ff-49eb-80a7-bc588827afe6","resolution":{"observed_at":"2026-08-11T14:27:27.750112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:27:27.727885Z","title":"Learned token pruning for transformers,","venue":null,"work_id":"8bed48b8-07f6-421f-aeaa-be686fcfe9db","year":2022},"citing_paper":{"arxiv_id":"2412.12009","last_updated":"2025-03-30T02:39:14Z","snapshot_observed_at":"2026-08-17T13:24:14.277154Z","submitted_at":"2024-12-16T17:36:02Z","title":"SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T14:27:27.327836Z"},"links":{"citing_paper":"/paper/2412.12009"},"observation_digest":"sha256:4398d1b3f06a59f29daec6cf7d76a76d73a9f6237652684e256bfca23140b79d","observation_id":"0bdeeabc-0705-4dda-a662-d1d1e81ff128","resolution":{"observed_at":"2026-08-11T14:27:27.734347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:27:27.709468Z","title":"Cortical oscillations and speech processing: Emerging computational principles and operations,","venue":null,"work_id":"5741d0f2-0ec7-4b62-a2f8-564022df3cd6","year":2012},"citing_paper":{"arxiv_id":"2412.12009","last_updated":"2025-03-30T02:39:14Z","snapshot_observed_at":"2026-08-17T13:24:14.277154Z","submitted_at":"2024-12-16T17:36:02Z","title":"SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T14:27:27.334489Z"},"links":{"citing_paper":"/paper/2412.12009"},"observation_digest":"sha256:71844b19797341c05f88be0c715b984c9e74868ffc16eef60442ed1d9fde2793","observation_id":"b1377ffc-43f5-44e1-8593-d1475917ee1c","resolution":{"observed_at":"2026-08-11T14:27:27.715513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-18T23:15:35.529250Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-08-11T14:27:27.340179Z","title":"Llm inference unveiled: Survey and roofline model insights,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12009","last_updated":"2025-03-30T02:39:14Z","snapshot_observed_at":"2026-08-17T13:24:14.277154Z","submitted_at":"2024-12-16T17:36:02Z","title":"SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T14:27:27.340179Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2412.12009"},"observation_digest":"sha256:f651088f00d7c46fd24b2923b3f2f220898d3114747523baf62030df25c31683","observation_id":"3eddaf34-10e1-4853-bcea-ca125b391400","resolution":{"observed_at":"2026-08-11T14:27:27.340179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:27:27.691056Z","title":"Dream: A challenge data set and models for dialogue- based reading comprehension,","venue":null,"work_id":"aae10925-b7be-4d24-94bf-66624701f960","year":2019},"citing_paper":{"arxiv_id":"2412.12009","last_updated":"2025-03-30T02:39:14Z","snapshot_observed_at":"2026-08-17T13:24:14.277154Z","submitted_at":"2024-12-16T17:36:02Z","title":"SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T14:27:27.348476Z"},"links":{"citing_paper":"/paper/2412.12009"},"observation_digest":"sha256:7206eb3b6ef7809124e901df20ffe4c572e47665d4c91ef887a6102093e51c3d","observation_id":"3c719319-0ede-44e5-ba2a-bb6eecdc3606","resolution":{"observed_at":"2026-08-11T14:27:27.697902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:27:27.669415Z","title":"WavLLM: Towards robust and adaptive speech large language model,","venue":null,"work_id":"2d3cfc36-8749-4dbf-9821-2326a84d1c35","year":2024},"citing_paper":{"arxiv_id":"2412.12009","last_updated":"2025-03-30T02:39:14Z","snapshot_observed_at":"2026-08-17T13:24:14.277154Z","submitted_at":"2024-12-16T17:36:02Z","title":"SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T14:27:27.353817Z"},"links":{"citing_paper":"/paper/2412.12009"},"observation_digest":"sha256:ccf017838b3870ca8df7c5db22c1f3024dbd49592d6e013ed8907af04d1b4cb2","observation_id":"c834cfa0-87fe-4051-add2-51de44ff5887","resolution":{"observed_at":"2026-08-11T14:27:27.677871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.12009","last_updated":"2025-03-30T02:39:14Z","latest_version":2,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-17T13:24:14.277154Z","submitted_at":"2024-12-16T17:36:02Z","title":"SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":0,"verified_fuzzy":16},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 1 inbound Pith citation observation for arXiv:2412.12009."}