Pith. sign in

Paper Citation Record · LEDGER

VoiceGiraffe: A Benchmark for Extreme Long-Context Audio-Language Understanding

As of 5 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2605.27976.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2605.27976 v1

Coverage vector

measured 31 of 31 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-06-29T10:35:43.312600Z

measured 31 of 31 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-05T06:32:48.257954+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

31 of 31 outbound references displayed

  • verified exact3
  • verified fuzzy0
  • unresolved27
  • parse uncertain0
  • malformed identifier1
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 851e009d-8c6c-4938-89f4-c8790ec6d149 · outbound

This paper cites Phi-4-mini technical report: Compact yet powerful multimodal language models via mixture-of-loras.

VoiceGiraffe: A Benchmark for Extreme Long-Context Audio-Language Understanding Phi-4-mini technical report: Compact yet powerful multimodal language models via mixture-of-loras

Reference 1

Resolution
unresolved
no resolver link, observed 2026-06-29T10:35:43.312600Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-29T10:35:43.312600Z digest=sha256:c82543c3195a6d46cd100428e57c7c4e57cb98aac841c9b86ac656a1881d7f32

Observation 42f812bf-b1e7-4d67-a60d-22cb7fe0b643 · outbound

This paper cites BLAB: brutally long audio bench.

VoiceGiraffe: A Benchmark for Extreme Long-Context Audio-Language Understanding BLAB: brutally long audio bench

Reference 2

Resolution
unresolved
no resolver link, observed 2026-06-29T10:35:43.312600Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-29T10:35:43.312600Z digest=sha256:a93455e7a5c7d0db84c908609a040a0efe5ad71daaeca3f5156be70724b0ca21

Observation 0620e2f9-239f-487e-be99-74052a52bdf7 · outbound

This paper cites Pyannote.audio: Neural building blocks for speaker diarization.

VoiceGiraffe: A Benchmark for Extreme Long-Context Audio-Language Understanding Pyannote.audio: Neural building blocks for speaker diarization

Reference 3

Resolution
unresolved
no resolver link, observed 2026-06-29T10:35:43.312600Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-29T10:35:43.312600Z digest=sha256:9ca8a70a3a8ed10acd8a11d9bbd93d6eb079079c87f84d1d1c065cea60016c3d

Observation 7d78f6d0-4b47-4c62-92db-9c0ad324e38f · outbound

This paper cites Qwen-audio: Advancing universal audio understanding via unified large-scale audio-language models.

VoiceGiraffe: A Benchmark for Extreme Long-Context Audio-Language Understanding Qwen-audio: Advancing universal audio understanding via unified large-scale audio-language models

Reference 4

Resolution
unresolved
no resolver link, observed 2026-06-29T10:35:43.312600Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-29T10:35:43.312600Z digest=sha256:18515d68e9c8e14325206cc0e04f60fb8ab0064ad0a2a41e701825bdb4b36de5

Observation c7e7acb4-b88c-4c6c-82cf-5ee75273ffbf · outbound

This paper cites Qwen2-audio technical report.

VoiceGiraffe: A Benchmark for Extreme Long-Context Audio-Language Understanding Qwen2-audio technical report

Reference 5

Resolution
unresolved
no resolver link, observed 2026-06-29T10:35:43.312600Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-29T10:35:43.312600Z digest=sha256:cda7890fed668ceb5b607794d589b098d7b2d9f7ec6233201c7e75c4f7d4c3b7

Observation e04493a2-55a0-4500-be36-9c3eb09b70a8 · outbound

This paper cites Sakshi, Oriol Nieto, Ramani Duraiswami, and Dinesh Manocha.

VoiceGiraffe: A Benchmark for Extreme Long-Context Audio-Language Understanding Sakshi, Oriol Nieto, Ramani Duraiswami, and Dinesh Manocha

Reference 6

Resolution
unresolved
no resolver link, observed 2026-06-29T10:35:43.312600Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-29T10:35:43.312600Z digest=sha256:044eef1c3f0edb6040af54ff1d2a144086c2a4209058df5f667157c2b4a3d046

Observation dac1407f-ed96-4e3d-bc0b-7ec2e6790ae5 · outbound

This paper cites Sakshi, Jaehyeon Kim, Wei Ping, Rafael Valle, Dinesh Manocha, and Bryan Catanzaro.

VoiceGiraffe: A Benchmark for Extreme Long-Context Audio-Language Understanding Sakshi, Jaehyeon Kim, Wei Ping, Rafael Valle, Dinesh Manocha, and Bryan Catanzaro

Reference 7

Resolution
unresolved
no resolver link, observed 2026-06-29T10:35:43.312600Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-29T10:35:43.312600Z digest=sha256:b85372513d2be6f5915a8c1ef54df0754c5bc898637880a9d24f7a110676eb92

Observation 3e84f7e1-f91d-4b23-ac57-affe6d032fe9 · outbound

This paper cites Audio flamingo 3: Advancing audio intelligence with fully open large audio language models.

VoiceGiraffe: A Benchmark for Extreme Long-Context Audio-Language Understanding Audio flamingo 3: Advancing audio intelligence with fully open large audio language models

Reference 8

Resolution
unresolved
no resolver link, observed 2026-06-29T10:35:43.312600Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-29T10:35:43.312600Z digest=sha256:4ac8147929fc818a90f0263f759a39d0d8d016e9d88ac757b99c3873c4156587

Observation 9c809f7b-43f4-402d-84ed-f14f232cec2a · outbound

This paper cites Audiomarathon: A comprehensive benchmark for long-context audio understanding and efficiency in audio llms.

VoiceGiraffe: A Benchmark for Extreme Long-Context Audio-Language Understanding Audiomarathon: A comprehensive benchmark for long-context audio understanding and efficiency in audio llms

Reference 9

Resolution
unresolved
no resolver link, observed 2026-06-29T10:35:43.312600Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-29T10:35:43.312600Z digest=sha256:755354013475d6a00d6394d67d4370daa44778e51448b3d1f3ab034b9d8b5662

Observation 569bf9ae-8437-4e5a-bb32-c8e03654e8e6 · outbound

This paper cites Baichuan-omni-1.5 technical report.

VoiceGiraffe: A Benchmark for Extreme Long-Context Audio-Language Understanding Baichuan-omni-1.5 technical report

Reference 10

Resolution
verified exact
arxiv_id, observed 2026-06-29T13:13:28.450843Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-06-29T10:35:43.312600Z digest=sha256:4ad7698443cd2896bae08ea5964bc239f6e84b7374a573aa63388cfde87e639e

Observation f7499b1a-c5a1-4c88-b7c5-01ca3a55ca6e · outbound

This paper cites Audio flamingo: A novel audio language model with few-shot learning and dialogue abilities.

VoiceGiraffe: A Benchmark for Extreme Long-Context Audio-Language Understanding Audio flamingo: A novel audio language model with few-shot learning and dialogue abilities

Reference 11

Resolution
unresolved
no resolver link, observed 2026-06-29T10:35:43.312600Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-29T10:35:43.312600Z digest=sha256:f84b5b464a895f1ff5221067c7e33d7a80c5f5010a21d19eaa906cb5e449b245

Observation e077b7d2-3f8b-4bd9-87ac-dc83eec48aa8 · outbound

This paper cites Chronosaudio: A comprehensive long-audio benchmark for evaluating audio-large language models.

VoiceGiraffe: A Benchmark for Extreme Long-Context Audio-Language Understanding Chronosaudio: A comprehensive long-audio benchmark for evaluating audio-large language models

Reference 12

Resolution
unresolved
no resolver link, observed 2026-06-29T10:35:43.312600Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-29T10:35:43.312600Z digest=sha256:841eb4290276ebd00cb43c609b6959c772291839c7e32ecca8d7b92e6bed12cd

Observation 17384832-b48b-4050-bafa-e35836cdbddb · outbound

This paper cites MMAR: A challenging benchmark for deep reasoning in speech, audio, music, and their mix.

VoiceGiraffe: A Benchmark for Extreme Long-Context Audio-Language Understanding MMAR: A challenging benchmark for deep reasoning in speech, audio, music, and their mix

Reference 13

Resolution
unresolved
no resolver link, observed 2026-06-29T10:35:43.312600Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-29T10:35:43.312600Z digest=sha256:e858f17e75eecc1c8b64eeab5eb10f569cc465e320626103f501a9e892d231a4

Observation f10b74e5-fc46-4133-a5c3-5b3b604c34bd · outbound

This paper cites GPT-4o System Card.

VoiceGiraffe: A Benchmark for Extreme Long-Context Audio-Language Understanding GPT-4o System Card

Reference 14

Resolution
verified exact
local_arxiv, observed 2026-06-29T13:13:28.453130Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-06-29T10:35:43.312600Z digest=sha256:c616195ca16a026b1bc1a7b59a6ef2bae84f8681409292e414df732c69c48d16

Observation 9b0012c3-023d-49cf-997a-18b56063d347 · outbound

This paper cites an unresolved cited work.

VoiceGiraffe: A Benchmark for Extreme Long-Context Audio-Language Understanding Unresolved cited work

Reference 15

Resolution
unresolved
no resolver link, observed 2026-06-29T10:35:43.312600Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-29T10:35:43.312600Z digest=sha256:128f0522d9fbfe437ec105ded67ff28d820a1f228a1072b929f82b7982a1289f

Observation 2e640e11-715b-4601-9465-099bc6d385c5 · outbound

This paper cites Sakshi, Utkarsh Tyagi, Sonal Kumar, Ashish Seth, Ramaneswaran Selvakumar, Oriol Nieto, Ramani Duraiswami, Sreyan Ghosh, and Dinesh Manocha.

VoiceGiraffe: A Benchmark for Extreme Long-Context Audio-Language Understanding Sakshi, Utkarsh Tyagi, Sonal Kumar, Ashish Seth, Ramaneswaran Selvakumar, Oriol Nieto, Ramani Duraiswami, Sreyan Ghosh, and Dinesh Manocha

Reference 16

Resolution
unresolved
no resolver link, observed 2026-06-29T10:35:43.312600Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-29T10:35:43.312600Z digest=sha256:9933632b76b26338fc4866f468d6b9edf47647039dbdc82f0bdb787668dac21d

Observation fe581de5-a0be-43d4-b6c3-899fc0ca8364 · outbound

This paper cites SALMONN: towards generic hearing abilities for large language models.

VoiceGiraffe: A Benchmark for Extreme Long-Context Audio-Language Understanding SALMONN: towards generic hearing abilities for large language models

Reference 17

Resolution
unresolved
no resolver link, observed 2026-06-29T10:35:43.312600Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-29T10:35:43.312600Z digest=sha256:b9cb8d47a95a43de0bdefe9d2e28ff9f16ddca6aebeac2ffb9e98e236a00841f

Observation 86c1bdb6-b4b4-400b-84e1-efcc5e2af339 · outbound

This paper cites Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities.

VoiceGiraffe: A Benchmark for Extreme Long-Context Audio-Language Understanding Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities

Reference 18

Resolution
unresolved
no resolver link, observed 2026-06-29T10:35:43.312600Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-29T10:35:43.312600Z digest=sha256:b1ae663acfcc1cb4a65acdcfb4220bad8167f0ff7282f9b6936cf25d82826de7

Observation 0a7bf7e8-7c82-45dc-9587-e1334619446b · outbound

This paper cites Moss-audio technical report.

VoiceGiraffe: A Benchmark for Extreme Long-Context Audio-Language Understanding Moss-audio technical report

Reference 19

Resolution
unresolved
no resolver link, observed 2026-06-29T10:35:43.312600Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-29T10:35:43.312600Z digest=sha256:4ca3633ed75af796a24fdc3b7b5ea290378d4cd245e2f1cff223f719a6081e93

Observation 7e47dbdf-7f19-412b-b7f8-24016b634eda · outbound

This paper cites Qwen3.5-omni technical report.

VoiceGiraffe: A Benchmark for Extreme Long-Context Audio-Language Understanding Qwen3.5-omni technical report

Reference 20

Resolution
unresolved
no resolver link, observed 2026-06-29T10:35:43.312600Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-29T10:35:43.312600Z digest=sha256:61b555d2428e95bb0592b04e067b7ea6ad51bf6bb7bb12a8f42e95b3b643e397

Observation 66141ead-8d4f-4b70-a333-6aa7552b0b66 · outbound

This paper cites Qwen3-omni technical report.

VoiceGiraffe: A Benchmark for Extreme Long-Context Audio-Language Understanding Qwen3-omni technical report

Reference 21

Resolution
unresolved
no resolver link, observed 2026-06-29T10:35:43.312600Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-29T10:35:43.312600Z digest=sha256:d206d5eb1df59edec3bc3f40d665da1d8fbea251dbdfd35bdf47aa9c0f2a1d7c

Observation 952cb64f-03ac-40c5-8e9d-e348decc72ce · outbound

This paper cites an unresolved cited work.

VoiceGiraffe: A Benchmark for Extreme Long-Context Audio-Language Understanding Unresolved cited work

Reference 22

Resolution
unresolved
no resolver link, observed 2026-06-29T10:35:43.312600Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-29T10:35:43.312600Z digest=sha256:812d0e7884b3801470120057d6c9a386ec91e773f1e7fa6a9cbfe51d643590be

Observation b8f964fd-55a8-4320-8dce-2ae5ecb38e3f · outbound

This paper cites Mimo-audio: Audio language models are few-shot learners.

VoiceGiraffe: A Benchmark for Extreme Long-Context Audio-Language Understanding Mimo-audio: Audio language models are few-shot learners

Reference 23

Resolution
unresolved
no resolver link, observed 2026-06-29T10:35:43.312600Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-29T10:35:43.312600Z digest=sha256:6df8e0d422a042dd0f52de4e6e1c6460d558c32bd5cc37202eafae2bdede74b9

Observation 94ee65de-4ed3-421b-be04-48b765a604db · outbound

This paper cites Qwen2.5-omni technical report.

VoiceGiraffe: A Benchmark for Extreme Long-Context Audio-Language Understanding Qwen2.5-omni technical report

Reference 24

Resolution
unresolved
no resolver link, observed 2026-06-29T10:35:43.312600Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-29T10:35:43.312600Z digest=sha256:064294b991fcb0f36a71955ef789e537a2ce01050631e931a44b5b12d727fe70

Observation 2e6fdf44-b206-4cf4-b8ef-80a14c3ea324 · outbound

This paper cites Longspeech: A scalable benchmark for transcription, translation and understanding in long speech.

VoiceGiraffe: A Benchmark for Extreme Long-Context Audio-Language Understanding Longspeech: A scalable benchmark for transcription, translation and understanding in long speech

Reference 25

Resolution
unresolved
no resolver link, observed 2026-06-29T10:35:43.312600Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-29T10:35:43.312600Z digest=sha256:48e70b3caf9577ca0623960107fa715f0afd7bcb28e2346ef585eaf5b2fb4b75

Observation 484ce664-ced3-42cb-8c16-1b2d548db4c0 · outbound

This paper cites Air-bench: Benchmarking large audio-language models via generative comprehension.

VoiceGiraffe: A Benchmark for Extreme Long-Context Audio-Language Understanding Air-bench: Benchmarking large audio-language models via generative comprehension

Reference 26

Resolution
unresolved
no resolver link, observed 2026-06-29T10:35:43.312600Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-29T10:35:43.312600Z digest=sha256:fd0fec079591dd01be8b9d50bddc0085a662ab165797f093b32b2341cf3dfbf7

Observation 23dffe9d-da5f-4b31-8e18-932863f078be · outbound

This paper cites MiniCPM-V: A GPT-4V Level MLLM on Your Phone.

VoiceGiraffe: A Benchmark for Extreme Long-Context Audio-Language Understanding MiniCPM-V: A GPT-4V Level MLLM on Your Phone

Reference 27

Resolution
verified exact
local_arxiv, observed 2026-06-29T13:13:28.444375Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-06-29T10:35:43.312600Z digest=sha256:b941131bbc47385ed9d42d15bffdc9be2aa6f75a5d1a413d6fa1e7bc983240d8

Observation b4ea9a28-8e27-4944-a7c5-62dcac7abff5 · outbound

This paper cites Salmonn-omni: A standalone speech LLM without codec injection for full-duplex conversation.

VoiceGiraffe: A Benchmark for Extreme Long-Context Audio-Language Understanding Salmonn-omni: A standalone speech LLM without codec injection for full-duplex conversation

Reference 28

Resolution
unresolved
no resolver link, observed 2026-06-29T10:35:43.312600Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-29T10:35:43.312600Z digest=sha256:3024b23bb064396ddf8ca1a1f47aa9797d09a6c5ae3ea8af847719638d111653

Observation 4bc62ca5-3a29-40f9-b947-1dddcf747746 · outbound

This paper cites @esa (Ref.

VoiceGiraffe: A Benchmark for Extreme Long-Context Audio-Language Understanding @esa (Ref

Reference 29

Resolution
unresolved
no resolver link, observed 2026-06-29T10:35:43.312600Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-29T10:35:43.312600Z digest=sha256:79258fe8edb3f3245d932fc9f6e0332d18e9b56013fe59a0bbef3030fa6a2018

Observation 5537e823-2b50-45d2-8b31-25bb367fe59c · outbound

This paper cites an unresolved cited work.

VoiceGiraffe: A Benchmark for Extreme Long-Context Audio-Language Understanding Unresolved cited work

Reference 30

Resolution
unresolved
no resolver link, observed 2026-06-29T10:35:43.312600Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-29T10:35:43.312600Z digest=sha256:8dfee15db7f26696bae2d4649dc61fe9a31e84c79c64e565d615500e7f8fa0d4

Observation 21ae1eb0-6eac-43e8-b9a2-f671c77de499 · outbound

This paper cites Victoria Beckham.

VoiceGiraffe: A Benchmark for Extreme Long-Context Audio-Language Understanding Victoria Beckham

Reference 31

Resolution
malformed identifier
arxiv_id, observed 2026-06-29T13:13:28.446916Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-06-29T10:35:43.312600Z digest=sha256:bba108f84ed1380856110c226663fef656a5344e284ce65038849d5358c3dd58

Pith citing papers

No inbound Pith citation observations are available.