Pith. sign in

Paper Citation Record · LEDGER

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model

As of 16 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 1 inbound Pith citation observation for arXiv:2505.13062.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.13062 v3

Coverage vector

measured 41 of 41 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-15T20:25:31.105122Z

measured 42 of 42 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-16T06:30:59.297886+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-15T20:25:30.954743Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-08-15T20:25:31.298438Z

Reference resolution

41 of 41 outbound references displayed

  • verified exact0
  • verified fuzzy16
  • unresolved23
  • parse uncertain0
  • malformed identifier1
  • metadata mismatch1

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 4ea2c479-b15d-413c-acd7-527324f5090a · outbound

This paper cites Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model

Reference 1

Resolution
metadata mismatch
local_arxiv, observed 2026-08-15T20:25:31.304236Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:25:30.954743Z digest=sha256:e496fab3a997eac5b77f54d48ffbb8d38f545a8c4f94c85267d5185c559ee192

Observation f5731167-1c17-4eed-965a-c55997dc66e0 · outbound

This paper cites SFT for SV AD Given a silent video V = I T t=1 withT frames, the SV AD task aims to generate a corresponding audio descriptionCaudio.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model SFT for SV AD Given a silent video V = I T t=1 withT frames, the SV AD task aims to generate a corresponding audio descriptionCaudio

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:25:31.521636Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:25:30.963218Z digest=sha256:1fbbf5afb1a571a0f6eddef48613f84610679aeb4e8fb76ec48ec42afa6de9f4

Observation eaed0417-0dd9-4561-86bf-b27b85b69929 · outbound

This paper cites an unresolved cited work.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model Unresolved cited work

Reference 3

Resolution
malformed identifier
raw_fallback, observed 2026-08-15T20:25:31.510788Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:25:30.967354Z digest=sha256:9292ea46771f61080d73ec39c8b946ce9afdd7f133470cc1257e40e59cb1ffcd

Observation b1f99f45-1435-4309-ad95-58a9ab79dc68 · outbound

This paper cites an unresolved cited work.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model Unresolved cited work

Reference 4

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:25:31.500577Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:25:30.971335Z digest=sha256:f8eee78caf28508e23e2648acc5a5dd8a146b8b6cf27d5b91d44db9219e7b204

Observation 284182dc-e2cc-4900-a2d2-3ec29bfd01a3 · outbound

This paper cites MiniGPT4-Video: Advancing Multimodal LLMs for Video Understanding with Interleaved Visual-Textual Tokens.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model MiniGPT4-Video: Advancing Multimodal LLMs for Video Understanding with Interleaved Visual-Textual Tokens

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-15T20:25:30.990915Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:25:30.990915Z digest=sha256:42ff745adc3a3f40c9dde6bf17df799999657cd067719107b89ea6fdc8847afb

Observation 1ce585bf-1cbd-46e4-8dea-10197763c2d2 · outbound

This paper cites Multisensory- guided associative learning enhances multisensory representation in primary auditory cortex,.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model Multisensory- guided associative learning enhances multisensory representation in primary auditory cortex,

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:25:31.489915Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:25:30.974975Z digest=sha256:2e407e5ab3cd8aac38296a9946006e4f33e3ea96daf657356549c58e76920cdb

Observation 77e07d20-e03f-49b3-88ca-f220eee99961 · outbound

This paper cites MM-LLMs: Recent Advances in MultiModal Large Language Models.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model MM-LLMs: Recent Advances in MultiModal Large Language Models

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-15T20:25:30.978656Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:25:30.978656Z digest=sha256:412082fe5ceb6e4b673db530db353f275702e0da396e288d14b477bc72278bf0

Observation 362b949f-dad6-4244-a3b8-c006b8b180b2 · outbound

This paper cites VideoChat: Chat-Centric Video Understanding.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model VideoChat: Chat-Centric Video Understanding

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-15T20:25:30.982484Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:25:30.982484Z digest=sha256:1fab69651de0483cc7877ab6f3ad23ec3f4f83cf23cc673bb229474feff31b58

Observation 2196f4a7-e8cf-44d3-8da0-5a3c6c9a569c · outbound

This paper cites Video-LLaVA: Learning United Visual Representation by Alignment Before Projection.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model Video-LLaVA: Learning United Visual Representation by Alignment Before Projection

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-15T20:25:30.986800Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:25:30.986800Z digest=sha256:715451a22ccfa1d9cc250afbbaf44961196b272d050bf4c1daa3621aaa18a5e0

Observation 4c19d327-59f8-4445-8d81-db6b18681e49 · outbound

This paper cites STA-V2A: Video-to-Audio Generation with Semantic and Temporal Alignment.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model STA-V2A: Video-to-Audio Generation with Semantic and Temporal Alignment

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-15T20:25:31.011778Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:25:31.011778Z digest=sha256:82744c5e9a9b16fff9bc28d806b28cc2ffd65826195bb07cd37cb603f96b6d14

Observation 9ae3ddbc-b652-4a76-839e-9901d10ec1b6 · outbound

This paper cites Video-to-Audio Generation with Hidden Alignment.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model Video-to-Audio Generation with Hidden Alignment

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-15T20:25:30.995667Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:25:30.995667Z digest=sha256:3b690fc90d830e8eef9b554c33755438df5b3a80bc2a73e9b75e02ba228ec067

Observation f15cd0ab-403f-4041-baad-11197ebdf900 · outbound

This paper cites Frieren: Efficient Video-to-Audio Generation Network with Rectified Flow Matching.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model Frieren: Efficient Video-to-Audio Generation Network with Rectified Flow Matching

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-15T20:25:30.999910Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:25:30.999910Z digest=sha256:d15540a49b34976564a95742ff53f7425a35828216088caba11e111fb4f83317

Observation 44878e4b-545a-41f0-a16e-fceac3f57f41 · outbound

This paper cites V2a- mapper: A lightweight solution for vision-to-audio generation by connecting foundation models,.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model V2a- mapper: A lightweight solution for vision-to-audio generation by connecting foundation models,

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:25:31.478939Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:25:31.004061Z digest=sha256:129cf5192ee59f20f384af8e0a418b243aea7fd70ff8f0de96d200a285045f7c

Observation feace7b4-450d-4946-b42d-21e6045664e0 · outbound

This paper cites Foleygen: Visually-guided audio generation,.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model Foleygen: Visually-guided audio generation,

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:25:31.468363Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:25:31.007650Z digest=sha256:5420c90d36f2060f5401b4d7351125d49ea86bd794ebf640886c0b2a8ee72fb9

Observation 18472efb-57f1-4f3f-b574-bca98d354bf9 · outbound

This paper cites Wavcaps: A chatgpt-assisted weakly- labelled audio captioning dataset for audio-language multimodal research,.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model Wavcaps: A chatgpt-assisted weakly- labelled audio captioning dataset for audio-language multimodal research,

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-15T20:25:31.030495Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:25:31.030495Z digest=sha256:55812cf8e078843c64f220f1b7a71227976560e3d34a850ceef994408141f8bc

Observation 25a35509-3055-4ad8-a498-f9160489027d · outbound

This paper cites Text-to-Audio Generation Synchronized with Videos.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model Text-to-Audio Generation Synchronized with Videos

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-15T20:25:31.015693Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:25:31.015693Z digest=sha256:9d00a59feec119a1a11fc2a022e83a64ad7e31e88bba79ef3ed00b992d961957

Observation 8fb3c112-9498-4a3f-b0fe-a785e763ebd2 · outbound

This paper cites FoleyCrafter: Bring Silent Videos to Life with Lifelike and Synchronized Sounds.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model FoleyCrafter: Bring Silent Videos to Life with Lifelike and Synchronized Sounds

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-15T20:25:31.019247Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:25:31.019247Z digest=sha256:b752efd638ed641ae813d230ea89cb8071912efa32a44c44a7ce79dfa75c50bf

Observation a03c0787-f0c9-4648-ac43-3779aea4f037 · outbound

This paper cites Read, Watch and Scream! Sound Generation from Text and Video.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model Read, Watch and Scream! Sound Generation from Text and Video

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-15T20:25:31.022815Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:25:31.022815Z digest=sha256:7d325f071393c15a6b32fa87e93d1c55b0859574028ac2c3c7ca6e979753ef45

Observation f584c6a1-2a11-49c5-8f75-1f9adfd55165 · outbound

This paper cites FolAI: Synchronized Foley Sound Generation with Semantic and Temporal Alignment.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model FolAI: Synchronized Foley Sound Generation with Semantic and Temporal Alignment

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-15T20:25:31.026317Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:25:31.026317Z digest=sha256:09b83bba25d82cce97bf7901e30ae93e17152f0139103e7b689060a9c6e200a5

Observation 92e1dd92-2121-47ad-9bc6-fa069eb0e06c · outbound

This paper cites LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-15T20:25:31.048189Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:25:31.048189Z digest=sha256:4931b7a83d5c457657f4af07ed90a88e231faf70dccfd9a128913a50af3f42c8

Observation 7707387e-fe86-4ddf-82f1-7b08dc136b3c · outbound

This paper cites Conette: An efficient au- dio captioning system leveraging multiple datasets with task em- bedding,.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model Conette: An efficient au- dio captioning system leveraging multiple datasets with task em- bedding,

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-15T20:25:31.033984Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:25:31.033984Z digest=sha256:d89733386b12757892cade4acb7e8c15dc33ff293428c4920c479c2fc28ab709

Observation 678a54ef-0ac2-4661-a5e2-11c78754244a · outbound

This paper cites Automatic video captioning using tree hierarchical deep convolutional neu- ral network and asrnn-bi-directional lstm,.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model Automatic video captioning using tree hierarchical deep convolutional neu- ral network and asrnn-bi-directional lstm,

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:25:31.445167Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:25:31.037314Z digest=sha256:7bc88eef57398d50c309c8d32e49a650dcdedb83d6146010308eaecefcd8c28d

Observation dbbae53a-3ae4-421f-9fee-05f82fe597b7 · outbound

This paper cites Streaming dense video captioning,.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model Streaming dense video captioning,

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:25:31.434478Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:25:31.040976Z digest=sha256:ff4b798c5f3f7a0c368591abfe0ab0f0c856bd3fc9d1419595cbc9797cc5175d

Observation d77a8053-30e2-4f0f-a42a-4f421eb3052c · outbound

This paper cites AVCap: Leveraging Audio-Visual Features as Text Tokens for Captioning.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model AVCap: Leveraging Audio-Visual Features as Text Tokens for Captioning

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-15T20:25:31.044527Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:25:31.044527Z digest=sha256:1468c65aafcf045d5381ad9de9c36231c7119d3931f79ec107e57ea042218df6

Observation 82eef265-2b49-4bf9-bda8-ddcdf46e4150 · outbound

This paper cites LoRA: Low-Rank Adaptation of Large Language Models,.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model LoRA: Low-Rank Adaptation of Large Language Models,

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:25:31.403181Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:25:31.066625Z digest=sha256:0fec86f9d380003ed464c3f95f251d06088a1160ce1ed26ca238539c1ed36e90

Observation dd4e23ca-97e8-42fd-9630-4ff4ae785269 · outbound

This paper cites an unresolved cited work.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model Unresolved cited work

Reference 26

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:25:31.531676Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:25:30.959376Z digest=sha256:4fadf9d76984a85b85cf0313a98a7e9e1c03861dc19ceed9cd056b52b59b6438

Observation 74fa0396-0ea8-4937-835c-55415ff7c5d2 · outbound

This paper cites An eye for an ear: zero-shot audio description leveraging an image captioner with audio-visual token distribution matching,.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model An eye for an ear: zero-shot audio description leveraging an image captioner with audio-visual token distribution matching,

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:25:31.424081Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:25:31.051720Z digest=sha256:a7963e21fb126d857aa60daabc877af4bf4c1ef33d0aa194223694b4b0ca3d32

Observation 9b4b0f06-7b50-45f8-89ba-2a35155a16aa · outbound

This paper cites VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-15T20:25:31.055296Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:25:31.055296Z digest=sha256:b062fb51957bf49e87584ce25fbe72480d960107a250dd360ac9f72ec6539ea8

Observation 85d49c75-0db9-4a8b-a2c5-6836a03b46f8 · outbound

This paper cites Oryx MLLM: On-Demand Spatial-Temporal Understanding at Arbitrary Resolution.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model Oryx MLLM: On-Demand Spatial-Temporal Understanding at Arbitrary Resolution

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-15T20:25:31.059117Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:25:31.059117Z digest=sha256:78577c70f80062793f592a8bf76a23df5d8468de86dd0a456b11acee60ef6fa3

Observation 243a8b76-21f5-40d4-8d5f-b7a273d96fda · outbound

This paper cites Internvl: Scaling up vision foun- dation models and aligning for generic visual-linguistic tasks,.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model Internvl: Scaling up vision foun- dation models and aligning for generic visual-linguistic tasks,

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:25:31.413892Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:25:31.063165Z digest=sha256:427f83bd1d7465c195901f834d9327fdb3584a65f22236070e4487a63eaa14e6

Observation 37f408ac-3dd9-45af-b12c-26f66d1d4934 · outbound

This paper cites Chain-of-thought prompting elicits reasoning in large language models,.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model Chain-of-thought prompting elicits reasoning in large language models,

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-15T20:25:31.070010Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:25:31.070010Z digest=sha256:ff95f78d69d22708ad9874e091f81d0010ddfb3fdda6e1322dd3b7e6bc7e4675

Observation bd2efa4d-726f-4c0b-8bd7-2e9e2e40e59f · outbound

This paper cites Audiocaps: Generat- ing captions for audios in the wild,.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model Audiocaps: Generat- ing captions for audios in the wild,

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-15T20:25:31.073254Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:25:31.073254Z digest=sha256:c7025641f69c6329cea0a5a8b0355eaa4d94617230485185e1fb96dae59773f1

Observation a8375c5c-9baf-456c-9441-576008fcf55d · outbound

This paper cites GPT-4o System Card.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model GPT-4o System Card

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-15T20:25:31.076500Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:25:31.076500Z digest=sha256:fe2e798ff709abd1aa425ee63bbfb9fea1eb50afb116d0b9cef327c5c748e331

Observation 98e3f8bc-e07e-4d65-96e2-5a71e5504bab · outbound

This paper cites Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation,.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation,

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:25:31.380074Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:25:31.079772Z digest=sha256:396e43ace5281e9f60d15ba60a3bd65764aa05786c74a896c99c7d7e4c7a6660

Observation e4209607-048a-4018-8810-7e9937d9f066 · outbound

This paper cites Bleu: a method for automatic evaluation of machine translation,.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model Bleu: a method for automatic evaluation of machine translation,

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:25:31.369004Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:25:31.083009Z digest=sha256:248f4ed0d331b2fba31c837d1b77b312ab2affeaa19e8e415c7a55cd2ab6914f

Observation ca474cb5-5e15-4d39-8400-74b900f0eab9 · outbound

This paper cites Meteor: An automatic metric for mt evaluation with improved correlation with human judgments,.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model Meteor: An automatic metric for mt evaluation with improved correlation with human judgments,

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:25:31.357837Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:25:31.086629Z digest=sha256:ed38fee4ff6f7011e12efc590984d6d81abe8c02b07d5ace6b073e91ea407d40

Observation c7563e6a-e57e-4d09-988a-1600ab5f93cf · outbound

This paper cites Rouge: A package for automatic evaluation of sum- maries,.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model Rouge: A package for automatic evaluation of sum- maries,

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:25:31.346844Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:25:31.089834Z digest=sha256:d43fabbbfece697a4a7d92e849369da40d539dcf1ad4b4366c5683d477cd5ad7

Observation c4be74c4-4337-4175-8cf9-e9c46ee7b2af · outbound

This paper cites Cider: Consensus-based image description evaluation,.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model Cider: Consensus-based image description evaluation,

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:25:31.336845Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:25:31.093343Z digest=sha256:d493dd26550afcf5571a82df1afab37890cd49d40d4a05517ca681465559bb19

Observation 0a9bf1a8-5169-4aa7-8c10-824cf5de2467 · outbound

This paper cites Spice: Se- mantic propositional image caption evaluation,.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model Spice: Se- mantic propositional image caption evaluation,

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:25:31.326264Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:25:31.097455Z digest=sha256:4612927ee75a269b966bbdc702bdb3db85f26530fbd849a24a2c8e56e3bdd93d

Observation b3fb4b55-5c87-4e36-b638-651ffbeb94f6 · outbound

This paper cites Diverse and aligned audio-to-video generation via text-to-video model adaptation,.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model Diverse and aligned audio-to-video generation via text-to-video model adaptation,

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:25:31.315646Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:25:31.100975Z digest=sha256:d0153a9f26f722dc1632c7673ec63c2f43a1dc7e788d6b9ddf54d23f36b49b39

Observation aef9d9d5-9aa1-4124-a0f2-5894db01ff40 · outbound

This paper cites The Llama 3 Herd of Models.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model The Llama 3 Herd of Models

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-15T20:25:31.105122Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:25:31.105122Z digest=sha256:187864bd0a7edf2545e8709c5c940a96d80a44be96e06ce9c325596748958eb4

Pith citing papers

Observation 4ea2c479-b15d-413c-acd7-527324f5090a · inbound

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model cites this paper.

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model

Reference 1

Resolution
metadata mismatch
local_arxiv, observed 2026-08-15T20:25:31.304236Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:25:30.954743Z digest=sha256:e496fab3a997eac5b77f54d48ffbb8d38f545a8c4f94c85267d5185c559ee192