{"as_of":"2026-08-16T11:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ccd8cfde1d2f1dcb46e485c0f26fe1d705b8080b82dda6e1d99953a741854006","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:25:31.105122Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:25:30.954743Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-15T20:25:31.298438Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-16T11:14:22.300321Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"cited_work":{"arxiv_id":"2505.13062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.13062","snapshot_observed_at":"2026-08-15T20:25:31.298438Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","venue":"cs.MM","work_id":"0c6c9e4f-259f-4ca2-8f6f-003ecb0b5240","year":2025},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-16T11:14:22.300321Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:30.954743Z"},"links":{"cited_paper":"/paper/2505.13062","citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:e496fab3a997eac5b77f54d48ffbb8d38f545a8c4f94c85267d5185c559ee192","observation_id":"4ea2c479-b15d-413c-acd7-527324f5090a","resolution":{"observed_at":"2026-08-15T20:25:31.304236Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.13062/citation-record","integrity":"/paper/2505.13062/integrity","json":"/paper/2505.13062/citation-record.json","paper":"/paper/2505.13062"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-16T11:14:22.300321Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"cited_work":{"arxiv_id":"2505.13062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.13062","snapshot_observed_at":"2026-08-15T20:25:31.298438Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","venue":"cs.MM","work_id":"0c6c9e4f-259f-4ca2-8f6f-003ecb0b5240","year":2025},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-16T11:14:22.300321Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:30.954743Z"},"links":{"cited_paper":"/paper/2505.13062","citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:e496fab3a997eac5b77f54d48ffbb8d38f545a8c4f94c85267d5185c559ee192","observation_id":"4ea2c479-b15d-413c-acd7-527324f5090a","resolution":{"observed_at":"2026-08-15T20:25:31.304236Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:25:31.517834Z","title":"SFT for SV AD Given a silent video V = I T t=1 withT frames, the SV AD task aims to generate a corresponding audio descriptionCaudio","venue":null,"work_id":"0babd06f-37d0-48d7-8871-0c04daaccc69","year":null},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-16T11:14:22.300321Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:30.963218Z"},"links":{"citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:1fbbf5afb1a571a0f6eddef48613f84610679aeb4e8fb76ec48ec42afa6de9f4","observation_id":"f5731167-1c17-4eed-965a-c55997dc66e0","resolution":{"observed_at":"2026-08-15T20:25:31.521636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:25:31.507194Z","title":null,"venue":null,"work_id":"c6f986e6-8168-47cc-9016-c17c1c259606","year":null},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-16T11:14:22.300321Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:30.967354Z"},"links":{"citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:9292ea46771f61080d73ec39c8b946ce9afdd7f133470cc1257e40e59cb1ffcd","observation_id":"eaed0417-0dd9-4561-86bf-b27b85b69929","resolution":{"observed_at":"2026-08-15T20:25:31.510788Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:25:31.497044Z","title":null,"venue":null,"work_id":"830e61ff-ac27-40a3-9307-7a4e58d0b600","year":null},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-16T11:14:22.300321Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:30.971335Z"},"links":{"citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:f8eee78caf28508e23e2648acc5a5dd8a146b8b6cf27d5b91d44db9219e7b204","observation_id":"b1f99f45-1435-4309-ad95-58a9ab79dc68","resolution":{"observed_at":"2026-08-15T20:25:31.500577Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03413","last_updated":"2024-04-04T12:46:01Z","snapshot_observed_at":"2026-08-13T00:37:45.501808Z","submitted_at":"2024-04-04T12:46:01Z","title":"MiniGPT4-Video: Advancing Multimodal LLMs for Video Understanding with Interleaved Visual-Textual Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03413","snapshot_observed_at":"2026-08-15T20:25:30.990915Z","title":"Minigpt4-video: Advancing mul- timodal llms for video understanding with interleaved visual- textual tokens,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-16T11:14:22.300321Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:30.990915Z"},"links":{"cited_paper":"/paper/2404.03413","citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:42ff745adc3a3f40c9dde6bf17df799999657cd067719107b89ea6fdc8847afb","observation_id":"284182dc-e2cc-4900-a2d2-3ec29bfd01a3","resolution":{"observed_at":"2026-08-15T20:25:30.990915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:25:31.486279Z","title":"Multisensory- guided associative learning enhances multisensory representation in primary auditory cortex,","venue":null,"work_id":"39627957-4e6a-4f45-ba63-bc15bb069234","year":2022},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-16T11:14:22.300321Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:30.974975Z"},"links":{"citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:2e407e5ab3cd8aac38296a9946006e4f33e3ea96daf657356549c58e76920cdb","observation_id":"1ce585bf-1cbd-46e4-8dea-10197763c2d2","resolution":{"observed_at":"2026-08-15T20:25:31.489915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13601","last_updated":"2024-05-28T05:36:23Z","snapshot_observed_at":"2026-08-13T04:35:22.207759Z","submitted_at":"2024-01-24T17:10:45Z","title":"MM-LLMs: Recent Advances in MultiModal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13601","snapshot_observed_at":"2026-08-15T20:25:30.978656Z","title":"Mm-llms: Recent advances in multimodal large language mod- els,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-16T11:14:22.300321Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:30.978656Z"},"links":{"cited_paper":"/paper/2401.13601","citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:412082fe5ceb6e4b673db530db353f275702e0da396e288d14b477bc72278bf0","observation_id":"77e07d20-e03f-49b3-88ca-f220eee99961","resolution":{"observed_at":"2026-08-15T20:25:30.978656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-15T20:25:30.982484Z","title":"Videochat: Chat-centric video under- standing,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-16T11:14:22.300321Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:30.982484Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:1fab69651de0483cc7877ab6f3ad23ec3f4f83cf23cc673bb229474feff31b58","observation_id":"362b949f-dad6-4244-a3b8-c006b8b180b2","resolution":{"observed_at":"2026-08-15T20:25:30.982484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-15T20:25:30.986800Z","title":"Video- llava: Learning united visual representation by alignment before projection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-16T11:14:22.300321Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:30.986800Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:715451a22ccfa1d9cc250afbbaf44961196b272d050bf4c1daa3621aaa18a5e0","observation_id":"2196f4a7-e8cf-44d3-8da0-5a3c6c9a569c","resolution":{"observed_at":"2026-08-15T20:25:30.986800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.08601","last_updated":"2025-03-24T04:00:01Z","snapshot_observed_at":"2026-08-12T22:45:43.619281Z","submitted_at":"2024-09-13T07:31:44Z","title":"STA-V2A: Video-to-Audio Generation with Semantic and Temporal Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.08601","snapshot_observed_at":"2026-08-15T20:25:31.011778Z","title":"Sta-v2a: Video-to-audio generation with semantic and temporal alignment,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-16T11:14:22.300321Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:31.011778Z"},"links":{"cited_paper":"/paper/2409.08601","citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:70b0ac1bba4a610bce605d0e51f3d4e654fe85774926a9a2f2a2ce68d9dc3940","observation_id":"4c19d327-59f8-4445-8d81-db6b18681e49","resolution":{"observed_at":"2026-08-15T20:25:31.011778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07464","last_updated":"2025-03-11T15:57:51Z","snapshot_observed_at":"2026-08-13T22:24:07.024837Z","submitted_at":"2024-07-10T08:40:39Z","title":"Video-to-Audio Generation with Hidden Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07464","snapshot_observed_at":"2026-08-15T20:25:30.995667Z","title":"Video-to-audio generation with hidden alignment,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-16T11:14:22.300321Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:30.995667Z"},"links":{"cited_paper":"/paper/2407.07464","citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:b20040b218c7cdc622e9fc5dedc1c48044aa54891df315087e36769d7412f6a4","observation_id":"9ae3ddbc-b652-4a76-839e-9901d10ec1b6","resolution":{"observed_at":"2026-08-15T20:25:30.995667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00320","last_updated":"2025-01-04T18:12:07Z","snapshot_observed_at":"2026-08-12T23:52:40.690851Z","submitted_at":"2024-06-01T06:40:22Z","title":"Frieren: Efficient Video-to-Audio Generation Network with Rectified Flow Matching","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00320","snapshot_observed_at":"2026-08-15T20:25:30.999910Z","title":"Frieren: Efficient video-to-audio generation with rectified flow matching,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-16T11:14:22.300321Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:30.999910Z"},"links":{"cited_paper":"/paper/2406.00320","citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:d15540a49b34976564a95742ff53f7425a35828216088caba11e111fb4f83317","observation_id":"f15cd0ab-403f-4041-baad-11197ebdf900","resolution":{"observed_at":"2026-08-15T20:25:30.999910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:25:31.475236Z","title":"V2a- mapper: A lightweight solution for vision-to-audio generation by connecting foundation models,","venue":null,"work_id":"3b502579-9269-44b6-b75e-7c65114ed0f7","year":2024},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-16T11:14:22.300321Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:31.004061Z"},"links":{"citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:129cf5192ee59f20f384af8e0a418b243aea7fd70ff8f0de96d200a285045f7c","observation_id":"44878e4b-545a-41f0-a16e-fceac3f57f41","resolution":{"observed_at":"2026-08-15T20:25:31.478939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:25:31.464588Z","title":"Foleygen: Visually-guided audio generation,","venue":null,"work_id":"d3095917-e600-4879-9472-beabf04368df","year":2024},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-16T11:14:22.300321Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:31.007650Z"},"links":{"citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:5420c90d36f2060f5401b4d7351125d49ea86bd794ebf640886c0b2a8ee72fb9","observation_id":"feace7b4-450d-4946-b42d-21e6045664e0","resolution":{"observed_at":"2026-08-15T20:25:31.468363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:25:31.030495Z","title":"Wavcaps: A chatgpt-assisted weakly- labelled audio captioning dataset for audio-language multimodal research,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-16T11:14:22.300321Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:31.030495Z"},"links":{"citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:55812cf8e078843c64f220f1b7a71227976560e3d34a850ceef994408141f8bc","observation_id":"18472efb-57f1-4f3f-b574-bca98d354bf9","resolution":{"observed_at":"2026-08-15T20:25:31.030495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07938","last_updated":"2024-03-08T22:27:38Z","snapshot_observed_at":"2026-08-14T12:28:06.522240Z","submitted_at":"2024-03-08T22:27:38Z","title":"Text-to-Audio Generation Synchronized with Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07938","snapshot_observed_at":"2026-08-15T20:25:31.015693Z","title":"Text-to-audio generation synchronized with videos,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-16T11:14:22.300321Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:31.015693Z"},"links":{"cited_paper":"/paper/2403.07938","citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:9d00a59feec119a1a11fc2a022e83a64ad7e31e88bba79ef3ed00b992d961957","observation_id":"25a35509-3055-4ad8-a498-f9160489027d","resolution":{"observed_at":"2026-08-15T20:25:31.015693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01494","last_updated":"2024-07-01T17:35:56Z","snapshot_observed_at":"2026-08-12T23:31:04.494652Z","submitted_at":"2024-07-01T17:35:56Z","title":"FoleyCrafter: Bring Silent Videos to Life with Lifelike and Synchronized Sounds","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01494","snapshot_observed_at":"2026-08-15T20:25:31.019247Z","title":"Foleycrafter: Bring silent videos to life with lifelike and synchro- nized sounds,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-16T11:14:22.300321Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:31.019247Z"},"links":{"cited_paper":"/paper/2407.01494","citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:b752efd638ed641ae813d230ea89cb8071912efa32a44c44a7ce79dfa75c50bf","observation_id":"8fb3c112-9498-4a3f-b0fe-a785e763ebd2","resolution":{"observed_at":"2026-08-15T20:25:31.019247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05551","last_updated":"2024-12-26T15:23:36Z","snapshot_observed_at":"2026-08-12T23:27:09.723258Z","submitted_at":"2024-07-08T01:59:17Z","title":"Read, Watch and Scream! Sound Generation from Text and Video","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05551","snapshot_observed_at":"2026-08-15T20:25:31.022815Z","title":"Read, watch and scream! sound generation from text and video,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-16T11:14:22.300321Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:31.022815Z"},"links":{"cited_paper":"/paper/2407.05551","citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:4c2e1aceb4d2a8a4931b44c6b8dc7153f7e7840b12ef85ccba61065b44cca3c9","observation_id":"a03c0787-f0c9-4648-ac43-3779aea4f037","resolution":{"observed_at":"2026-08-15T20:25:31.022815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15023","last_updated":"2025-05-05T16:55:53Z","snapshot_observed_at":"2026-08-15T01:38:35.648532Z","submitted_at":"2024-12-19T16:37:19Z","title":"FolAI: Synchronized Foley Sound Generation with Semantic and Temporal Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15023","snapshot_observed_at":"2026-08-15T20:25:31.026317Z","title":"Stable-v2a: Syn- thesis of synchronized sound effects with temporal and semantic controls,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-16T11:14:22.300321Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:31.026317Z"},"links":{"cited_paper":"/paper/2412.15023","citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:09b83bba25d82cce97bf7901e30ae93e17152f0139103e7b689060a9c6e200a5","observation_id":"f584c6a1-2a11-49c5-8f75-1f9adfd55165","resolution":{"observed_at":"2026-08-15T20:25:31.026317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09291","last_updated":"2025-03-15T12:38:50Z","snapshot_observed_at":"2026-08-16T11:13:43.640159Z","submitted_at":"2025-01-16T04:53:29Z","title":"LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09291","snapshot_observed_at":"2026-08-15T20:25:31.048189Z","title":"Lavcap: Llm-based audio-visual captioning using optimal transport,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-16T11:14:22.300321Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:31.048189Z"},"links":{"cited_paper":"/paper/2501.09291","citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:4931b7a83d5c457657f4af07ed90a88e231faf70dccfd9a128913a50af3f42c8","observation_id":"92e1dd92-2121-47ad-9bc6-fa069eb0e06c","resolution":{"observed_at":"2026-08-15T20:25:31.048189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:25:31.033984Z","title":"Conette: An efficient au- dio captioning system leveraging multiple datasets with task em- bedding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-16T11:14:22.300321Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:31.033984Z"},"links":{"citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:d89733386b12757892cade4acb7e8c15dc33ff293428c4920c479c2fc28ab709","observation_id":"7707387e-fe86-4ddf-82f1-7b08dc136b3c","resolution":{"observed_at":"2026-08-15T20:25:31.033984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:25:31.441513Z","title":"Automatic video captioning using tree hierarchical deep convolutional neu- ral network and asrnn-bi-directional lstm,","venue":null,"work_id":"6098508e-8541-4fa6-aeaf-5ce919def1e7","year":2024},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-16T11:14:22.300321Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:31.037314Z"},"links":{"citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:7bc88eef57398d50c309c8d32e49a650dcdedb83d6146010308eaecefcd8c28d","observation_id":"678a54ef-0ac2-4661-a5e2-11c78754244a","resolution":{"observed_at":"2026-08-15T20:25:31.445167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:25:31.430656Z","title":"Streaming dense video captioning,","venue":null,"work_id":"cd437627-c595-454e-ad46-60169634d4d1","year":2024},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-16T11:14:22.300321Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:31.040976Z"},"links":{"citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:ff4b798c5f3f7a0c368591abfe0ab0f0c856bd3fc9d1419595cbc9797cc5175d","observation_id":"dbbae53a-3ae4-421f-9fee-05f82fe597b7","resolution":{"observed_at":"2026-08-15T20:25:31.434478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07801","last_updated":"2024-07-11T02:38:14Z","snapshot_observed_at":"2026-08-15T11:12:34.238058Z","submitted_at":"2024-07-10T16:17:49Z","title":"AVCap: Leveraging Audio-Visual Features as Text Tokens for Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07801","snapshot_observed_at":"2026-08-15T20:25:31.044527Z","title":"Avcap: Leveraging audio- visual features as text tokens for captioning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-16T11:14:22.300321Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:31.044527Z"},"links":{"cited_paper":"/paper/2407.07801","citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:182ad77b04762e882ff2b443111098852cd024135c6e85255a45534aa2a26138","observation_id":"d77a8053-30e2-4f0f-a42a-4f421eb3052c","resolution":{"observed_at":"2026-08-15T20:25:31.044527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:25:31.399601Z","title":"LoRA: Low-Rank Adaptation of Large Language Models,","venue":null,"work_id":"a75637ff-309a-4d53-bc67-ee3da8654622","year":2022},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-16T11:14:22.300321Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:31.066625Z"},"links":{"citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:0fec86f9d380003ed464c3f95f251d06088a1160ce1ed26ca238539c1ed36e90","observation_id":"82eef265-2b49-4bf9-bda8-ddcdf46e4150","resolution":{"observed_at":"2026-08-15T20:25:31.403181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:25:31.528403Z","title":null,"venue":null,"work_id":"764819f5-795c-4fdb-a362-db428d498b57","year":null},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-16T11:14:22.300321Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:30.959376Z"},"links":{"citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:4fadf9d76984a85b85cf0313a98a7e9e1c03861dc19ceed9cd056b52b59b6438","observation_id":"dd4e23ca-97e8-42fd-9630-4ff4ae785269","resolution":{"observed_at":"2026-08-15T20:25:31.531676Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:25:31.420443Z","title":"An eye for an ear: zero-shot audio description leveraging an image captioner with audio-visual token distribution matching,","venue":null,"work_id":"b263c885-8609-492e-9298-cd5bda07f442","year":2025},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-16T11:14:22.300321Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:31.051720Z"},"links":{"citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:a7963e21fb126d857aa60daabc877af4bf4c1ef33d0aa194223694b4b0ca3d32","observation_id":"74fa0396-0ea8-4937-835c-55415ff7c5d2","resolution":{"observed_at":"2026-08-15T20:25:31.424081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-08-14T16:25:22.654846Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-15T20:25:31.055296Z","title":"Videollama 2: Advanc- ing spatial-temporal modeling and audio understanding in video- llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-16T11:14:22.300321Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:31.055296Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:b062fb51957bf49e87584ce25fbe72480d960107a250dd360ac9f72ec6539ea8","observation_id":"9b4b0f06-7b50-45f8-89ba-2a35155a16aa","resolution":{"observed_at":"2026-08-15T20:25:31.055296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12961","last_updated":"2025-02-27T06:09:46Z","snapshot_observed_at":"2026-08-12T22:41:32.229292Z","submitted_at":"2024-09-19T17:59:51Z","title":"Oryx MLLM: On-Demand Spatial-Temporal Understanding at Arbitrary Resolution","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12961","snapshot_observed_at":"2026-08-15T20:25:31.059117Z","title":"Oryx mllm: On-demand spatial-temporal understanding at arbitrary resolu- tion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-16T11:14:22.300321Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:31.059117Z"},"links":{"cited_paper":"/paper/2409.12961","citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:515b2804227bbcbdc86826cbb06237bef86b062b5bb0c8c6d970af625ec749a4","observation_id":"85d49c75-0db9-4a8b-a2c5-6836a03b46f8","resolution":{"observed_at":"2026-08-15T20:25:31.059117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:25:31.410088Z","title":"Internvl: Scaling up vision foun- dation models and aligning for generic visual-linguistic tasks,","venue":null,"work_id":"7d75f381-9774-4518-942a-61c08c5eb590","year":2024},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-16T11:14:22.300321Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:31.063165Z"},"links":{"citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:427f83bd1d7465c195901f834d9327fdb3584a65f22236070e4487a63eaa14e6","observation_id":"243a8b76-21f5-40d4-8d5f-b7a273d96fda","resolution":{"observed_at":"2026-08-15T20:25:31.413892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:25:31.070010Z","title":"Chain-of-thought prompting elicits reasoning in large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-16T11:14:22.300321Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:31.070010Z"},"links":{"citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:ff95f78d69d22708ad9874e091f81d0010ddfb3fdda6e1322dd3b7e6bc7e4675","observation_id":"37f408ac-3dd9-45af-b12c-26f66d1d4934","resolution":{"observed_at":"2026-08-15T20:25:31.070010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:25:31.073254Z","title":"Audiocaps: Generat- ing captions for audios in the wild,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-16T11:14:22.300321Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:31.073254Z"},"links":{"citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:c7025641f69c6329cea0a5a8b0355eaa4d94617230485185e1fb96dae59773f1","observation_id":"bd2efa4d-726f-4c0b-8bd7-2e9e2e40e59f","resolution":{"observed_at":"2026-08-15T20:25:31.073254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-15T20:25:31.076500Z","title":"Gpt-4o system card,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-16T11:14:22.300321Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:31.076500Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:fe2e798ff709abd1aa425ee63bbfb9fea1eb50afb116d0b9cef327c5c748e331","observation_id":"a8375c5c-9baf-456c-9441-576008fcf55d","resolution":{"observed_at":"2026-08-15T20:25:31.076500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:25:31.376648Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation,","venue":null,"work_id":"c84e39dc-8d7d-4971-a295-70242f83577c","year":2023},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-16T11:14:22.300321Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:31.079772Z"},"links":{"citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:396e43ace5281e9f60d15ba60a3bd65764aa05786c74a896c99c7d7e4c7a6660","observation_id":"98e3f8bc-e07e-4d65-96e2-5a71e5504bab","resolution":{"observed_at":"2026-08-15T20:25:31.380074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:25:31.365320Z","title":"Bleu: a method for automatic evaluation of machine translation,","venue":null,"work_id":"adb091c7-0f71-45fd-91ce-3ed270552fce","year":2002},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-16T11:14:22.300321Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:31.083009Z"},"links":{"citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:248f4ed0d331b2fba31c837d1b77b312ab2affeaa19e8e415c7a55cd2ab6914f","observation_id":"e4209607-048a-4018-8810-7e9937d9f066","resolution":{"observed_at":"2026-08-15T20:25:31.369004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:25:31.353600Z","title":"Meteor: An automatic metric for mt evaluation with improved correlation with human judgments,","venue":null,"work_id":"ebd14b16-3903-4c5a-9716-a046fee8ec87","year":2005},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-16T11:14:22.300321Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:31.086629Z"},"links":{"citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:ed38fee4ff6f7011e12efc590984d6d81abe8c02b07d5ace6b073e91ea407d40","observation_id":"ca474cb5-5e15-4d39-8400-74b900f0eab9","resolution":{"observed_at":"2026-08-15T20:25:31.357837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:25:31.343368Z","title":"Rouge: A package for automatic evaluation of sum- maries,","venue":null,"work_id":"365a2c82-2660-478a-aa75-95a39891c827","year":2004},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-16T11:14:22.300321Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:31.089834Z"},"links":{"citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:d43fabbbfece697a4a7d92e849369da40d539dcf1ad4b4366c5683d477cd5ad7","observation_id":"c7563e6a-e57e-4d09-988a-1600ab5f93cf","resolution":{"observed_at":"2026-08-15T20:25:31.346844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:25:31.333409Z","title":"Cider: Consensus-based image description evaluation,","venue":null,"work_id":"157d85a4-3867-4cfb-a7f9-7ce416e82211","year":2015},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-16T11:14:22.300321Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:31.093343Z"},"links":{"citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:d493dd26550afcf5571a82df1afab37890cd49d40d4a05517ca681465559bb19","observation_id":"c4be74c4-4337-4175-8cf9-e9c46ee7b2af","resolution":{"observed_at":"2026-08-15T20:25:31.336845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:25:31.322767Z","title":"Spice: Se- mantic propositional image caption evaluation,","venue":null,"work_id":"0287c932-bb38-444d-86aa-9d487f59bcd1","year":2016},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-16T11:14:22.300321Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:31.097455Z"},"links":{"citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:4612927ee75a269b966bbdc702bdb3db85f26530fbd849a24a2c8e56e3bdd93d","observation_id":"0a9bf1a8-5169-4aa7-8c10-824cf5de2467","resolution":{"observed_at":"2026-08-15T20:25:31.326264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:25:31.311737Z","title":"Diverse and aligned audio-to-video generation via text-to-video model adaptation,","venue":null,"work_id":"e20c8836-cc22-4ce2-817d-7fc829441559","year":2024},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-16T11:14:22.300321Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:31.100975Z"},"links":{"citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:d0153a9f26f722dc1632c7673ec63c2f43a1dc7e788d6b9ddf54d23f36b49b39","observation_id":"b3fb4b55-5c87-4e36-b638-651ffbeb94f6","resolution":{"observed_at":"2026-08-15T20:25:31.315646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-15T20:25:31.105122Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","snapshot_observed_at":"2026-08-16T11:14:22.300321Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T20:25:31.105122Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.13062"},"observation_digest":"sha256:187864bd0a7edf2545e8709c5c940a96d80a44be96e06ce9c325596748958eb4","observation_id":"aef9d9d5-9aa1-4124-a0f2-5894db01ff40","resolution":{"observed_at":"2026-08-15T20:25:31.105122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.13062","last_updated":"2025-05-28T02:26:20Z","latest_version":3,"primary_category":"cs.MM","snapshot_observed_at":"2026-08-16T11:14:22.300321Z","submitted_at":"2025-05-19T12:52:51Z","title":"Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":16},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 1 inbound Pith citation observation for arXiv:2505.13062."}