{"as_of":"2026-08-07T23:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a23e1a4d9759c5fb497288273ea3580a1391b528c9d4cc513df096c03a0dfbcd","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:20:17.616572Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:20:14.606479Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T13:20:19.500789Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-07T13:14:09.265446Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"cited_work":{"arxiv_id":"2505.22045","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.22045","snapshot_observed_at":"2026-08-07T13:20:19.500789Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","venue":"cs.MM","work_id":"59672561-b82e-40ef-ba06-f32d2abff6a0","year":2025},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-07T13:14:09.265446Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:14.606479Z"},"links":{"cited_paper":"/paper/2505.22045","citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:542ec271ded02fcd260c268c82d8b04caad677b0c272aba37263f8a3e3a4ca38","observation_id":"5b3a8d93-2fb8-4921-ad48-6933a4507c29","resolution":{"observed_at":"2026-08-07T13:20:19.650775Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.22045/citation-record","integrity":"/paper/2505.22045/integrity","json":"/paper/2505.22045/citation-record.json","paper":"/paper/2505.22045"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:22.989978Z","title":"This task is applicable in ar- eas such as multimedia retrieval [2, 3], assistive technologies for the hearing-impaired [4, 5], and intelligent video analysis systems [6]","venue":null,"work_id":"8a8e7f99-5806-4ff6-adc6-7ca04f28430d","year":null},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-07T13:14:09.265446Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:13.754361Z"},"links":{"citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:cf3ee887e39c6784d6ff54e53de51d7fbf1d7e79ceb3ba4dd8afb6b79148b910","observation_id":"990bc393-2e2b-40b4-a080-f8d8f0809d60","resolution":{"observed_at":"2026-08-07T13:20:23.517742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:22.323570Z","title":null,"venue":null,"work_id":"38c04006-3164-4537-8dfd-09e2f3c631ad","year":null},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-07T13:14:09.265446Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:14.270326Z"},"links":{"citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:7fccc231100bee0a67d5ff84a96596308f23621f0c47f6ef8aa05979af9d5fba","observation_id":"c12670d2-e9e1-4c7c-a64b-51375d1c0e73","resolution":{"observed_at":"2026-08-07T13:20:22.382099Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:22.158488Z","title":null,"venue":null,"work_id":"899d3c43-ea90-4fe4-996c-c03cc3e65b41","year":null},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-07T13:14:09.265446Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:14.364911Z"},"links":{"citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:b6da48a1412a1c20e4d284eb9db60a302819999f411785a834ad115e63faba16","observation_id":"90bc94fd-7a50-4db7-9b8f-084ecf204c51","resolution":{"observed_at":"2026-08-07T13:20:22.261447Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:22.461269Z","title":null,"venue":null,"work_id":"d36b103a-ac7e-4b59-9a0f-b36694d70c8a","year":null},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-07T13:14:09.265446Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:14.135637Z"},"links":{"citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:3e6663373cdf089280a64525360cee8075fbc9c69fde0f01b13d0073474639f1","observation_id":"eb936e67-e883-4cf1-b057-e56dbc38e60f","resolution":{"observed_at":"2026-08-07T13:20:22.548312Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:20.986668Z","title":"Video accessibility enhancement for hearing-impaired users,","venue":null,"work_id":"87b58a17-59db-4ca0-b06c-8cdbd05a58ac","year":2011},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-07T13:14:09.265446Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:15.414743Z"},"links":{"citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:3db7b3cad5d3a2a8533e37297bdfe9b9d69dfa5b059a2d21706fa8f76b0998c7","observation_id":"c793a1bb-f23e-46da-9739-496822bd745e","resolution":{"observed_at":"2026-08-07T13:20:21.105960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10002","last_updated":"2024-12-13T09:40:37Z","snapshot_observed_at":"2026-07-06T20:06:26.221438Z","submitted_at":"2024-12-13T09:40:37Z","title":"NowYouSee Me: Context-Aware Automatic Audio Description","version":1},"cited_work":{"arxiv_id":"2412.10002","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.10002","snapshot_observed_at":"2026-08-07T13:20:18.426408Z","title":"NowYouSee Me: Context-Aware Automatic Audio Description","venue":"cs.CV","work_id":"9ca5c962-52ef-4686-81b8-8658c472900c","year":2024},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-07T13:14:09.265446Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:15.541739Z"},"links":{"cited_paper":"/paper/2412.10002","citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:4a1245663505972a5eaa32b709f8cc4d5cbdb699bb33d883bd9cf9ba1f614f20","observation_id":"e616a5a0-59cd-4e20-a11e-9eba3d580b2b","resolution":{"observed_at":"2026-08-07T13:20:18.566942Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:21.979829Z","title":"Moreover, our system achieves an approximately 6x im- provement in inference speed compared to the baseline while still maintaining competitive accuracy","venue":null,"work_id":"4c19fb24-aaaf-4215-b25f-8ebf9a344dc9","year":null},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-07T13:14:09.265446Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:14.457576Z"},"links":{"citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:c0d4f323d22e257dc560b411fe7424ef291df37c8d84bc5f0a1ae305a826e6f0","observation_id":"adbdb357-3523-47fe-8530-11cd4fb8af36","resolution":{"observed_at":"2026-08-07T13:20:22.071681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-07T13:14:09.265446Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"cited_work":{"arxiv_id":"2505.22045","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.22045","snapshot_observed_at":"2026-08-07T13:20:19.500789Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","venue":"cs.MM","work_id":"59672561-b82e-40ef-ba06-f32d2abff6a0","year":2025},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-07T13:14:09.265446Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:14.606479Z"},"links":{"cited_paper":"/paper/2505.22045","citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:542ec271ded02fcd260c268c82d8b04caad677b0c272aba37263f8a3e3a4ca38","observation_id":"5b3a8d93-2fb8-4921-ad48-6933a4507c29","resolution":{"observed_at":"2026-08-07T13:20:19.650775Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"4730.6500","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:19.276356Z","title":"Experimental settings 3.1.1","venue":null,"work_id":"02948d7a-7149-41e2-a017-99cd073f76bf","year":null},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-07T13:14:09.265446Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:14.730364Z"},"links":{"citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:b050f793ae7d6ee40d09ab68db8aa100dbedace05269a845c7de0f616f83a9af","observation_id":"0ae373ed-7693-4ab2-976d-0b72c193b6f2","resolution":{"observed_at":"2026-08-07T13:20:19.374002Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:21.685771Z","title":null,"venue":null,"work_id":"b36fff56-9f27-4eac-8729-cc1a3a8a4da3","year":null},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-07T13:14:09.265446Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:14.866290Z"},"links":{"citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:1596284a5f54b505e76b05ddd8a8af9e804e0244c6a60a8473f25aca822d02e6","observation_id":"297b5d00-b720-40bf-9c6c-39e32e83f461","resolution":{"observed_at":"2026-08-07T13:20:21.860195Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:21.497038Z","title":"Automated audio captioning: An overview of recent progress and new challenges,","venue":null,"work_id":"689956bc-f083-47f0-b4e1-4d3838a0e4e4","year":2022},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-07T13:14:09.265446Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:14.990600Z"},"links":{"citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:8bbd579fe6aa42e28938f83f1b22b04bb33c40920f0f426c1c3d968061c9775c","observation_id":"7c8cc59d-b511-4993-8a1e-2c094d0b08db","resolution":{"observed_at":"2026-08-07T13:20:21.613178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:22.752477Z","title":"Building on this, LA VCap","venue":null,"work_id":"66a1ba5a-f489-43ec-a5be-0d283641267b","year":null},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-07T13:14:09.265446Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:13.858742Z"},"links":{"citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:f336bf0c018e0a27f544db8df0bb1d26dae63651dfdab1dfdd13f3980edfd0a3","observation_id":"bad65a29-c5d1-40ac-969d-888ac3c0dcfc","resolution":{"observed_at":"2026-08-07T13:20:22.840359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:22.630230Z","title":"V ACT [11] proposes an Adap- tive Audio-Visual Attention method that integrates audio and visual information through confidence scores derived from the †Corresponding author","venue":null,"work_id":"8a6d09a1-af28-4f67-90c0-f7e7c4e15510","year":null},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-07T13:14:09.265446Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:13.995623Z"},"links":{"citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:e9b8e3de14c98fdd97f116ca02e06750e2ece84d492af7c5489cf918585eaa77","observation_id":"2f3c8141-f216-4f2f-8659-2f6409d76d98","resolution":{"observed_at":"2026-08-07T13:20:22.692869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15537","last_updated":"2022-06-30T10:53:15Z","snapshot_observed_at":"2026-07-06T12:54:11.616335Z","submitted_at":"2022-03-29T13:18:50Z","title":"On Metric Learning for Audio-Text Cross-Modal Retrieval","version":3},"cited_work":{"arxiv_id":"2203.15537","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.15537","snapshot_observed_at":"2026-08-07T13:20:18.816681Z","title":"On Metric Learning for Audio-Text Cross-Modal Retrieval","venue":"eess.AS","work_id":"e6f02d62-6d80-4991-be1a-8ff94f900151","year":2022},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-07T13:14:09.265446Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:15.102806Z"},"links":{"cited_paper":"/paper/2203.15537","citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:cb054c89f16e1c35c9d281a15d98adadfa5f77ddbc2d251d6e10acd8eaed3ddc","observation_id":"f26e6adf-f26c-431c-86e0-c3a924c667db","resolution":{"observed_at":"2026-08-07T13:20:18.957344Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15147","last_updated":"2022-03-28T23:47:57Z","snapshot_observed_at":"2026-08-05T16:38:44.509543Z","submitted_at":"2022-03-28T23:47:57Z","title":"Separate What You Describe: Language-Queried Audio Source Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15147","snapshot_observed_at":"2026-08-07T13:20:15.203731Z","title":"Separate what you describe: Language-queried audio source separation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-07T13:14:09.265446Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:15.203731Z"},"links":{"cited_paper":"/paper/2203.15147","citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:8a43d54dfcc11543215a17d2f2d20eda3c883f63e0fef12e84e49459e05dcd3e","observation_id":"9197c34b-162e-4298-a2b0-d28ae0669ef7","resolution":{"observed_at":"2026-08-07T13:20:15.203731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:21.248970Z","title":"Dynamic captioning: video accessibility enhancement for hearing impair- ment,","venue":null,"work_id":"e916bd48-182b-4a97-845e-8fe5a5bac5f3","year":2010},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-07T13:14:09.265446Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:15.338815Z"},"links":{"citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:07d451410d881a90a8282691e1cab3a285f0bfb70144e576ce8e93f3a7f201e3","observation_id":"0432c5c9-bbfb-4bac-a482-b5624e261675","resolution":{"observed_at":"2026-08-07T13:20:21.362097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09401","last_updated":"2025-06-01T07:01:51Z","snapshot_observed_at":"2026-08-03T12:17:56.736085Z","submitted_at":"2024-09-14T10:23:35Z","title":"Towards Diverse and Efficient Audio Captioning via Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.09401","snapshot_observed_at":"2026-08-07T13:20:15.647051Z","title":"Towards diverse and efficient audio captioning via diffusion models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-07T13:14:09.265446Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:15.647051Z"},"links":{"cited_paper":"/paper/2409.09401","citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:e6193a53289bc6ace964fdfbb2b56726021aa55120c0ee2038d4f53815b24c30","observation_id":"2e695f49-ffc9-48b4-9ca6-e94392156a0a","resolution":{"observed_at":"2026-08-07T13:20:15.647051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.09817","last_updated":"2021-07-21T00:31:50Z","snapshot_observed_at":"2026-08-05T22:00:33.145653Z","submitted_at":"2021-07-21T00:31:50Z","title":"Audio Captioning Transformer","version":1},"cited_work":{"arxiv_id":"2107.09817","doi":null,"metadata_source":"pith","pith_arxiv_id":"2107.09817","snapshot_observed_at":"2026-08-07T13:20:18.135780Z","title":"Audio Captioning Transformer","venue":"eess.AS","work_id":"c397f728-4970-4f02-a404-a534d0a580bb","year":2021},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-07T13:14:09.265446Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:15.714734Z"},"links":{"cited_paper":"/paper/2107.09817","citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:742a181c307f7b41cf83d40924b099f9a023fa893f4700da12634642ab0e67e9","observation_id":"b8e6e2e4-5745-481d-abaa-bceab90c8304","resolution":{"observed_at":"2026-08-07T13:20:18.267155Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:15.853445Z","title":"Clotho: An audio cap- tioning dataset,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-07T13:14:09.265446Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:15.853445Z"},"links":{"citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:7b9348937217305a4d69bd85037bb79745285d1429b29f0de112fd09309eeca6","observation_id":"50ab83a6-bbc2-48ba-a227-606ea4b0012f","resolution":{"observed_at":"2026-08-07T13:20:15.853445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13275","last_updated":"2024-06-25T08:07:36Z","snapshot_observed_at":"2026-07-06T18:33:28.511600Z","submitted_at":"2024-06-19T07:09:46Z","title":"Enhancing Automated Audio Captioning via Large Language Models with Optimized Audio Encoding","version":2},"cited_work":{"arxiv_id":"2406.13275","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.13275","snapshot_observed_at":"2026-08-07T13:20:17.952996Z","title":"Enhancing Automated Audio Captioning via Large Language Models with Optimized Audio Encoding","venue":"cs.SD","work_id":"bc3bb14c-d932-4282-8466-1f0deef86ac7","year":2024},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-07T13:14:09.265446Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:15.968878Z"},"links":{"cited_paper":"/paper/2406.13275","citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:2e0acfeb6951e0c687dbccccdf0f82d2652d6e85c9c88b76ff24c1c407e2e31e","observation_id":"987c54b5-ee94-4442-89d2-239d455eff1a","resolution":{"observed_at":"2026-08-07T13:20:18.006011Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.16428","last_updated":"2023-05-29T03:53:01Z","snapshot_observed_at":"2026-07-06T14:11:55.178649Z","submitted_at":"2022-10-28T22:45:41Z","title":"Visually-Aware Audio Captioning With Adaptive Audio-Visual Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.16428","snapshot_observed_at":"2026-08-07T13:20:16.007613Z","title":"Visually-aware audio captioning with adaptive audio-visual attention,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-07T13:14:09.265446Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:16.007613Z"},"links":{"cited_paper":"/paper/2210.16428","citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:438b36638058190467c7318e2820a5eb547b0e09fd67827464fbf0fd73eca8fd","observation_id":"829b6f68-f844-45d7-90b6-2c9c107b8d66","resolution":{"observed_at":"2026-08-07T13:20:16.007613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:20.804759Z","title":"Avcap: Leveraging audio-visual fea- tures as text tokens for captioning,","venue":null,"work_id":"a6c18d96-87b0-4365-a327-35456aaff485","year":2024},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-07T13:14:09.265446Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:16.098663Z"},"links":{"citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:f08108155239abe8840313cda11bfcbed179528ecf4c24eb3fcba70a2100871c","observation_id":"8b570a96-c39e-45dc-82f4-d53d388ce3bd","resolution":{"observed_at":"2026-08-07T13:20:20.844151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09291","last_updated":"2025-03-15T12:38:50Z","snapshot_observed_at":"2026-08-05T03:11:14.295782Z","submitted_at":"2025-01-16T04:53:29Z","title":"LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09291","snapshot_observed_at":"2026-08-07T13:20:16.225698Z","title":"Lavcap: Llm-based audio-visual captioning using optimal transport,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-07T13:14:09.265446Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:16.225698Z"},"links":{"cited_paper":"/paper/2501.09291","citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:5abc34ed894cf2a9e08dbd400e01f4640871595f3991ee5b707c8d0d9e4edbe0","observation_id":"21c84687-edff-4251-a172-5b1d6519ca57","resolution":{"observed_at":"2026-08-07T13:20:16.225698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:16.407539Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-07T13:14:09.265446Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:16.407539Z"},"links":{"citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:02e07f8d6d3e833a8b26a8a94c428159d83d572a7b05b9aebb1b4ba05b3f2f49","observation_id":"db42c618-b50c-44eb-af32-601868dfd147","resolution":{"observed_at":"2026-08-07T13:20:16.407539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07839","last_updated":"2023-04-11T22:47:19Z","snapshot_observed_at":"2026-07-06T14:05:23.547010Z","submitted_at":"2022-10-02T07:29:57Z","title":"Contrastive Audio-Visual Masked Autoencoder","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07839","snapshot_observed_at":"2026-08-07T13:20:16.505610Z","title":"Contrastive audio-visual masked au- toencoder,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-07T13:14:09.265446Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:16.505610Z"},"links":{"cited_paper":"/paper/2210.07839","citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:32692fded7292a41c761d13ccb689f5610254875752f2af54c37d98d8e7fbaf2","observation_id":"4b5530ac-5d7b-4943-9ce5-9a3b7aae252e","resolution":{"observed_at":"2026-08-07T13:20:16.505610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T13:20:16.676736Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-07T13:14:09.265446Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:16.676736Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:ce70fa69a47c42653de9aa65a0d8e9e262b805d7df5c4a9046d8cfe737273614","observation_id":"c03b655d-b14e-4e42-ba09-491c1f051c61","resolution":{"observed_at":"2026-08-07T13:20:16.676736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:16.761687Z","title":"Audiocaps: Generat- ing captions for audios in the wild,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-07T13:14:09.265446Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:16.761687Z"},"links":{"citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:d2a040ee4a72f07f74821834aa2271d090905f148d070817ec4e258b32ca4507","observation_id":"77c30047-e1f8-4dba-9d37-5b52cef44cf0","resolution":{"observed_at":"2026-08-07T13:20:16.761687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:16.839969Z","title":"Audio set: An ontology and human-labeled dataset for audio events,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-07T13:14:09.265446Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:16.839969Z"},"links":{"citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:2a208600f48e5699058ccdfea5d0c235c5fb64f293207bda003e700713b224d2","observation_id":"9c36b8df-cb5c-41bb-95a2-5e1fb082b908","resolution":{"observed_at":"2026-08-07T13:20:16.839969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:16.934236Z","title":"Bleu: a method for automatic evaluation of machine translation,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-07T13:14:09.265446Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:16.934236Z"},"links":{"citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:4821257cb2f88254b747122b040b95948f2f2b3f27a392bd6f877c0430030612","observation_id":"bec60f63-820b-4a4f-aea3-fb6c780ad572","resolution":{"observed_at":"2026-08-07T13:20:16.934236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:17.172488Z","title":"Meteor: An automatic metric for mt evaluation with improved correlation with human judgments,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-07T13:14:09.265446Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:17.172488Z"},"links":{"citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:81761e7d071a6b6566d6beb2a2c96f08b448ea0e555b2674908b5b46040b6c4d","observation_id":"5a72782a-6566-4ddb-884c-0e8661853b19","resolution":{"observed_at":"2026-08-07T13:20:17.172488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:17.246884Z","title":"Rouge: A package for automatic evaluation of sum- maries,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-07T13:14:09.265446Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:17.246884Z"},"links":{"citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:9862c78224dde6d8b51656151253be449818d5cce5c3c63baad48862296cbe13","observation_id":"685df9f8-685a-4bf1-9b69-598c1c271207","resolution":{"observed_at":"2026-08-07T13:20:17.246884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:20.560719Z","title":"Cider: Consensus-based image description evaluation,","venue":null,"work_id":"2deeea88-3cdb-40b9-9e00-1750bf44b27d","year":2015},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-07T13:14:09.265446Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:17.364740Z"},"links":{"citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:fae848987e87add1e736874cf52d5fc0e3ec2e9710cb64f39f82d414a973c914","observation_id":"bf2ab7b3-ee15-491a-922a-ec8ebbf9222e","resolution":{"observed_at":"2026-08-07T13:20:20.685683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:20.316261Z","title":"Spice: Semantic propositional image caption evaluation,","venue":null,"work_id":"64fa121e-9979-4beb-855c-888c1f69025e","year":2016},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-07T13:14:09.265446Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:17.461337Z"},"links":{"citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:56a6635ad4703aa6a4031e7ae49fd7cb3326d894a245e88a9f5cc33f6c7d387d","observation_id":"fbc936b4-d313-491e-9f1a-439a4feb4b53","resolution":{"observed_at":"2026-08-07T13:20:20.419907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:20.055599Z","title":"Improved image captioning via policy gradient optimization of spider,","venue":null,"work_id":"361b44e4-3a02-4d90-9bf4-186754e60ee5","year":2017},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-07T13:14:09.265446Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:17.534077Z"},"links":{"citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:34ff6800e386960d60f5ed5d68ccad3f7f59be8d1629792d1775c664ce7e1c7c","observation_id":"62b9ede9-917c-48ea-a188-2d2857d12da9","resolution":{"observed_at":"2026-08-07T13:20:20.172010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:19.795920Z","title":"Microsoft coco: Common objects in context,","venue":null,"work_id":"5e644225-17bf-439a-94a1-f78bac0d8fe2","year":2014},"citing_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-07T13:14:09.265446Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:17.616572Z"},"links":{"citing_paper":"/paper/2505.22045"},"observation_digest":"sha256:c27f3d75fdbbb3788c2331cf95d39613e71ef5cddecbc30c7d3406fd8c0bc330","observation_id":"32c864e5-d2ad-45be-96cf-e0ad68300752","resolution":{"observed_at":"2026-08-07T13:20:19.936515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","latest_version":1,"primary_category":"cs.MM","snapshot_observed_at":"2026-08-07T13:14:09.265446Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":17,"verified_exact":5,"verified_fuzzy":12},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 1 inbound Pith citation observation for arXiv:2505.22045."}