{"as_of":"2026-08-18T03:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ab5fcd79fe5cdd8e9fa60b2799055e23141278d3499010e596d0cca00755ce4e","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T18:46:09.224346Z","state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T15:42:22.538919Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-11T13:56:18.448461Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.11278","snapshot_observed_at":"2026-08-11T15:42:22.538919Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10749","last_updated":"2024-12-14T08:34:44Z","snapshot_observed_at":"2026-08-11T18:52:59.825080Z","submitted_at":"2024-12-14T08:34:44Z","title":"Patch-level Sounding Object Tracking for Audio-Visual Question Answering","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T15:42:22.538919Z"},"links":{"cited_paper":"/paper/2411.11278","citing_paper":"/paper/2412.10749"},"observation_digest":"sha256:82bb91388f56e5ccdb8a40ee68d4dba2370bb40bd817cbb703bfbec406d9ae60","observation_id":"c92d3f27-fe3c-45ba-ae38-67084b2e76f7","resolution":{"observed_at":"2026-08-11T15:42:22.538919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.11278","snapshot_observed_at":"2026-08-11T15:13:01.650537Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-17T23:24:38.973608Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.650537Z"},"links":{"cited_paper":"/paper/2411.11278","citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:fb86ccd3c34336a00f8d5797a3fe72b16eb9ab9571da89eca9c9f3b0c8e03e4d","observation_id":"48fc6d8a-1ce9-49e8-858d-5fa97ed8ff73","resolution":{"observed_at":"2026-08-11T15:13:01.650537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"cited_work":{"arxiv_id":"2411.11278","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.11278","snapshot_observed_at":"2026-08-11T13:56:18.448461Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","venue":"cs.CV","work_id":"326422a8-7cf0-47ac-895f-8c8fe6ada264","year":2024},"citing_paper":{"arxiv_id":"2412.12628","last_updated":"2024-12-18T09:58:32Z","snapshot_observed_at":"2026-08-15T22:50:25.356078Z","submitted_at":"2024-12-17T07:43:36Z","title":"Dense Audio-Visual Event Localization under Cross-Modal Consistency and Multi-Temporal Granularity Collaboration","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T13:56:18.376640Z"},"links":{"cited_paper":"/paper/2411.11278","citing_paper":"/paper/2412.12628"},"observation_digest":"sha256:4c04de4b18b8333be2c307a1d7379c426a68277c437f09116dbf090469c3c580","observation_id":"713eb6f8-0602-456b-9bf5-3a8246146c5a","resolution":{"observed_at":"2026-08-11T13:56:18.454468Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.11278/citation-record","integrity":"/paper/2411.11278/integrity","json":"/paper/2411.11278/citation-record.json","paper":"/paper/2411.11278"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:10.042561Z","title":"Look, listen and learn","venue":null,"work_id":"4d88c419-04cc-4fc4-84f6-a9d0e586acb9","year":2017},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:08.980979Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:5242f3dd5e2f54a1d41eef80018124a3e8fb1ac4ba9877ec28a106157bf61b77","observation_id":"15ae7e47-9079-4e17-aff9-8493e5226573","resolution":{"observed_at":"2026-08-12T18:46:10.047568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:10.029163Z","title":"Objects that sound","venue":null,"work_id":"78f2c442-1487-4509-b414-26d820536f30","year":2018},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:08.985768Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:74e32e4d1b80e5e47e419bd424ef80d6eece83949e67cb548d5774a116c52382","observation_id":"b654f469-11c6-46ed-bd46-4020b5b52226","resolution":{"observed_at":"2026-08-12T18:46:10.033663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:10.015181Z","title":"Cross-modal label contrastive learning for unsupervised audio-visual event localization","venue":null,"work_id":"79b756fd-e8f8-42f5-b6d9-579e73dadb73","year":2023},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:08.990953Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:81ecad26da95408c35dd7896b3a2209f0ec054561e9bbb3194c253d30b068076","observation_id":"3d8a9846-c091-4486-ad9b-cde801a175a6","resolution":{"observed_at":"2026-08-12T18:46:10.019915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:10.000721Z","title":"VGGSound: A large-scale audio-visual dataset","venue":null,"work_id":"eef739b5-80b0-4cde-a3dc-64ce6dea1bdb","year":2020},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:08.995675Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:5cbe530d439ff963139d4054140686b6fd721c816fd80cfaa28b49995739ffdb","observation_id":"54e70ea2-a5b7-46d3-b39d-807029624e50","resolution":{"observed_at":"2026-08-12T18:46:10.005165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.985028Z","title":"Localizing visual sounds the hard way","venue":null,"work_id":"bd8e15b0-929b-4867-8f8b-dbfd188ed6b4","year":null},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:08.999948Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:cab83cbd44a7aaeafd4663fffcd2bef8a887b8eb31279c81c6e16f2b490faca0","observation_id":"2d36fa57-ac3a-4b43-9698-acdf7ee7dc05","resolution":{"observed_at":"2026-08-12T18:46:09.990268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.972068Z","title":"Cm-pie: Cross-modal per- ception for interactive-enhanced audio-visual video parsing","venue":null,"work_id":"d5bdf125-8a7c-4185-ada4-12b01593c66a","year":2024},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.004285Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:24bda44330c31eacd24901195b633cb89ff695d10b54194a9a59f6b08adf68bb","observation_id":"6232c27f-83f8-49f8-92db-e107fafa0fb8","resolution":{"observed_at":"2026-08-12T18:46:09.976520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-08-14T16:25:22.654846Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-12T18:46:09.008696Z","title":"Videollama 2: Advancing spatial- temporal modeling and audio understanding in video-llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.008696Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:5b73f4e469fb29778726df9bfa9967acb9bc28c9b2c95dd7bb50a68705a55ff9","observation_id":"8a14af03-16fa-4481-b53b-4a3d0046855c","resolution":{"observed_at":"2026-08-12T18:46:09.008696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.958270Z","title":"Audio-visual event localization via re- cursive fusion by joint co-attention","venue":null,"work_id":"8e979d4b-90c4-4ddc-ab9f-344179bee5e3","year":2021},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.014532Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:dff86418c4a7003e691a427475f3a455a28302186a8e6315e6ee561a7c64dbb9","observation_id":"e941a208-8151-4e4c-a3ef-d426edcd63ae","resolution":{"observed_at":"2026-08-12T18:46:09.962817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.944979Z","title":"Col- lecting cross-modal presence-absence evidence for weakly- supervised audio-visual event perception","venue":null,"work_id":"8f94e7c2-1b6e-4c81-8c69-7582dfa846b3","year":2023},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.018653Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:3d8c64f5fdd641589b2ffd3aca145f18aa270383ad53d44ad7e1026b19febf6d","observation_id":"08ec1f37-eb68-4f14-a17f-6688462cd2ce","resolution":{"observed_at":"2026-08-12T18:46:09.949431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.931934Z","title":"Learning event-specific localization preferences for audio-visual event localization","venue":null,"work_id":"48992634-357f-4c48-9794-21391839b2a2","year":2023},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.022625Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:b2bd4a3ce25c3792e915a6a4ffa653b61418a19f7d3a7fae177d1fece0ebb2a4","observation_id":"03af3082-c28c-4052-b44d-472b72a03977","resolution":{"observed_at":"2026-08-12T18:46:09.936627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.919330Z","title":"Imagebind: One embedding space to bind them all","venue":null,"work_id":"91ba7277-8a2d-4626-acb4-fe484c656d04","year":2023},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.026858Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:dcfd0c4f6465ce9f3ecf5b72038980558481e4cb71b10cb6f5f4039335dfeaae","observation_id":"d84a4fff-4d56-4430-b5cb-eddc723d8748","resolution":{"observed_at":"2026-08-12T18:46:09.923665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.18709","last_updated":"2025-03-02T15:37:39Z","snapshot_observed_at":"2026-08-17T18:11:01.191449Z","submitted_at":"2023-10-28T13:37:52Z","title":"Audio-Visual Instance Segmentation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.18709","snapshot_observed_at":"2026-08-12T18:46:09.031350Z","title":"Audio-visual instance segmentation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.031350Z"},"links":{"cited_paper":"/paper/2310.18709","citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:deeb346c6a15b13d27b3627ed7f80695585d93172c6167a2fd08b2dc6cac5c36","observation_id":"957f44bc-9f62-468c-b23e-716e6fea6864","resolution":{"observed_at":"2026-08-12T18:46:09.031350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.906864Z","title":"Instance-level panoramic audio-visual saliency detection and ranking","venue":null,"work_id":"6b95b067-eaae-4775-aaca-ed868cca093e","year":2024},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.035837Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:4054443aa53dbb7e4ee1c9c88e0c264a80218d9efd19d222069223f921d484b8","observation_id":"a96ab497-95ca-4e75-9cff-26a6729e0e55","resolution":{"observed_at":"2026-08-12T18:46:09.910930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.893557Z","title":"Open- vocabulary audio-visual semantic segmentation","venue":null,"work_id":"694bb09f-8f14-4b10-a913-369f83ce9504","year":2024},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.039915Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:fa89efc6f8e8cae4fd7801da08fd93bf14094426d42d05e232723a4f258fe678","observation_id":"5246e0ec-f4c8-4027-a389-f584c7f24db5","resolution":{"observed_at":"2026-08-12T18:46:09.897879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.879878Z","title":"Unitr: A unified transformer-based framework for co-object and multi-modal saliency detection","venue":null,"work_id":"b3baaba5-6cb5-4ee0-9bba-227d66b328ea","year":2024},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.044185Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:dee4a5f9a0bdb3b7d707726aa4c411f0b1686fbde725ac6c38fb737ed7692e74","observation_id":"5f1eb038-f382-4a6a-be20-a9785bfcb55b","resolution":{"observed_at":"2026-08-12T18:46:09.884566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.866217Z","title":"Improving audio-visual segmentation with bidirectional generation","venue":null,"work_id":"483fa902-e2e4-4961-9a5e-3fcf28e552aa","year":null},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.048212Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:0fbc8e025fbf4aab312ae9125811733b804c93c36e36c1b993a9fd61c8942c01","observation_id":"a346d44a-fc6d-4e6e-81f3-b145e9878fee","resolution":{"observed_at":"2026-08-12T18:46:09.870776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01952","last_updated":"2024-08-04T07:48:12Z","snapshot_observed_at":"2026-08-16T13:28:41.875134Z","submitted_at":"2024-08-04T07:48:12Z","title":"CACE-Net: Co-guidance Attention and Contrastive Enhancement for Effective Audio-Visual Event Localization","version":1},"cited_work":{"arxiv_id":"2408.01952","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.01952","snapshot_observed_at":"2026-08-12T18:46:09.384698Z","title":"CACE-Net: Co-guidance Attention and Contrastive Enhancement for Effective Audio-Visual Event Localization","venue":"cs.CV","work_id":"e0dec3e5-8000-4a8f-8df7-1704c214ad96","year":2024},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.052170Z"},"links":{"cited_paper":"/paper/2408.01952","citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:697d62c0b0429ded4ee16d620ae1ca085a87737b2bac3398846010afe4e5cd4d","observation_id":"874d31ba-32d2-4cfa-8b29-edc990c1a07f","resolution":{"observed_at":"2026-08-12T18:46:09.390007Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20378","last_updated":"2024-12-29T06:46:24Z","snapshot_observed_at":"2026-08-17T17:55:33.588218Z","submitted_at":"2024-12-29T06:46:24Z","title":"Tri-Ergon: Fine-grained Video-to-Audio Generation with Multi-modal Conditions and LUFS Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20378","snapshot_observed_at":"2026-08-12T18:46:09.056514Z","title":"Tri-ergon: Fine-grained video-to-audio generation with multi-modal conditions and lufs control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.056514Z"},"links":{"cited_paper":"/paper/2412.20378","citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:859d9de4ce30782e96707e4e7fe68b9a5cd785b739b5efce007fb6f023878a37","observation_id":"d306687a-1075-4646-866d-1cfdbeeb8a15","resolution":{"observed_at":"2026-08-12T18:46:09.056514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.852145Z","title":"Learning to answer questions in dynamic audio-visual scenarios","venue":null,"work_id":"99521b23-b520-4da6-9126-5781b5f8d090","year":2022},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.060887Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:a334cfb814c2c04599be1619aa6de5ca140e2cd2aa91e6d1c280d9db8779e9ce","observation_id":"91dfb26e-d9f5-4f0f-89a2-30f94572cd51","resolution":{"observed_at":"2026-08-12T18:46:09.856923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.839179Z","title":"Progressive spatio- temporal perception for audio-visual question answering","venue":null,"work_id":"86ed9b01-0050-4980-b6cb-17013bd48d40","year":2023},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.064881Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:29fdceaab46c0c6c41d0c95f187051fd3193ccc778ebd9445c2f5e8983fb82ee","observation_id":"22acee5f-a790-4170-88bb-9f2f8279567e","resolution":{"observed_at":"2026-08-12T18:46:09.843528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.826090Z","title":"Object-aware adaptive-positivity learning for audio- visual question answering","venue":null,"work_id":"b19bd83d-2769-4dac-82ae-cad847cd4edd","year":2024},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.068921Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:ab697917d069f8fe8f21efa08f9191d9ae290753fdce72901e3c72a59f0a8752","observation_id":"0a9f6f5f-dd27-4a60-b15c-cca3ed389c4c","resolution":{"observed_at":"2026-08-12T18:46:09.830691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10749","last_updated":"2024-12-14T08:34:44Z","snapshot_observed_at":"2026-08-11T18:52:59.825080Z","submitted_at":"2024-12-14T08:34:44Z","title":"Patch-level Sounding Object Tracking for Audio-Visual Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10749","snapshot_observed_at":"2026-08-12T18:46:09.072989Z","title":"Patch-level sounding object track- ing for audio-visual question answering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.072989Z"},"links":{"cited_paper":"/paper/2412.10749","citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:184699efdf983243bb6b6e91ebf85822e5a1160080a690f827a2dc10c876b441","observation_id":"8e31d5b9-e864-45e8-aff4-c19f3f8681a7","resolution":{"observed_at":"2026-08-12T18:46:09.072989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.813520Z","title":"Dual- modality seq2seq network for audio-visual event localiza- tion","venue":null,"work_id":"0e1b55d5-839d-4118-a249-0d8bdc03338d","year":2002},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.077495Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:6024d7d3fcba01a4ab5b9366b27be658bffb038b42de2ab19c03f75b6c559108","observation_id":"589c317f-813f-4a64-a4f7-0b500e8e0b48","resolution":{"observed_at":"2026-08-12T18:46:09.817876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.800463Z","title":"Ave-clip: Audioclip-based multi-window temporal transformer for au- dio visual event localization","venue":null,"work_id":"19d3d299-3808-441d-a378-0825a7831e2e","year":null},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.081450Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:8ac40d5b8e393ec15c6c68da453c1f79bf64a328ce775e42f4efc421d3fcf391","observation_id":"948e84e3-e531-4587-b11d-f3b592fa2aaf","resolution":{"observed_at":"2026-08-12T18:46:09.805042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.787370Z","title":"T-vsl: Text-guided visual sound source localization in mixtures","venue":null,"work_id":"72a2f83d-1dba-4d17-906a-0ad5f43b243c","year":2024},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.085692Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:d181f8388b2c4c6debc5959f01decbad1b44280039791e3a346bfee5e43b2ea7","observation_id":"7b1c059b-1e82-405e-846a-55817dcaaf67","resolution":{"observed_at":"2026-08-12T18:46:09.791568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16579","last_updated":"2025-07-01T05:44:57Z","snapshot_observed_at":"2026-08-16T15:12:00.870091Z","submitted_at":"2023-07-31T11:29:50Z","title":"Contrastive Conditional Latent Diffusion for Audio-visual Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16579","snapshot_observed_at":"2026-08-12T18:46:09.089546Z","title":"Contrastive conditional la- tent diffusion for audio-visual segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.089546Z"},"links":{"cited_paper":"/paper/2307.16579","citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:d2e1251ef396faf1592865637f771345a15450c606070a89a33bf19544bd0365","observation_id":"9bb406f7-6335-40dd-b73d-58ac7d1a56f7","resolution":{"observed_at":"2026-08-12T18:46:09.089546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.774346Z","title":"Multimodal variational auto-encoder based audio-visual segmentation","venue":null,"work_id":"44d3b158-94a8-4494-a3f4-eabdab4ea20d","year":2023},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.093768Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:3a316835796a556b487062483eb4b1bf84fcda8e2b04264ad54a0a9e4039110b","observation_id":"5e220090-092e-4cf7-a549-d71aec5aefb0","resolution":{"observed_at":"2026-08-12T18:46:09.778579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.761019Z","title":"Tavg- bench: Benchmarking text to audible-video generation","venue":null,"work_id":"3a38c4f4-7868-4dd9-b902-d41b2f0a36e3","year":2024},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.098002Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:3a8e0b12b44561922cc5ed1dc8aaac1f2a3fccf40938772ac63fbf641ad635a9","observation_id":"69ced0a5-5a5b-4617-bd3c-2074af874c0e","resolution":{"observed_at":"2026-08-12T18:46:09.765637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.747347Z","title":"Avgzslnet: Audio-visual gen- eralized zero-shot learning by reconstructing label features from multi-modal embeddings","venue":null,"work_id":"169a94f1-d059-467b-9af3-624eaace8dd1","year":null},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.101963Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:440d2cc8df414881e2c7862a8c18d55a54ee1b3187ea7c52494cc936ca808209","observation_id":"c3a994b7-43ff-4711-a239-bb9de0336e58","resolution":{"observed_at":"2026-08-12T18:46:09.752061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.734430Z","title":"Temporal and cross-modal at- tention for audio-visual zero-shot learning","venue":null,"work_id":"175463c2-866b-457d-bc96-d263de61eeb5","year":2022},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.106230Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:217d4e267c04b09ac07b26c9d01508aef039da5d2a2223ac3a116182d7b06a54","observation_id":"d974016a-dbb9-4d62-a7da-f52c4ecae096","resolution":{"observed_at":"2026-08-12T18:46:09.738739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.720201Z","title":"Audio-visual generalised zero-shot learning with cross-modal attention and language","venue":null,"work_id":"6c868103-497e-4be2-8046-8bfcfbee0d40","year":2022},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.110153Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:968297c844a2ca6e83db85081f0a21651ccffc2537b2d0bb02bbcfa07ccf47db","observation_id":"0d2011d4-2b03-463c-80cb-468d84ce853a","resolution":{"observed_at":"2026-08-12T18:46:09.725021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.706876Z","title":"Localizing visual sounds the easy way","venue":null,"work_id":"c8fafe9b-6b1b-4e7d-9fde-a79309370e93","year":2022},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.114184Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:af3d218e00eed8e408a5d24b41841cbd3d22c2f95bb3d67916e0aa42e109d93a","observation_id":"c273f183-ba0f-4b3d-b47b-84f3c7c1f979","resolution":{"observed_at":"2026-08-12T18:46:09.711381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13095","last_updated":"2024-07-18T01:57:16Z","snapshot_observed_at":"2026-08-16T13:33:14.712391Z","submitted_at":"2024-07-18T01:57:16Z","title":"Audio-visual Generalized Zero-shot Learning the Easy Way","version":1},"cited_work":{"arxiv_id":"2407.13095","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.13095","snapshot_observed_at":"2026-08-12T18:46:09.324837Z","title":"Audio-visual Generalized Zero-shot Learning the Easy Way","venue":"cs.CV","work_id":"192f24a6-0b2f-4d03-9d21-d853d4eef38e","year":2024},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.118070Z"},"links":{"cited_paper":"/paper/2407.13095","citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:f8df5c6965776738b630dd6459d75060a3218bfd9ec44f511b771a391c3f04c8","observation_id":"532280ed-dce2-424b-8d00-1fbf9c3fb8eb","resolution":{"observed_at":"2026-08-12T18:46:09.331158Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13435","last_updated":"2023-12-13T17:24:10Z","snapshot_observed_at":"2026-08-17T15:43:08.581326Z","submitted_at":"2023-11-22T14:48:30Z","title":"PG-Video-LLaVA: Pixel Grounding Large Video-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.13435","snapshot_observed_at":"2026-08-12T18:46:09.122320Z","title":"Pg-video-llava: Pixel grounding large video- language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.122320Z"},"links":{"cited_paper":"/paper/2311.13435","citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:8527f0f26a752190294040a2299bc000dc15dce1f63b4aaac2a933f864fc6d51","observation_id":"e1baf286-9313-4b41-8078-83b2e386eef0","resolution":{"observed_at":"2026-08-12T18:46:09.122320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.693533Z","title":"Coordinated joint multimodal embeddings for gen- eralized audio-visual zero-shot classification and retrieval of videos","venue":null,"work_id":"91a9852a-f4ab-4d54-a106-adb233cafc30","year":2020},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.126554Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:9bf8f0d1f8afd24e8134c6007d39fa7eb4135c6820183ba3e2b899094a112ecf","observation_id":"2b3d1c9b-ae43-4380-b520-da37344b8188","resolution":{"observed_at":"2026-08-12T18:46:09.697966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.680861Z","title":"Multiple sound sources localization from coarse to fine","venue":null,"work_id":"9db1a431-0ee5-4f31-9ad0-6aeca4132417","year":2020},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.130581Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:f8817849faefe19f8da00b04c7ee9d4510cf32ab97733b3db65f212929c4b226","observation_id":"96feb531-bea0-4026-91b0-970b7faa4a88","resolution":{"observed_at":"2026-08-12T18:46:09.685165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.668416Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"4ce85b63-7e4d-42dd-a9a1-9cde717cf1e9","year":2021},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.134348Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:0a92ab62689446e679f216599098f0c710d6685686d90128cd03861d9f8b3c27","observation_id":"b994d640-c782-4562-8410-0d4860a4332f","resolution":{"observed_at":"2026-08-12T18:46:09.672549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.655803Z","title":"Fine-grained audible video description","venue":null,"work_id":"b94be99e-a215-4879-b4ce-2be8bfe02725","year":2023},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.138191Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:5b4210a2db7d1d0d09073be36d0ca5bed2a81e427ee8bafe15491c9c730cbaf8","observation_id":"35c39a77-6b3a-465e-ba69-8414e423aa8f","resolution":{"observed_at":"2026-08-12T18:46:09.660094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.643322Z","title":"Audio-visual event localization in unconstrained videos","venue":null,"work_id":"5ee4efc7-b69f-4b63-b101-d474ef99314a","year":2018},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.142176Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:19c338920f3e91885b5ca40093b389dbaff36c959a7e601b9cd7d96c84fe79f3","observation_id":"1c508258-4c6d-426e-bdbb-c3f94c062d87","resolution":{"observed_at":"2026-08-12T18:46:09.647523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.630484Z","title":"Unified mul- tisensory perception: Weakly-supervised audio-visual video parsing","venue":null,"work_id":"f2c70dc9-2e47-4ad7-a223-74fd8d54b4aa","year":2020},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.146224Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:b60707fd49b10c5338373edfc4ddd8a796372f71b4b225dc39e58ccc4546a940","observation_id":"7d863dad-2e44-40a8-aab0-12e60cb51587","resolution":{"observed_at":"2026-08-12T18:46:09.635048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.616697Z","title":"Attention is all you need","venue":null,"work_id":"e22a790e-e524-436b-b7b0-de7dfd2c243f","year":2017},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.150182Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:44d92084aca9474dc43db60973e9c9913619f094847539a59ad7eca2dc690eb5","observation_id":"5c33d0ff-547b-4703-b12e-4454b95a9959","resolution":{"observed_at":"2026-08-12T18:46:09.621497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.603944Z","title":"Dual attention matching for audio-visual event localization","venue":null,"work_id":"b75be790-2c1d-400f-8abd-064737699e92","year":2019},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.154304Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:a9907835dc194bf90016e01952e5ea36298c4dfb6c3d0ec092973ad07e4d1f54","observation_id":"ac6509aa-b06f-4c3c-a7fa-3e181c1cbf3c","resolution":{"observed_at":"2026-08-12T18:46:09.608346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.590868Z","title":"Span-based audio-visual localization","venue":null,"work_id":"6f514399-5871-4b18-aeb7-4e6634f21b70","year":2022},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.158467Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:d6bbb5a02dbdbdae1e39dcec8357f2f35cedbdd2d007891c03589fe9852de367","observation_id":"4f50f783-1427-4760-8706-ac9a7d3f2cea","resolution":{"observed_at":"2026-08-12T18:46:09.595451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.577324Z","title":"Large-scale con- trastive language-audio pretraining with feature fusion and keyword-to-caption augmentation","venue":null,"work_id":"14dc4559-fd56-4d2d-a9a0-e8b8891530ed","year":null},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.162578Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:837a04a17b2b9a5ef770a5a3241cee15ee00fcd929acb3daecfe9f997f06f725","observation_id":"df237228-da4d-46ce-acf6-e08773a08056","resolution":{"observed_at":"2026-08-12T18:46:09.581830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.564056Z","title":"Cross-modal background suppres- sion for audio-visual event localization","venue":null,"work_id":"0774b7c6-07f2-4209-8ca2-85b7da4fcd8e","year":2022},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.167077Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:5a04bed852ffd4b9419df4763f407026a466906e6ee49a04329fd8a2dd5526bb","observation_id":"9bbcc665-b21d-40be-b3de-975a8b0bbe90","resolution":{"observed_at":"2026-08-12T18:46:09.568696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.550778Z","title":"Cross-modal relation-aware networks for audio-visual event localization","venue":null,"work_id":"51bc3ede-6b39-4895-b9cb-e103de64628e","year":2020},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.171117Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:b4d71869c6f1fad12543fd5ebc0b5309d8a74684bc36ae7b7b7b1cdcca7c69d4","observation_id":"37030a44-de52-4b64-913e-cc1ee7b9df23","resolution":{"observed_at":"2026-08-12T18:46:09.554943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.537807Z","title":"Avqa: A dataset for audio- visual question answering on videos","venue":null,"work_id":"a9f795bb-69fa-4bf0-81ca-7b589fddf267","year":2022},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.175171Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:1ea03c740762530a832c9218ac6bd21f5c9b8a68fe9458d157c0d7d738bbd214","observation_id":"e8d08bf5-7c82-43b6-beed-f170b905e4a7","resolution":{"observed_at":"2026-08-12T18:46:09.541968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.524649Z","title":"MM-Pyramid: Multimodal pyramid attentional network for audio-visual event localization and video pars- ing","venue":null,"work_id":"e123b864-69ef-4f19-9e23-91a0203a56ed","year":2022},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.179231Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:7a470796b2c6e891f2fc4b7002fc51469c72363af0759c581629709408ffce5a","observation_id":"595072d6-bec8-41d5-911a-50e0a92a590a","resolution":{"observed_at":"2026-08-12T18:46:09.529073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.511003Z","title":"Ope- nA VE: Moving towards open set audio-visual event localiza- tion","venue":null,"work_id":"7f19d686-043e-479c-bf8e-c18d675b0cd8","year":2024},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.183240Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:9dd8a482388abf17808ed332cd4681772422a462901738de7b949757433a0db9","observation_id":"1f5ecc0c-7de5-4b10-8d1d-c3084f9907a6","resolution":{"observed_at":"2026-08-12T18:46:09.515990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-17T23:24:38.973608Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.11248","snapshot_observed_at":"2026-08-12T18:46:09.187257Z","title":"Multimodal class-aware semantic enhance- ment network for audio-visual video parsing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.187257Z"},"links":{"cited_paper":"/paper/2412.11248","citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:5d8dea6f2e99441e1486d76d35c0ec7e383dc643102883efd3defa74d504bb4e","observation_id":"5bfb899d-dbe4-41ae-b09e-6ccaccffd004","resolution":{"observed_at":"2026-08-12T18:46:09.187257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.497155Z","title":"Positive sample propagation along the audio- visual event line","venue":null,"work_id":"af9f9025-7f1f-411d-8f52-d9c02077ef20","year":2021},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.191431Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:d83896b6eff32a9e4c8d012960eb695d37cc338cdd8326512891fea649a979fd","observation_id":"852432ce-a2c2-4942-8fed-79a9d7ebf983","resolution":{"observed_at":"2026-08-12T18:46:09.501606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.482749Z","title":"Contrastive pos- itive sample propagation along the audio-visual event line","venue":null,"work_id":"b1b15eb5-dc15-43ac-ac35-08dc334f6110","year":2022},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.195775Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:6b8ed456387ecfa6e361786c86610ba6f5436399d713e7f0178e6730def6e74c","observation_id":"9da1f39c-47e7-491a-80d6-66f8272c44ae","resolution":{"observed_at":"2026-08-12T18:46:09.487226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.468827Z","title":"Audio–visual segmentation","venue":null,"work_id":"ecda54c6-5bf5-49cb-95bd-bf7ff0aceed4","year":2022},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.199812Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:a47cb93628a6a767a126b663bd9b70d78ecb83dc521fc101744cfad6afb9cdcd","observation_id":"2c50363e-0199-41f4-b865-1a4ca2b65e4d","resolution":{"observed_at":"2026-08-12T18:46:09.473057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.02344","last_updated":"2023-03-04T07:21:37Z","snapshot_observed_at":"2026-08-16T15:50:51.505984Z","submitted_at":"2023-03-04T07:21:37Z","title":"Improving Audio-Visual Video Parsing with Pseudo Visual Labels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.02344","snapshot_observed_at":"2026-08-12T18:46:09.203800Z","title":"Im- proving audio-visual video parsing with pseudo visual labels","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.203800Z"},"links":{"cited_paper":"/paper/2303.02344","citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:d5e7c30fd011f23ba8a19c69b2754239c06c55b888e3bc3c635423d5f099d787","observation_id":"fdd1c146-5842-494b-8172-761b85846dd7","resolution":{"observed_at":"2026-08-12T18:46:09.203800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.13190","last_updated":"2023-01-30T18:53:32Z","snapshot_observed_at":"2026-08-16T15:59:03.490415Z","submitted_at":"2023-01-30T18:53:32Z","title":"Audio-Visual Segmentation with Semantics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.13190","snapshot_observed_at":"2026-08-12T18:46:09.208097Z","title":"Audio-visual segmentation with semantics","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.208097Z"},"links":{"cited_paper":"/paper/2301.13190","citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:0f6b1cf85eae7929a3a3012c09d1359ed14a05825a6ae87781e9cbc796f087df","observation_id":"628c6665-f9bf-4f0b-8fe9-9feeb3d577ba","resolution":{"observed_at":"2026-08-12T18:46:09.208097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.455566Z","title":"Label-anticipated event disentan- glement for audio-visual video parsing","venue":null,"work_id":"3ecd8f93-4d40-4feb-95ca-f3ae3c081799","year":2024},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.212176Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:bd2edb4bcba99af4013b7e176fb1bcfd51391ee8feae1a695dce2dbf77aafc7c","observation_id":"6175d65a-f33b-4108-a611-6608d1b1ccd6","resolution":{"observed_at":"2026-08-12T18:46:09.459970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.441374Z","title":"Ad- vancing weakly-supervised audio-visual video parsing via segment-wise pseudo labeling","venue":null,"work_id":"852ac768-cc70-44d4-8539-1a3b45fb00a6","year":2024},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.216131Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:dcd2e6ca9fac151c7572a26d6b2ff66919ec456ff69a85c6c617ebed48ca36be","observation_id":"afc1a1ef-2e6f-4c20-9714-4ecb58d0ea83","resolution":{"observed_at":"2026-08-12T18:46:09.446303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12628","last_updated":"2024-12-18T09:58:32Z","snapshot_observed_at":"2026-08-15T22:50:25.356078Z","submitted_at":"2024-12-17T07:43:36Z","title":"Dense Audio-Visual Event Localization under Cross-Modal Consistency and Multi-Temporal Granularity Collaboration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12628","snapshot_observed_at":"2026-08-12T18:46:09.220172Z","title":"Dense audio-visual event lo- calization under cross-modal consistency and multi-temporal granularity collaboration","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.220172Z"},"links":{"cited_paper":"/paper/2412.12628","citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:fec52c890c4ceecf8cc9bfbeebdaec2f58aa3e6eacc381f03d704613ed25afe2","observation_id":"2304d58c-8bc4-4702-93b2-f8a419010663","resolution":{"observed_at":"2026-08-12T18:46:09.220172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.427419Z","title":"Instruction: For the given 10-second video, divide it into 10 one-second segments. For each segment, if its audio and visual streams describe the same event, assign the label “x","venue":null,"work_id":"e4200b68-d186-40a5-a9ce-f31f2039dbb4","year":null},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.224346Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:ff25300906e07f00b501f95a4ed8eff6a117eb5dbb6971aafd62f85fe59752b0","observation_id":"9f6023f4-5c01-4c81-926d-3ef258f96086","resolution":{"observed_at":"2026-08-12T18:46:09.432304Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":2,"verified_fuzzy":46},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 3 inbound Pith citation observations for arXiv:2411.11278."}