{"as_of":"2026-08-21T05:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cab2ba60e53a83303b46b1e9d03f8aef42e895d0ae75048b6648097c4507f71d","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T23:14:31.426091Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T01:07:11.142298Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-16T01:07:11.189974Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.20872","last_updated":"2024-12-31T03:39:42Z","snapshot_observed_at":"2026-08-10T23:05:50.113962Z","submitted_at":"2024-12-30T11:23:15Z","title":"LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing","version":2},"cited_work":{"arxiv_id":"2412.20872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.20872","snapshot_observed_at":"2026-08-16T01:07:11.189974Z","title":"LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing","venue":"cs.CV","work_id":"a63470db-cae7-479d-8464-bafc006b3a24","year":2024},"citing_paper":{"arxiv_id":"2505.02096","last_updated":"2025-05-04T13:03:13Z","snapshot_observed_at":"2026-08-16T00:59:19.680095Z","submitted_at":"2025-05-04T13:03:13Z","title":"TeMTG: Text-Enhanced Multi-Hop Temporal Graph Modeling for Audio-Visual Video Parsing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:11.142298Z"},"links":{"cited_paper":"/paper/2412.20872","citing_paper":"/paper/2505.02096"},"observation_digest":"sha256:af3a3a6555bbacca59ebc323d537a5ffd0a26aa6f4ab61b1a50cab3a2f2aa8fb","observation_id":"5ece17e2-c5a1-4539-b62f-01df159f5a7a","resolution":{"observed_at":"2026-08-16T01:07:11.196864Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.20872/citation-record","integrity":"/paper/2412.20872/integrity","json":"/paper/2412.20872/citation-record.json","paper":"/paper/2412.20872"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:14:31.957211Z","title":"Audio- visual event localization in unconstrained videos,","venue":null,"work_id":"c4360ac4-398d-4995-ba8d-5253541a8896","year":2018},"citing_paper":{"arxiv_id":"2412.20872","last_updated":"2024-12-31T03:39:42Z","snapshot_observed_at":"2026-08-10T23:05:50.113962Z","submitted_at":"2024-12-30T11:23:15Z","title":"LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T23:14:31.338358Z"},"links":{"citing_paper":"/paper/2412.20872"},"observation_digest":"sha256:bf23d3df0f436c249363c8b8145ae4c62b5c0b3c4980449a824246cd2452dc7f","observation_id":"027ffa93-b264-4561-9501-c1dbc7f1e54b","resolution":{"observed_at":"2026-08-10T23:14:31.960670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:14:31.947255Z","title":"Dual attention matching for audio-visual event localization,","venue":null,"work_id":"18cce315-93c5-4f99-b14d-6a24ad5031b1","year":2019},"citing_paper":{"arxiv_id":"2412.20872","last_updated":"2024-12-31T03:39:42Z","snapshot_observed_at":"2026-08-10T23:05:50.113962Z","submitted_at":"2024-12-30T11:23:15Z","title":"LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T23:14:31.342825Z"},"links":{"citing_paper":"/paper/2412.20872"},"observation_digest":"sha256:0b41e327ecb60aa4eef4982918c8a6ddfd6b8e24791263c0bfbbdddabdd6898f","observation_id":"cb88e4eb-532b-4cd9-bbb8-27a098845744","resolution":{"observed_at":"2026-08-10T23:14:31.950588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:14:31.935341Z","title":"Learning to answer questions in dynamic audio-visual scenarios,","venue":null,"work_id":"425aa201-7155-46f9-aba8-f49daea3d45a","year":2022},"citing_paper":{"arxiv_id":"2412.20872","last_updated":"2024-12-31T03:39:42Z","snapshot_observed_at":"2026-08-10T23:05:50.113962Z","submitted_at":"2024-12-30T11:23:15Z","title":"LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T23:14:31.346742Z"},"links":{"citing_paper":"/paper/2412.20872"},"observation_digest":"sha256:807915966cf194548bf65cb47d076f1ef872868604d18660f9e15e0a4c1fd492","observation_id":"a80ea30b-4a9b-47e5-bc61-38e74334137d","resolution":{"observed_at":"2026-08-10T23:14:31.940052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:14:31.924024Z","title":"Listen to look: Action recognition by previewing audio,","venue":null,"work_id":"b64554d5-c4b9-478a-8b4a-a32da826a9c0","year":2020},"citing_paper":{"arxiv_id":"2412.20872","last_updated":"2024-12-31T03:39:42Z","snapshot_observed_at":"2026-08-10T23:05:50.113962Z","submitted_at":"2024-12-30T11:23:15Z","title":"LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T23:14:31.350756Z"},"links":{"citing_paper":"/paper/2412.20872"},"observation_digest":"sha256:0b612d0b3ad1a798de8314c11185e8146a08735d5fc3a77b77e07444762d9377","observation_id":"291f353f-4670-4556-b5a5-2814a3299113","resolution":{"observed_at":"2026-08-10T23:14:31.927958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:14:31.912393Z","title":"Unified multisensory per- ception: Weakly-supervised audio-visual video parsing,","venue":null,"work_id":"a59990c3-98bc-4634-b2de-23e40560ca8f","year":2020},"citing_paper":{"arxiv_id":"2412.20872","last_updated":"2024-12-31T03:39:42Z","snapshot_observed_at":"2026-08-10T23:05:50.113962Z","submitted_at":"2024-12-30T11:23:15Z","title":"LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T23:14:31.354817Z"},"links":{"citing_paper":"/paper/2412.20872"},"observation_digest":"sha256:d99ea503afc413449d883f177bf762121a039da84d380cf479fe024fbd73b26b","observation_id":"084c3cf5-50bc-4850-9bab-73e7b19f63e7","resolution":{"observed_at":"2026-08-10T23:14:31.917109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:14:31.901204Z","title":"MM-Pyramid: Multimodal pyramid attentional network for audio-visual event localization and video parsing,","venue":null,"work_id":"5686f376-f727-49ed-8522-9025ac5aa0dd","year":2022},"citing_paper":{"arxiv_id":"2412.20872","last_updated":"2024-12-31T03:39:42Z","snapshot_observed_at":"2026-08-10T23:05:50.113962Z","submitted_at":"2024-12-30T11:23:15Z","title":"LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T23:14:31.358620Z"},"links":{"citing_paper":"/paper/2412.20872"},"observation_digest":"sha256:3ce553c2cb5dbd22bab4e942dca8760ec1c5da85116d6aa5102afe8cf811cee1","observation_id":"78b33c2e-ab8e-4b1a-9698-0c5370b29680","resolution":{"observed_at":"2026-08-10T23:14:31.905241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05152","last_updated":"2023-12-20T23:06:09Z","snapshot_observed_at":"2026-08-18T20:44:56.061187Z","submitted_at":"2023-11-09T05:24:20Z","title":"Cross-modal Prompts: Adapting Large Pre-trained Models for Audio-Visual Downstream Tasks","version":2},"cited_work":{"arxiv_id":"2311.05152","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.05152","snapshot_observed_at":"2026-08-10T23:14:31.474918Z","title":"Cross-modal Prompts: Adapting Large Pre-trained Models for Audio-Visual Downstream Tasks","venue":"cs.LG","work_id":"12afae91-a09a-47ea-8b23-bee70a7ecc6d","year":2023},"citing_paper":{"arxiv_id":"2412.20872","last_updated":"2024-12-31T03:39:42Z","snapshot_observed_at":"2026-08-10T23:05:50.113962Z","submitted_at":"2024-12-30T11:23:15Z","title":"LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T23:14:31.362775Z"},"links":{"cited_paper":"/paper/2311.05152","citing_paper":"/paper/2412.20872"},"observation_digest":"sha256:8c1071239d108de112ed804d22210aca12a77715e1ac95c215102ae18a5d6e67","observation_id":"772b055e-a842-4dae-8880-c4f23906bcb5","resolution":{"observed_at":"2026-08-10T23:14:31.479730Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:14:31.886462Z","title":"Modality-independent teachers meet weakly-supervised audio-visual event parser","venue":null,"work_id":"a32ec167-accb-4afd-8346-b8408808deeb","year":2023},"citing_paper":{"arxiv_id":"2412.20872","last_updated":"2024-12-31T03:39:42Z","snapshot_observed_at":"2026-08-10T23:05:50.113962Z","submitted_at":"2024-12-30T11:23:15Z","title":"LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T23:14:31.366623Z"},"links":{"citing_paper":"/paper/2412.20872"},"observation_digest":"sha256:2f995ed60f599d23a8c74cfe83a01235d660525dc54cae10a8d5400dabed394c","observation_id":"3678b30a-fd30-4b7a-8caf-757610b41371","resolution":{"observed_at":"2026-08-10T23:14:31.893531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:14:31.874648Z","title":"Label-anticipated Event Disentanglement for Audio-Visual Video Parsing,","venue":null,"work_id":"1345640a-34e1-4b21-af4b-3bd58ef31535","year":2024},"citing_paper":{"arxiv_id":"2412.20872","last_updated":"2024-12-31T03:39:42Z","snapshot_observed_at":"2026-08-10T23:05:50.113962Z","submitted_at":"2024-12-30T11:23:15Z","title":"LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T23:14:31.369985Z"},"links":{"citing_paper":"/paper/2412.20872"},"observation_digest":"sha256:d4c2afa1752ceee3c7a0d84615ab889a1fd42d4fe06fccc1f3fb1d3d0d6e3eb0","observation_id":"b00ba2d6-0458-437d-baf4-b8376e7bfa00","resolution":{"observed_at":"2026-08-10T23:14:31.878816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:14:31.648477Z","title":"Cbam: Convo- lutional block attention module,","venue":null,"work_id":"5fd41cb1-0b94-4728-8ee1-baf7c98d6d77","year":2018},"citing_paper":{"arxiv_id":"2412.20872","last_updated":"2024-12-31T03:39:42Z","snapshot_observed_at":"2026-08-10T23:05:50.113962Z","submitted_at":"2024-12-30T11:23:15Z","title":"LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T23:14:31.373333Z"},"links":{"citing_paper":"/paper/2412.20872"},"observation_digest":"sha256:37f830b34af59b3bc95fd1090b1175f50eeebeff2565656b7396d29c90b20c6e","observation_id":"1f1ea22e-4445-4d3c-80e6-f73bb5246b79","resolution":{"observed_at":"2026-08-10T23:14:31.651641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:14:31.638224Z","title":"Towards Efficient Audio-Visual Learners via Empowering Pre-trained Vi- sion Transformers with Cross-Modal Adaptation,","venue":null,"work_id":"dacbf8fd-bffe-4525-86c8-3268d6b94503","year":2024},"citing_paper":{"arxiv_id":"2412.20872","last_updated":"2024-12-31T03:39:42Z","snapshot_observed_at":"2026-08-10T23:05:50.113962Z","submitted_at":"2024-12-30T11:23:15Z","title":"LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T23:14:31.376298Z"},"links":{"citing_paper":"/paper/2412.20872"},"observation_digest":"sha256:f62ccb6483223b9f2a759e42cfd95e1768fa0cd25513b9be06f440ce1c9b66b8","observation_id":"02f180ef-7605-4869-b5be-14b205afe4d5","resolution":{"observed_at":"2026-08-10T23:14:31.642040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:14:31.626175Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"1d4d78f4-bd38-4e1b-b16c-2776a6f78b14","year":2021},"citing_paper":{"arxiv_id":"2412.20872","last_updated":"2024-12-31T03:39:42Z","snapshot_observed_at":"2026-08-10T23:05:50.113962Z","submitted_at":"2024-12-30T11:23:15Z","title":"LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T23:14:31.379469Z"},"links":{"citing_paper":"/paper/2412.20872"},"observation_digest":"sha256:23fab0579d8034c3a265fd0953456b2c606a330e11409ac4e739d07cca17d508","observation_id":"f874c14f-f6c7-419f-a57f-5c741bf31e3a","resolution":{"observed_at":"2026-08-10T23:14:31.630531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:14:31.614085Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation,","venue":null,"work_id":"4786eb07-0ae1-44de-9252-b3fd4a16d5ed","year":2019},"citing_paper":{"arxiv_id":"2412.20872","last_updated":"2024-12-31T03:39:42Z","snapshot_observed_at":"2026-08-10T23:05:50.113962Z","submitted_at":"2024-12-30T11:23:15Z","title":"LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T23:14:31.382375Z"},"links":{"citing_paper":"/paper/2412.20872"},"observation_digest":"sha256:608e9fe636867d8c1b1bdaf2f125e444f41d18238ac8227e621637d116d24393","observation_id":"c57e30cc-86a3-408f-84d0-533adb9a56ae","resolution":{"observed_at":"2026-08-10T23:14:31.618846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:14:31.603131Z","title":"Balanced multimodal learning via on-the-fly gradient modulation,","venue":null,"work_id":"b33f11d9-32d8-4b2a-951d-dcc5e9e0d0e3","year":2022},"citing_paper":{"arxiv_id":"2412.20872","last_updated":"2024-12-31T03:39:42Z","snapshot_observed_at":"2026-08-10T23:05:50.113962Z","submitted_at":"2024-12-30T11:23:15Z","title":"LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T23:14:31.385120Z"},"links":{"citing_paper":"/paper/2412.20872"},"observation_digest":"sha256:6388fef35fb6945e8961b390d93d7ebf12d781cf8a9f6b8a5a079b8984f57a0a","observation_id":"f9db92f0-8937-4978-a6c2-e1ab5c9da90a","resolution":{"observed_at":"2026-08-10T23:14:31.606881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:14:31.592033Z","title":"What makes training multi-modal classification networks hard?","venue":null,"work_id":"3d30e528-303e-4918-90a2-7da6569ac71b","year":2020},"citing_paper":{"arxiv_id":"2412.20872","last_updated":"2024-12-31T03:39:42Z","snapshot_observed_at":"2026-08-10T23:05:50.113962Z","submitted_at":"2024-12-30T11:23:15Z","title":"LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T23:14:31.388073Z"},"links":{"citing_paper":"/paper/2412.20872"},"observation_digest":"sha256:f9e1298134b20917eec94623f98f572024183f62d24daa83a18fb44d3d84f5d1","observation_id":"86bc2f74-c6ed-4c96-823a-881dafcffd81","resolution":{"observed_at":"2026-08-10T23:14:31.596182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:14:31.580440Z","title":"Scal- ing multimodal pre-training via cross-modality gradient harmonization,","venue":null,"work_id":"d9386f0e-5984-4eac-9a60-c9a1e5f34fbf","year":2022},"citing_paper":{"arxiv_id":"2412.20872","last_updated":"2024-12-31T03:39:42Z","snapshot_observed_at":"2026-08-10T23:05:50.113962Z","submitted_at":"2024-12-30T11:23:15Z","title":"LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T23:14:31.391510Z"},"links":{"citing_paper":"/paper/2412.20872"},"observation_digest":"sha256:e1b9c7cf604ee90ab6cf43efd3d47adbfbcfb49085ccf88e8363afdf6ea18510","observation_id":"d9fe477f-bdc7-40ed-a1da-392e5ae1f55b","resolution":{"observed_at":"2026-08-10T23:14:31.584694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:14:31.569659Z","title":"Text-IF: Leveraging Semantic Text Guidance for Degradation- Aware and Interactive Image Fusion,","venue":null,"work_id":"5fe6b440-3043-4491-b16f-90258eb4fce6","year":2024},"citing_paper":{"arxiv_id":"2412.20872","last_updated":"2024-12-31T03:39:42Z","snapshot_observed_at":"2026-08-10T23:05:50.113962Z","submitted_at":"2024-12-30T11:23:15Z","title":"LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T23:14:31.394816Z"},"links":{"citing_paper":"/paper/2412.20872"},"observation_digest":"sha256:c74e000fe2db45f43afa5e4aab141c7ce1d917cc59a608b84f36466aba949505","observation_id":"c8b9b600-26d9-4085-b466-68c64a65c0dd","resolution":{"observed_at":"2026-08-10T23:14:31.573528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:14:31.559550Z","title":"Language- driven All-in-one Adverse Weather Removal,","venue":null,"work_id":"78432d41-0f0f-4e6a-a0b2-68245dd27a58","year":2024},"citing_paper":{"arxiv_id":"2412.20872","last_updated":"2024-12-31T03:39:42Z","snapshot_observed_at":"2026-08-10T23:05:50.113962Z","submitted_at":"2024-12-30T11:23:15Z","title":"LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T23:14:31.398392Z"},"links":{"citing_paper":"/paper/2412.20872"},"observation_digest":"sha256:c510068c31f6bc68278ba7391d8c34da43ed310c5d78a4ca8e30f17d862afbc8","observation_id":"5dcd6f78-f15d-456f-ac84-61bcdc1c61ba","resolution":{"observed_at":"2026-08-10T23:14:31.563153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:14:31.548864Z","title":"Multi-modal grouping network for weakly-supervised audio-visual video parsing,","venue":null,"work_id":"7058c116-4556-4d1b-8954-673eca543b63","year":2022},"citing_paper":{"arxiv_id":"2412.20872","last_updated":"2024-12-31T03:39:42Z","snapshot_observed_at":"2026-08-10T23:05:50.113962Z","submitted_at":"2024-12-30T11:23:15Z","title":"LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T23:14:31.402479Z"},"links":{"citing_paper":"/paper/2412.20872"},"observation_digest":"sha256:0e09da063c2a513547afa62096c3070b71cb3e95616bdabaf1e67cd56b037901","observation_id":"261f4f31-11f2-498b-ac28-e0c59cc642ac","resolution":{"observed_at":"2026-08-10T23:14:31.552666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:14:31.538310Z","title":"Joint-modal label denoising for weakly-supervised audio-visual video parsing,","venue":null,"work_id":"85025027-ec52-4f73-a814-52f8c2cfe223","year":2022},"citing_paper":{"arxiv_id":"2412.20872","last_updated":"2024-12-31T03:39:42Z","snapshot_observed_at":"2026-08-10T23:05:50.113962Z","submitted_at":"2024-12-30T11:23:15Z","title":"LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T23:14:31.406002Z"},"links":{"citing_paper":"/paper/2412.20872"},"observation_digest":"sha256:fe16a6631239dfd9a845239e4e8ae043f540547e6998ed24704e6fd75a1eadc7","observation_id":"c695cf29-0b0d-4c24-b307-03af97c209ed","resolution":{"observed_at":"2026-08-10T23:14:31.541674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:14:31.526896Z","title":"Collecting cross-modal presence-absence evidence for weakly-supervised audio- visual event perception,","venue":null,"work_id":"6f2ad8bc-7252-498c-a6c6-aaf07431b3c6","year":2023},"citing_paper":{"arxiv_id":"2412.20872","last_updated":"2024-12-31T03:39:42Z","snapshot_observed_at":"2026-08-10T23:05:50.113962Z","submitted_at":"2024-12-30T11:23:15Z","title":"LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T23:14:31.409922Z"},"links":{"citing_paper":"/paper/2412.20872"},"observation_digest":"sha256:1f6d1a03ae6e71f734bb0ef93e44dd9b9775bb084d94ed199e3d6abe12df3304","observation_id":"d4577133-bff7-4684-a3a1-cdca17f11bec","resolution":{"observed_at":"2026-08-10T23:14:31.531000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10690","last_updated":"2024-07-15T09:31:54Z","snapshot_observed_at":"2026-08-16T13:51:54.671840Z","submitted_at":"2024-05-17T10:51:15Z","title":"CoLeaF: A Contrastive-Collaborative Learning Framework for Weakly Supervised Audio-Visual Video Parsing","version":4},"cited_work":{"arxiv_id":"2405.10690","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.10690","snapshot_observed_at":"2026-08-10T23:14:31.455861Z","title":"CoLeaF: A Contrastive-Collaborative Learning Framework for Weakly Supervised Audio-Visual Video Parsing","venue":"cs.CV","work_id":"62802a26-66dd-4381-8ac3-1fed77a74ed8","year":2024},"citing_paper":{"arxiv_id":"2412.20872","last_updated":"2024-12-31T03:39:42Z","snapshot_observed_at":"2026-08-10T23:05:50.113962Z","submitted_at":"2024-12-30T11:23:15Z","title":"LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T23:14:31.413878Z"},"links":{"cited_paper":"/paper/2405.10690","citing_paper":"/paper/2412.20872"},"observation_digest":"sha256:d3e19d9a80f3029fba35469929e346dcd5bff762047aa75fa43534ab34c7ce3d","observation_id":"efe3f719-9e97-4b0f-867f-25133ee6c53b","resolution":{"observed_at":"2026-08-10T23:14:31.462911Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:14:31.515900Z","title":"CM-PIE: Cross-modal perception for interactive-enhanced audio-visual video parsing,","venue":null,"work_id":"2486480e-211a-442e-8c5a-9b0ef2a8cb63","year":2024},"citing_paper":{"arxiv_id":"2412.20872","last_updated":"2024-12-31T03:39:42Z","snapshot_observed_at":"2026-08-10T23:05:50.113962Z","submitted_at":"2024-12-30T11:23:15Z","title":"LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T23:14:31.417511Z"},"links":{"citing_paper":"/paper/2412.20872"},"observation_digest":"sha256:4071b98ac8c320e18ae4395ce958f6ee072eae4828dbd237a390e886fa896d34","observation_id":"854a2959-0109-4ff4-bb39-9fcbbd030c5a","resolution":{"observed_at":"2026-08-10T23:14:31.519353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:14:31.503627Z","title":"V ALOR: Vision- Audio-Language Omni-Perception Pretraining Model and Dataset,","venue":null,"work_id":"74a31436-aab3-418b-95ad-56c4cc9b039d","year":2024},"citing_paper":{"arxiv_id":"2412.20872","last_updated":"2024-12-31T03:39:42Z","snapshot_observed_at":"2026-08-10T23:05:50.113962Z","submitted_at":"2024-12-30T11:23:15Z","title":"LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T23:14:31.421175Z"},"links":{"citing_paper":"/paper/2412.20872"},"observation_digest":"sha256:6394a73d69b9e292441b300415f71874736b19776ef992e4670f1bdb4db2c6b2","observation_id":"bd2c0d7f-8b4b-4b52-a42f-fa13dda274b7","resolution":{"observed_at":"2026-08-10T23:14:31.508137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:14:31.489907Z","title":"Multi-grained representa- tion learning for cross-modal retrieval,","venue":null,"work_id":"56741781-3d01-4763-b72a-1fde830b4cc1","year":2023},"citing_paper":{"arxiv_id":"2412.20872","last_updated":"2024-12-31T03:39:42Z","snapshot_observed_at":"2026-08-10T23:05:50.113962Z","submitted_at":"2024-12-30T11:23:15Z","title":"LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T23:14:31.426091Z"},"links":{"citing_paper":"/paper/2412.20872"},"observation_digest":"sha256:9804a27d851d24f1ed8ab56439af9f061c96b64ff4a9d30cb2d8c1b1b0b9a380","observation_id":"d7cf971f-fddf-4cb3-84f1-1c7240fbf6a6","resolution":{"observed_at":"2026-08-10T23:14:31.494562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.20872","last_updated":"2024-12-31T03:39:42Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T23:05:50.113962Z","submitted_at":"2024-12-30T11:23:15Z","title":"LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":2,"verified_fuzzy":23},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 1 inbound Pith citation observation for arXiv:2412.20872."}