{"as_of":"2026-08-20T18:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:17a462715d840c150da6dc2fdb4a4e6880bfc72ac5817bec5b6d65a8b32f0ce0","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T01:07:11.155102Z","state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.02096/citation-record","integrity":"/paper/2505.02096/integrity","json":"/paper/2505.02096/citation-record.json","paper":"/paper/2505.02096"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:11.463034Z","title":"Unified multisensory perception: Weakly-supervised audio-visual video parsing","venue":null,"work_id":"bd433d0f-b9d6-47f4-8373-ca508d454658","year":2020},"citing_paper":{"arxiv_id":"2505.02096","last_updated":"2025-05-04T13:03:13Z","snapshot_observed_at":"2026-08-16T00:59:19.680095Z","submitted_at":"2025-05-04T13:03:13Z","title":"TeMTG: Text-Enhanced Multi-Hop Temporal Graph Modeling for Audio-Visual Video Parsing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:11.072369Z"},"links":{"citing_paper":"/paper/2505.02096"},"observation_digest":"sha256:abf04c005aa66d0e357f340508f42b2952d337a24aa0e8113506437a4bbb6072","observation_id":"a7dd5de0-2dab-41e4-a835-14a405e210d3","resolution":{"observed_at":"2026-08-16T01:07:11.469693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:11.448718Z","title":"Anchor-aware Deep Metric Learning for Audio-visual Retrieval","venue":null,"work_id":"3cfa05a4-84ca-4acf-abcf-3631f3dfc4b7","year":2024},"citing_paper":{"arxiv_id":"2505.02096","last_updated":"2025-05-04T13:03:13Z","snapshot_observed_at":"2026-08-16T00:59:19.680095Z","submitted_at":"2025-05-04T13:03:13Z","title":"TeMTG: Text-Enhanced Multi-Hop Temporal Graph Modeling for Audio-Visual Video Parsing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:11.077331Z"},"links":{"citing_paper":"/paper/2505.02096"},"observation_digest":"sha256:ae5347c034900242f0495f968b0e41dfd5bd0ee1778e553b4a7ff564d75aae70","observation_id":"021b902c-6d23-4de5-b802-8a5810a5ba1f","resolution":{"observed_at":"2026-08-16T01:07:11.453549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:11.434877Z","title":"Boosting Audio Visual Question Answer- ing via Key Semantic-Aware Cues","venue":null,"work_id":"f0393591-2b54-4703-b9fc-ee45f6dc5b3c","year":2024},"citing_paper":{"arxiv_id":"2505.02096","last_updated":"2025-05-04T13:03:13Z","snapshot_observed_at":"2026-08-16T00:59:19.680095Z","submitted_at":"2025-05-04T13:03:13Z","title":"TeMTG: Text-Enhanced Multi-Hop Temporal Graph Modeling for Audio-Visual Video Parsing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:11.081688Z"},"links":{"citing_paper":"/paper/2505.02096"},"observation_digest":"sha256:afc64fc21c0e736dbcb88f4a313b9980a5d7ff72b0e3a54817b9e266cf6be90c","observation_id":"a3492174-f6e7-4e7d-9f35-a25b1b3c0052","resolution":{"observed_at":"2026-08-16T01:07:11.439219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:11.419965Z","title":"Open-Vocabulary Audio-Visual Semantic Segmentation","venue":null,"work_id":"1e5c6b59-7d4a-42ef-89b2-9fbc14d45e2b","year":2024},"citing_paper":{"arxiv_id":"2505.02096","last_updated":"2025-05-04T13:03:13Z","snapshot_observed_at":"2026-08-16T00:59:19.680095Z","submitted_at":"2025-05-04T13:03:13Z","title":"TeMTG: Text-Enhanced Multi-Hop Temporal Graph Modeling for Audio-Visual Video Parsing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:11.086055Z"},"links":{"citing_paper":"/paper/2505.02096"},"observation_digest":"sha256:3fd69bb9102d28b78d6d78cbaae77a8c8f867cf6374dc2f7e6f4d48281f4b3f0","observation_id":"add480ef-be21-4bf4-9aa9-760545df8d74","resolution":{"observed_at":"2026-08-16T01:07:11.425110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:11.404107Z","title":"Drcnet: Dynamic image restoration contrastive network","venue":null,"work_id":"91d2ff79-e586-49e6-8e04-7868d98e6987","year":2022},"citing_paper":{"arxiv_id":"2505.02096","last_updated":"2025-05-04T13:03:13Z","snapshot_observed_at":"2026-08-16T00:59:19.680095Z","submitted_at":"2025-05-04T13:03:13Z","title":"TeMTG: Text-Enhanced Multi-Hop Temporal Graph Modeling for Audio-Visual Video Parsing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:11.090531Z"},"links":{"citing_paper":"/paper/2505.02096"},"observation_digest":"sha256:5706f3ff0e01ccab714ad7fc625dbe61279e80ef6016f1527ef60b0cc7a0354a","observation_id":"58e56d40-8fb5-4b30-a1ea-3aa846ee1c41","resolution":{"observed_at":"2026-08-16T01:07:11.408437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:11.388795Z","title":"Collecting cross-modal presence-absence evidence for weakly-supervised audio-visual event percep- tion","venue":null,"work_id":"ce24aae3-e63f-4122-a4a9-da26d7f94d7e","year":2023},"citing_paper":{"arxiv_id":"2505.02096","last_updated":"2025-05-04T13:03:13Z","snapshot_observed_at":"2026-08-16T00:59:19.680095Z","submitted_at":"2025-05-04T13:03:13Z","title":"TeMTG: Text-Enhanced Multi-Hop Temporal Graph Modeling for Audio-Visual Video Parsing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:11.095159Z"},"links":{"citing_paper":"/paper/2505.02096"},"observation_digest":"sha256:62dff77476865a5bc69169939684d935e0ee605b216788ee998c49c699246706","observation_id":"e0ab1285-db4f-42fb-80d3-4c5d3154ca63","resolution":{"observed_at":"2026-08-16T01:07:11.393321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:11.374544Z","title":"ColeaF: A Contrastive-Collaborative Learning Framework for Weakly Supervised Audio- Visual Video Parsing","venue":null,"work_id":"59a923f2-e83f-42ee-9774-5abe1e6674f1","year":2024},"citing_paper":{"arxiv_id":"2505.02096","last_updated":"2025-05-04T13:03:13Z","snapshot_observed_at":"2026-08-16T00:59:19.680095Z","submitted_at":"2025-05-04T13:03:13Z","title":"TeMTG: Text-Enhanced Multi-Hop Temporal Graph Modeling for Audio-Visual Video Parsing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:11.100048Z"},"links":{"citing_paper":"/paper/2505.02096"},"observation_digest":"sha256:777085593a2158fb0da828181d0e08e9856a8cbb5748128dea260b68742bafb7","observation_id":"dae141fa-5161-48f0-ac2f-5ad330576e3f","resolution":{"observed_at":"2026-08-16T01:07:11.379326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:11.360470Z","title":"Modality-independent teachers meet weakly-supervised audio-visual event parser","venue":null,"work_id":"f87d4527-63e7-4d79-86db-48550ee2a1b0","year":2023},"citing_paper":{"arxiv_id":"2505.02096","last_updated":"2025-05-04T13:03:13Z","snapshot_observed_at":"2026-08-16T00:59:19.680095Z","submitted_at":"2025-05-04T13:03:13Z","title":"TeMTG: Text-Enhanced Multi-Hop Temporal Graph Modeling for Audio-Visual Video Parsing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:11.104350Z"},"links":{"citing_paper":"/paper/2505.02096"},"observation_digest":"sha256:6180a01d421bdacf88db673a67c772c18d5d31c180ce94bf991dc7da7d91dfc1","observation_id":"b7ea8ed5-813f-4743-a7c7-4aaa4fd7f381","resolution":{"observed_at":"2026-08-16T01:07:11.365057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:11.345777Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation","venue":null,"work_id":"e358bb94-055f-462a-a8a6-7ab1e0cff2ce","year":2023},"citing_paper":{"arxiv_id":"2505.02096","last_updated":"2025-05-04T13:03:13Z","snapshot_observed_at":"2026-08-16T00:59:19.680095Z","submitted_at":"2025-05-04T13:03:13Z","title":"TeMTG: Text-Enhanced Multi-Hop Temporal Graph Modeling for Audio-Visual Video Parsing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:11.108434Z"},"links":{"citing_paper":"/paper/2505.02096"},"observation_digest":"sha256:ff4403c529deccc3a7b70f6f1d8b39678a54f0ea5904795e84ec3de3bdf0cbcd","observation_id":"3046f933-f1a6-488f-89cc-edad067283ab","resolution":{"observed_at":"2026-08-16T01:07:11.350667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:11.113438Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.02096","last_updated":"2025-05-04T13:03:13Z","snapshot_observed_at":"2026-08-16T00:59:19.680095Z","submitted_at":"2025-05-04T13:03:13Z","title":"TeMTG: Text-Enhanced Multi-Hop Temporal Graph Modeling for Audio-Visual Video Parsing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:11.113438Z"},"links":{"citing_paper":"/paper/2505.02096"},"observation_digest":"sha256:a6e30650b1cdb68783fb247d425798a6ce05ada81e6e0cb6bfade4c5655a0e61","observation_id":"c576de82-eff6-4850-ac0a-16b5c962a0ed","resolution":{"observed_at":"2026-08-16T01:07:11.113438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:11.321548Z","title":"Label-anticipated event disentanglement for audio-visual video parsing","venue":null,"work_id":"80650543-5059-42ba-adbe-7a4bed68ebae","year":2024},"citing_paper":{"arxiv_id":"2505.02096","last_updated":"2025-05-04T13:03:13Z","snapshot_observed_at":"2026-08-16T00:59:19.680095Z","submitted_at":"2025-05-04T13:03:13Z","title":"TeMTG: Text-Enhanced Multi-Hop Temporal Graph Modeling for Audio-Visual Video Parsing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:11.117790Z"},"links":{"citing_paper":"/paper/2505.02096"},"observation_digest":"sha256:74e136190bff0e2997bd217b64264d53d0e95482b7544ba1e45a18216ddfcf9e","observation_id":"dc383dae-d85b-413c-9e92-fd23c178ec86","resolution":{"observed_at":"2026-08-16T01:07:11.325932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:11.307834Z","title":"Revisit weakly-supervised audio- visual video parsing from the language perspective","venue":null,"work_id":"c48260ad-2a5c-4c58-a280-39a04165bda1","year":2024},"citing_paper":{"arxiv_id":"2505.02096","last_updated":"2025-05-04T13:03:13Z","snapshot_observed_at":"2026-08-16T00:59:19.680095Z","submitted_at":"2025-05-04T13:03:13Z","title":"TeMTG: Text-Enhanced Multi-Hop Temporal Graph Modeling for Audio-Visual Video Parsing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:11.122031Z"},"links":{"citing_paper":"/paper/2505.02096"},"observation_digest":"sha256:dca370ac309ac2c14e84e0582a975fb8eb9dcde81b7301500fa7bfda8d8cb38e","observation_id":"b2387bf3-1c95-4779-86e2-6a98eb59c3f4","resolution":{"observed_at":"2026-08-16T01:07:11.312269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:11.293562Z","title":"Multi-modal grouping network for weakly- supervised audio-visual video parsing","venue":null,"work_id":"39981843-abc8-4eca-b929-ca89f3ca37d5","year":2022},"citing_paper":{"arxiv_id":"2505.02096","last_updated":"2025-05-04T13:03:13Z","snapshot_observed_at":"2026-08-16T00:59:19.680095Z","submitted_at":"2025-05-04T13:03:13Z","title":"TeMTG: Text-Enhanced Multi-Hop Temporal Graph Modeling for Audio-Visual Video Parsing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:11.126128Z"},"links":{"citing_paper":"/paper/2505.02096"},"observation_digest":"sha256:e0b870335c8c869a856a0bf5bc34ef00dcb22ea5260412e4f50c174593488859","observation_id":"c0f97708-68f5-42ec-9bf9-e3c403287f8f","resolution":{"observed_at":"2026-08-16T01:07:11.297903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:11.279220Z","title":"CM-PIE: Cross-modal perception for interactive-enhanced audio- visual video parsing","venue":null,"work_id":"c3dac36a-97f0-46dd-a5ce-9d8ae1e66f41","year":2024},"citing_paper":{"arxiv_id":"2505.02096","last_updated":"2025-05-04T13:03:13Z","snapshot_observed_at":"2026-08-16T00:59:19.680095Z","submitted_at":"2025-05-04T13:03:13Z","title":"TeMTG: Text-Enhanced Multi-Hop Temporal Graph Modeling for Audio-Visual Video Parsing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:11.130288Z"},"links":{"citing_paper":"/paper/2505.02096"},"observation_digest":"sha256:5af6dc7c791c1bddff1a3611d0182719a0e7ebe46999e6afc6a3f6727b828c17","observation_id":"a522badc-0009-4868-8061-94284f83e6c2","resolution":{"observed_at":"2026-08-16T01:07:11.283830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:11.263361Z","title":"Advancing Weakly- Supervised Audio-Visual Video Parsing via Segment-Wise Pseudo Labeling","venue":null,"work_id":"c24bb838-17ab-4091-81b6-e8b3ebc9c181","year":2024},"citing_paper":{"arxiv_id":"2505.02096","last_updated":"2025-05-04T13:03:13Z","snapshot_observed_at":"2026-08-16T00:59:19.680095Z","submitted_at":"2025-05-04T13:03:13Z","title":"TeMTG: Text-Enhanced Multi-Hop Temporal Graph Modeling for Audio-Visual Video Parsing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:11.134351Z"},"links":{"citing_paper":"/paper/2505.02096"},"observation_digest":"sha256:5284ec298f91f426a02471bf91dc8980abf6906769bfce17f19b2e50ae48cf8a","observation_id":"205d1c3f-f0ce-4a7c-a39f-29915a5f5e2a","resolution":{"observed_at":"2026-08-16T01:07:11.268622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:11.249529Z","title":"Resisting Noise in Pseudo Labels: Audible Video Event Parsing With Evidential Learning","venue":null,"work_id":"4cda1d70-1fa0-4d69-9f18-dabf05fa7f7f","year":2024},"citing_paper":{"arxiv_id":"2505.02096","last_updated":"2025-05-04T13:03:13Z","snapshot_observed_at":"2026-08-16T00:59:19.680095Z","submitted_at":"2025-05-04T13:03:13Z","title":"TeMTG: Text-Enhanced Multi-Hop Temporal Graph Modeling for Audio-Visual Video Parsing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:11.138245Z"},"links":{"citing_paper":"/paper/2505.02096"},"observation_digest":"sha256:ea7ec1f0b64fe38a81bec34564a69ea17f83e1f9d46cdc7ff522aafa3b4a773d","observation_id":"6f958f28-13b4-4bd8-a62b-2ed47f291f51","resolution":{"observed_at":"2026-08-16T01:07:11.253974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20872","last_updated":"2024-12-31T03:39:42Z","snapshot_observed_at":"2026-08-10T23:05:50.113962Z","submitted_at":"2024-12-30T11:23:15Z","title":"LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing","version":2},"cited_work":{"arxiv_id":"2412.20872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.20872","snapshot_observed_at":"2026-08-16T01:07:11.189974Z","title":"LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing","venue":"cs.CV","work_id":"a63470db-cae7-479d-8464-bafc006b3a24","year":2024},"citing_paper":{"arxiv_id":"2505.02096","last_updated":"2025-05-04T13:03:13Z","snapshot_observed_at":"2026-08-16T00:59:19.680095Z","submitted_at":"2025-05-04T13:03:13Z","title":"TeMTG: Text-Enhanced Multi-Hop Temporal Graph Modeling for Audio-Visual Video Parsing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:11.142298Z"},"links":{"cited_paper":"/paper/2412.20872","citing_paper":"/paper/2505.02096"},"observation_digest":"sha256:af3a3a6555bbacca59ebc323d537a5ffd0a26aa6f4ab61b1a50cab3a2f2aa8fb","observation_id":"5ece17e2-c5a1-4539-b62f-01df159f5a7a","resolution":{"observed_at":"2026-08-16T01:07:11.196864Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:11.235469Z","title":"Multilayer perceptron (MLP)","venue":null,"work_id":"5d2ee605-e8ce-4c34-a136-4a2dbf20ce9a","year":2017},"citing_paper":{"arxiv_id":"2505.02096","last_updated":"2025-05-04T13:03:13Z","snapshot_observed_at":"2026-08-16T00:59:19.680095Z","submitted_at":"2025-05-04T13:03:13Z","title":"TeMTG: Text-Enhanced Multi-Hop Temporal Graph Modeling for Audio-Visual Video Parsing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:11.146746Z"},"links":{"citing_paper":"/paper/2505.02096"},"observation_digest":"sha256:02239e93cd08fde0caf8ef91c3dce25ad4c30b80f1d3511fca1585dbbcf7c72f","observation_id":"5270ffcd-4953-4a08-bf54-75c0b06c962e","resolution":{"observed_at":"2026-08-16T01:07:11.239969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:11.220818Z","title":"Graph Attention Networks","venue":null,"work_id":"785cf8d9-2f38-4565-9510-3b63d53dcdf4","year":2018},"citing_paper":{"arxiv_id":"2505.02096","last_updated":"2025-05-04T13:03:13Z","snapshot_observed_at":"2026-08-16T00:59:19.680095Z","submitted_at":"2025-05-04T13:03:13Z","title":"TeMTG: Text-Enhanced Multi-Hop Temporal Graph Modeling for Audio-Visual Video Parsing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:11.150922Z"},"links":{"citing_paper":"/paper/2505.02096"},"observation_digest":"sha256:06120c6da7cd88b84e0a4b53a64217b69ab32ac8818d0856ac8083d797e8c37f","observation_id":"ee8ed6a6-d325-4e62-8c34-e0eae99be691","resolution":{"observed_at":"2026-08-16T01:07:11.225269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:11.206763Z","title":"Exploring heterogeneous clues for weakly-supervised audio- visual video parsing","venue":null,"work_id":"cdcde828-9dbc-4beb-998e-ef26d6ff3268","year":2021},"citing_paper":{"arxiv_id":"2505.02096","last_updated":"2025-05-04T13:03:13Z","snapshot_observed_at":"2026-08-16T00:59:19.680095Z","submitted_at":"2025-05-04T13:03:13Z","title":"TeMTG: Text-Enhanced Multi-Hop Temporal Graph Modeling for Audio-Visual Video Parsing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:11.155102Z"},"links":{"citing_paper":"/paper/2505.02096"},"observation_digest":"sha256:02547ee8fe65ab0b79e6cbef4963f1cf2e33752b4467027a0803de5ebc6fea26","observation_id":"7a03950c-6d74-458c-bc6f-f95aa5fb23ae","resolution":{"observed_at":"2026-08-16T01:07:11.211167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.02096","last_updated":"2025-05-04T13:03:13Z","latest_version":1,"primary_category":"cs.MM","snapshot_observed_at":"2026-08-16T00:59:19.680095Z","submitted_at":"2025-05-04T13:03:13Z","title":"TeMTG: Text-Enhanced Multi-Hop Temporal Graph Modeling for Audio-Visual Video Parsing"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":1,"verified_exact":1,"verified_fuzzy":18},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 0 inbound Pith citation observations for arXiv:2505.02096."}