{"as_of":"2026-08-18T04:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1803d7190b8f38fb295d470e5ce7ab78a034fb83c3601cff9c9c46d4882169f7","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T15:13:01.716269Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T18:46:09.187257Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-11T13:56:18.465821Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-17T23:24:38.973608Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.11248","snapshot_observed_at":"2026-08-12T18:46:09.187257Z","title":"Multimodal class-aware semantic enhance- ment network for audio-visual video parsing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.187257Z"},"links":{"cited_paper":"/paper/2412.11248","citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:5d8dea6f2e99441e1486d76d35c0ec7e383dc643102883efd3defa74d504bb4e","observation_id":"5bfb899d-dbe4-41ae-b09e-6ccaccffd004","resolution":{"observed_at":"2026-08-12T18:46:09.187257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-17T23:24:38.973608Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"cited_work":{"arxiv_id":"2412.11248","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.11248","snapshot_observed_at":"2026-08-11T13:56:18.465821Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","venue":"cs.CV","work_id":"fe00f9d2-e092-4365-861d-1ffbf6bbc59c","year":2024},"citing_paper":{"arxiv_id":"2412.12628","last_updated":"2024-12-18T09:58:32Z","snapshot_observed_at":"2026-08-15T22:50:25.356078Z","submitted_at":"2024-12-17T07:43:36Z","title":"Dense Audio-Visual Event Localization under Cross-Modal Consistency and Multi-Temporal Granularity Collaboration","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T13:56:18.373538Z"},"links":{"cited_paper":"/paper/2412.11248","citing_paper":"/paper/2412.12628"},"observation_digest":"sha256:b4a3f6e1478e8c543774d7709e7d6d68aa8809cde9dfce2a9ffbf36697f8f974","observation_id":"b3a2f034-4c50-428a-8de4-c76bfb94b117","resolution":{"observed_at":"2026-08-11T13:56:18.469675Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.11248/citation-record","integrity":"/paper/2412.11248/integrity","json":"/paper/2412.11248/citation-record.json","paper":"/paper/2412.11248"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:02.352228Z","title":null,"venue":null,"work_id":"92b7a30f-9adf-4b60-951e-266468c70ed5","year":2022},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-17T23:24:38.973608Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.503232Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:d8d998f04a21a00c5b24bf6a467f3d4164cdce7f430133099de56c879f70af88","observation_id":"152bc8e2-6f13-4888-9caf-0ef6577f5b79","resolution":{"observed_at":"2026-08-11T15:13:02.357232Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:02.338944Z","title":null,"venue":null,"work_id":"9410bbd3-d8ad-4554-b663-1705b834e024","year":2020},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-17T23:24:38.973608Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.507978Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:b0aee19ce171870678f95f302bd6d470c775e1d31a6cff31a2a9482c7ed0d337","observation_id":"8a8ca093-f307-4a25-8bc9-af5db5325c02","resolution":{"observed_at":"2026-08-11T15:13:02.344000Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:02.328005Z","title":null,"venue":null,"work_id":"ce6aded1-8333-4a8a-b8f6-33a1eb4ea3c8","year":2023},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-17T23:24:38.973608Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.511958Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:642c741d88dc08fa85ea79fd378e8efcf150ba5895984cfa01c24c29eb196606","observation_id":"e46f345d-56f2-4ada-bd80-75674c9db2e9","resolution":{"observed_at":"2026-08-11T15:13:02.331773Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:02.317016Z","title":null,"venue":null,"work_id":"386c8f0e-9fc0-4227-902e-d292a30e9fdc","year":2023},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-17T23:24:38.973608Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.515898Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:a240ac7d002df3e4f3b80d83940c0abe6e034548db77c92fd32ac54961433a9c","observation_id":"de3c04df-b900-45d0-a819-bc2d3b5a390b","resolution":{"observed_at":"2026-08-11T15:13:02.320177Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:02.306176Z","title":"F.; Ellis, D","venue":null,"work_id":"335b2bf4-2984-41b7-97c5-4c83a6745113","year":2017},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-17T23:24:38.973608Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.520388Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:a9221862febfbd46ecc6574a61368dedfbd59063bf81e41f876afa3ec8946bfe","observation_id":"96b8a80f-c045-404f-99e2-12ba2276b82d","resolution":{"observed_at":"2026-08-11T15:13:02.310257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:01.525271Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-17T23:24:38.973608Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.525271Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:a3d5a61b80b985c6536b04b8d94af62b08f6d68fd891695f7141312b658e485f","observation_id":"bac78026-f41b-48c9-b671-062ca42a91f0","resolution":{"observed_at":"2026-08-11T15:13:01.525271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.18709","last_updated":"2025-03-02T15:37:39Z","snapshot_observed_at":"2026-08-17T18:11:01.191449Z","submitted_at":"2023-10-28T13:37:52Z","title":"Audio-Visual Instance Segmentation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.18709","snapshot_observed_at":"2026-08-11T15:13:01.530544Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-17T23:24:38.973608Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.530544Z"},"links":{"cited_paper":"/paper/2310.18709","citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:bc4af63f0770cd5c0d7e7d44be1edc0b250e80e3f9c5437b3042f1f2f83d7774","observation_id":"9f8b9332-6d8a-4bf3-964b-7e7c04d4fff3","resolution":{"observed_at":"2026-08-11T15:13:01.530544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:01.534796Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-17T23:24:38.973608Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.534796Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:44340e53e57f165fe6095507580985efd83e2fdd972302f7b8ff141cac1e34ec","observation_id":"a05edc5c-1cb7-46ac-b3f2-5e6671f1580e","resolution":{"observed_at":"2026-08-11T15:13:01.534796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:02.286090Z","title":"P.; Gemmeke, J","venue":null,"work_id":"891bbd65-b3c9-4720-8a45-3f798d497e58","year":2017},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-17T23:24:38.973608Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.539244Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:30f37429e85266d03d5ffc224dbbd7a6f275fad2a83399fb6f8beadd5e092b02","observation_id":"46e2a1c5-9a05-482b-8179-df7efdd7c833","resolution":{"observed_at":"2026-08-11T15:13:02.290661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:02.272681Z","title":null,"venue":null,"work_id":"a67e0729-e100-4a4a-9be7-48ce4ef8efc0","year":2024},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-17T23:24:38.973608Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.543947Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:bb6e9722bc957089824591506c7cbd8dbab3edf90cc919851795edccb8101e8c","observation_id":"a1369f5f-1c43-4bc5-a4cc-1190dd49db7a","resolution":{"observed_at":"2026-08-11T15:13:02.277598Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:02.261350Z","title":null,"venue":null,"work_id":"9a02264f-bcea-4966-b2dd-004615bd32a6","year":2022},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-17T23:24:38.973608Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.547767Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:ea07a6059485d6dd40cd9c13f4fe72ccb9f01de237f00df605829282f9125164","observation_id":"42d8ebf1-0b54-4646-a411-b5667af67a97","resolution":{"observed_at":"2026-08-11T15:13:02.265427Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:02.247335Z","title":null,"venue":null,"work_id":"b9a73031-818e-4b56-ac71-5ca4954aab55","year":2023},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-17T23:24:38.973608Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.552516Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:310e076287af46dab8bbb484a74c17362ca322b7f1957fe1634f71d73e6f10e6","observation_id":"1c244fac-dbb7-4c0f-9fd9-4a6c79480b9e","resolution":{"observed_at":"2026-08-11T15:13:02.252960Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:02.230659Z","title":null,"venue":null,"work_id":"68eb0971-4944-4d58-b22d-78aca063f029","year":2024},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-17T23:24:38.973608Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.556987Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:6572aa77fdee49f5068f4eb9fa6d27e5ffa1441558b8fb6b27a5c5a4d8b785e8","observation_id":"8947d35f-4634-4b91-943e-1ffdf78d0b5c","resolution":{"observed_at":"2026-08-11T15:13:02.237881Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:02.206444Z","title":null,"venue":null,"work_id":"ce0744ae-6481-4d8d-be52-4c11669a2bea","year":2021},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-17T23:24:38.973608Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.560638Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:0e2d102abf459cff53daeb4bfcf189741943eeda2ce8e785ec5163103b130b95","observation_id":"36aaa316-8977-4622-92a1-75a227528847","resolution":{"observed_at":"2026-08-11T15:13:02.215252Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:02.187736Z","title":null,"venue":null,"work_id":"d7c151fc-9bb8-4fae-a996-0a4b0ac0fdab","year":2024},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-17T23:24:38.973608Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.564174Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:e9e4b1f9bbc24d5aecef43e93de88adff2d4d6052f7aac4b78af2753541e621c","observation_id":"13525f6b-e307-44c1-b63b-d246b0397b3b","resolution":{"observed_at":"2026-08-11T15:13:02.191234Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:02.177197Z","title":null,"venue":null,"work_id":"d827916d-f508-4426-bd36-c5698f465cc3","year":2022},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-17T23:24:38.973608Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.568853Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:15ed0a82b539e98417c4d5c47d1cb22139d833b48460b5786480afdd9d0fcde3","observation_id":"839b9835-4224-44b8-bda9-0591367cece2","resolution":{"observed_at":"2026-08-11T15:13:02.180373Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:02.166819Z","title":null,"venue":null,"work_id":"d3f09b48-1dee-40b3-89c2-85b98d1ac5ea","year":2020},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-17T23:24:38.973608Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.575523Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:c00ea443055bc5e01c7160b3fcec3db6a986858d130c5fd25d80481a823dbd27","observation_id":"2c960343-0c7c-4e4e-8d65-d3178a14fbf1","resolution":{"observed_at":"2026-08-11T15:13:02.170183Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:02.154887Z","title":"W.; Hallacy, C.; Ramesh, A.; Goh, G.; Agarwal, S.; Sastry, G.; Askell, A.; Mishkin, P.; Clark, J.; et al","venue":null,"work_id":"897c4e29-b8e8-44ec-a3ab-60bc48b4a72d","year":2021},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-17T23:24:38.973608Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.579559Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:e6378dc037c85b2ba04a1456003b88d28598bcfd4a2f3cbb04d85643ffdfea8b","observation_id":"de5b8cf5-49c5-4fe4-88c7-a999b27b955d","resolution":{"observed_at":"2026-08-11T15:13:02.159959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:02.136923Z","title":null,"venue":null,"work_id":"32345541-a917-4db7-b9d6-82464521a2ae","year":2023},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-17T23:24:38.973608Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.583425Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:79b8db5e160515bb6f38dc095084f5176361ce84ea20d81a0c68d2a73f24d231","observation_id":"5e9b2698-649e-4dd8-9b60-cfc33fe15b51","resolution":{"observed_at":"2026-08-11T15:13:02.142356Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:02.122022Z","title":null,"venue":null,"work_id":"6c289313-4fa5-4666-8943-3206ed743355","year":2023},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-17T23:24:38.973608Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.587774Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:5e862054d48d2158ddd7dbbb1c41478826e691782912d52afc2041a5b4c9aff8","observation_id":"499b408c-e05d-413b-adc8-2bc71fc96023","resolution":{"observed_at":"2026-08-11T15:13:02.127223Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:02.105972Z","title":null,"venue":null,"work_id":"4f5c8f7d-4a59-467e-bf56-1b4ba4fa82c0","year":2020},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-17T23:24:38.973608Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.591201Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:2cea6ab1b5ff4511defb9763bc92ff1f3b49242a439aec04c02b33406f9d61ec","observation_id":"016322f5-764b-4511-bbcb-6f1a27bce399","resolution":{"observed_at":"2026-08-11T15:13:02.110992Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:02.093819Z","title":null,"venue":null,"work_id":"7f0aa4ee-9cac-4b79-9860-5663e69abe8a","year":2018},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-17T23:24:38.973608Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.596421Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:030ea478d0e5bd1ba2faba4b456c3dbad133c64d693a66549143eeaa283477de","observation_id":"f53c176c-a24b-481f-9c0e-b0978f71300b","resolution":{"observed_at":"2026-08-11T15:13:02.098185Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:02.079942Z","title":null,"venue":null,"work_id":"0b2e1375-23f6-45b3-82e0-5f1eec1f211d","year":2018},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-17T23:24:38.973608Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.602269Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:0c292c34def98d14532fa640e77a65177c28b09fa1e2276ba81fe49d2b6024f0","observation_id":"073d1454-1ce4-4a84-a759-f054066f7a83","resolution":{"observed_at":"2026-08-11T15:13:02.084854Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:01.607127Z","title":null,"venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-17T23:24:38.973608Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.607127Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:e99a10972e6d531020cf2215058aae42e0c0eb76d3806fb07718cb50b4f48166","observation_id":"6fce31ed-c484-4572-b37c-eae0c58a7026","resolution":{"observed_at":"2026-08-11T15:13:01.607127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:02.057543Z","title":"N.; Kaiser, .; and Polosukhin, I","venue":null,"work_id":"584c213c-ac57-40af-a7d6-50648feff11f","year":2017},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-17T23:24:38.973608Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.618028Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:d11d8ad864dc83a4802c2500b0f7d9ea1738b6b1ef7ffe9187dada39982c23e8","observation_id":"ae410929-8a5c-4740-a4eb-20ff16e71d7a","resolution":{"observed_at":"2026-08-11T15:13:02.061349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:02.044759Z","title":null,"venue":null,"work_id":"07c13150-3afc-4e18-828a-592043d15a7c","year":2023},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-17T23:24:38.973608Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.625361Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:88193596deb325a9954959a846e18b384251815a62f86a5c119168e4a9773311","observation_id":"5744a7ba-dab8-4d57-aa56-97e1a8653492","resolution":{"observed_at":"2026-08-11T15:13:02.048833Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:02.026664Z","title":null,"venue":null,"work_id":"f53569c0-82ef-4c25-ac97-cf8d73e030ec","year":2021},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-17T23:24:38.973608Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.632171Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:7b46c69135c2cd3a460ad0062c586c48ddb8df424a889d7731bdbe5d79f7f1ee","observation_id":"40717953-16bc-4610-87fc-78b738aa165a","resolution":{"observed_at":"2026-08-11T15:13:02.036042Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:02.012608Z","title":null,"venue":null,"work_id":"cac810d2-534c-4d09-987b-16b35a35f297","year":2022},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-17T23:24:38.973608Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.638233Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:d7ec44543a6b8f857d465667511eac7090cac20f12f2bf2106559e33109c6a20","observation_id":"7a0785a9-699c-4fa1-870a-35b3e64cfb3d","resolution":{"observed_at":"2026-08-11T15:13:02.017257Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:01.999299Z","title":null,"venue":null,"work_id":"298505a9-6915-4af1-b920-175768d92a5b","year":2023},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-17T23:24:38.973608Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.643471Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:9484fc53aa5753d5876aaa624671657c296382f3564d91b0ff1041b5d1fc2576","observation_id":"d34537c7-6574-4a5d-b6f6-931a7005d3da","resolution":{"observed_at":"2026-08-11T15:13:02.003427Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:01.985653Z","title":null,"venue":null,"work_id":"280c9773-76cf-4b72-aea1-b3c782486e37","year":2018},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-17T23:24:38.973608Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.647104Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:743f0ba0ee6667e2014ad5f8fa56148198c1629dd46f9b46c9352f5877cace14","observation_id":"b3c12c5d-d5de-43b4-b413-f57dcde977d0","resolution":{"observed_at":"2026-08-11T15:13:01.989549Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.11278","snapshot_observed_at":"2026-08-11T15:13:01.650537Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-17T23:24:38.973608Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.650537Z"},"links":{"cited_paper":"/paper/2411.11278","citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:fb86ccd3c34336a00f8d5797a3fe72b16eb9ab9571da89eca9c9f3b0c8e03e4d","observation_id":"48fc6d8a-1ce9-49e8-858d-5fa97ed8ff73","resolution":{"observed_at":"2026-08-11T15:13:01.650537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:01.971622Z","title":null,"venue":null,"work_id":"c8bd67ce-6e8d-451e-aebe-a23e89b37263","year":2024},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-17T23:24:38.973608Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.655647Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:8493905095661591729f2fe5e65bb1e26921c2392fd1f640621c87e56da8e4de","observation_id":"6fbe334b-da2a-4eef-95c7-83a8a7709da8","resolution":{"observed_at":"2026-08-11T15:13:01.976795Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:01.958433Z","title":null,"venue":null,"work_id":"827575b1-73d6-4c39-97ac-d811ad76e65a","year":2025},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-17T23:24:38.973608Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.659388Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:43eb5a4bebaa848f80fb977cb1d2a027f2604e7b39d86dac6968db23e3248392","observation_id":"9a1164dd-821f-4d28-9048-73339a9e5ac3","resolution":{"observed_at":"2026-08-11T15:13:01.963252Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:01.946099Z","title":null,"venue":null,"work_id":"fa5221b0-5c88-40fc-913b-7c24d5d82b13","year":2022},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-17T23:24:38.973608Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.663322Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:c2146d6e8447feda8cdbfc3cc17ec604235a48e60df77cc94683017b1ff7f66a","observation_id":"ab830127-220f-4ef8-b25c-a206d3868923","resolution":{"observed_at":"2026-08-11T15:13:01.950389Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.02344","last_updated":"2023-03-04T07:21:37Z","snapshot_observed_at":"2026-08-16T15:50:51.505984Z","submitted_at":"2023-03-04T07:21:37Z","title":"Improving Audio-Visual Video Parsing with Pseudo Visual Labels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.02344","snapshot_observed_at":"2026-08-11T15:13:01.678056Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-17T23:24:38.973608Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.678056Z"},"links":{"cited_paper":"/paper/2303.02344","citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:c73724ab114f30ad8191364c6beeea738f4d318009faebf6fe52fa443f7f15dd","observation_id":"721ed835-fb5d-4b6b-bf17-ccceec3759de","resolution":{"observed_at":"2026-08-11T15:13:01.678056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:01.934167Z","title":null,"venue":null,"work_id":"e058913e-7e67-4aaa-b174-1d37478dd641","year":2024},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-17T23:24:38.973608Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.687877Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:035418e1d4f471fbc8f8d0909edfa642e7ff3166336f5d356044dcdfc738dae0","observation_id":"ab8b3c04-9637-494d-947d-b4e10f3630bd","resolution":{"observed_at":"2026-08-11T15:13:01.937829Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:01.918982Z","title":null,"venue":null,"work_id":"0122e524-af3a-4829-8267-873b3f621792","year":2024},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-17T23:24:38.973608Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.692972Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:0baa19ccba1c23e9bac7689abb815ec90518795ced92ca2ac522a50810da4777","observation_id":"752b6c02-d5fa-4668-8eb9-33f52d4532ec","resolution":{"observed_at":"2026-08-11T15:13:01.923772Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:01.895420Z","title":null,"venue":null,"work_id":"ff1c3f92-3dce-45b2-96f5-ac72d85916f2","year":2022},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-17T23:24:38.973608Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.699314Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:3c054edff406348cfe66fc2ae041f55ef9d3fdddb9c93d091568b83c41a2d5a1","observation_id":"0a2cddf0-f471-432b-b64b-8172fd3b6a78","resolution":{"observed_at":"2026-08-11T15:13:01.900502Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:01.877880Z","title":null,"venue":null,"work_id":"3f702f91-6d88-4624-94fb-11d0c9159c52","year":2021},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-17T23:24:38.973608Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.704379Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:3b608db78fcb2595c79117302cf678749e08e0a9f9e32686907274551b700ca0","observation_id":"6f2e5818-9d05-4da6-bf83-838f13abeb5c","resolution":{"observed_at":"2026-08-11T15:13:01.883597Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:01.709680Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-17T23:24:38.973608Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.709680Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:6486b8276daee3c41f4b0471596c21b26f0bc65d21d5376eb439c4a4930def2e","observation_id":"4c799edf-192b-4a94-8b09-6a28a428b66c","resolution":{"observed_at":"2026-08-11T15:13:01.709680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:01.716269Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-17T23:24:38.973608Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.716269Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:f49bbeedf8e3089ca361af0208f928778d65a37dbbf36fa07e10e041b1f6bd2e","observation_id":"5d1c6ee0-6e20-4648-9f21-da311c408f88","resolution":{"observed_at":"2026-08-11T15:13:01.716269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T23:24:38.973608Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":0,"verified_fuzzy":4},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 2 inbound Pith citation observations for arXiv:2412.11248."}