{"as_of":"2026-08-19T03:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6c59ab16c41ebf75a56566db55ebbd7284aa6e7affa014455f626dc261fc718e","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T20:00:45.115183Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.06208/citation-record","integrity":"/paper/2412.06208/integrity","json":"/paper/2412.06208/citation-record.json","paper":"/paper/2412.06208"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:00:44.906424Z","title":"Towards a theory of semantic communication,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2412.06208","last_updated":"2024-12-09T04:58:49Z","snapshot_observed_at":"2026-08-18T15:05:53.148825Z","submitted_at":"2024-12-09T04:58:49Z","title":"Pilot-guided Multimodal Semantic Communication for Audio-Visual Event Localization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T20:00:44.906424Z"},"links":{"citing_paper":"/paper/2412.06208"},"observation_digest":"sha256:d43a19d58413f4bc21f745528d698344c601bf756f2c1490217a4de9a8c7a721","observation_id":"f0035939-76b1-4ec3-92c0-f8cee4b8d973","resolution":{"observed_at":"2026-08-11T20:00:44.906424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:00:44.914309Z","title":"6g networks: Beyond shannon towards semantic and goal-oriented communications,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.06208","last_updated":"2024-12-09T04:58:49Z","snapshot_observed_at":"2026-08-18T15:05:53.148825Z","submitted_at":"2024-12-09T04:58:49Z","title":"Pilot-guided Multimodal Semantic Communication for Audio-Visual Event Localization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T20:00:44.914309Z"},"links":{"citing_paper":"/paper/2412.06208"},"observation_digest":"sha256:749d3743acb2293a3f132274b89fe799382421e244ee224539456268ad3520a5","observation_id":"6e1c190a-4def-47e9-83b2-bb683036e627","resolution":{"observed_at":"2026-08-11T20:00:44.914309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:00:44.919706Z","title":"Semantic communications: Overview, open issues, and future research directions,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.06208","last_updated":"2024-12-09T04:58:49Z","snapshot_observed_at":"2026-08-18T15:05:53.148825Z","submitted_at":"2024-12-09T04:58:49Z","title":"Pilot-guided Multimodal Semantic Communication for Audio-Visual Event Localization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T20:00:44.919706Z"},"links":{"citing_paper":"/paper/2412.06208"},"observation_digest":"sha256:8673104241f2a41b584d85ac6b59e1c148a9302789083d6ff70d7873c0f00488","observation_id":"ab301f53-8a24-430c-8cf2-0525675752ca","resolution":{"observed_at":"2026-08-11T20:00:44.919706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:00:45.695202Z","title":"A unified multi-task semantic communication system for multimodal data,","venue":null,"work_id":"624b1dc0-548f-4fbf-a82b-b7409e834352","year":2024},"citing_paper":{"arxiv_id":"2412.06208","last_updated":"2024-12-09T04:58:49Z","snapshot_observed_at":"2026-08-18T15:05:53.148825Z","submitted_at":"2024-12-09T04:58:49Z","title":"Pilot-guided Multimodal Semantic Communication for Audio-Visual Event Localization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T20:00:44.924890Z"},"links":{"citing_paper":"/paper/2412.06208"},"observation_digest":"sha256:0259d3286bfb77015adf344f9c6414c999dd8cbd3468cb317115714b213e14bd","observation_id":"0c8b310c-db51-44c5-97f7-768ac764fa9a","resolution":{"observed_at":"2026-08-11T20:00:45.701038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:00:44.930134Z","title":"Less data, more knowledge: Building next generation semantic communication networks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06208","last_updated":"2024-12-09T04:58:49Z","snapshot_observed_at":"2026-08-18T15:05:53.148825Z","submitted_at":"2024-12-09T04:58:49Z","title":"Pilot-guided Multimodal Semantic Communication for Audio-Visual Event Localization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T20:00:44.930134Z"},"links":{"citing_paper":"/paper/2412.06208"},"observation_digest":"sha256:70e00e5fa11224b24ea186ea8c97ed298db6681ecd346b7a7e5be269dc0b4420","observation_id":"3b977f12-e0b7-41a7-b692-156790a54f00","resolution":{"observed_at":"2026-08-11T20:00:44.930134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:00:45.661801Z","title":"Multimodal semantic communication accelerated bidirectional caching for 6g mec,","venue":null,"work_id":"e9d7e9a1-2e43-4363-bcf0-73a39f8b3e99","year":2023},"citing_paper":{"arxiv_id":"2412.06208","last_updated":"2024-12-09T04:58:49Z","snapshot_observed_at":"2026-08-18T15:05:53.148825Z","submitted_at":"2024-12-09T04:58:49Z","title":"Pilot-guided Multimodal Semantic Communication for Audio-Visual Event Localization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T20:00:44.938999Z"},"links":{"citing_paper":"/paper/2412.06208"},"observation_digest":"sha256:82a91666d86c663440937e23588ef751e8e54e4ebcea18964f6839dc07f62b6a","observation_id":"96086142-4ad9-4a61-aeda-54af4a5aedd9","resolution":{"observed_at":"2026-08-11T20:00:45.668004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:00:45.642294Z","title":"Multimodal and multiuser semantic communications for channel-level information fusion,","venue":null,"work_id":"76b20aae-1feb-4e9a-889c-742ab8202d74","year":2022},"citing_paper":{"arxiv_id":"2412.06208","last_updated":"2024-12-09T04:58:49Z","snapshot_observed_at":"2026-08-18T15:05:53.148825Z","submitted_at":"2024-12-09T04:58:49Z","title":"Pilot-guided Multimodal Semantic Communication for Audio-Visual Event Localization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T20:00:44.945718Z"},"links":{"citing_paper":"/paper/2412.06208"},"observation_digest":"sha256:5f98a5877bacd8c684a5a5208d0cca9336b877df48ae1a6df905a9fad8facd9f","observation_id":"3af7c1a3-ab79-465e-b19e-74edfc77631b","resolution":{"observed_at":"2026-08-11T20:00:45.647843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:00:45.577965Z","title":"Distributed semantic communications for multimodal audio-visual parsing tasks,","venue":null,"work_id":"1f19ee7a-6ad5-42b9-a5f5-73d76bee06ef","year":2024},"citing_paper":{"arxiv_id":"2412.06208","last_updated":"2024-12-09T04:58:49Z","snapshot_observed_at":"2026-08-18T15:05:53.148825Z","submitted_at":"2024-12-09T04:58:49Z","title":"Pilot-guided Multimodal Semantic Communication for Audio-Visual Event Localization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T20:00:44.965872Z"},"links":{"citing_paper":"/paper/2412.06208"},"observation_digest":"sha256:e00cab763414506527c802d2fdc069d41c5635ed1ed5b977623f071611c622c7","observation_id":"13455fc6-1db5-4637-9acc-23aa2e587b39","resolution":{"observed_at":"2026-08-11T20:00:45.583885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12580","last_updated":"2024-05-28T01:15:25Z","snapshot_observed_at":"2026-08-18T23:29:02.557136Z","submitted_at":"2024-05-21T08:24:05Z","title":"Hybrid Digital-Analog Semantic Communications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12580","snapshot_observed_at":"2026-08-11T20:00:44.972971Z","title":"Hybrid digital-analog semantic communications,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06208","last_updated":"2024-12-09T04:58:49Z","snapshot_observed_at":"2026-08-18T15:05:53.148825Z","submitted_at":"2024-12-09T04:58:49Z","title":"Pilot-guided Multimodal Semantic Communication for Audio-Visual Event Localization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T20:00:44.972971Z"},"links":{"cited_paper":"/paper/2405.12580","citing_paper":"/paper/2412.06208"},"observation_digest":"sha256:b23a07f233bf971e8ff7447ea20e0b16d2358bf287eb98a860882bbd28b054eb","observation_id":"b7830c30-6e7f-4dcc-8663-5ead0ac4fc4e","resolution":{"observed_at":"2026-08-11T20:00:44.972971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07357","last_updated":"2021-12-14T16:48:26Z","snapshot_observed_at":"2026-08-18T20:43:09.083448Z","submitted_at":"2021-08-16T21:59:26Z","title":"Task-Oriented Multi-User Semantic Communications for VQA Task","version":3},"cited_work":{"arxiv_id":"2108.07357","doi":null,"metadata_source":"pith","pith_arxiv_id":"2108.07357","snapshot_observed_at":"2026-08-11T20:00:45.234408Z","title":"Task-Oriented Multi-User Semantic Communications for VQA Task","venue":"eess.SP","work_id":"8529c146-b7e1-4456-a1a0-ba44f8976339","year":2021},"citing_paper":{"arxiv_id":"2412.06208","last_updated":"2024-12-09T04:58:49Z","snapshot_observed_at":"2026-08-18T15:05:53.148825Z","submitted_at":"2024-12-09T04:58:49Z","title":"Pilot-guided Multimodal Semantic Communication for Audio-Visual Event Localization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T20:00:44.979262Z"},"links":{"cited_paper":"/paper/2108.07357","citing_paper":"/paper/2412.06208"},"observation_digest":"sha256:28f7a7d04603da1aabf49e4da4bdc0a2f392b1c65e3fba5d4c74cc44000595dd","observation_id":"856af302-ba39-436e-9038-b664d751ae82","resolution":{"observed_at":"2026-08-11T20:00:45.242536Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:00:44.984342Z","title":"Task-oriented multi- user semantic communications,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.06208","last_updated":"2024-12-09T04:58:49Z","snapshot_observed_at":"2026-08-18T15:05:53.148825Z","submitted_at":"2024-12-09T04:58:49Z","title":"Pilot-guided Multimodal Semantic Communication for Audio-Visual Event Localization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T20:00:44.984342Z"},"links":{"citing_paper":"/paper/2412.06208"},"observation_digest":"sha256:de34a09a0b3dfa02ac39d45f445db4ccddbea8efe4084fdd2dd937282efbb10e","observation_id":"2db5b3eb-96f4-4cbb-a89f-02a3b77ecd26","resolution":{"observed_at":"2026-08-11T20:00:44.984342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:00:45.550754Z","title":"Content-aware semantic communica- tion for goal-oriented wireless communications,","venue":null,"work_id":"8755354b-fd57-4c0e-ab1f-d39c2ce89b5f","year":2023},"citing_paper":{"arxiv_id":"2412.06208","last_updated":"2024-12-09T04:58:49Z","snapshot_observed_at":"2026-08-18T15:05:53.148825Z","submitted_at":"2024-12-09T04:58:49Z","title":"Pilot-guided Multimodal Semantic Communication for Audio-Visual Event Localization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T20:00:44.989726Z"},"links":{"citing_paper":"/paper/2412.06208"},"observation_digest":"sha256:9198b60df9d55eee00eed2885f35064a775622c6d8b3f4253ccb2ecb4a4b143e","observation_id":"23fb147c-62cd-414e-a4cb-639e4fefc2d7","resolution":{"observed_at":"2026-08-11T20:00:45.556997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08360","last_updated":"2024-05-24T05:01:25Z","snapshot_observed_at":"2026-08-16T14:27:08.066643Z","submitted_at":"2024-01-16T13:37:45Z","title":"AdaSem: Adaptive Goal-Oriented Semantic Communications for End-to-End Camera Relocalization","version":2},"cited_work":{"arxiv_id":"2401.08360","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.08360","snapshot_observed_at":"2026-08-11T20:00:45.191721Z","title":"AdaSem: Adaptive Goal-Oriented Semantic Communications for End-to-End Camera Relocalization","venue":"cs.IT","work_id":"1a842f41-c173-410f-8678-73cba435aa78","year":2024},"citing_paper":{"arxiv_id":"2412.06208","last_updated":"2024-12-09T04:58:49Z","snapshot_observed_at":"2026-08-18T15:05:53.148825Z","submitted_at":"2024-12-09T04:58:49Z","title":"Pilot-guided Multimodal Semantic Communication for Audio-Visual Event Localization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T20:00:44.996081Z"},"links":{"cited_paper":"/paper/2401.08360","citing_paper":"/paper/2412.06208"},"observation_digest":"sha256:946e688f1c5530bf3f91c46bea2676fcdf6a082dd2d598f87c450d9ec8d93b8e","observation_id":"2f066ca6-892e-4f5a-992c-090f57cd89f5","resolution":{"observed_at":"2026-08-11T20:00:45.201794Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:00:45.534600Z","title":"Wireless resource management in intelligent semantic communication networks,","venue":null,"work_id":"738d9073-1d09-4b06-a00d-9d31b749bc9b","year":2022},"citing_paper":{"arxiv_id":"2412.06208","last_updated":"2024-12-09T04:58:49Z","snapshot_observed_at":"2026-08-18T15:05:53.148825Z","submitted_at":"2024-12-09T04:58:49Z","title":"Pilot-guided Multimodal Semantic Communication for Audio-Visual Event Localization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T20:00:45.001439Z"},"links":{"citing_paper":"/paper/2412.06208"},"observation_digest":"sha256:e7e0b384beae223c42e426240cd0e4d2050f0eab4c09d371b3389dd415e8b812","observation_id":"0d4502a1-18f1-410d-97cc-14bc66e72af7","resolution":{"observed_at":"2026-08-11T20:00:45.539505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:00:45.508472Z","title":"Semantic and effective communication for remote control tasks with dynamic feature compression,","venue":null,"work_id":"b8c6f71f-ae1b-4388-b0fb-43f08362af6f","year":2023},"citing_paper":{"arxiv_id":"2412.06208","last_updated":"2024-12-09T04:58:49Z","snapshot_observed_at":"2026-08-18T15:05:53.148825Z","submitted_at":"2024-12-09T04:58:49Z","title":"Pilot-guided Multimodal Semantic Communication for Audio-Visual Event Localization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T20:00:45.006499Z"},"links":{"citing_paper":"/paper/2412.06208"},"observation_digest":"sha256:767c9c5d34f7f5534d2692d72b3d860883827baeb31244363d042e2ef5fe31e1","observation_id":"66452566-df5e-48a5-9075-baa246bd6bfd","resolution":{"observed_at":"2026-08-11T20:00:45.524145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:00:45.485427Z","title":"Cross-modal semantic communi- cations,","venue":null,"work_id":"ff3cdd1e-f82b-426d-b117-ba605d19c850","year":2022},"citing_paper":{"arxiv_id":"2412.06208","last_updated":"2024-12-09T04:58:49Z","snapshot_observed_at":"2026-08-18T15:05:53.148825Z","submitted_at":"2024-12-09T04:58:49Z","title":"Pilot-guided Multimodal Semantic Communication for Audio-Visual Event Localization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T20:00:45.013277Z"},"links":{"citing_paper":"/paper/2412.06208"},"observation_digest":"sha256:912393672fea362a091452ab58fa81972589c1b706e719d988e392da14d7bf7d","observation_id":"c6ea22c8-1e73-4440-b7da-905015326e8d","resolution":{"observed_at":"2026-08-11T20:00:45.491280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:00:45.624391Z","title":"Audio-visual event localization in unconstrained videos,","venue":null,"work_id":"8f37ed9c-abd6-4968-a481-b2d66577878f","year":2018},"citing_paper":{"arxiv_id":"2412.06208","last_updated":"2024-12-09T04:58:49Z","snapshot_observed_at":"2026-08-18T15:05:53.148825Z","submitted_at":"2024-12-09T04:58:49Z","title":"Pilot-guided Multimodal Semantic Communication for Audio-Visual Event Localization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T20:00:45.026660Z"},"links":{"citing_paper":"/paper/2412.06208"},"observation_digest":"sha256:7b256c6ffdb39e60a7e245a1c21ea42e1b8d932134ae237647c88eee826a31d2","observation_id":"af61bd9b-6147-4dc7-bcba-bbc0790046bc","resolution":{"observed_at":"2026-08-11T20:00:45.629093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:00:45.462940Z","title":"Dual-modality seq2seq net- work for audio-visual event localization,","venue":null,"work_id":"1703da1f-5139-418b-9643-2b8519672f6c","year":2019},"citing_paper":{"arxiv_id":"2412.06208","last_updated":"2024-12-09T04:58:49Z","snapshot_observed_at":"2026-08-18T15:05:53.148825Z","submitted_at":"2024-12-09T04:58:49Z","title":"Pilot-guided Multimodal Semantic Communication for Audio-Visual Event Localization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T20:00:45.033172Z"},"links":{"citing_paper":"/paper/2412.06208"},"observation_digest":"sha256:e0e2fb190c110656d3fb359cfd3fc22f9523f3e5a06d22aa093c61ad0f2d3681","observation_id":"27e2c6ab-b992-49b6-b94b-38276bb8dc19","resolution":{"observed_at":"2026-08-11T20:00:45.468425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:00:45.441952Z","title":"Dual attention matching for audio- visual event localization,","venue":null,"work_id":"3142fd21-6a7c-4a78-8459-a084b1a97bf4","year":2019},"citing_paper":{"arxiv_id":"2412.06208","last_updated":"2024-12-09T04:58:49Z","snapshot_observed_at":"2026-08-18T15:05:53.148825Z","submitted_at":"2024-12-09T04:58:49Z","title":"Pilot-guided Multimodal Semantic Communication for Audio-Visual Event Localization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T20:00:45.046449Z"},"links":{"citing_paper":"/paper/2412.06208"},"observation_digest":"sha256:7619d2bc898c628565130a6c93804c2a966757fd30d62587cafc4a68d46adf16","observation_id":"791b8ea2-8c61-40e6-9051-1a529965a22c","resolution":{"observed_at":"2026-08-11T20:00:45.452247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:00:45.420566Z","title":"Cross-modal relation- aware networks for audio-visual event localization,","venue":null,"work_id":"4dfeaae6-3bc1-473d-81b3-323eb97ab6d3","year":2020},"citing_paper":{"arxiv_id":"2412.06208","last_updated":"2024-12-09T04:58:49Z","snapshot_observed_at":"2026-08-18T15:05:53.148825Z","submitted_at":"2024-12-09T04:58:49Z","title":"Pilot-guided Multimodal Semantic Communication for Audio-Visual Event Localization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T20:00:45.053275Z"},"links":{"citing_paper":"/paper/2412.06208"},"observation_digest":"sha256:dda42fecc8a49c3f52250dc40f42bf5d215bea70af4bc34e8506d0fc09c33e46","observation_id":"1e128d22-69bb-4bd3-aa26-877e1f31d4aa","resolution":{"observed_at":"2026-08-11T20:00:45.425909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:00:45.391486Z","title":"Audio- visual event localization via recursive fusion by joint co-attention,","venue":null,"work_id":"dcca0c4b-3388-4edb-b54e-2dedb91b0ed5","year":2021},"citing_paper":{"arxiv_id":"2412.06208","last_updated":"2024-12-09T04:58:49Z","snapshot_observed_at":"2026-08-18T15:05:53.148825Z","submitted_at":"2024-12-09T04:58:49Z","title":"Pilot-guided Multimodal Semantic Communication for Audio-Visual Event Localization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T20:00:45.057568Z"},"links":{"citing_paper":"/paper/2412.06208"},"observation_digest":"sha256:69d58ca3fb5f1fd562a6626fc5f526b8d37939a8af1a891c635d618dd772b7b3","observation_id":"334f9bd1-fb92-471d-b655-b750641abd35","resolution":{"observed_at":"2026-08-11T20:00:45.397865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:00:45.370410Z","title":"Cross-modal attention network for temporal inconsistent audio-visual event localization,","venue":null,"work_id":"0ceb3dae-8093-4254-82b7-8170f9c9cdd3","year":2020},"citing_paper":{"arxiv_id":"2412.06208","last_updated":"2024-12-09T04:58:49Z","snapshot_observed_at":"2026-08-18T15:05:53.148825Z","submitted_at":"2024-12-09T04:58:49Z","title":"Pilot-guided Multimodal Semantic Communication for Audio-Visual Event Localization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T20:00:45.062348Z"},"links":{"citing_paper":"/paper/2412.06208"},"observation_digest":"sha256:449919fdf089c91829be41937442ade5d1a74ac2090fc29e7852b06d92187091","observation_id":"2c88d11e-72e0-4112-9a05-c7c81a21f733","resolution":{"observed_at":"2026-08-11T20:00:45.376320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:00:45.603238Z","title":"Positive sample propagation along the audio-visual event line,","venue":null,"work_id":"35aa0f06-c023-4277-98b9-d49e8968e936","year":2021},"citing_paper":{"arxiv_id":"2412.06208","last_updated":"2024-12-09T04:58:49Z","snapshot_observed_at":"2026-08-18T15:05:53.148825Z","submitted_at":"2024-12-09T04:58:49Z","title":"Pilot-guided Multimodal Semantic Communication for Audio-Visual Event Localization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T20:00:45.067708Z"},"links":{"citing_paper":"/paper/2412.06208"},"observation_digest":"sha256:f35436c997d5a5fcd38f159f66b7982781cd4eb727ca38f7ad6e97c6c7f72b36","observation_id":"2e7edaf1-edb0-4bd1-863a-ba894926af19","resolution":{"observed_at":"2026-08-11T20:00:45.609344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:00:45.072423Z","title":"Discriminative cross-modality attention network for temporal inconsistent audio-visual event localization,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.06208","last_updated":"2024-12-09T04:58:49Z","snapshot_observed_at":"2026-08-18T15:05:53.148825Z","submitted_at":"2024-12-09T04:58:49Z","title":"Pilot-guided Multimodal Semantic Communication for Audio-Visual Event Localization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T20:00:45.072423Z"},"links":{"citing_paper":"/paper/2412.06208"},"observation_digest":"sha256:d81266a2feca9797f9f4c19486599361b4aa67ce3c0f3f6ceadc8929329ba5ea","observation_id":"cf4e2547-7e9b-4ca4-9111-0f4c52d79245","resolution":{"observed_at":"2026-08-11T20:00:45.072423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:00:45.339012Z","title":"Audiovisual transformer with instance attention for audio-visual event localization,","venue":null,"work_id":"12c2e645-313d-4412-9080-56f543c19276","year":2020},"citing_paper":{"arxiv_id":"2412.06208","last_updated":"2024-12-09T04:58:49Z","snapshot_observed_at":"2026-08-18T15:05:53.148825Z","submitted_at":"2024-12-09T04:58:49Z","title":"Pilot-guided Multimodal Semantic Communication for Audio-Visual Event Localization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T20:00:45.078949Z"},"links":{"citing_paper":"/paper/2412.06208"},"observation_digest":"sha256:ae22cb8879a9ea3f5453a8641c44dbbbc746886afd288162ef8e18e1efc60dda","observation_id":"20991b18-85a2-4596-8b4f-40257d8f4e58","resolution":{"observed_at":"2026-08-11T20:00:45.344183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1556","last_updated":"2015-04-10T16:25:04Z","snapshot_observed_at":"2026-08-17T19:17:06.411141Z","submitted_at":"2014-09-04T19:48:04Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.1556","snapshot_observed_at":"2026-08-11T20:00:45.084248Z","title":"Very deep convolutional networks for large-scale image recognition,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.06208","last_updated":"2024-12-09T04:58:49Z","snapshot_observed_at":"2026-08-18T15:05:53.148825Z","submitted_at":"2024-12-09T04:58:49Z","title":"Pilot-guided Multimodal Semantic Communication for Audio-Visual Event Localization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T20:00:45.084248Z"},"links":{"cited_paper":"/paper/1409.1556","citing_paper":"/paper/2412.06208"},"observation_digest":"sha256:c7423cc696026bb2311c1b7bda5ad8ca345f4422f6edb548106bcd848b3494f6","observation_id":"b8a508c0-b700-4aed-94c1-d0df5be7f458","resolution":{"observed_at":"2026-08-11T20:00:45.084248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:00:45.324367Z","title":"Eulernet: Adaptive feature interaction learning via euler’s formula for ctr prediction,","venue":null,"work_id":"e0110f94-daae-4055-b120-6b07ba45d0de","year":2023},"citing_paper":{"arxiv_id":"2412.06208","last_updated":"2024-12-09T04:58:49Z","snapshot_observed_at":"2026-08-18T15:05:53.148825Z","submitted_at":"2024-12-09T04:58:49Z","title":"Pilot-guided Multimodal Semantic Communication for Audio-Visual Event Localization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T20:00:45.094192Z"},"links":{"citing_paper":"/paper/2412.06208"},"observation_digest":"sha256:48825a94cb21079cd7ffc80ac3bd2ad98d1c5ce4a3aee53e61eaa004c3d03722","observation_id":"c23b6528-b314-4382-879b-cfff6afb103a","resolution":{"observed_at":"2026-08-11T20:00:45.329181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:00:45.101082Z","title":"Imagenet classification with deep convolutional neural networks,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2412.06208","last_updated":"2024-12-09T04:58:49Z","snapshot_observed_at":"2026-08-18T15:05:53.148825Z","submitted_at":"2024-12-09T04:58:49Z","title":"Pilot-guided Multimodal Semantic Communication for Audio-Visual Event Localization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T20:00:45.101082Z"},"links":{"citing_paper":"/paper/2412.06208"},"observation_digest":"sha256:b756a87be6aa508b9dea686b0fa3b5252b3d85596fadfdbfddd183bcb4888dfa","observation_id":"e7c16729-9406-4cde-83f2-f4357cfa744b","resolution":{"observed_at":"2026-08-11T20:00:45.101082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:00:45.291215Z","title":"Cnn architectures for large-scale audio classification,","venue":null,"work_id":"d75d02d5-1dd4-4913-a88e-0d4f19ae8bb0","year":2017},"citing_paper":{"arxiv_id":"2412.06208","last_updated":"2024-12-09T04:58:49Z","snapshot_observed_at":"2026-08-18T15:05:53.148825Z","submitted_at":"2024-12-09T04:58:49Z","title":"Pilot-guided Multimodal Semantic Communication for Audio-Visual Event Localization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T20:00:45.106592Z"},"links":{"citing_paper":"/paper/2412.06208"},"observation_digest":"sha256:079705ea6985b9d891e8a074b77109f8f20c93a9b90f97878be695168a882ba6","observation_id":"4249d608-4d62-44f1-a133-a8886b9e48a6","resolution":{"observed_at":"2026-08-11T20:00:45.297298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:00:45.115183Z","title":"Audio set: An ontology and human- labeled dataset for audio events,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.06208","last_updated":"2024-12-09T04:58:49Z","snapshot_observed_at":"2026-08-18T15:05:53.148825Z","submitted_at":"2024-12-09T04:58:49Z","title":"Pilot-guided Multimodal Semantic Communication for Audio-Visual Event Localization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T20:00:45.115183Z"},"links":{"citing_paper":"/paper/2412.06208"},"observation_digest":"sha256:3758f2bc6cdacbc7c13d2f97396bfa0b3c66bc07474ede11f0781ef73350c532","observation_id":"28aba50c-a367-4577-8ad0-35dea7faa297","resolution":{"observed_at":"2026-08-11T20:00:45.115183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.06208","last_updated":"2024-12-09T04:58:49Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-18T15:05:53.148825Z","submitted_at":"2024-12-09T04:58:49Z","title":"Pilot-guided Multimodal Semantic Communication for Audio-Visual Event Localization"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":2,"verified_fuzzy":18},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 0 inbound Pith citation observations for arXiv:2412.06208."}