{"as_of":"2026-08-07T22:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b8fb0cc4fa06b33cfde0e8e1f968bbd179168046ccef7f91cc7fd3e5b86ce42f","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:03:03.579463Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.09323/citation-record","integrity":"/paper/2507.09323/integrity","json":"/paper/2507.09323/citation-record.json","paper":"/paper/2507.09323"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:04.017550Z","title":"Vatt: Transformers for multimodal self-supervised learning from raw video, audio and text","venue":null,"work_id":"c703a986-0935-4997-a77a-12226b16bb2e","year":2021},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-06T17:56:24.157027Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:02.905926Z"},"links":{"citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:e73973b5ae1216c424625e2462f18358e811febf83b5da0ac5965dbfeae8ea96","observation_id":"81fd07c6-b149-4500-99ae-b80d39c05c51","resolution":{"observed_at":"2026-08-06T18:03:04.021804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:04.003866Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":"d860f575-04aa-4d20-a968-df581a7e683f","year":2022},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-06T17:56:24.157027Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:02.983484Z"},"links":{"citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:ea8df9001603b21ea80d95a90f7b7c3f34457ab44b52d0d10107be979cd46ca7","observation_id":"cefb466b-5949-46af-bcea-ebb65e9331cc","resolution":{"observed_at":"2026-08-06T18:03:04.007900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.989470Z","title":"Multimodal machine learning: A survey and tax- onomy","venue":null,"work_id":"b8fcdbe3-8d9f-4cc2-96f0-64f51595f1af","year":2019},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-06T17:56:24.157027Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.160526Z"},"links":{"citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:fe3a3bda1b22f317ef8da458234a90d447b5bd870f391261ebf3de54dcdf92a0","observation_id":"b0797321-987a-43db-877a-5e0851227593","resolution":{"observed_at":"2026-08-06T18:03:03.994738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.975917Z","title":"Vggsound: A large-scale audio-visual dataset","venue":null,"work_id":"fd4c99c4-6bb2-4c78-89b5-1c0916b7c596","year":2020},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-06T17:56:24.157027Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.298243Z"},"links":{"citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:5e8e13e6b1949565678fef3d14b799d925c3253b4cab9ac354f456a4a4a3e1c7","observation_id":"8ee51abf-9a5d-485d-9cd4-b7c4d669e9d0","resolution":{"observed_at":"2026-08-06T18:03:03.980373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.961567Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":"203def2e-abcf-4a9d-8364-6e737575e624","year":2020},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-06T17:56:24.157027Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.420105Z"},"links":{"citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:6847c70df2ad876c6c2149340118153f8aa1694e0c4a9efbd754595458fe52d2","observation_id":"7537496e-dbc4-4ce6-b0a8-25fb935740eb","resolution":{"observed_at":"2026-08-06T18:03:03.965880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.946494Z","title":"Scaling egocentric vision: The epic-kitchens dataset","venue":null,"work_id":"a0769a54-906e-4933-a467-0de8bea80938","year":2018},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-06T17:56:24.157027Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.475163Z"},"links":{"citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:044431a209b5c01ee6bd3a9e4d8d18f02c733b38b978c22c395b71d6f16b0b42","observation_id":"87a38546-9c25-4da7-b423-bcd7692e4e77","resolution":{"observed_at":"2026-08-06T18:03:03.951067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.932425Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":"c4ca6549-8629-41ca-8b7a-1ad8c36af49d","year":2020},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-06T17:56:24.157027Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.480607Z"},"links":{"citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:7cd00b720d45a07f85c97a5303461198850fb1f5c28563c18854ee1ce8d43a62","observation_id":"08276ac1-58f2-4dcf-be21-fe5fceb7038d","resolution":{"observed_at":"2026-08-06T18:03:03.936862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.01595","last_updated":"2020-05-29T01:30:14Z","snapshot_observed_at":"2026-08-07T16:30:14.320440Z","submitted_at":"2020-05-29T01:30:14Z","title":"Large Scale Audiovisual Learning of Sounds with Weakly Labeled Data","version":1},"cited_work":{"arxiv_id":"2006.01595","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.01595","snapshot_observed_at":"2026-08-06T18:03:03.681222Z","title":"Large Scale Audiovisual Learning of Sounds with Weakly Labeled Data","venue":"eess.AS","work_id":"28442f5c-ecba-430b-b49a-9790ada03f3d","year":2020},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-06T17:56:24.157027Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.485282Z"},"links":{"cited_paper":"/paper/2006.01595","citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:bdf42f3e215a4377c6e664943872264324f64a94bb260e67ba640b922f74dec2","observation_id":"cda91782-4f55-477d-a412-4ffe5229e882","resolution":{"observed_at":"2026-08-06T18:03:03.685469Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.918507Z","title":"Audio set: An ontology and human- labeled dataset for audio events","venue":null,"work_id":"e2590733-9c68-4fa2-8e71-1906b47173d1","year":2017},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-06T17:56:24.157027Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.490036Z"},"links":{"citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:2d91a6a4a460c2fcd0330d308e651173ae4310ff4275b2f680ca981db2c74529","observation_id":"db469e9c-eab5-497f-84ec-e9d938026c04","resolution":{"observed_at":"2026-08-06T18:03:03.922445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.905458Z","title":"Audiovisual masked autoencoders","venue":null,"work_id":"6bff47fb-8693-45e6-b9df-a35442ade275","year":null},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-06T17:56:24.157027Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.494154Z"},"links":{"citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:1afea03b75e0c8b3fe88317c4a925c4adc32ffa5189871ed5e233f92c3e60d0d","observation_id":"13d93ebc-8506-4e7e-ac6c-8d0f6ba74705","resolution":{"observed_at":"2026-08-06T18:03:03.909656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-03T23:00:35.904734Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-06T18:03:03.498534Z","title":"Ast: Audio spectrogram transformer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-06T17:56:24.157027Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.498534Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:45df32776ebf2288413abd01da454c1b733aa7d2a20a890e0be155d910b9dd87","observation_id":"8eeb24fa-c3e4-4bf2-bce0-6e3ca5a37666","resolution":{"observed_at":"2026-08-06T18:03:03.498534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.892528Z","title":"Uavm: Towards unifying audio and visual models","venue":null,"work_id":"a3f98d61-52e9-4c3e-ae84-b418e6b31092","year":null},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-06T17:56:24.157027Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.503076Z"},"links":{"citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:f28b63407b443226902499306dd2bde38d93151c658b9d7e1e300411ae2e483c","observation_id":"75677a28-1a87-4e6a-8b4c-a88b97687b0e","resolution":{"observed_at":"2026-08-06T18:03:03.896484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07839","last_updated":"2023-04-11T22:47:19Z","snapshot_observed_at":"2026-07-06T14:05:23.547010Z","submitted_at":"2022-10-02T07:29:57Z","title":"Contrastive Audio-Visual Masked Autoencoder","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07839","snapshot_observed_at":"2026-08-06T18:03:03.507305Z","title":"Contrastive audio-visual masked autoencoder.arXiv preprint arXiv:2210.07839, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-06T17:56:24.157027Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.507305Z"},"links":{"cited_paper":"/paper/2210.07839","citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:f8866ee2d2499637d947e21ce4e258691584c6e4b887897f5bcb8eafcf3a3e00","observation_id":"8696b57a-3e26-4303-8f96-eccab980b3f1","resolution":{"observed_at":"2026-08-06T18:03:03.507305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.511781Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-06T17:56:24.157027Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.511781Z"},"links":{"citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:5cffef405a5e279aa43699601c7b87d849fc7f3b91fea55483098436bf62f75c","observation_id":"43fe541e-1486-4185-b0fb-1a857cf9e9d8","resolution":{"observed_at":"2026-08-06T18:03:03.511781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.871685Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units","venue":null,"work_id":"26436529-f284-45bb-926e-629fd7736eda","year":2021},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-06T17:56:24.157027Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.515621Z"},"links":{"citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:5b9ddb60bce4a52415888974e350f46afa69590c9254dbf1a405cd7d3608969a","observation_id":"34a4a523-6847-4011-a690-2d8c5743b512","resolution":{"observed_at":"2026-08-06T18:03:03.875713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.858566Z","title":"Perceiver io: A general architecture for structured inputs & outputs","venue":null,"work_id":"e1b9da7a-11c4-421a-be83-f1fb19e32c05","year":2021},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-06T17:56:24.157027Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.519693Z"},"links":{"citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:ea84f7f24415435b2246b42381895acd54d1e23d2e82895551c4e9b9149f2e8a","observation_id":"66f5017d-ab57-4e8a-9d3d-ba3f78cce6a2","resolution":{"observed_at":"2026-08-06T18:03:03.862821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.523260Z","title":"Supervised contrastive learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-06T17:56:24.157027Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.523260Z"},"links":{"citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:4ba8a96b30eb3323e099c661b87b1f26e7fef50a50035b83db6331fae7cf1fe9","observation_id":"9fd1149d-b653-4743-b5b1-1c9cda6cd8de","resolution":{"observed_at":"2026-08-06T18:03:03.523260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.835739Z","title":"Kipf and Max Welling","venue":null,"work_id":"ba18600e-c9cd-4081-896c-ad6946c72d95","year":2017},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-06T17:56:24.157027Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.527353Z"},"links":{"citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:fda50bd1aecaaee10971aaad0a04d45a47feba355549b972b65727b019b80674","observation_id":"3dfc1e15-bec4-4adf-9842-a7c36837af65","resolution":{"observed_at":"2026-08-06T18:03:03.840950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.531207Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-06T17:56:24.157027Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.531207Z"},"links":{"citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:1d1765070568b6bcadb03e9e9bae21bf2bb62a138b320c0326c3ebe55b4be8c3","observation_id":"91f8c0f3-0761-4cd8-88b6-c75018c4447e","resolution":{"observed_at":"2026-08-06T18:03:03.531207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.813771Z","title":"Attention bottlenecks for multimodal fusion","venue":null,"work_id":"e41b7948-8a37-4a22-8115-a928f1468e21","year":2021},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-06T17:56:24.157027Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.534986Z"},"links":{"citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:836abd1f53bb3ee185ce226411a34c25c396a4d5a69dc5bff0104ca5921be07b","observation_id":"8884ea43-29e0-40e3-97c3-353b84b113d4","resolution":{"observed_at":"2026-08-06T18:03:03.817741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.07804","last_updated":"2020-07-03T09:59:06Z","snapshot_observed_at":"2026-08-02T14:05:53.425649Z","submitted_at":"2019-07-17T22:59:56Z","title":"OmniNet: A unified architecture for multi-modal multi-task learning","version":2},"cited_work":{"arxiv_id":"1907.07804","doi":null,"metadata_source":"pith","pith_arxiv_id":"1907.07804","snapshot_observed_at":"2026-08-06T18:03:03.629279Z","title":"OmniNet: A unified architecture for multi-modal multi-task learning","venue":"cs.LG","work_id":"c74699d5-2aa0-400e-8403-2a2d87ec8377","year":2019},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-06T17:56:24.157027Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.538749Z"},"links":{"cited_paper":"/paper/1907.07804","citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:96a85f88f3ccfd03501238e2a99abf994b6a0039cbe9cd593fe0cf898cd1fe46","observation_id":"d8e499b7-5b22-433e-a139-d600351e428f","resolution":{"observed_at":"2026-08-06T18:03:03.635985Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.799360Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":"49097a25-9818-4694-ae4c-a6b44f2afd25","year":2023},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-06T17:56:24.157027Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.542837Z"},"links":{"citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:5c5f850958e1944b9800bc756570530c2fa6c0b1a9af5fdde06fd572ee3aa5ba","observation_id":"cbb55465-42fc-4aad-af02-d8caa9f7e5b2","resolution":{"observed_at":"2026-08-06T18:03:03.804017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.785110Z","title":"Multimodal fusion for audio-image and video action recognition","venue":null,"work_id":"2cdd95f1-c13d-48ad-8fbb-4dce8253414f","year":2024},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-06T17:56:24.157027Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.546642Z"},"links":{"citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:4c649ee66034b6a4a7d32adb188619759b05f013f4017610ef8122f6006bf762","observation_id":"45308ca1-9e25-49cf-8ec7-039260699ba7","resolution":{"observed_at":"2026-08-06T18:03:03.789208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-07-06T03:01:10.229407Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-06T18:03:03.550744Z","title":"Ucf101: A dataset of 101 human actions classes from videos in the wild","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-06T17:56:24.157027Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.550744Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:f33fd57a2baf9de7737497927b4b4e0943b7bfff6eb6d1a6afdb873207e57b52","observation_id":"93092bbe-2d4a-4d8b-9715-0b47c7270d60","resolution":{"observed_at":"2026-08-06T18:03:03.550744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.771819Z","title":"Omnivec: Learn- ing robust representations with cross modal sharing","venue":null,"work_id":"8b5fb2e4-50a3-441a-b6fa-d9c27b531631","year":2024},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-06T17:56:24.157027Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.555128Z"},"links":{"citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:3c6b741d9b366894f398beb2125c66ea59cb44d6374d21b8786be5db59b34933","observation_id":"69247b40-9d48-4fe2-82f4-5a69517c00d3","resolution":{"observed_at":"2026-08-06T18:03:03.776085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.758251Z","title":"One-peace: Ex- ploring one general representation model toward unlimited modalities","venue":null,"work_id":"480f4821-ed31-4c13-9afe-6ccf3ea4e9d6","year":2023},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-06T17:56:24.157027Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.559513Z"},"links":{"citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:7cec3bc37e8f329d81cb3bd866c63f65164455c25a7eb633f52663c051781b63","observation_id":"43b5864b-2380-435f-9838-5310b5699aad","resolution":{"observed_at":"2026-08-06T18:03:03.762263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.745402Z","title":"What makes train- ing multi-modal classification networks hard? In Proceed- ings of the IEEE/CVF conference on computer vision and pattern recognition, pages 12695–12705, 2020","venue":null,"work_id":"8cf452f4-1812-4f40-8f75-124a949fde02","year":2020},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-06T17:56:24.157027Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.563766Z"},"links":{"citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:d72202ff91a5a2a15565cdf6f5e4d734a724819d4f61cfefd435d99f487f3780","observation_id":"7db7b7c4-35da-46b2-9112-372c202ae259","resolution":{"observed_at":"2026-08-06T18:03:03.749426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.731829Z","title":"Multi-stream multi-class fusion of deep net- works for video classification","venue":null,"work_id":"f0f01811-e38d-46d9-b526-b1447d405ace","year":2016},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-06T17:56:24.157027Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.567838Z"},"links":{"citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:3efe297ab630873fc791690ebf1fc6f51aba60ec11d89b51c9367bc31a82663a","observation_id":"1ee6d336-c67d-4573-95c9-601d530a2871","resolution":{"observed_at":"2026-08-06T18:03:03.736313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.571745Z","title":"Multimodal learning with transformers: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-06T17:56:24.157027Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.571745Z"},"links":{"citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:b57dccd5e2420cb2b92e4e5615922d3ea06cb4194601d818d6f0a5ebdc64eda4","observation_id":"430b57eb-fd29-4b5e-a891-bc128515017a","resolution":{"observed_at":"2026-08-06T18:03:03.571745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.708929Z","title":"Peters, and Yejin Choi","venue":null,"work_id":"858d9a05-bda3-4668-ba9b-6f37b30eea80","year":2021},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-06T17:56:24.157027Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.575757Z"},"links":{"citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:eb058ebf07f59bda62e041d5a1dcdbcc2612c95f00ec129813cfda0aaa2c8e91","observation_id":"386e133a-4d35-425b-b3ee-13d6a532b2b8","resolution":{"observed_at":"2026-08-06T18:03:03.712763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.695095Z","title":"Multimodal representation learning: Advances, trends and challenges","venue":null,"work_id":"7623a681-ac7f-4da7-9962-599b517a9ef7","year":2019},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-06T17:56:24.157027Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.579463Z"},"links":{"citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:df91436ecf95f19810f27960b96071475e0173413c254495c1797d296c8d6924","observation_id":"43cce9bc-5253-4dba-a12c-ba2f1337c6fd","resolution":{"observed_at":"2026-08-06T18:03:03.699421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T17:56:24.157027Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":2,"verified_fuzzy":22},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2507.09323."}