{"as_of":"2026-08-08T22:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:023736baf01e0a8504a99ce9baa579dd010624df1e19df4510ef29551c4d053f","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:54:10.310454Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.12481/citation-record","integrity":"/paper/2506.12481/integrity","json":"/paper/2506.12481/citation-record.json","paper":"/paper/2506.12481"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:24.409582Z","title":"Action-net: Multipath excitation for action recognition,","venue":null,"work_id":"83130276-0874-487c-9e72-d2257a251aee","year":2021},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:04.567844Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:022aaed66034f79bc3dbfd0a82c6e4b65cd221ece4d334a6d5d85087a2af9df8","observation_id":"33ae0cbb-4038-4f82-abc3-4610f115b6e6","resolution":{"observed_at":"2026-08-07T00:54:24.615139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:24.135427Z","title":"Spa- tiotemporal self-attention modeling with temporal patch shift for action recognition,","venue":null,"work_id":"6831294b-abc3-4f6c-9463-a8e167889dfd","year":2022},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:04.618766Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:3c5565bf98ccc2a70c301a06a98fadcdd290ba8e91691d11247fd7d9b3124273","observation_id":"ee869c44-cb35-42aa-9f14-7e0d3d9e2a1c","resolution":{"observed_at":"2026-08-07T00:54:24.240040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:23.835678Z","title":"Recurring the transformer for video action recognition,","venue":null,"work_id":"ca57f7dd-ff30-4cb5-86c0-af731c8f200d","year":2022},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:04.717366Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:7c761d0adf0af63b0640b41b0bc930f2e42b738453ece3e0a510a0f4375e4f3b","observation_id":"10458ee1-fc22-4035-b16f-b98a2be23da6","resolution":{"observed_at":"2026-08-07T00:54:23.993701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:23.614830Z","title":"Graph convolutional module for temporal action localization in videos,","venue":null,"work_id":"e3e8db5c-e55f-4a2e-8eda-8218b2933f66","year":2021},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:04.799608Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:d2e60d018cbbaaab92180a1b0b7231d9e82e55e7d016ab591a7e90ff416b5d82","observation_id":"8c3fbca8-55b2-4f3a-ae88-4588751d188b","resolution":{"observed_at":"2026-08-07T00:54:23.705035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:04.889542Z","title":"Tent: Fully test-time adaptation by entropy minimization,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:04.889542Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:5b431faeb4b402e0c8ae17d9b4029fdf79f83e887820bcdd67691f0877552527","observation_id":"d8c8c786-7de4-4842-b7c0-c913004154ff","resolution":{"observed_at":"2026-08-07T00:54:04.889542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:23.378688Z","title":"Memo: Test time robustness via adaptation and augmentation,","venue":null,"work_id":"5212b94f-1fa0-4e9e-b302-ca5c94949f88","year":2022},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:04.993798Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:7565efff65866a4a42b398cd01c1e17b06e01b34f7729b0a59c30c34a6eb9c20","observation_id":"d6d6f54d-38c6-45c3-9c36-2a2d30a9815a","resolution":{"observed_at":"2026-08-07T00:54:23.485877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:23.027469Z","title":"Test-time classifier adjustment module for model-agnostic domain generalization,","venue":null,"work_id":"a572701c-1e27-4e04-b49e-ffb8c9caf4d7","year":2021},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:05.066115Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:9e224d04ea8642f65163975c39f962baad203c5bf673f9031a31b254918b93ea","observation_id":"2c7e5712-aaae-4611-b40f-f39171f40063","resolution":{"observed_at":"2026-08-07T00:54:23.195994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:22.768247Z","title":"The norm must go on: dynamic unsupervised domain adaptation by normalization,","venue":null,"work_id":"92395a25-5fc7-4357-b6f9-0e140905d901","year":2022},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:05.135072Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:01c11173e9067f555725ecbb14e336bda8892af18daa63cfd223939de6fa9cd8","observation_id":"bc74be26-e558-4bef-af5b-03f3aba10f92","resolution":{"observed_at":"2026-08-07T00:54:22.878578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:22.207041Z","title":"Test-time training with masked autoencoders,","venue":null,"work_id":"ea9e05c3-926c-4ce2-b068-154d1d33244e","year":2022},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:05.254178Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:d3643c158349d1c7ae8e67703b6797e0ef1214cfb44cbfcfd6b7280ad463163b","observation_id":"2e9a76d2-9df5-4787-a2c8-ed762a4f47ff","resolution":{"observed_at":"2026-08-07T00:54:22.349948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:21.938311Z","title":"Efficient test-time model adaptation without forgetting,","venue":null,"work_id":"b38324b3-417b-4c29-86b5-516f062692cd","year":2022},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:05.322903Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:8b4dea9306d98e657db4e5a218b4e050ab054f48a14784de30d901bf734e96bc","observation_id":"3495722d-2572-4367-aa3f-5915c6aa5dc8","resolution":{"observed_at":"2026-08-07T00:54:22.061736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:21.679201Z","title":"Test- time training with self-supervision for generalization under distribution shifts,","venue":null,"work_id":"e0d6ef94-0e39-44ca-b573-9c824050619a","year":2020},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:05.375815Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:3cfd8c0c23b24790bef0b090184d5e6d8e18df95c2d51efcf77e5eb8befb0f7d","observation_id":"c1ea4377-336a-4605-b6d8-3c1632d76d71","resolution":{"observed_at":"2026-08-07T00:54:21.785630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:21.414889Z","title":"Ttt++: When does self-supervised test-time training fail or thrive?","venue":null,"work_id":"94cdd013-59ad-4ae2-b2d8-e696fba62cf8","year":2021},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:05.448681Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:f034517692406b2a9c428a670c643249865a85bb80c0393ad50e5382292c7278","observation_id":"84dd50fd-d4c4-4f41-899a-8a87e855d20c","resolution":{"observed_at":"2026-08-07T00:54:21.566451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:21.111877Z","title":"Video test-time adaptation for action recognition,","venue":null,"work_id":"c97794e0-b4ee-43c5-8537-6e00c3fc5055","year":2023},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:05.518462Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:3780434af172ddb06ebbe63e94fb316e42bf3cb49d340fcb7568d7aa71dba462","observation_id":"c10440b1-1872-475a-aafb-534383584764","resolution":{"observed_at":"2026-08-07T00:54:21.264182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:20.873459Z","title":"Exploring motion cues for video test-time adaptation,","venue":null,"work_id":"a8eb2bb1-ab9b-47c2-9e0d-e9c3c6fddbe2","year":2023},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:05.610626Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:4bc64e507225f0e61a6816add0c2d2da670bae14c0f9462e09a2b2cbee15a916","observation_id":"39240480-f0e0-46aa-bf14-37bc0fb45207","resolution":{"observed_at":"2026-08-07T00:54:21.000344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:20.590521Z","title":"Temporal coherent test time optimization for robust video classification,","venue":null,"work_id":"6c782118-5721-4902-82c4-a3a1265e5ce3","year":2023},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:05.690630Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:c978de6c5e74bbb7202fdc72738f762c7c0b0524e4ad6a6d5e6c13fbe3010cfe","observation_id":"868f3f2a-d989-4b31-9e57-31d4e654e113","resolution":{"observed_at":"2026-08-07T00:54:20.721022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:20.313273Z","title":"Ast: Audio spectrogram trans- former,","venue":null,"work_id":"f385b91f-c713-4c5d-94dc-c92fb64611fe","year":2021},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:05.784542Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:e92258f258e0f7ac1ce2e69631db8674e03a03e4f5860c399d41b7b3fb7378d2","observation_id":"91fc1409-706e-4903-9822-ac82210290cd","resolution":{"observed_at":"2026-08-07T00:54:20.447973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:19.996016Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":"ad9027bb-57a0-49d4-94a4-d6ca4fa38a64","year":2019},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:05.838913Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:ecab7425875177670473361196fee054eb687c9e75b0a71c37c7c6dda55a0aaf","observation_id":"b65251ea-1f18-4f5e-b089-cf9994bdeab2","resolution":{"observed_at":"2026-08-07T00:54:20.157611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:19.756505Z","title":"Language models are few-shot learners,","venue":null,"work_id":"30f7cf3d-1ae8-4dcf-aca0-2a0a7d0523b2","year":2020},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:05.948670Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:0cf1a6d7f1a5aa8f8e59165e3967ff0cb59248e4b36cbfa04c85265daf94e163","observation_id":"c4706b51-6c68-4ebd-8e0b-3fdcc501bc46","resolution":{"observed_at":"2026-08-07T00:54:19.851606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:06.000889Z","title":"Benchmarking micro-action recognition: Dataset, methods, and applications,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:06.000889Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:30f05c8c0cd9ce728540719dbe507b08a8ce1bc337aec9dc690386f3d9f4cd4a","observation_id":"70221e23-df80-470b-a2b2-58c44d3425b0","resolution":{"observed_at":"2026-08-07T00:54:06.000889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:19.548732Z","title":"Repetitive action counting with hybrid temporal relation modeling,","venue":null,"work_id":"27811f42-96c3-4709-aa01-dbfa2edcf8ca","year":2025},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:06.065746Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:004ddeff9c08f048e9b14946e1e21ddda535c69330fd01c535e8ba2c8ef4d205","observation_id":"c6ff85e7-5055-4b09-a6ab-c043df2f96c8","resolution":{"observed_at":"2026-08-07T00:54:19.626432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14719","last_updated":"2025-04-15T12:11:11Z","snapshot_observed_at":"2026-08-03T15:15:24.967171Z","submitted_at":"2024-12-19T10:41:24Z","title":"Prototypical Calibrating Ambiguous Samples for Micro-Action Recognition","version":3},"cited_work":{"arxiv_id":"2412.14719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14719","snapshot_observed_at":"2026-08-07T00:54:11.316284Z","title":"Prototypical Calibrating Ambiguous Samples for Micro-Action Recognition","venue":"cs.CV","work_id":"85dea143-6760-46b7-9003-f1629ee0d15b","year":2024},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:06.134824Z"},"links":{"cited_paper":"/paper/2412.14719","citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:883cdf9be6c86bc296cd709a4d4c4caac608c25f5927f59ed177f5c118678fab","observation_id":"7520c981-33b3-4f84-a967-38a94ee653a4","resolution":{"observed_at":"2026-08-07T00:54:11.422232Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:19.359124Z","title":"Test-time classifier adjustment module for model-agnostic domain generalization,","venue":null,"work_id":"0c598861-1ee8-466d-9f30-f5e9f91d0da9","year":2021},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:06.202380Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:f963f1231d825ac15fd4be9c6c2072686d5bafe71a1c52e30e43b7fd0d536d39","observation_id":"178c1827-fb16-4470-8a43-a91f2e495c3a","resolution":{"observed_at":"2026-08-07T00:54:19.444206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:19.106426Z","title":"Revisiting realistic test-time training: Se- quential inference and adaptation by anchored clustering,","venue":null,"work_id":"16f9e81a-e5b4-4164-8d27-89a16e8786ae","year":2022},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:06.281441Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:e4075c70f00e59c683f24c112e57b006aacfed1ecc622cd7df67243c33032e69","observation_id":"ef41e3dd-1d18-4f5b-b14e-bb2a1a9827a9","resolution":{"observed_at":"2026-08-07T00:54:19.222262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.02355","last_updated":"2022-09-07T17:24:26Z","snapshot_observed_at":"2026-07-06T12:15:20.950385Z","submitted_at":"2021-12-04T15:01:35Z","title":"SITA: Single Image Test-time Adaptation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.02355","snapshot_observed_at":"2026-08-07T00:54:06.445024Z","title":"Sita: Single image test-time adaptation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:06.445024Z"},"links":{"cited_paper":"/paper/2112.02355","citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:de8650dd65f7632864478b9ba43cc5a30ee36373f14d555666c1ad0f9c381718","observation_id":"e7b9f108-df4e-422d-aee0-b29fe0e605e0","resolution":{"observed_at":"2026-08-07T00:54:06.445024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:22.450525Z","title":"Parameter- free online test-time adaptation,","venue":null,"work_id":"fe8d4297-18c5-4599-9fc8-932df04e1dda","year":2022},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:06.515578Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:ae747aa87eca8d698c1c71bf68191abe659b06eaf1e6ec56fd4693f912b8d75c","observation_id":"98665da7-8afb-46f2-85cd-083c4b518967","resolution":{"observed_at":"2026-08-07T00:54:22.606696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:18.922166Z","title":"Camera-aware recurrent learn- ing and earth mover’s test-time adaption for generalizable person re- identification,","venue":null,"work_id":"77f34777-b535-48d6-a5da-da2500f1f788","year":2023},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:06.595754Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:1017b20eabaf7b44b7cb6cf0bc2c98c41a5e4858c5be45fe01149170736c087e","observation_id":"d9f47279-cac6-4db3-ae65-aabd91af77d6","resolution":{"observed_at":"2026-08-07T00:54:19.006423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:18.640395Z","title":"Question type-aware debiasing for test-time visual question answering model adaptation,","venue":null,"work_id":"c4bb6365-1f55-4e08-91a1-fa07ae25802c","year":2024},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:06.646156Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:b0ec71e71a779066e6f6e6e81fb9077008ec9a8cf2331ef4e7206222f3aa41d3","observation_id":"4af02cc9-a9bb-41b2-8a9f-5acf0a4dd16e","resolution":{"observed_at":"2026-08-07T00:54:18.793452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:18.383344Z","title":"Ttagaze: Self- supervised test-time adaptation for personalized gaze estimation,","venue":null,"work_id":"9481a52f-145a-4d11-bb07-48743b502ec2","year":2024},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:06.746865Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:41b5610ef8ec55881662c924afa392097ee575a766ff2b23fdd0a1ae904fc173","observation_id":"426ef29f-b9f3-4086-95eb-a0d32b81d8f0","resolution":{"observed_at":"2026-08-07T00:54:18.520748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:18.101678Z","title":"What makes training multi-modal classification networks hard?","venue":null,"work_id":"5e4879bb-dbe0-408e-a1aa-23e346107a73","year":2020},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:06.826776Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:518585ff17749eb00eb6113defb090f3d4d30f1f1b26613674ea00cb45ff4bc6","observation_id":"174aeb4e-61c4-42e6-9455-24baaf35f24f","resolution":{"observed_at":"2026-08-07T00:54:18.232489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:17.860855Z","title":"Self-supervised learning by cross-modal audio-video cluster- ing,","venue":null,"work_id":"3d9dbc27-5300-413c-aa14-77c2d24b86b8","year":2020},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:06.903443Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:a246c38dcca0838908af2fd86c4a376073e938166dda889fb4d21c7a1ba0f899","observation_id":"255777d1-a2c8-4efb-8993-09c7139213b3","resolution":{"observed_at":"2026-08-07T00:54:17.967929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:06.978167Z","title":"Look, listen and learn,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:06.978167Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:f158285cb6c8e2777c2263c9199867eb0eda81d51d4aee9b2472268f7fb1db34","observation_id":"32c2113e-0cb1-47d9-9873-d608507ab27e","resolution":{"observed_at":"2026-08-07T00:54:06.978167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:17.630579Z","title":"Epic-fusion: Audio-visual temporal binding for egocentric action recognition,","venue":null,"work_id":"bc5a567f-6fd1-43d9-bb7a-90e141e3d59d","year":2019},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:07.054009Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:eedfdc0798487fa3008e5d727bc749f2778cbdd3d5742e8fca0dbb5191f57721","observation_id":"91176f35-89b1-40de-9e1b-290dcc898439","resolution":{"observed_at":"2026-08-07T00:54:17.726461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:17.329175Z","title":"Exploring multimodal video representation for action recognition,","venue":null,"work_id":"d7da58eb-aba6-47fc-b16b-259ffdc28ed9","year":2016},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:07.124278Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:328b942e5b1ef8441d28f929b36f3f28f83875330c7c36b232b35a07e1c72626","observation_id":"085ab076-13e7-4e6a-8a21-931541ac745c","resolution":{"observed_at":"2026-08-07T00:54:17.454728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:17.071174Z","title":"Slowfast networks for video recognition,","venue":null,"work_id":"a6e1d220-6f15-45f2-b5d4-df8a5ad05d52","year":2019},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:07.191632Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:7041bdd2c0a075cfd3c09fdd8ed9b8b2e9698ad6a08e77a5b87089efacb8e1bb","observation_id":"23b8b71f-fc10-4aae-ae61-be9c24406bd2","resolution":{"observed_at":"2026-08-07T00:54:17.205407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:16.813592Z","title":"Attention is all you need,","venue":null,"work_id":"03ad1736-d6d1-4701-8779-d952e5047e5b","year":2017},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:07.258909Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:ec32f9714e28d188fb328ec82bf87eae0c66920695a59ef6f022fdccd7c871d6","observation_id":"6fd2c850-6ad3-497b-9e49-8f6d456f83a1","resolution":{"observed_at":"2026-08-07T00:54:16.943553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:16.570525Z","title":"Polyvit: Co-training vision transformers on images, videos and audio,","venue":null,"work_id":"e7664ede-d9bb-4e29-b3be-8a24e3bdcb17","year":2023},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:07.337614Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:fa7cc189537e62ff5c345c998cad95b9078b3dfa3de791497b2bb600f0072402","observation_id":"fb303fa4-2626-4463-a998-61c25ca33da5","resolution":{"observed_at":"2026-08-07T00:54:16.667500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:16.347230Z","title":"Attention bottlenecks for multimodal fusion,","venue":null,"work_id":"e150bfc0-9a81-4855-969f-6a832805b1e5","year":2021},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:07.455568Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:d2566b8a40ce3e885fa6dd9044ca517c611c7698916cd254ad3e1e4cde8c79a6","observation_id":"b16713c7-918d-429d-855c-720015e773d1","resolution":{"observed_at":"2026-08-07T00:54:16.446415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:16.089801Z","title":"Mm-vit: Multi-modal video transformer for compressed video action recognition,","venue":null,"work_id":"835731d5-25c3-4d30-8237-25a222010274","year":2022},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:07.518122Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:8ad39ab691d0351be89a88604fc8603bfb470da903a4d89f596e20b47a0bd68b","observation_id":"dcf141e3-719f-4d7e-a95d-e6b3f163ad40","resolution":{"observed_at":"2026-08-07T00:54:16.200539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:15.779778Z","title":"Multimodal video summa- rization via time-aware transformers,","venue":null,"work_id":"96928d02-da37-41fd-ad07-d254a660cb19","year":2021},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:07.586329Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:96c0755fa5290be95700597e6a8911ef971794440a1edec5d80b9ac4eb8c658d","observation_id":"e23503e9-c259-49d7-b4b0-9f13b0e6a016","resolution":{"observed_at":"2026-08-07T00:54:15.879756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:15.554908Z","title":"Bootstrapping audio-visual video segmentation by strengthening audio cues,","venue":null,"work_id":"4f79f4fa-0ba4-4932-b53a-11b59d857174","year":2024},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:07.655498Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:b8f38fa8a47cadf30460c91efc75914535b3b96f7761b392b2743c92c72e7d4f","observation_id":"5bf451c0-f468-4d10-af81-edc6f728bcc2","resolution":{"observed_at":"2026-08-07T00:54:15.684124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:15.277943Z","title":"Multimodal imbalance-aware gradient modulation for weakly-supervised audio-visual video parsing,","venue":null,"work_id":"dc4cfbb7-15cd-4c34-87a5-2a2df34ca020","year":2023},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:07.721031Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:e6d12d5a21f48ef419dd1156bc63ecb40a1dfb48624835b5b9a5d5783a91fa00","observation_id":"9bdd4f10-6020-4ed5-b822-df7c825746f8","resolution":{"observed_at":"2026-08-07T00:54:15.364959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.01689","last_updated":"2021-06-03T08:46:43Z","snapshot_observed_at":"2026-07-06T11:15:30.045776Z","submitted_at":"2021-06-03T08:46:43Z","title":"Cross-Domain First Person Audio-Visual Action Recognition through Relative Norm Alignment","version":1},"cited_work":{"arxiv_id":"2106.01689","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.01689","snapshot_observed_at":"2026-08-07T00:54:11.040331Z","title":"Cross-Domain First Person Audio-Visual Action Recognition through Relative Norm Alignment","venue":"cs.CV","work_id":"f56837c6-b977-4723-9161-4fa184c05675","year":2021},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:07.779728Z"},"links":{"cited_paper":"/paper/2106.01689","citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:01eb4971304353e210212cc2b6d057fe46ff3e4a3db411f7ddcc664fd0d902e6","observation_id":"9d225224-9080-4aae-9bab-c8c718e3a678","resolution":{"observed_at":"2026-08-07T00:54:11.168964Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:15.035036Z","title":"Domain generalization through audio-visual relative norm align- ment in first person action recognition,","venue":null,"work_id":"31719ff5-75e1-4c20-86f5-408b1849e6a9","year":2022},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:07.851954Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:c5a8d8e5c3e8dc0147d4f0f07f77d8aefcc6c34083078ea6d2ae25c2746ef371","observation_id":"aad33de7-7250-4584-acf3-6102305d0e99","resolution":{"observed_at":"2026-08-07T00:54:15.133343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.10026","last_updated":"2021-07-01T02:56:46Z","snapshot_observed_at":"2026-07-06T11:20:38.670388Z","submitted_at":"2021-06-18T10:03:30Z","title":"EPIC-KITCHENS-100 Unsupervised Domain Adaptation Challenge for Action Recognition 2021: Team M3EM Technical Report","version":3},"cited_work":{"arxiv_id":"2106.10026","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.10026","snapshot_observed_at":"2026-08-07T00:54:10.742646Z","title":"EPIC-KITCHENS-100 Unsupervised Domain Adaptation Challenge for Action Recognition 2021: Team M3EM Technical Report","venue":"cs.CV","work_id":"10bdd8c8-36a4-46b9-a896-c4869c22e936","year":2021},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:07.929631Z"},"links":{"cited_paper":"/paper/2106.10026","citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:ff45e06b0e1eb3f5e34c0caee3babc3582b19356f25678df6a31e9046a9bdb57","observation_id":"59d7580c-d9ac-49f8-850d-120223135aa0","resolution":{"observed_at":"2026-08-07T00:54:10.875629Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:14.772101Z","title":"Audio-adaptive activity recognition across video domains,","venue":null,"work_id":"29a096e4-0a6b-4eb5-a711-2243a80bb424","year":2022},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:07.986874Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:d358cd9e90e0902f7d801caff0ec04f90f85901878cf039f44e1b676f16141c6","observation_id":"d358d349-6e20-44f5-a9dd-9e2524f5621e","resolution":{"observed_at":"2026-08-07T00:54:14.886959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.10963","last_updated":"2021-01-14T21:11:06Z","snapshot_observed_at":"2026-08-06T05:58:45.817385Z","submitted_at":"2020-06-19T05:08:43Z","title":"Evaluating Prediction-Time Batch Normalization for Robustness under Covariate Shift","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.10963","snapshot_observed_at":"2026-08-07T00:54:08.059471Z","title":"Evaluating prediction-time batch normalization for robustness under covariate shift,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:08.059471Z"},"links":{"cited_paper":"/paper/2006.10963","citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:b02ba724e0570ea65203b874fcc6f81ee66ff68ab156cfd61f9e903b24cc239e","observation_id":"490a2777-9fd1-498a-b718-385ebbfdf2b5","resolution":{"observed_at":"2026-08-07T00:54:08.059471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:14.521595Z","title":"Do we really need to access the source data? source hypothesis transfer for unsupervised domain adaptation,","venue":null,"work_id":"e6770457-d5ed-489d-8d28-c8215e0eb324","year":2020},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:08.145311Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:8b28c441896ca183f4c84a24d9b42979c979749f70728dd09ee91db3f33d4a63","observation_id":"07ed5fe3-4fa2-4c93-9df1-22ac58be4d8f","resolution":{"observed_at":"2026-08-07T00:54:14.624959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:14.351944Z","title":"Improving robustness against common corruptions by co- variate shift adaptation,","venue":null,"work_id":"c2309f73-21f1-48b1-8254-f33869169a5a","year":2020},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:08.228981Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:d75878ec40b810f0f97cbbd8dcc107c29de3f485e83d9997715f626c38aa8430","observation_id":"dc90267e-2b60-4a94-b076-e9ad0be78f72","resolution":{"observed_at":"2026-08-07T00:54:14.417289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:14.168029Z","title":"Entropy is not enough for test-time adaptation: From the perspective of disentangled factors,","venue":null,"work_id":"f6f60e57-9fa1-424f-ada8-ff8485376a23","year":2024},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:08.301199Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:ae02d1c0ef5e4a992afbe7316dc2691028694d907cf596f15c61c4baf87ab1a0","observation_id":"d93c796a-0242-4373-beae-a396379c58d4","resolution":{"observed_at":"2026-08-07T00:54:14.240539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:08.407003Z","title":"Universal test-time adaptation through weight ensembling, diversity weighting, and prior correction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:08.407003Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:7bf8c11efe12b2f6a47ac5aa340eeb279963789efbff1cc3996709c9bd362bd2","observation_id":"0476f983-fb1a-487f-b7f6-fdf12a861e8a","resolution":{"observed_at":"2026-08-07T00:54:08.407003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09685","last_updated":"2023-08-18T17:13:45Z","snapshot_observed_at":"2026-07-06T16:07:45.513778Z","submitted_at":"2023-08-18T17:13:45Z","title":"Audiovisual Moments in Time: A Large-Scale Annotated Dataset of Audiovisual Actions","version":1},"cited_work":{"arxiv_id":"2308.09685","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.09685","snapshot_observed_at":"2026-08-07T00:54:10.497735Z","title":"Audiovisual Moments in Time: A Large-Scale Annotated Dataset of Audiovisual Actions","venue":"cs.LG","work_id":"55312479-4da3-445d-95d7-e44c745e369e","year":2023},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:08.481578Z"},"links":{"cited_paper":"/paper/2308.09685","citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:ade8f383c57672b69d7f355fe6bffcac54cc7a1558d55f2c948c2c0e0453adbc","observation_id":"e768709d-a74b-4c7f-a212-9d9dd48ce3f1","resolution":{"observed_at":"2026-08-07T00:54:10.599730Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:08.563466Z","title":"Audio-visual event localization in unconstrained videos,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:08.563466Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:74f680dac44be09d399934f381d0e162d390e6cabc513af7a97a4e8bee4698ca","observation_id":"7c8791cc-cb44-4098-89e3-c7f0b9e6e398","resolution":{"observed_at":"2026-08-07T00:54:08.563466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:13.952441Z","title":"Audio set: An ontology and human- labeled dataset for audio events,","venue":null,"work_id":"704a5322-2f5d-4193-a97c-42da7b118778","year":2017},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:08.636158Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:8924b3a3ae000e5c646507cbb1410bcd6e621a7a1af3d20f512c2121b46145be","observation_id":"b130993e-00e3-4e84-93ae-9c0080fb87fc","resolution":{"observed_at":"2026-08-07T00:54:14.034428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-07-06T03:01:10.229407Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-07T00:54:08.763811Z","title":"Ucf101: A dataset of 101 human actions classes from videos in the wild,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:08.763811Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:495a571de0f7f880531b4fffca7032afc5083a36f0e2bc319748a25256391d89","observation_id":"36651001-5f58-4677-9828-bb06c1502279","resolution":{"observed_at":"2026-08-07T00:54:08.763811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-08T17:46:50.107463Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-07T00:54:08.874815Z","title":"The kinetics human action video dataset,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:08.874815Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:8d74b2610f00764a6e5b47196e03e2066103d5d9d1e94cf8977e233c2de015a8","observation_id":"3574da86-e5cc-46e9-8e52-1f40c592e625","resolution":{"observed_at":"2026-08-07T00:54:08.874815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:13.718108Z","title":"Large-scale robustness analysis of video action recognition models,","venue":null,"work_id":"f9657085-68c2-436d-b014-c6f7cc0597dc","year":2023},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:09.001476Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:b37d252949fabad9f87305f78f5df7ae78e9bd15e13ba84fb4b69edc3bdbfbac","observation_id":"b8e4cf70-b82d-4853-8bd2-105440ec9aaf","resolution":{"observed_at":"2026-08-07T00:54:13.827545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:13.477755Z","title":"Benchmarking the ro- bustness of spatial-temporal models against corruptions,","venue":null,"work_id":"40e052bc-6d9c-430b-b8e0-862850bd2b1a","year":2021},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:09.163831Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:c60866f59d2a6afdbfa86e2004420bd121852b8612261bfa202823b41cdd6b7d","observation_id":"4e846e41-3dc4-440c-8be9-eb0aaa189ba4","resolution":{"observed_at":"2026-08-07T00:54:13.597851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:13.209909Z","title":"Tam: Temporal adaptive module for video recognition,","venue":null,"work_id":"12f4bf1e-890b-4ef8-95d1-928871c4e5b3","year":2021},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:09.279285Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:d99d336f9c59ab9899fbcee382aecc2bbb0b5ab6ee120cc171739042255b81dd","observation_id":"2a2a7b6d-6b0b-4dd2-ab25-f9a9fc0582ef","resolution":{"observed_at":"2026-08-07T00:54:13.364637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:12.982634Z","title":"Tsm: Temporal shift module for efficient video understanding,","venue":null,"work_id":"4a02f8cc-2bd4-448a-b245-151bac6622ca","year":2020},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:09.361593Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:5f5a43712a7b867ae42b7e62f4124b9dd21d1a827aa721ef800133a93c27c5e4","observation_id":"46ee0324-101f-42ee-aab1-47ce005d4311","resolution":{"observed_at":"2026-08-07T00:54:13.073191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:09.442939Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:09.442939Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:c579e7a99d810bafa7c7bd9ee472a3532fb6d581191d6241122cd00b344ff8e7","observation_id":"87006b49-a61e-4ac3-9280-5a8f1af116ed","resolution":{"observed_at":"2026-08-07T00:54:09.442939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T00:54:09.583647Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:09.583647Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:2619c239d3d7dbf3c5019a30dbed0f2d3646a780b80bd6e95372ef895824e9b8","observation_id":"63070090-db99-4110-ac56-e39954512b6b","resolution":{"observed_at":"2026-08-07T00:54:09.583647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:12.719484Z","title":"The claude 3 model family: Opus, sonnet, haiku","venue":null,"work_id":"042d7623-703a-44d7-9b61-5448f2302c25","year":null},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:09.675286Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:8d8d7272f6d9895a490f3ab72bab9f87688de6db8f814a2b9572a11343052e2a","observation_id":"509beed8-46ef-43fc-b9db-5dcc97aeaea0","resolution":{"observed_at":"2026-08-07T00:54:12.826462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T00:54:09.790417Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:09.790417Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:fe4f111a181a3f2e42868c69e282cb003e6ada87947118892c31b9650e1bc3c8","observation_id":"8f407caa-0ac6-4087-82e7-a198afb82056","resolution":{"observed_at":"2026-08-07T00:54:09.790417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:12.415243Z","title":"Binggpt: Desktop application of new bing’s ai-powered chat,","venue":null,"work_id":"a1909ddc-bca6-4f37-9460-2f644df25495","year":2024},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:09.936000Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:ed53c7d680a9b13d86af69173bba9301e9cd8def603c2ae70c3a8b7034191cd8","observation_id":"ae8a3d41-acce-48ab-98aa-75f321b8c5bd","resolution":{"observed_at":"2026-08-07T00:54:12.566777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:12.185934Z","title":"Audio mamba: Bidirectional state space model for audio representation learning,","venue":null,"work_id":"c1fd412c-8cfd-40c2-8524-bd8b346cfd59","year":2024},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:10.052087Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:79cc6b29b562e3cc6b7588ee4291e71850b41a918a09d0ddf0e1e4be8bebd00d","observation_id":"11f5fe04-e0d2-4495-9474-6b730c5133c5","resolution":{"observed_at":"2026-08-07T00:54:12.285855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:11.905724Z","title":"Beats: Audio pre-training with acoustic tokenizers,","venue":null,"work_id":"57690836-a0ea-4f8d-8f46-9c2de784a189","year":2023},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:10.186685Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:41a37136e31012b2b3b85f4137e0b007db16f5bbe457da5c55984fdf5c98c31e","observation_id":"74beaab0-40bb-4086-b1e8-2dedecce1868","resolution":{"observed_at":"2026-08-07T00:54:12.035490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:54:11.587663Z","title":"Tim: A time interval machine for audio-visual action recognition,","venue":null,"work_id":"6944af18-d4ba-4a14-a416-16bb58f9f6a4","year":2024},"citing_paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:10.310454Z"},"links":{"citing_paper":"/paper/2506.12481"},"observation_digest":"sha256:cbc6d1ec6dbc5784eea5589b7a66efe778945a99b9c32e8bef131719d880c1c0","observation_id":"1976f334-fbb2-432d-bf83-acf962a6dd6f","resolution":{"observed_at":"2026-08-07T00:54:11.746977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.12481","last_updated":"2025-06-14T12:44:58Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T00:46:14.662713Z","submitted_at":"2025-06-14T12:44:58Z","title":"Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":4,"verified_fuzzy":51},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 0 inbound Pith citation observations for arXiv:2506.12481."}