{"as_of":"2026-08-08T04:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:23e4d4b47cac0a9678ae351bafb4298856f43e1b69946f6c0a24722423f5e9cf","coverage":[{"denominator":95,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":95,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:52:55.019874Z","state":"measured"},{"denominator":95,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":95,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.12426/citation-record","integrity":"/paper/2507.12426/integrity","json":"/paper/2507.12426/citation-record.json","paper":"/paper/2507.12426"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:46.543670Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:46.543670Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:a78ef456bd5be686c64e554e251a1a5a4941ae1b1e9e54c1bae013187f1c2ecb","observation_id":"7d6fa9a7-95b3-4e9b-b0c8-bfc6deb3b292","resolution":{"observed_at":"2026-08-06T16:52:46.543670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:46.603264Z","title":"Spatiotemporal residual networks for video action recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:46.603264Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:b828cee742fd765f20bf9c7fd07a36cb1fa07748608a64f9aea92966a21bd3b5","observation_id":"f6dfecc4-6bac-46de-8600-043905dbef6d","resolution":{"observed_at":"2026-08-06T16:52:46.603264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:46.762590Z","title":"Learning spatiotemporal features with 3d convolutional networks,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:46.762590Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:eadf9790a9259f0258eafb939ef86efff135139939c01a3adda37bdd77f9431d","observation_id":"da7f7c26-20f2-4582-829d-229133615bd3","resolution":{"observed_at":"2026-08-06T16:52:46.762590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:46.834049Z","title":"Large-scale video classification with convolutional neural networks,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:46.834049Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:6a707f36d5585b8a3cfc8a0b9c6639289affca1c2e2d3dfea068a2d5e667caad","observation_id":"1139d00a-d086-4239-9ee1-f7fbbe824386","resolution":{"observed_at":"2026-08-06T16:52:46.834049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:46.912945Z","title":"Beyond short snippets: Deep networks for video classification,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:46.912945Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:4fffb9a973078a07d9934fff3c08a5dee5457f04d6ef73b06c3a3458f3187320","observation_id":"81df5fdd-3704-4da7-864d-36ff4ef50b15","resolution":{"observed_at":"2026-08-06T16:52:46.912945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:46.999396Z","title":"Two-stream convolutional networks for action recognition in videos,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:46.999396Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:93dca2750c81c38e8177768eb978eff037b39e7bfb73a04dabcd4c9ce9de8884","observation_id":"30e07942-23e6-46a0-9685-6d2274f38ca8","resolution":{"observed_at":"2026-08-06T16:52:46.999396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:47.061463Z","title":"Action recognition using deep 3d cnns with sequential feature aggregation and attention,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:47.061463Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:ad221a6560a79d8bbbab2cdf51db35d54b64b1c56759d6a81caf50a2592bef6a","observation_id":"2ab53b6f-85c6-446e-b41c-2ad3340312f1","resolution":{"observed_at":"2026-08-06T16:52:47.061463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:47.139621Z","title":"A closer look at spatiotemporal convolutions for action recognition,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:47.139621Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:a793117bbb769a24d89a1e418a4597d1465fe908cf838feda965ceaeb683a2d6","observation_id":"befd3be9-d7eb-4f72-a1a3-e92c65ab6b2a","resolution":{"observed_at":"2026-08-06T16:52:47.139621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:47.215422Z","title":"Human action recognition in videos using convolution long short-term memory network with spatio-temporal networks,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:47.215422Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:b624b068795f08423469ac9609f265a652480ea06c7de2c466522ecebd9ae9c4","observation_id":"89171f78-0d81-4a0f-8b44-9d16f4498847","resolution":{"observed_at":"2026-08-06T16:52:47.215422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:47.293116Z","title":"Action recognition in videos using pre-trained 2d convolutional neural networks,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:47.293116Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:76f071c1245604b0c1d7dcf8ef1b2da0eb8a0e5d17b41d2cd013f734857f9970","observation_id":"ea61037a-f432-42f1-8c1e-5bc5d0ed4871","resolution":{"observed_at":"2026-08-06T16:52:47.293116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:47.365973Z","title":"Video-focalnets: Spatio-temporal focal modulation for video action recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:47.365973Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:1a267fab3363c838b5f36aa6a456db28fc17a774924a34f5481063afc2dbc4a9","observation_id":"57809d8d-af21-4dad-a9c4-caa9ce0ce57b","resolution":{"observed_at":"2026-08-06T16:52:47.365973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:47.458192Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:47.458192Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:081a86e147d74163034ed256dacfac110cdc7dd2dcd083aa0da160ee383ba6c3","observation_id":"cbd63ea4-ac98-4630-b0d5-2f34a2a50e21","resolution":{"observed_at":"2026-08-06T16:52:47.458192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:47.549508Z","title":"Morph: flexible acceleration for 3d cnn-based video understanding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:47.549508Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:9eaa73fbbbf5541a4c8e9fabdbe0f1813a77f94f8b6ccb0e689c0259bc446799","observation_id":"94573c9d-c9d9-405f-a809-205fd9385d3b","resolution":{"observed_at":"2026-08-06T16:52:47.549508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:47.646960Z","title":"Video swin transformer,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:47.646960Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:aac01132818716b9240327d30483201bf0169850cead72368b2f866d8c2646cf","observation_id":"7dacace1-b6ab-4d7f-a2f6-134e5c83ccb9","resolution":{"observed_at":"2026-08-06T16:52:47.646960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:47.720373Z","title":"Is space-time attention all you need for video understanding?","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:47.720373Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:a79f433a61f16b1cb526391a93c587e3f243ba9920f2b6b2b55506acb206ae69","observation_id":"f0cf805b-b70b-45ea-9f7b-4c0d38c27a59","resolution":{"observed_at":"2026-08-06T16:52:47.720373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:06.295815Z","title":"Vivit: A video vision transformer,","venue":null,"work_id":"16d52d46-7c16-4aad-b83e-4bb4caceddae","year":2021},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:47.802678Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:3545278de140da42d50ae392eafd4a061be37e04a6ea7d6d0b9a5e21e74287d7","observation_id":"3eb7b69d-ddd7-49e0-9c4f-fe022bf11c61","resolution":{"observed_at":"2026-08-06T16:53:06.347041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:06.185665Z","title":"Video swin transformer,","venue":null,"work_id":"ad6476f6-536d-4508-8813-57412b7a1945","year":2022},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:47.915356Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:745a2ba65a66d99c3d12509d6c04e59b5975c86f3ac9a1bf3d8b505016d6d47e","observation_id":"82e5e3f7-b6c3-41a8-9fc9-f6b66ec19b23","resolution":{"observed_at":"2026-08-06T16:53:06.256262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:05.929428Z","title":"Multiview transformers for video recognition,","venue":null,"work_id":"aba279cd-a984-4842-9a64-36f68f2d3b76","year":2022},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:48.002422Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:a93dd91a39960a820339644f43685fcdd4f5f583fdd585d76f84d36576ea3af3","observation_id":"05571d0b-4696-43a4-a4c0-f3ef2b565420","resolution":{"observed_at":"2026-08-06T16:53:06.027968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:05.726144Z","title":"Vivit: a video vision transformer,","venue":null,"work_id":"57ddd6ea-7fe1-402f-b863-0483f67a74f7","year":2021},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:48.113860Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:fa89913ec9d3677ec1a0e4956e047649c995d260f0395b6c51117a26d6f8dff8","observation_id":"d19db6ac-64a3-4d5b-8bc4-38a75d42c01d","resolution":{"observed_at":"2026-08-06T16:53:05.838377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.06987","last_updated":"2022-10-17T19:58:40Z","snapshot_observed_at":"2026-07-06T08:08:03.081236Z","submitted_at":"2019-07-15T12:58:21Z","title":"A Short Note on the Kinetics-700 Human Action Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.06987","snapshot_observed_at":"2026-08-06T16:52:48.257823Z","title":"A short note on the kinetics-700 human action dataset,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:48.257823Z"},"links":{"cited_paper":"/paper/1907.06987","citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:7b4aa1b61e953dda178e2f824c6eb1d4d5216a8f89f349044e83cf37254692ba","observation_id":"b1bcdfe6-4cdc-44f8-aad7-61da12e91435","resolution":{"observed_at":"2026-08-06T16:52:48.257823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:05.480592Z","title":"The\" something something","venue":null,"work_id":"ee4e4e30-a27a-48fe-92ba-f69b88f176cc","year":2017},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:48.310977Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:9883e4951cb1639f875d14a5be9e556482d014caeb6bf2ee7def25d1f57edbd1","observation_id":"a818e4a1-4b5e-4a94-b1fa-ad39061bc3c9","resolution":{"observed_at":"2026-08-06T16:53:05.619678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:05.294045Z","title":"Tsnet: token sparsification for efficient video transformer,","venue":null,"work_id":"5615ef7a-05f7-415f-b690-1ad48af5f1b3","year":2023},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:48.397443Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:18382e34995753070952e68ca51a3b90f9da17c1bda83e478b2ed1f23128ca4b","observation_id":"619217a0-41a1-4d5f-bb13-e281e3ab75a4","resolution":{"observed_at":"2026-08-06T16:53:05.374484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:05.126976Z","title":"Dualformer: local- global stratified transformer for efficient video recognition,","venue":null,"work_id":"59b7425f-342e-48d1-bbe3-3e6c0d54df50","year":2021},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:48.495776Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:d91a1aae123dc595e712a733c63590423b1b2c72d399ca4e7d8b4a9fbc29502e","observation_id":"14426831-847c-42f1-a119-ab7de1c633fd","resolution":{"observed_at":"2026-08-06T16:53:05.198144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:04.927965Z","title":"Aerobics action recognition algorithm based on three-dimensional convolutional neural network and multilabel clas- sification,","venue":null,"work_id":"e2002952-e390-4c41-b1fa-2e38694a9ff3","year":2021},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:48.645264Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:26547503738a7b62b5a8beeb020b13b9fd92181f21484e9d0a0662b802c6a13f","observation_id":"9e639f13-90b9-4e10-890f-1c9f41288763","resolution":{"observed_at":"2026-08-06T16:53:05.032271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:04.694391Z","title":"Tsm: temporal shift module for efficient video understanding,","venue":null,"work_id":"302689ff-4022-4c59-82f7-3b1084be9168","year":2019},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:48.745524Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:c4673561302cd16de6f7fccbd193b9d8c5e41574e70403f62442f1b9f147095a","observation_id":"ecd963af-485a-4dc1-8fed-b62f79566714","resolution":{"observed_at":"2026-08-06T16:53:04.810289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:48.903466Z","title":"Multi-stream interaction networks for human action recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:48.903466Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:d7c6a77a53cd001ad08d62f3a154dab45b28c1bd17e26fca7a4d31ad3aa44b6e","observation_id":"02dadde9-ea1b-43a4-9339-e281a66574ed","resolution":{"observed_at":"2026-08-06T16:52:48.903466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:04.488656Z","title":"Spatio- temporal adaptive network with bidirectional temporal difference for action recognition,","venue":null,"work_id":"a75279ab-3f45-4027-b2b4-859454d5cf4e","year":2023},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:48.988513Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:0a0eea4d1b2705df3724166e8f49ff6d2f3960ad2a09903bf23a32785e622fe7","observation_id":"f4125143-b5a1-47c0-ad04-f863252f597f","resolution":{"observed_at":"2026-08-06T16:53:04.577825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:04.284275Z","title":"Agpn: Action granularity pyramid network for video action recognition,","venue":null,"work_id":"63baa2f9-9f11-4fc4-a087-eb8183b21a10","year":2023},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:49.052816Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:f406ec39be7f1c062859e3c385c4baf5ac75e9fe03bb3591743ca49b10ec1dde","observation_id":"7239b067-039d-4a18-b7ed-b876d7c032a5","resolution":{"observed_at":"2026-08-06T16:53:04.413558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:04.094932Z","title":"Mawkdn: A multimodal fusion wavelet knowledge distillation approach based on cross-view attention for action recognition,","venue":null,"work_id":"8a9c5e01-ccae-4525-b6b4-030ea4ce410e","year":2023},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:49.130816Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:94627c2535d1d7301a2d142b260f7d8e4505f805daf48f45d9242af99dc148b6","observation_id":"10739f60-4c9f-4362-bc5d-71672cacce9c","resolution":{"observed_at":"2026-08-06T16:53:04.180393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:03.904063Z","title":"Convolutional neural networks or vision transformers: who will win the race for action recognitions in visual data?","venue":null,"work_id":"135ac3fc-36c9-4b86-992a-437d3fb05d1c","year":2023},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:49.203358Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:5cf26f3f54b1c23f8ef701b4b7c097c498a9fd54896cb7f345f66c95b512b190","observation_id":"a3b87581-b7aa-4cce-8d76-78178a971912","resolution":{"observed_at":"2026-08-06T16:53:04.004396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:03.716153Z","title":"Decoupled knowledge distillation,","venue":null,"work_id":"71332dcd-9900-4e50-82c8-b40e2ddc348c","year":2022},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:49.291727Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:b4d983e882e01c8a4f82381c9983f360a1d303f30cf247b0f913c567ea1d4f9d","observation_id":"dc449c7c-7aab-4408-9730-7df66158556e","resolution":{"observed_at":"2026-08-06T16:53:03.788026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:03.530977Z","title":"Knowledge distil- lation in video-based human action recognition: an intuitive approach to efficient and flexible model training,","venue":null,"work_id":"44caf298-45c8-41d9-ab75-1312c7ed6be4","year":2024},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:49.359338Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:87033fddb85cfe66579be965da42ae3f0ef7ff3de923ad90a6965890a3c6ee03","observation_id":"6c54a01c-3a35-469e-8b2d-214a8e7009c1","resolution":{"observed_at":"2026-08-06T16:53:03.616547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:03.356560Z","title":"Tomato leaf disease recognition based on multi-task distillation learning,","venue":null,"work_id":"cba12220-0bc2-4a83-9ce8-9f02534b1ce8","year":2024},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:49.445207Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:41b91c6ca17aa25ee2b297e3e6c533044589d9c6bb5c2195ceaa9c3cfce0557f","observation_id":"0c4740cb-6e71-425d-b39b-8bb395344d67","resolution":{"observed_at":"2026-08-06T16:53:03.441174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:03.162283Z","title":"Videoadviser: video knowledge distillation for multimodal transfer learning,","venue":null,"work_id":"c3653a10-7552-4616-ac93-0bab50eb4fe0","year":2023},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:49.510135Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:ae6558b967244350e3bf8bf0d1c98aeb375428823cefc0a195dc33df69a24ed7","observation_id":"abc9a7cf-cff3-428b-86d2-4a8ec455593e","resolution":{"observed_at":"2026-08-06T16:53:03.264063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:03.022920Z","title":"Generative model- based feature knowledge distillation for action recognition,","venue":null,"work_id":"e0e408a1-e656-4556-9ea1-d487f273ac7a","year":2024},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:49.627318Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:153dadba8297924c336be70df9245ba9babef39ed61a3a76e7d60d68f0b6c316","observation_id":"f0e5042d-7bdc-44c7-ad1e-eb7de09209f5","resolution":{"observed_at":"2026-08-06T16:53:03.099709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:02.817642Z","title":"Distillation of human-object interaction contexts for action recognition,","venue":null,"work_id":"38ae02db-6bf4-4a66-b2aa-aa534a1d324a","year":2021},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:49.680694Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:994f73c9f201a026b7abed35488185835e590c5299ee6f164b8ba43d29391b6a","observation_id":"7ac67c90-6540-4d09-9d3f-49fb1a495643","resolution":{"observed_at":"2026-08-06T16:53:02.880266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-07-06T05:01:27.910364Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-06T16:52:49.779462Z","title":"Gaussian error linear units (gelus),","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:49.779462Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:5e95cfc4b037d44bd8fc09ac6676eca6524e786d57f8bfdee7a8f4eaa4af376c","observation_id":"51a66055-0d5c-4e05-ae76-efc69f911c32","resolution":{"observed_at":"2026-08-06T16:52:49.779462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:02.694813Z","title":"Recognizing 50 human action categories of web videos,","venue":null,"work_id":"b73164ee-41c2-4196-b5c2-d49c7d23e9f0","year":2013},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:49.860074Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:86b72afb7f5b686fc123ce9b763af1417e7e0b6f7a27f464c5f110bcc8f612b4","observation_id":"42c9bee4-121f-49f0-bb40-e03ca6c20299","resolution":{"observed_at":"2026-08-06T16:53:02.753222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-07-06T03:01:10.229407Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-06T16:52:50.009362Z","title":"Ucf101: A dataset of 101 human actions classes from videos in the wild,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:50.009362Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:aa0e77cec42f98aa6b8c34cd955fc21aca218a7b5be44fcaf3e99851e166d403","observation_id":"9a6faf9b-3c84-4091-854b-7615a44fba10","resolution":{"observed_at":"2026-08-06T16:52:50.009362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:02.598379Z","title":"Hmdb: a large video database for human motion recognition,","venue":null,"work_id":"f4f4987d-e9e9-4893-9ef7-ac261731db68","year":2011},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:50.106813Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:defec0ba9d3858149f9a94116890f17b45fd4ec76ee5b950e51cdb6b7169ca67","observation_id":"3f17c9e8-b6e2-4c9c-bddf-97a6c44e5f88","resolution":{"observed_at":"2026-08-06T16:53:02.650847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:02.471844Z","title":"The\" something something","venue":null,"work_id":"6cb12d87-020e-4862-bc77-1861b7b682cc","year":2017},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:50.174304Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:de39fb166a53ed94d928c9bd4215d5d50b8b66a0334ac5b26d2797421a89cb7a","observation_id":"c75510fe-4399-4f99-b634-5292bf4a285f","resolution":{"observed_at":"2026-08-06T16:53:02.556260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-07-06T05:43:22.028213Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-06T16:52:50.256104Z","title":"The kinetics human action video dataset,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:50.256104Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:9eb297ccd8f6b19d769c9ad9bcb92024c96973c8be61514b0f6deef277f872fa","observation_id":"b3a55fc2-d47e-44ba-bc91-dbe64eb2618d","resolution":{"observed_at":"2026-08-06T16:52:50.256104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.04676","last_updated":"2022-02-08T16:36:12Z","snapshot_observed_at":"2026-08-04T03:00:58.368363Z","submitted_at":"2022-01-12T20:02:32Z","title":"UniFormer: Unified Transformer for Efficient Spatiotemporal Representation Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.04676","snapshot_observed_at":"2026-08-06T16:52:50.390492Z","title":"Uniformer: Unified transformer for efficient spatiotemporal representation learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:50.390492Z"},"links":{"cited_paper":"/paper/2201.04676","citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:f4837fd8f5df69a906693371a143c72c7a5aa9689a3fc137ae2e8955330abdb3","observation_id":"1c01ee1e-7001-44a3-a8f4-b282d3eed1db","resolution":{"observed_at":"2026-08-06T16:52:50.390492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:02.306077Z","title":"Going deeper with convolutions,","venue":null,"work_id":"6b7cff65-bbfe-4b65-98e1-b5b06ea62e56","year":2015},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:50.471227Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:27a5cee355a6efb921c02bee1859a10f26fe06d48110b79dac69114b99b7e34b","observation_id":"771bb7c5-6e0d-495d-8627-a7fe6aec94b5","resolution":{"observed_at":"2026-08-06T16:53:02.389286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:02.237426Z","title":"Making sense of neuromorphic event data for human action recognition,","venue":null,"work_id":"82a3dd7e-9128-439f-826c-f36e232a8475","year":2021},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:50.520535Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:b68f46b580a3114ec97864dc89a5b1ad8e20f35dfc31b07e353073e5ef99dc55","observation_id":"24febacd-fbf9-4fa0-95f4-43b6defeb682","resolution":{"observed_at":"2026-08-06T16:53:02.263934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:02.151553Z","title":"Human action recognition using dis- tance transform and entropy based features,","venue":null,"work_id":"e5b86bf9-3e41-4fcf-b066-f7be641b6000","year":2021},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:50.601096Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:a7171704db6799aa2de6628bae8eedd1793d0cb1b6448e84d1ea325941d12101","observation_id":"d670189b-3b5f-453a-9bb4-193e9c814505","resolution":{"observed_at":"2026-08-06T16:53:02.200658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:02.086776Z","title":"Human action recognition using hybrid deep evolving neural networks,","venue":null,"work_id":"5fb3c33f-6280-486f-82e7-a64b8c4c6e25","year":2022},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:50.719001Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:58c437546d6e9aa87f5a10aa6ea2740d8d086aa339b4d6ad5d8c756c410e7d64","observation_id":"121473c8-a8a4-402a-bb27-b0ab77aab99d","resolution":{"observed_at":"2026-08-06T16:53:02.116040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:02.013093Z","title":"Simple-action-guided dictionary learning for complex action recognition,","venue":null,"work_id":"b356f284-a06f-4c31-9aba-3c4bdc1cc1d5","year":2022},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:50.830577Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:72da065f7dc853cabc640fe6e056e43410e1be72c3051f5d631450ac9e83041b","observation_id":"36e68b1f-41af-4cf8-b42b-2f5eebc74e94","resolution":{"observed_at":"2026-08-06T16:53:02.035273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:01.863842Z","title":"Human activity classification using the 3dcnn architecture,","venue":null,"work_id":"e6b407ab-a92b-418d-aa2c-07158f6aa107","year":2022},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:50.937287Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:6290ac00f45407140ac569d1c569b45f902ba3d9af40cea1828b0011acc0c227","observation_id":"6a77b057-5bb1-4b19-9eeb-6b4c9707ba87","resolution":{"observed_at":"2026-08-06T16:53:01.921818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:01.690806Z","title":"Fast classification and action recognition with event-based imaging,","venue":null,"work_id":"4d60fe21-a909-4b30-aac1-74104f387b62","year":2022},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:51.096512Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:577774d7dec8301559158ec08003f997062529863e8186f6bf0dd94416513d5d","observation_id":"46e3ecc0-c91d-4f86-8982-338625a5b2c6","resolution":{"observed_at":"2026-08-06T16:53:01.770390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:01.545539Z","title":"Spatio-temporal features based human action recognition using convolutional long short-term deep neural network,","venue":null,"work_id":"c9ceda3e-8639-40b0-bbd5-28a01d50b340","year":2023},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:51.214457Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:e49e6ee6654159a4cd2299d893d68a854028dfdb6eea776adb645daf96d2da88","observation_id":"04678e70-a280-4266-b2bf-1cbc78009620","resolution":{"observed_at":"2026-08-06T16:53:01.610341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:01.452362Z","title":"Human action recognition using multi-stream fusion and hybrid deep neural networks,","venue":null,"work_id":"72327103-f372-42f3-9585-9c24aa2b43ba","year":2023},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:51.327664Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:104a05b0c3da2eeb693d49f3842ab19b642e94ffb5824bb0f88765e5441bd6d9","observation_id":"26c54948-d8b3-443e-b9b7-c1fb8ddcacac","resolution":{"observed_at":"2026-08-06T16:53:01.479218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:01.391388Z","title":"Self-supervised video representation learning by uncovering spatio-temporal statistics,","venue":null,"work_id":"5459e037-ebbd-4824-befd-afe76c154954","year":2021},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:51.425880Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:8db9a0a4a222bad3d6aae5030d2a55e11fb8d10376002792b9c20d0741f2442b","observation_id":"51710b76-8eed-4762-b895-c9825289873f","resolution":{"observed_at":"2026-08-06T16:53:01.420896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:01.265176Z","title":"Enhancing self-supervised video representation learning via multi-level feature optimization,","venue":null,"work_id":"20b77063-aa7d-4a21-9272-0982719cd6d1","year":2021},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:51.505885Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:7f0d9a3242bd36bb453f6ef23f2339d0c0d50ca560134bba3cce88d0bcb65fe8","observation_id":"7057970c-2ce6-4cfe-a130-d6867f5205b4","resolution":{"observed_at":"2026-08-06T16:53:01.332744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:01.107082Z","title":"Videomoco: Contrastive video representation learning with temporally adversarial examples,","venue":null,"work_id":"b57f2bd7-54a0-4611-8e78-aa1f3de9fea3","year":2021},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:51.608989Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:fb9ac872e779b916bc3ee053e692569ef171e7a8b559fe7b01e14e661ac57139","observation_id":"d59234f2-5c29-47a9-83f8-a177742866da","resolution":{"observed_at":"2026-08-06T16:53:01.169505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:01.022290Z","title":"Action recognition from a single coded image,","venue":null,"work_id":"ac96a79b-6ce1-4541-a4dd-8e8eaa4012db","year":2022},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:51.708625Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:f076d88b4c65c25065ed630317c08b59df8acdd620f6ba1133f298b7f7d9e084","observation_id":"ef665412-a01e-4b14-ae2b-f6664f0c0d74","resolution":{"observed_at":"2026-08-06T16:53:01.043969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:00.915528Z","title":"Tclr: Temporal contrastive learning for video representation,","venue":null,"work_id":"c940e349-298e-4eb8-8e34-e7afb29a13ee","year":2022},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:51.782435Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:f896ab981c9465496f1594c34f5f72aad3af80f4c0670a5357e75cc2008084b2","observation_id":"7c3b9fb0-aafb-4894-bebe-e9dd1baf0f02","resolution":{"observed_at":"2026-08-06T16:53:00.949242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:00.784226Z","title":"Learn2augment: learning to composite videos for data augmentation in action recognition,","venue":null,"work_id":"6e56a0c1-9bad-4ccf-9056-b0928b899d03","year":2022},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:51.887584Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:6fb244ece5b0839d4da088e192e82564b962c73cb17064590cf2eb16299f0ea3","observation_id":"8e4ccfc8-44d5-4f05-b48a-8474961d34c8","resolution":{"observed_at":"2026-08-06T16:53:00.857703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:00.593355Z","title":"Learning from temporal gradient for semi-supervised action recognition,","venue":null,"work_id":"5e9e2939-b4f3-419c-94a5-4a27757a5d5b","year":2022},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:51.993613Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:b75bd0ae35be63212476f034f18233a1f7521edd8eb9efc37fc7b4523d9d6e3e","observation_id":"5e96c946-27dc-4cae-b725-e151ef84c116","resolution":{"observed_at":"2026-08-06T16:53:00.657387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.00506","last_updated":"2022-05-01T16:31:25Z","snapshot_observed_at":"2026-08-04T18:59:10.388793Z","submitted_at":"2022-05-01T16:31:25Z","title":"Preserve Pre-trained Knowledge: Transfer Learning With Self-Distillation For Action Recognition","version":1},"cited_work":{"arxiv_id":"2205.00506","doi":null,"metadata_source":"pith","pith_arxiv_id":"2205.00506","snapshot_observed_at":"2026-08-06T16:52:55.251624Z","title":"Preserve Pre-trained Knowledge: Transfer Learning With Self-Distillation For Action Recognition","venue":"cs.CV","work_id":"3a26ca6b-a6d8-4e10-8469-64e4d135667e","year":2022},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:52.098718Z"},"links":{"cited_paper":"/paper/2205.00506","citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:b2f368166a0462272b6e834371d4dde1b262bb12470aa9ff81bd9d4ffa6f39c3","observation_id":"627c3103-b39a-40f0-aac2-395d19dc5380","resolution":{"observed_at":"2026-08-06T16:52:55.326931Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:00.361033Z","title":"Extreme low- resolution action recognition with confident spatial-temporal attention transfer,","venue":null,"work_id":"05516ce2-e18b-4921-86e1-0529a661cf58","year":2023},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:52.195968Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:77e4d9ed9ad0adfb23eabe46f84e9b3b27a5b51761f54d5a584e826f6e68510f","observation_id":"64a00eee-4644-447b-b2c3-22bcf3d2d01a","resolution":{"observed_at":"2026-08-06T16:53:00.478916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:00.215151Z","title":"Self-supervised video-based action recognition with disturbances,","venue":null,"work_id":"e039025d-6bbc-4371-baa5-6a9d13711288","year":2023},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:52.315336Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:72e1456755aaf00dd102b139bd714d1dcb77ba4d0ae6a8a3a4f6e71504d0397c","observation_id":"0a6f9449-9838-4d17-a28b-95f3b333cdee","resolution":{"observed_at":"2026-08-06T16:53:00.286153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:00.080022Z","title":"Spatial-temporal exclusive capsule network for open set action recognition,","venue":null,"work_id":"0b696afe-4c53-41f4-9427-178731a00e7f","year":2023},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:52.428855Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:39ce82939c385cd165c9fe65906ed89853de81ea8a68b25ecf611b89e6f7e883","observation_id":"24aaf547-bc02-420f-8f6f-ae968884f75f","resolution":{"observed_at":"2026-08-06T16:53:00.146160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:59.933671Z","title":"Sv- former: Semi-supervised video transformer for action recognition,","venue":null,"work_id":"ca2e28c6-1c1d-4ae4-bfb6-c8e7602f0a49","year":2023},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:52.509199Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:125948fdc8ad61167ad2faacaa4ee3c4d280c1425c8a509582eea429cf591438","observation_id":"7cff12ac-649e-46be-b717-016115aaf030","resolution":{"observed_at":"2026-08-06T16:52:59.986980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11654","last_updated":"2024-01-22T02:21:26Z","snapshot_observed_at":"2026-07-06T17:18:32.330256Z","submitted_at":"2024-01-22T02:21:26Z","title":"ActionHub: A Large-scale Action Video Description Dataset for Zero-shot Action Recognition","version":1},"cited_work":{"arxiv_id":"2401.11654","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.11654","snapshot_observed_at":"2026-08-06T16:52:55.128625Z","title":"ActionHub: A Large-scale Action Video Description Dataset for Zero-shot Action Recognition","venue":"cs.CV","work_id":"6d1eb68c-0bd6-4070-a0d0-387c9b154cf7","year":2024},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:52.604016Z"},"links":{"cited_paper":"/paper/2401.11654","citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:f3dec5e5269eb25a06da7abe8f426f52c37462d75d326e8b44be3122aa04a901","observation_id":"6e74282b-f332-4229-bd4c-a2008662ed7a","resolution":{"observed_at":"2026-08-06T16:52:55.174880Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:59.730876Z","title":"Self-supervised learning via multi-transformation classification for action recognition,","venue":null,"work_id":"395711c9-51c7-46f4-8e13-af74b5a25a20","year":2024},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:52.730793Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:2a531afa07323f3e2f808430116a94cc9d0338bf12749f7fbf9363f4c6ed47eb","observation_id":"3ac35da3-01a0-4f25-8917-be0cde4a5013","resolution":{"observed_at":"2026-08-06T16:52:59.802805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:59.483213Z","title":"Semi-supervised action recog- nition with dynamic temporal information fusion,","venue":null,"work_id":"e6df6188-e660-44ec-a49a-aa3380f8ead0","year":2024},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:52.788124Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:454442516465b1db40c8ebf00db19014fb24be51d3d9c42e390acfcaa148b5a6","observation_id":"48d46bd4-9904-490f-9eaa-43495d8f3c7f","resolution":{"observed_at":"2026-08-06T16:52:59.610844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:59.357219Z","title":"Spatiotemporal contrastive video representation learning,","venue":null,"work_id":"b972e908-20c5-426e-9883-1990164f016d","year":2021},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:52.852312Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:8b16f9bf4f06d17bab3a44648c616a436578f6e70b00d41da7157cf61647c45e","observation_id":"fa98add2-c079-44e4-aac9-8e0bc6c79754","resolution":{"observed_at":"2026-08-06T16:52:59.422918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:59.204333Z","title":"Representation learning for compressed video action recognition via attentive cross- modal interaction with motion enhancement,","venue":null,"work_id":"225af9e8-cc12-42b4-b785-9ab10a0fa095","year":2022},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:52.921579Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:2ae6163d17a3d521a323c445ec5fe31bc12739e18254c2fa6166b7ac5d9319db","observation_id":"9dd942c3-2298-4b33-bc85-24eb0ffdef8a","resolution":{"observed_at":"2026-08-06T16:52:59.292874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:59.096821Z","title":"Motion-driven visual tempo learn- ing for video-based action recognition,","venue":null,"work_id":"a4739dd7-b3aa-419a-a12c-73a0820afabb","year":2022},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:52.991457Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:ad046b25f3abe53fb4ce00417132202003eefddefa116b76183ab3d8e3346fd6","observation_id":"001c1faf-2447-4562-8b39-aec022990205","resolution":{"observed_at":"2026-08-06T16:52:59.149388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:58.893205Z","title":"Learning spatiotemporal and motion features in a unified 2d network for action recognition,","venue":null,"work_id":"1abda6a3-8435-42ec-a780-2b283aa8bdf5","year":2022},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:53.056544Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:9d619f3e285e1e5cec6c1cfb81c263e7de1a3e033d3d1c365e84c43d7dbab2c4","observation_id":"1fea8405-db0e-418c-a4ed-095cc6fcfc9b","resolution":{"observed_at":"2026-08-06T16:52:58.958930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:58.749122Z","title":"Vit-ret: Vision and recurrent transformer neural networks for human activity recognition in videos,","venue":null,"work_id":"46d83dc8-25a0-4c87-a084-a2eec868ddf0","year":2023},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:53.175022Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:b1a4980fb050619cb02cf7b702e23678b7c8ffc851b179acfc89edf10a953b3c","observation_id":"72f9b3c9-d38f-4a75-b885-c9606e8b1c55","resolution":{"observed_at":"2026-08-06T16:52:58.805940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:58.587576Z","title":"Spatial-temporal interleaved net- work for efficient action recognition,","venue":null,"work_id":"7888202d-faaf-41f7-aafa-da073214396f","year":2024},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:53.283537Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:5421694abacc3c26dbef11b48b9b6835d02e3ec2c4c56daa7ea8feffe15f0048","observation_id":"6274f1a9-a5e3-4101-ace2-d631abf33154","resolution":{"observed_at":"2026-08-06T16:52:58.668315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:58.367876Z","title":"A hybrid transformer framework for efficient activity recog- nition using consumer electronics,","venue":null,"work_id":"d61213cd-3630-4528-b90c-ede845d377eb","year":2024},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:53.396459Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:ba88ccfdb256a766b814d2199d27462f5296702e0ea02e737e5f9e6cfbb5636f","observation_id":"35e04df3-1d2c-4336-90ce-67622692a76b","resolution":{"observed_at":"2026-08-06T16:52:58.469065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:58.222995Z","title":"A knowledge-based hierarchical causal inference network for video action recognition,","venue":null,"work_id":"32a50469-02f4-4710-92d9-971205949310","year":2024},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:53.500055Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:508714fb3be8b0dab8faabd9558730d487170adb44618af0735830344990ad9d","observation_id":"affa9eb6-feaf-49ce-ac9c-4e00473fd572","resolution":{"observed_at":"2026-08-06T16:52:58.287590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:53.559512Z","title":"Is space-time attention all you need for video understanding?","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:53.559512Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:a6a0718002d8f243761d79f0e9481eb7ce7b8494d5c9938da8971f4eabf23898","observation_id":"158182ec-519a-4c5b-9884-f96baf7d8dfb","resolution":{"observed_at":"2026-08-06T16:52:53.559512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:58.044289Z","title":"Vidtr: Video transformer without convolutions,","venue":null,"work_id":"55ffb34b-f9fe-4413-8258-661784939003","year":2021},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:53.632514Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:690e5fd9922e6797a676409451b84e6b9b42f6a8b19860e6ca79ddc2df1899e9","observation_id":"070b335d-9239-4dfb-b0cb-f10f38c64ee1","resolution":{"observed_at":"2026-08-06T16:52:58.141635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:57.918773Z","title":"Keeping your eye on the ball: Tra- jectory attention in video transformers,","venue":null,"work_id":"70e50689-517c-4dea-a204-f6529c7cd7d6","year":2021},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:53.714960Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:2fe5b1bf422f6a4fcf3cc78b737f68d3d1664ade3af5fdeb36e25eee3ca00c2e","observation_id":"cc5a6118-9795-47ed-af13-2a4b5f8d00de","resolution":{"observed_at":"2026-08-06T16:52:57.961367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:57.737084Z","title":"Multiscale vision transformers,","venue":null,"work_id":"061d5e46-4418-4a2c-835b-a8bee2166b32","year":2021},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:53.837040Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:7ce05981e3cb9e8ee5151f8aec97140b407fc23967d882cd2b8bfbe98d89e0b8","observation_id":"7be14330-1fd3-4783-b88b-c3567693fad5","resolution":{"observed_at":"2026-08-06T16:52:57.813054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:57.631587Z","title":"Multiview transformers for video recognition,","venue":null,"work_id":"ce48a6d5-2fea-445d-b504-806704e01086","year":2022},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:53.978259Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:fe56e1e99c4871bc29ed4b4b5cf6b3524db85f0d3b4d8bff6e51d01dbd5990c9","observation_id":"30bfd305-887a-4872-9621-edd153208baf","resolution":{"observed_at":"2026-08-06T16:52:57.677629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:57.521633Z","title":"Video swin transformer,","venue":null,"work_id":"965d39e6-d41a-4e10-9e7e-c8512a757bba","year":2022},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:54.063447Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:98316416d8f553d7577c6456e3f6bf320dfbad362e7b1f4ce8a3f04293c56d35","observation_id":"f796a309-6d28-429e-ab81-1870fb80b295","resolution":{"observed_at":"2026-08-06T16:52:57.567092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:57.379389Z","title":"Mvitv2: Improved multiscale vision transformers for classification and detection,","venue":null,"work_id":"95ddfaf1-2356-45e6-b92c-8fc99d94e238","year":2022},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:54.121446Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:1152c616463c5914c05756dd672d7f86b528d6990eb7a245057f3b704d9abea9","observation_id":"7af3d5bd-983f-4ee8-a0c6-9cd773fde5e9","resolution":{"observed_at":"2026-08-06T16:52:57.452633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:57.234935Z","title":"A novel spatio-temporal-wise network for action recognition,","venue":null,"work_id":"2b31876c-dd99-4a18-994a-c6ec2ef904ca","year":2023},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:54.207067Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:2b051e6fbe4d2ce39d909418a810b5825dabe3cc285a8c88a8a56f5eeefc91d4","observation_id":"1ac19103-74cc-4d7a-b7f4-eef175cdbd75","resolution":{"observed_at":"2026-08-06T16:52:57.285877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:57.099700Z","title":"D-tsm: Discriminative temporal shift module for action recognition,","venue":null,"work_id":"f68ec587-f051-4442-8ebd-eaae34189dba","year":2023},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:54.282421Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:107fe6c8f8464cd26016bb30954b71c2ca72e87244f4c12548c3ee9732bf8f0a","observation_id":"bf3879a6-426f-4218-82e6-3ee66704101c","resolution":{"observed_at":"2026-08-06T16:52:57.163489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:56.955623Z","title":"Scene adaptive mechanism for action recognition,","venue":null,"work_id":"e021c0b9-4c0f-4db4-a223-f22a20c6bf98","year":2024},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:54.344367Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:859a06741dc25227e2c05f8a20cb1febc942519b6a6ef0f7b0ff22c2c9cf2dff","observation_id":"e352fb0d-f249-40ef-b2c8-c164288a4a29","resolution":{"observed_at":"2026-08-06T16:52:57.021801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:56.800196Z","title":"Sta+: Spatiotemporal adaptation with adaptive model selection for video action recognition,","venue":null,"work_id":"123943e3-aa6b-48a2-b1e6-86d614c0b29f","year":2024},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:54.396120Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:f3222e0cc73a2291877a9ecfc3fb56cf81cfbd62d1daf82a02caafe7d3b52a32","observation_id":"8affa414-54cd-4ff1-b837-4f01b33aaef0","resolution":{"observed_at":"2026-08-06T16:52:56.855411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:56.650750Z","title":"Short-term action learning for video action recognition,","venue":null,"work_id":"2afbd62d-abd9-489c-8224-4422a9e8d9e2","year":2024},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:54.487275Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:b14f6ad8dcaa9481f2bad3badf646aca72438c6c371ce3cc6618c40b24508d74","observation_id":"bab42be6-c522-4b76-95fa-665b474a8812","resolution":{"observed_at":"2026-08-06T16:52:56.720156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:56.501800Z","title":"Tea: Temporal excitation and aggregation for action recognition,","venue":null,"work_id":"8980297f-5566-4e8f-aab7-6e61e45defc4","year":2020},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:54.566351Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:5929b5d09ff0cd2a6218c2476f9dd21245f2374d5952e67e321fbf6c71055694","observation_id":"75ed9bf1-ed5b-4bae-a3e7-d754c807b0ba","resolution":{"observed_at":"2026-08-06T16:52:56.585739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:56.292710Z","title":"Movinets: Mobile video networks for efficient video recogni- tion,","venue":null,"work_id":"aaab900b-6fb6-45f3-8e5d-d20fda34f553","year":2021},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:54.657092Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:e544745507e9014a5648a723009a571ba67eb5bf7fd911d654f5bb0945739804","observation_id":"1c59ee0d-d2d0-4368-8eab-645b74f76a7e","resolution":{"observed_at":"2026-08-06T16:52:56.394162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:56.122248Z","title":"Timebal- ance: Temporally-invariant and temporally-distinctive video represen- tations for semi-supervised action recognition,","venue":null,"work_id":"6f12b9d2-03d3-4e26-a1a1-848ffaf7493b","year":2023},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:54.746931Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:0998562c2afea34cb9bce74e2f891702d43df565c7d6e65fa1cbc2013d0db599","observation_id":"3901d6cc-435a-4bb1-87dc-5176f6e73f41","resolution":{"observed_at":"2026-08-06T16:52:56.180372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:55.965484Z","title":"Dilated multi-temporal modeling for action recognition,","venue":null,"work_id":"f1fdf970-c93f-4207-9626-4ba225e05c7a","year":2023},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:54.862860Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:2fbc03aa8d93dbcfefe82e211e4fc49f18cf36d66c395ce000cd018727f63533","observation_id":"89d04c6f-4153-4f0e-b987-06a169856d17","resolution":{"observed_at":"2026-08-06T16:52:56.035863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16416","last_updated":"2024-04-25T08:49:08Z","snapshot_observed_at":"2026-07-06T18:05:25.418545Z","submitted_at":"2024-04-25T08:49:08Z","title":"Learning Discriminative Spatio-temporal Representations for Semi-supervised Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16416","snapshot_observed_at":"2026-08-06T16:52:54.894113Z","title":"Learning discriminative spatio- temporal representations for semi-supervised action recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:54.894113Z"},"links":{"cited_paper":"/paper/2404.16416","citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:364b764baf034ef3a62bff73374527a5f917ec4bd6f35978f5b87bebe8c2276a","observation_id":"2d9693e9-22a7-4efb-9789-44932768db2c","resolution":{"observed_at":"2026-08-06T16:52:54.894113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:55.769765Z","title":"Discrimina- tive segment focus network for fine-grained video action recognition,","venue":null,"work_id":"159daac6-1296-4977-8b7c-80c634851e34","year":2024},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:54.944965Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:ebf2ababb17fa273abaa89081d13569f8b8d6ba37e50c8bc65e82bf55aea38f2","observation_id":"a4bdf994-b313-41e5-a2f3-029c2ad88fd7","resolution":{"observed_at":"2026-08-06T16:52:55.869769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:55.592538Z","title":"Temporal difference attention for action recog- nition,","venue":null,"work_id":"900a19d2-fa3b-4ae0-b31c-6df4abe68d8c","year":2024},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:54.978639Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:17ae03d30ba9dfaec4cbc43ada9e7999e669c602f137459ef5505b386b09576d","observation_id":"37f17f06-1d35-4c0e-ad1f-0514af327267","resolution":{"observed_at":"2026-08-06T16:52:55.666237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:55.437347Z","title":"An efficient motion visual learning method for video action recognition,","venue":null,"work_id":"cacc84f3-e1c8-4910-bc5f-f1aecae2db48","year":2024},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:55.019874Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:373a77135ca80f6b8a1d88432e19bdffa0d77976dd28004b48ec6941b04af535","observation_id":"62891965-1003-479c-9435-0d893005c4e6","resolution":{"observed_at":"2026-08-06T16:52:55.515616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T16:43:39.025858Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition"},"reference_resolution":{"displayed":95,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":2,"verified_fuzzy":70},"total_outbound_references":95},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 95 of 95 outbound references and 0 inbound Pith citation observations for arXiv:2507.12426."}