{"as_of":"2026-08-13T12:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2799e992e521752f5fa1afbf21020e093d1e1254d275fc6151da93cd3d1d5002","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:27:40.342777Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.06691/citation-record","integrity":"/paper/2608.06691/integrity","json":"/paper/2608.06691/citation-record.json","paper":"/paper/2608.06691"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:41.088162Z","title":"Vu: Edge computing-enabled video usefulness detection and its application in large-scale video surveillance systems,","venue":null,"work_id":"41b83d04-99f2-4088-b322-adb0e47ee6e7","year":2019},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.047787Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:9bff87a61463fa7835b97f8e50333549843d9d942cfdb6299ba1e0f914336d74","observation_id":"6446068b-9e34-46da-863a-200742939566","resolution":{"observed_at":"2026-08-10T22:27:41.091673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:41.077467Z","title":"Strack: Robust tracking of small objects in low-light conditions,","venue":null,"work_id":"565d1879-8139-4a85-8be6-55772306b791","year":2025},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.052470Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:6da0d5e0612b64d858e756bc76eb909e13eee31a3da3b426f0d80810be811431","observation_id":"ce831a05-68bd-4a0a-a1f0-4452f79e0f5e","resolution":{"observed_at":"2026-08-10T22:27:41.081127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:41.066961Z","title":"Ai-driven salient soc- cer events recognition framework for next-generation iot-enabled environments,","venue":null,"work_id":"97809960-9ecf-4a1a-bd7f-77dfefdd1048","year":2021},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.056292Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:3a95df1c0019d4392bfce8b620122259f96048a7dbac77abcaf634d193614b0b","observation_id":"aa017a64-7f5d-47e8-badd-372457076fed","resolution":{"observed_at":"2026-08-10T22:27:41.070793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:41.056126Z","title":"Contactless patient care using hospital iot: Cctv-camera-based physiological monitoring in icu,","venue":null,"work_id":"24ad56f5-74af-4862-83e9-ca84a7923b58","year":2023},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.060762Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:3275c72c00302bcb54acd8021ef1f72396390a9a4accada12022ec9c94cd23a0","observation_id":"489c6eb2-a67e-4f79-9813-2dc873cac505","resolution":{"observed_at":"2026-08-10T22:27:41.060164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:41.045664Z","title":"Optimization for short video propagation based on user interaction analysis in edge networks,","venue":null,"work_id":"fd58b11f-28e3-4d8c-9604-42176e8f66cd","year":2025},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.064561Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:9be0417f8598531cc8df59710d5d30baef7659ae99f8b4515c5e8f487ddc8591","observation_id":"7f4c3b93-3727-45f8-97f0-411502ac4afc","resolution":{"observed_at":"2026-08-10T22:27:41.049380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:41.035154Z","title":"Panacea+: Panoramic and con- trollable video generation for autonomous driving,","venue":null,"work_id":"eded80da-0486-4c24-b611-68fed1641bb5","year":2025},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.068617Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:c3cf208875f9245af36fd8b72264f6680c67367afbc29ccd1aae29e8f0a6425e","observation_id":"5641c2eb-0d0e-484a-9bc2-6e31e5cff03f","resolution":{"observed_at":"2026-08-10T22:27:41.038910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:41.024532Z","title":"Tracenet: A novel modular frame- work for robust multi-object tracking in crowded and dynamic environments,","venue":null,"work_id":"cf43fb10-de89-4079-8ba2-6c9cb766ed08","year":2026},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.072808Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:3349b55c973c81a42a7fe2139ecee210cd92f66bb1d046fd8923317d5381d5a5","observation_id":"825c093c-b36f-477d-9b78-c422c4a7b4cb","resolution":{"observed_at":"2026-08-10T22:27:41.028248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:41.012898Z","title":"Hamot: A hierarchical adaptive framework for robust multi-object tracking in complex environments,","venue":null,"work_id":"ef8da640-c581-46b6-adbb-83813121bbc0","year":2025},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.076547Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:9e6d2abbd2441f24885bd1e9c576371bb42486340e31deb8230ac77fabe96782","observation_id":"3ec1f5fc-3d76-4fe4-9268-6e610af93803","resolution":{"observed_at":"2026-08-10T22:27:41.016711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:41.003108Z","title":"Imagenet classifi- cation with deep convolutional neural networks,","venue":null,"work_id":"b77fb17c-6016-412c-9780-2d387063f9ad","year":2012},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.079916Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:9d7576105645d3a7aaa2efa6b61a801acd3c88fc11ee5063a54bad34360450d9","observation_id":"6b0a8d14-7003-4e49-ab4f-41958b95d69c","resolution":{"observed_at":"2026-08-10T22:27:41.006540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.993005Z","title":"Facelivt: Face recognition using linear vision transformer with structural reparameterization for mobile device,","venue":null,"work_id":"9bf1a60d-adfd-438c-8864-df23f2ece089","year":2025},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.083436Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:b99c33eca84e4249331205a9af96b0d06ff9af112708142493543a723e1b1e0c","observation_id":"1b672238-dcfa-4771-92ed-e303f32fa285","resolution":{"observed_at":"2026-08-10T22:27:40.996640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.983151Z","title":"Facelivtv2: An improved hybrid architecture for efficient mobile face recognition,","venue":null,"work_id":"6b75bdfd-3c69-4f62-9508-ba025a362ca5","year":2026},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.095593Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:a6ebd319dd0bc83aa9cc67ab99b37cbd0004ad8e1c8c1d639214f6358ef4db5e","observation_id":"aba0f7d5-da88-4d41-8800-d78c7bbcb1e0","resolution":{"observed_at":"2026-08-10T22:27:40.986791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.973017Z","title":"Video analytics for detecting motorcy- clist helmet rule violations,","venue":null,"work_id":"ac24eeba-d1bb-4394-b449-32b820c8aafc","year":2023},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.100508Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:14300ed5e30d7d1b6832dbc063551436b5dcff251506303918ad886e299458c2","observation_id":"d4e927d7-c21b-4282-aa1c-e235fa952a32","resolution":{"observed_at":"2026-08-10T22:27:40.976884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.962875Z","title":"Smiletrack: Similarity learning for occlusion-aware multiple object tracking,","venue":null,"work_id":"94ed884d-1e24-46a7-903c-9b113b558f40","year":2024},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.104805Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:dbd0337882241a477e98f01bf76c7bb4616540afc7ed432858ce8ee4dc26e810","observation_id":"115cada3-891f-4498-be39-4a779f6fad24","resolution":{"observed_at":"2026-08-10T22:27:40.966465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.952413Z","title":"Lighttrack-reid: A lightweight and occlusion-robust framework for multi-object tracking,","venue":null,"work_id":"afcd5aa6-db58-425e-a205-b4cc3a632dab","year":2026},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.109170Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:ffd379bc60ef7ece0fe752cef4656d0b65446760a117ea22b76bf676e93d14dd","observation_id":"25b79e1e-d969-478c-a333-1a8b44984e81","resolution":{"observed_at":"2026-08-10T22:27:40.956229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.941638Z","title":"Ssp-sam: Sam with semantic- spatial prompt for referring expression segmentation,","venue":null,"work_id":"56667418-498e-4698-baeb-14d136a31e83","year":2025},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.113254Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:a44da103b8a38dc1f1eb33a4362d7b7aa45c161f796f773ffa4c2ed5f7d528b8","observation_id":"07a36462-cc76-463d-bd06-260ce87bd08d","resolution":{"observed_at":"2026-08-10T22:27:40.945255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-08-12T17:34:19.526460Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-10T22:27:40.117497Z","title":"Ucf101: A dataset of 101 human actions classes from videos in the wild,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.117497Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:52e4d31a351dcfe35732a16301961cf6c54927071fac093a646930353047b00e","observation_id":"8615bf5f-10dd-46d8-89f3-c23fc20a300f","resolution":{"observed_at":"2026-08-10T22:27:40.117497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-08T17:46:50.107463Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-10T22:27:40.122220Z","title":"The kinet- ics human action video dataset,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.122220Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:21d6eb3c7bdd505b3ac631e5c146e71fa94e9802e39f70c827393524fbff92f3","observation_id":"7a7efa79-b9ab-498f-91ff-58d8ccba52e3","resolution":{"observed_at":"2026-08-10T22:27:40.122220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.930769Z","title":"Benchmarking micro-action recognition: Dataset, methods, and applications,","venue":null,"work_id":"7680c6ab-6180-4edf-a31d-ba275d311616","year":2024},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.127281Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:58b431a8907e77018129fddbb201a8727d0a737d85cc98c45f3f84edf676c5f3","observation_id":"1194cf6b-2017-4347-9730-afaeed236a1f","resolution":{"observed_at":"2026-08-10T22:27:40.934657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.918838Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset,","venue":null,"work_id":"e2961f49-d91d-428b-8986-839c2d1cb70e","year":2017},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.131656Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:2104550c9d2213cd183665637daec87db3bc56e12993337ec0c084cddd31a603","observation_id":"4b4263b8-20be-4149-8965-c717202842b3","resolution":{"observed_at":"2026-08-10T22:27:40.922436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.908378Z","title":"Slowfast networks for video recognition,","venue":null,"work_id":"cf9caa8e-bd79-482e-b097-8cfa194bf7c2","year":2019},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.136067Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:5e0d8559fc57f3bfa0d8ba204d2239e76950aa4211f7e5dcd7f6fdfb09ba0209","observation_id":"62e2f2dc-7870-41a3-9d90-46fc76f28263","resolution":{"observed_at":"2026-08-10T22:27:40.911990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.898412Z","title":"Spatio- temporal adaptive network with bidirectional temporal difference for action recognition,","venue":null,"work_id":"7153505c-407a-4c57-a34b-d700b90a6a98","year":2023},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.139961Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:f571c801c5bbfdbdd421f7bb0004b9bb86a24396991ae7cd574e80259f418fd7","observation_id":"26ea1807-0044-45b1-ba10-5c8df18bb87c","resolution":{"observed_at":"2026-08-10T22:27:40.901766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.888645Z","title":"Agpn: Action granu- larity pyramid network for video action recognition,","venue":null,"work_id":"a88b9856-67bf-4455-8b7e-58e658e78950","year":2023},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.143943Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:29f11b4552527b5d41b27067f031c01e257330f8dafdf82ff7411ca0aaa0b8e7","observation_id":"cc2b007b-c9da-4e9b-8851-659392ae8da2","resolution":{"observed_at":"2026-08-10T22:27:40.892327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T02:40:23.887636Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-10T22:27:40.148881Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.148881Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:b078586c22795b0ad7e7bdd8be39260ef22d1653054381f97e37827ec945948e","observation_id":"8fd14a40-fad8-4ce5-9bab-b86567274927","resolution":{"observed_at":"2026-08-10T22:27:40.148881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.878739Z","title":"Is space-time attention all you need for video understanding?,","venue":null,"work_id":"69c47844-2be8-49be-8da3-4e1921c35351","year":2021},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.153414Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:c8620b3de7960c175c65a36b9fe9bf8c0e9ea260f43be2dbcb4eaf37634e5140","observation_id":"e8798e85-d7cd-470b-bb11-a27c9dec6e2c","resolution":{"observed_at":"2026-08-10T22:27:40.882379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.868607Z","title":"Video trans- former network,","venue":null,"work_id":"10118c23-0d19-498c-9d38-0f8ea6ecc96d","year":2021},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.157498Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:b5c380973ca20b4bc714b0932d0054e23ea2afd90e14443077194641187ddc98","observation_id":"ce33abab-ab98-4780-a598-eb9d8d758f4d","resolution":{"observed_at":"2026-08-10T22:27:40.872162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.857576Z","title":"Video swin transformer,","venue":null,"work_id":"43ec1333-4da0-4f3c-a70a-b3ad584c2482","year":2022},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.161526Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:a51873b02bee7afafe30b6ae048e822cb698cdaae9e700883f3b9176eda539c8","observation_id":"3044da5a-160d-4259-a067-821e792a9988","resolution":{"observed_at":"2026-08-10T22:27:40.861137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.845509Z","title":"Uniformer: Unifying convolution and self-attention for visual recognition,","venue":null,"work_id":"be076afa-5a1a-45cb-99b3-a13ec395247b","year":2023},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.165668Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:d8e1ab9d26e61e4e2616b7fa5fd842380df32813eb6e0cc9229773e43f702348","observation_id":"b0bc3023-a163-4fef-a986-30e193666464","resolution":{"observed_at":"2026-08-10T22:27:40.849775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.834906Z","title":"Token shift transformer for video classification,","venue":null,"work_id":"7bfa3fee-494f-4632-acd4-a9f5bd228e26","year":2021},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.170393Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:250ef9441b13908b57b6c53ebe3a40fef83791b7e9d2b86a823ccbe0327f161c","observation_id":"3960f5b7-2ff6-40aa-9cf1-c12ea214b332","resolution":{"observed_at":"2026-08-10T22:27:40.838731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.824034Z","title":"Long-term leap attention, short-term periodic shift for video classification,","venue":null,"work_id":"0069da89-dc29-4e93-8787-dc055de5138b","year":2022},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.174913Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:46fe2bc1d4ce79c7056b46f5477207f70992ab59466088b388195407287ea9d4","observation_id":"463272fb-7394-4e9a-9dfe-22b32e2c2ab8","resolution":{"observed_at":"2026-08-10T22:27:40.827829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.813677Z","title":"Temporal shift module-based vision transformer network for action recognition,","venue":null,"work_id":"1a5417e2-729f-4ff8-8b7e-32a4b2938eec","year":2024},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.179422Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:cd47a39a1b5332654b0c395b5d1b71845da75b5d8ac81044bfcb3e210f486aa4","observation_id":"1414484c-054b-4516-a2f6-83214a961ae3","resolution":{"observed_at":"2026-08-10T22:27:40.817466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.803090Z","title":"Tsm: Temporal shift module for efficient and scalable video understanding on edge devices,","venue":null,"work_id":"e2196282-3bc4-4d2a-954e-3b0007faa9a0","year":2022},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.183365Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:5184d8f3fb65f7e3d9bc751ef9da803e69b9cf2fedf7d7c6af54ea823d5656b7","observation_id":"04d9fdcb-6eab-4b31-a445-aeea2fb72618","resolution":{"observed_at":"2026-08-10T22:27:40.807475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.792810Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":"6a710e46-772a-42ed-8303-0f1d89ed403f","year":2016},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.187289Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:a34ec1ba358d4c56d1ecf6e843ed23df6a9716f5fb2296c188b752e418354f45","observation_id":"0bf1222e-5649-486f-96a1-aa4919480ef8","resolution":{"observed_at":"2026-08-10T22:27:40.796691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.782319Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows,","venue":null,"work_id":"97fa5c44-e77b-4a78-b298-ac0f08e43526","year":2021},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.191220Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:eeb56b1fc84b78827a2a8b30d17ac00b997e95d7a726b18175dcbae642078d5e","observation_id":"772b8dea-c713-446b-9342-447d31407942","resolution":{"observed_at":"2026-08-10T22:27:40.785994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.771492Z","title":"Movinets: Mobile video networks for efficient video ACCEPTED ON IEEE INTERNET OF THINGS JOURNAL 15 recognition,","venue":null,"work_id":"4aa76c6c-a97e-4c8c-8bd9-0a5ebbac8ab4","year":2021},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.195231Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:6665953982e9ec9635ad0857df256eacdd22fa03398c68c307fad4bbf6fa6fcd","observation_id":"6ad807c0-1c73-4d7f-9606-7e8fdd14d417","resolution":{"observed_at":"2026-08-10T22:27:40.775546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.760869Z","title":"Deepsensemoe: Harnessing power of time series foundation models for few-shot human activity recognition,","venue":null,"work_id":"e1cb021a-86ec-4e04-bc1b-29fd376eb8c3","year":2026},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.198969Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:206f30828e846a59b1d24af625e4e6523391855f7db28e60409b1d07b26bc6af","observation_id":"9d08b420-9f98-4c2b-b032-70a8f1cb964e","resolution":{"observed_at":"2026-08-10T22:27:40.764881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.750390Z","title":"Sensor- prompt tuning: Aligning time series foundational models with motion sensors for few-shot activity recognition,","venue":null,"work_id":"2b5d9bb1-563b-49f3-957a-6fd74af63ea8","year":2026},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.203337Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:591f7be24ea4b7281f2365f33b024d4e35e43d50caab0f4409c20a8a10dfa847","observation_id":"6c045643-67e1-4125-b284-596da58b7944","resolution":{"observed_at":"2026-08-10T22:27:40.754344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.739622Z","title":"Deep convolutional state space model as human activity recognizer,","venue":null,"work_id":"2421f833-5848-49f5-8f1f-f32d68633add","year":2025},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.207439Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:80ed4f024bad42d1075eb5b60156a1718f806f4460107303abe850f9d66b72ac","observation_id":"5bc425de-23e7-4ef0-8155-74d804e89a77","resolution":{"observed_at":"2026-08-10T22:27:40.743235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.729342Z","title":"Learn- ing spatiotemporal features with 3d convolutional networks,","venue":null,"work_id":"c44588a6-18ce-4382-a50a-bfeb8b9e45b9","year":2015},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.211573Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:44c1b695cc1621d2c84eb5e7b17a5e8c5587547445787627512b7cbbadf521e1","observation_id":"b542c21c-f478-417e-8558-f9abb5e7654c","resolution":{"observed_at":"2026-08-10T22:27:40.732960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.718887Z","title":"A closer look at spatiotemporal convolutions for action recognition,","venue":null,"work_id":"67f56a05-e769-4260-847e-845ee3b57345","year":2018},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.215876Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:621989ca0a7bfd63b6ecc9e643749bd9feb5fa35b5b2ad23cbb6cfd4f00ffb76","observation_id":"c064a65e-95c7-4a90-bfcd-e2333808ac90","resolution":{"observed_at":"2026-08-10T22:27:40.722844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.708539Z","title":"Tsm: Temporal shift module for efficient video understanding,","venue":null,"work_id":"1bf40c6d-c50e-4531-aaec-b3908a4b5cd6","year":2019},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.220270Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:91a689fc0c81c34ecd190d5165646d4f97a9a6ad117dc4c35c9654ff2e8b3fde","observation_id":"889b1fdd-02e0-4eff-96ba-2b1ae6d532b6","resolution":{"observed_at":"2026-08-10T22:27:40.712154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.698423Z","title":"X3d: Expanding architectures for efficient video recognition,","venue":null,"work_id":"7a1cfc1a-13f5-4da8-b503-14479bf3c3d0","year":2020},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.224379Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:81d6cffd5d5cc552df01360698fc72dda025aa6df14b3352e4dfcaac37f1688f","observation_id":"3d071749-dd3b-42a2-9c07-3981aa196216","resolution":{"observed_at":"2026-08-10T22:27:40.701981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.687978Z","title":"Mtrfn: Multiscale temporal receptive field network for compressed video action recognition at edge servers,","venue":null,"work_id":"9cbe6651-dbcf-43e9-8510-088c56fc6647","year":2022},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.228568Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:4291e69f9c779e5e9f7aad8bb3119ae63f5084cf8e221d37d921ce7aca28d2eb","observation_id":"729c1e57-65a2-4d73-81cb-26df37db1c56","resolution":{"observed_at":"2026-08-10T22:27:40.691571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.677365Z","title":"Temporal transformer networks with self-supervision for action recognition,","venue":null,"work_id":"149841f5-2fe7-43d3-a1ea-e195ce522b88","year":2023},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.232932Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:d6ee8dcb69ecee9036acfec365159c4f756440cc25925ed9ac24608fe7f91f57","observation_id":"5b77e6e9-d2db-4631-b17f-7e60f9a968b0","resolution":{"observed_at":"2026-08-10T22:27:40.681114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.666463Z","title":"Pyramid vision transformer: A versatile backbone for dense prediction without convolutions,","venue":null,"work_id":"76cfad3c-66b9-4682-81b9-19760bbb30e8","year":2021},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.237403Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:1abc22b4316b427444669fc79bd92f1694f97f6946d3b18eb385c78c98e7c4fd","observation_id":"95c756aa-a568-4c49-a90c-ce7b5bfe3865","resolution":{"observed_at":"2026-08-10T22:27:40.670335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.654408Z","title":"Pvt v2: Improved baselines with pyramid vision transformer,","venue":null,"work_id":"926a06b6-27fe-4f03-a6c6-e46b051340c9","year":2022},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.241727Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:0c8934df1ca0b2e036e23905cd309a4200f1e8dd4d43121f95e4fa04fc3712ad","observation_id":"d1b090fb-e234-4404-a965-50a561d4c5b5","resolution":{"observed_at":"2026-08-10T22:27:40.658243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.643009Z","title":"Edgenext: efficiently amalgamated cnn-transformer architecture for mobile vision applications,","venue":null,"work_id":"28bb0cc8-f84a-4261-b554-f093f8d42e76","year":2022},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.246619Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:f159447149c62646698a34b2b21eacc87065e5dfa48a3e2825cb768657ef93af","observation_id":"ccbfb6c9-0cfc-4c6e-9830-bf21875327dd","resolution":{"observed_at":"2026-08-10T22:27:40.647566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.631237Z","title":"Fastvit: A fast hybrid vision transformer using structural reparameteriza- tion,","venue":null,"work_id":"da0483e5-27b0-4ef2-9c1c-f5d022bbf8bc","year":2023},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.251729Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:c11354bbaff4ce4630f35bc17626f7109d85be006bc75ee14a3c140cd7186e26","observation_id":"1b78b9a3-814b-45ac-a18d-ab3b3aaca3e9","resolution":{"observed_at":"2026-08-10T22:27:40.635765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.621054Z","title":"Effi- cientvit: Memory efficient vision transformer with cascaded group attention,","venue":null,"work_id":"cc3d351d-8ab5-4db4-949a-1c1650c45177","year":2023},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.257204Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:da08f92b5719a7bdeba92d03ec6378a39369daa81945b452e28ef2d81ecf4dcb","observation_id":"752c26c3-a8d0-481d-9f8c-6dfbf5cc5ae8","resolution":{"observed_at":"2026-08-10T22:27:40.624674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.611384Z","title":"Rethinking vision transformers for mobilenet size and speed,","venue":null,"work_id":"3ad734f8-394c-41f0-874a-7b202fee44bc","year":2023},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.262591Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:64fc4db66989a4c5af8dd7e72a344a582e8b65cdb1f0ccbf5090d7b2816d5fc6","observation_id":"4beaa791-5f24-4b2b-8c86-5158c16d44cc","resolution":{"observed_at":"2026-08-10T22:27:40.614803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.601240Z","title":"Shvit: Single-head vision transformer with memory efficient macro design,","venue":null,"work_id":"f0969bd3-7f97-49e1-a16d-063272a5ee4b","year":2024},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.267725Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:a140585700cb09f3a574523fd467d9af69da1d2b4d02fb98bdde420719ddd0d7","observation_id":"b5c99eb8-664c-4ef5-8860-264cf1970b49","resolution":{"observed_at":"2026-08-10T22:27:40.604805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.591655Z","title":"S2aformer: Strip self-attention for efficient vision transformer,","venue":null,"work_id":"4da8dc90-c654-47f9-a614-67a0f1528bf2","year":2025},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.273334Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:56bb2c28f7e670ba2898677e722ae188cbef5458b81dd74f9e844d155ae6e8c3","observation_id":"04aa0bbd-f7bf-4c89-8bda-e918efc119aa","resolution":{"observed_at":"2026-08-10T22:27:40.595095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.581596Z","title":"Training data-efficient image transformers & distilla- tion through attention,","venue":null,"work_id":"ac25b8f3-ffdf-445c-acc8-8c697a5025f9","year":2021},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.279089Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:9eaee5b0858994929c27c32cf26a3c0fdd7c9126bf0ade9237189d1d831d32bd","observation_id":"aef23658-fa46-492f-a303-37dfa7c8481c","resolution":{"observed_at":"2026-08-10T22:27:40.585278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.571171Z","title":"Tlee: Temporal-wise and layer-wise early exiting network for efficient video recognition on edge devices,","venue":null,"work_id":"32b0ec2d-4f5b-4919-8f51-2944ff2e3e49","year":2023},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.284367Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:e52f9466b3f3d9a71adec43c8f0e24874c5c84a30329757cbdcec2a9eab6fb91","observation_id":"c4753d23-db85-4daa-bd20-490a226cb9ad","resolution":{"observed_at":"2026-08-10T22:27:40.574896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.561108Z","title":"Conditional positional encodings for vision transformers,","venue":null,"work_id":"d9751f24-4752-4d69-bd58-a275039a38b6","year":2021},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.289822Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:7f5e6156cbd28f984e9c9c41e979705ac6dd0d6279d9840da424e1e8e56472c9","observation_id":"b7eacfc3-ca65-47d7-929c-9ac7e9abf9cd","resolution":{"observed_at":"2026-08-10T22:27:40.564719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.550661Z","title":"Imagenet large scale visual recognition challenge,","venue":null,"work_id":"a768131b-985a-410b-abdd-3a1ef0a92235","year":2015},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.294883Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:e16e6f929220c3758e0faea6705d59d648cb96b1278239e1ec08b199ec3b3208","observation_id":"c5b0fe72-9df0-48ea-8447-996c99abc3e7","resolution":{"observed_at":"2026-08-10T22:27:40.554668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.539822Z","title":"Iformer: Integrating convnet and transformer for mo- bile application,","venue":null,"work_id":"328c2c81-2b48-4466-8fd0-d73339e9b8df","year":2025},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.298796Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:0a458f1957271b25d4bd2285f57936663918e09aca03a7957d56b1bdc2b70243","observation_id":"a0359cc6-4548-4b47-93ec-df57e8c33dbc","resolution":{"observed_at":"2026-08-10T22:27:40.543574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.529406Z","title":"Microvit: a vision transformer with low complexity self attention for edge device,","venue":null,"work_id":"b0928019-1431-4375-88e8-130c46316489","year":2025},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.302353Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:ef6936c216219bc9c6e780e1136a1ab5629fe2f8887df5e65b4581c354117c1d","observation_id":"478bf45f-a4b1-4e34-9118-af9a6d1f8e93","resolution":{"observed_at":"2026-08-10T22:27:40.533254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.00962","last_updated":"2020-01-03T06:53:00Z","snapshot_observed_at":"2026-07-06T07:43:06.427641Z","submitted_at":"2019-04-01T16:53:35Z","title":"Large Batch Optimization for Deep Learning: Training BERT in 76 minutes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.00962","snapshot_observed_at":"2026-08-10T22:27:40.305685Z","title":"Large batch optimization for deep learning: Training bert in 76 minutes,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.305685Z"},"links":{"cited_paper":"/paper/1904.00962","citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:eb08f41a6a1f7247d19613271ed8d20f3964fde1caff04f9fb9e6c5215cd5566","observation_id":"51d46b3f-33ab-4ba9-a11d-3fb252a9bef7","resolution":{"observed_at":"2026-08-10T22:27:40.305685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.518659Z","title":"Group contextualization for video recognition,","venue":null,"work_id":"17fce9cd-1ebc-4335-9aad-339cffdacb51","year":2022},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.309572Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:0cf0fb38c8cd324827f38509fadc07b73e37396542ec583279bb8c2bc6b69dce","observation_id":"b731ffae-4e2c-4e47-ac7a-7fe3e1cf27cc","resolution":{"observed_at":"2026-08-10T22:27:40.522633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.507970Z","title":"Learning spatiotem- poral and motion features in a unified 2d network for action recognition,","venue":null,"work_id":"c640e55f-9c92-4f9d-8dfd-2a1c820bdeca","year":2022},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.313640Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:22fca2692dce23a2d2a1c25755cbbfb40df5de2711151c83947a1fcc25774e51","observation_id":"e1eae3e9-f5ae-4e1d-99a6-98ad33e4bfc9","resolution":{"observed_at":"2026-08-10T22:27:40.511593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.497643Z","title":"Multiscale vision transformers,","venue":null,"work_id":"f4eb5a2a-8cfc-44fe-929c-facb7639e147","year":2021},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.317104Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:e1d00c8478000fd4f7c20091cacc7d85f74d4e5c019e09f068d22c05ba6a55ca","observation_id":"2174d477-b034-4b21-8254-dd2b83a0c945","resolution":{"observed_at":"2026-08-10T22:27:40.501117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.485811Z","title":"Dualactnet: Exploiting slowfast architecture for micro-action recognition,","venue":null,"work_id":"8dffdf5f-d42c-411d-b15d-aa7bbfff54c7","year":2024},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.320808Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:26b5d87a5ef9c54a0abaddfed320b354a11f0f7d0020ba638ab3b26b80706b0b","observation_id":"3ca3896b-5bed-4a27-b671-2078122ca882","resolution":{"observed_at":"2026-08-10T22:27:40.489940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.473438Z","title":"Tdn: Temporal difference networks for efficient action recognition,","venue":null,"work_id":"3b27a57a-664f-4c12-a0e2-3888db379a19","year":1904},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.324351Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:f6fe1c1f3c3b1919b96b81fe8d6bfaab56a4eaae937692b904491fb16adc66c0","observation_id":"93cdfa9f-f153-45ec-8485-cf68f92763a4","resolution":{"observed_at":"2026-08-10T22:27:40.477359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10155","last_updated":"2019-08-27T12:16:55Z","snapshot_observed_at":"2026-08-10T21:47:43.103978Z","submitted_at":"2019-08-27T12:16:55Z","title":"Mobile Video Action Recognition","version":1},"cited_work":{"arxiv_id":"1908.10155","doi":null,"metadata_source":"pith","pith_arxiv_id":"1908.10155","snapshot_observed_at":"2026-08-10T22:27:40.372824Z","title":"Mobile Video Action Recognition","venue":"cs.CV","work_id":"fa43a1a3-9c6f-4a04-b4a0-e7b9c986bac6","year":2019},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.327863Z"},"links":{"cited_paper":"/paper/1908.10155","citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:1fbefbcb2839b9ced3a7d1b776ce41774401fc3189c25a95d88a6a595b0fe89c","observation_id":"c8d05b21-cdd9-4aec-bba6-d7c78fb0df7c","resolution":{"observed_at":"2026-08-10T22:27:40.378607Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.462058Z","title":"Compressed video action recognition,","venue":null,"work_id":"417273c4-a256-4e12-80b2-c1210e50a55c","year":2018},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.331790Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:375c5efcf15fab1be5dd8f7752c37f6c511afb65f9aa9f24aa948e4f7be7717f","observation_id":"5cd6d466-e69a-4f01-aeca-31dfc4634eb3","resolution":{"observed_at":"2026-08-10T22:27:40.466025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.450519Z","title":"Afd- former: A hybrid transformer with asymmetric flow division for synthesized view quality enhancement,","venue":null,"work_id":"54de0de4-6be1-48e2-8234-338b658c5550","year":2023},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.335302Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:e6f62ea52fab48cda4876447f8da81905b8abf4654a8a107bffeda6bcb46fcc6","observation_id":"fbd6d38c-f0ea-419d-8702-989a200502b0","resolution":{"observed_at":"2026-08-10T22:27:40.454538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.438447Z","title":"Token fusion: Bridging the gap between token pruning and token merging,","venue":null,"work_id":"8108acac-1dcc-435f-b283-aa5db5e738b9","year":2024},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.338827Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:26143b962c8680680b742f0137c030ed6890cb393b6e5b4493459cc13db1e9c2","observation_id":"4295a7c9-5fcc-4ede-af2d-9de71e111506","resolution":{"observed_at":"2026-08-10T22:27:40.442445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.426470Z","title":"He is currently a Full Professor with the Department of Electronic and Computer Engineering, National Taiwan University of Science and Technology","venue":null,"work_id":"644cb8f6-7d92-4d48-a846-238b4bfd6497","year":2005},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.342777Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:7e5478f4ddeef0f9deddbcdbf9de9d30156af6350c86dc4524e2520cd515dcd1","observation_id":"cc0be8c5-e969-41e8-962b-04edaeae6b16","resolution":{"observed_at":"2026-08-10T22:27:40.430469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T23:11:04.683884Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":4,"verified_exact":1,"verified_fuzzy":63},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 0 inbound Pith citation observations for arXiv:2608.06691."}