{"as_of":"2026-08-07T17:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:984e10f547895e6713947e0de6fd6b1f5c56b4af4b1a53704ffb18d79b5d853e","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T14:47:28.818411Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.17844/citation-record","integrity":"/paper/2507.17844/integrity","json":"/paper/2507.17844/citation-record.json","paper":"/paper/2507.17844"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.3390/app131810399","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:28.834783Z","title":"Review on wearable technology in sports: Concepts, challenges and opportunities,","venue":null,"work_id":"c546d240-9982-4916-a9f5-74a21813dc74","year":2023},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-07T13:01:45.072087Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.735332Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:d65be01c7376d7e3ef05819c58ea98a99e620bff888d38f792766ab98a70ea3a","observation_id":"d3859547-cc78-47d7-a1a8-e3fb88d0406d","resolution":{"observed_at":"2026-08-06T14:47:28.838947Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-06T14:47:28.737949Z","title":"Video -ChatGPT: Towards detailed video understanding via large vision and language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-07T13:01:45.072087Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.737949Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:58cb4eabe4018904724fb53f35732cb4e5fdfeee8172ce730b2da0cf72241de3","observation_id":"338bca84-3529-4456-bff5-dc53d909da87","resolution":{"observed_at":"2026-08-06T14:47:28.737949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-08-06T14:47:28.740370Z","title":"LLaMA-VID: An image is worth 2 tokens in large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-07T13:01:45.072087Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.740370Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:0e2217f834fa633ed986e6121a8a4f21e40e62ec8013d1f63db8f5891da99519","observation_id":"00d64863-bf51-4eca-aa1e-a18a39129839","resolution":{"observed_at":"2026-08-06T14:47:28.740370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:29.150432Z","title":"A path towards autonomous machine intelligence,","venue":null,"work_id":"41bf58f0-ce86-4aa0-999e-21ac515e1025","year":2022},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-07T13:01:45.072087Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.742825Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:57dca8dbfd38bfc6605a0f83098486d0bc23863e717d39c6ba7ce32bea8d74f4","observation_id":"74989adb-e10d-4565-aa3a-e6a220763406","resolution":{"observed_at":"2026-08-06T14:47:29.152382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:29.144283Z","title":"Self-supervised learning from images with a joint- embedding predictive architecture,","venue":null,"work_id":"0329fa94-359f-457a-9f6b-75c64d9533db","year":2023},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-07T13:01:45.072087Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.745119Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:9fdfbff9a73c8059ca403f1b2b818853961da490be0ac6280902fcc13fc26976","observation_id":"41494e1c-70a4-4022-8f07-fb841d1a0c80","resolution":{"observed_at":"2026-08-06T14:47:29.146394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:29.138320Z","title":"V -JEPA: Latent video prediction for visual representation learning,","venue":null,"work_id":"98c608d2-5d16-4ed1-8e5b-ec42fe0d88d3","year":2024},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-07T13:01:45.072087Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.747272Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:c6e7a4249ed46e643bb2f9de2a3b7ccca79e6ca9c407f4b3d1228a9610840e85","observation_id":"a7bd5611-59ef-4565-afb7-7d959e6fd077","resolution":{"observed_at":"2026-08-06T14:47:29.140706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04081","last_updated":"2024-10-02T05:00:57Z","snapshot_observed_at":"2026-08-04T07:20:28.702850Z","submitted_at":"2024-09-06T07:44:44Z","title":"UI-JEPA: Towards Active Perception of User Intent through Onscreen User Activity","version":3},"cited_work":{"arxiv_id":"2409.04081","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.04081","snapshot_observed_at":"2026-08-06T14:47:28.938066Z","title":"UI-JEPA: Towards Active Perception of User Intent through Onscreen User Activity","venue":"cs.CL","work_id":"cd2ed764-0ded-4b0a-98fc-3536c4df43f2","year":2024},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-07T13:01:45.072087Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.749711Z"},"links":{"cited_paper":"/paper/2409.04081","citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:a336142a26be6ffe695cf6dbae80f262da67e9893c0669963d2fd610b236c6af","observation_id":"643eb1ac-91a6-4c1e-bbc1-b16805fde231","resolution":{"observed_at":"2026-08-06T14:47:28.940562Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09985","last_updated":"2025-06-11T17:57:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-11T17:57:09Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09985","snapshot_observed_at":"2026-08-06T14:47:28.752004Z","title":"V -jepa 2: Selfsupervised video models enable understanding, prediction and planning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-07T13:01:45.072087Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.752004Z"},"links":{"cited_paper":"/paper/2506.09985","citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:2e38b8e278f90ec98ad0efa43cea76290821428bcad9b5ba5d6ff24588a0999f","observation_id":"029376f8-78cd-460f-9024-e915cb0e2d86","resolution":{"observed_at":"2026-08-06T14:47:28.752004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:29.132897Z","title":"Computer vision for sports: Current applications and research topics,","venue":null,"work_id":"cc5000c4-c7d9-4811-844b-771dcd3796b8","year":2017},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-07T13:01:45.072087Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.754962Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:70bbde1f21a09415eda111255d3043f0a585c8c739bf21b6e91ef9e1d0a4f9cb","observation_id":"354d65ae-8848-46b7-af8c-44abcdf96f4f","resolution":{"observed_at":"2026-08-06T14:47:29.134924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:29.127128Z","title":"Soccernet-v2: A dataset and benchmarks for holistic understanding of broadcast soccer videos,","venue":null,"work_id":"d237c831-bc77-46a3-9b78-57ece3cbf63b","year":2021},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-07T13:01:45.072087Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.757216Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:cff6534e03bd6386534dd279ae49a2bf9e882b7dac43b9f6f49f62a5b339099c","observation_id":"dc57ca70-1e9c-48d0-8886-435839cb8a2a","resolution":{"observed_at":"2026-08-06T14:47:29.129217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:29.121650Z","title":"Soccernet: A scalable dataset for action spotting in soccer videos,","venue":null,"work_id":"683ca72e-7ce6-423b-b072-d66c81d88d06","year":2018},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-07T13:01:45.072087Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.759138Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:30ad272563e885ec1ad7ecf95c49defdcb094968cd010dbe0a89c3f03e53008e","observation_id":"79293dc3-e8d5-4646-81d1-c6af34e48e68","resolution":{"observed_at":"2026-08-06T14:47:29.123627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:29.115801Z","title":"Fine-grained action recognition on a novel basketball dataset,","venue":null,"work_id":"572f47b0-19df-4e69-9405-815caa1faa1b","year":2020},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-07T13:01:45.072087Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.761422Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:0a02c1594d1365e1cafb03f43cc23f30e21e9ff12d5349b965af17c1177aac39","observation_id":"fac1c96e-771e-4fe3-bb4b-d68df025fad1","resolution":{"observed_at":"2026-08-06T14:47:29.118061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:29.109984Z","title":"Soccernet caption: Dense video captioning for soccer broadcasts commentaries,","venue":null,"work_id":"6f7dafb5-3022-49cd-b8d4-cf80b7b9a85d","year":2023},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-07T13:01:45.072087Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.763299Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:22cb58f0e483c20f2091a0491756c94245b0cd34831e5555cc074482b23b0289","observation_id":"8fd68349-1c4d-498b-8c8e-be5fefeb4b81","resolution":{"observed_at":"2026-08-06T14:47:29.112178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:29.104243Z","title":"Sports video captioning via attentive motion representation and group relationship modeling,","venue":null,"work_id":"f8915a00-0a13-4efd-af73-ac9e6846a1e2","year":2019},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-07T13:01:45.072087Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.765170Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:f8b790b59325d7fb476c8c103b374101e15a08c6c7179a1fa0338cd49a5bc215","observation_id":"f03400f5-4020-4fe7-bf01-b888895bf08e","resolution":{"observed_at":"2026-08-06T14:47:29.106353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:29.098758Z","title":"Matchtime: Towards automatic soccer game commentary generation,","venue":null,"work_id":"761595da-ca49-4bc6-9297-bf4c64aab5fb","year":2024},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-07T13:01:45.072087Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.767048Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:f65da2a0569e89d6bff84b002337f262ef0d0da23e23d306f43fc1d857650652","observation_id":"c99070ce-cc63-4f03-b9a5-68d95982b5fe","resolution":{"observed_at":"2026-08-06T14:47:29.100713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13888","last_updated":"2024-02-28T02:26:03Z","snapshot_observed_at":"2026-08-03T02:30:07.559069Z","submitted_at":"2024-01-25T02:08:37Z","title":"Knowledge Guided Entity-aware Video Captioning and A Basketball Benchmark","version":2},"cited_work":{"arxiv_id":"2401.13888","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.13888","snapshot_observed_at":"2026-08-06T14:47:28.922992Z","title":"Knowledge Guided Entity-aware Video Captioning and A Basketball Benchmark","venue":"cs.CV","work_id":"920715cb-aee8-410d-a710-50e194ecc528","year":2024},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-07T13:01:45.072087Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.768978Z"},"links":{"cited_paper":"/paper/2401.13888","citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:e77b7e129edbc45c8f74f05073cb25044438bf544d5a1fc8b82998c663f81541","observation_id":"1709e277-9f4e-4a28-9110-8115693abf3d","resolution":{"observed_at":"2026-08-06T14:47:28.925700Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:29.093300Z","title":"Fine-grained video captioning for sports narrative,","venue":null,"work_id":"bcaa96e7-20a1-4914-a1f2-ca6f5dc78a69","year":2018},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-07T13:01:45.072087Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.771064Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:69d6f20bcd75c134e445a44334bf7c62822aaec37e0083742ad59bf0cfc9668e","observation_id":"7c6771fa-87fd-482a-9d0d-3a0ade95999c","resolution":{"observed_at":"2026-08-06T14:47:29.095279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:29.087422Z","title":"Finegym: A hierarchical video dataset for fine -grained action understanding,","venue":null,"work_id":"fb661a44-efa6-4017-bbef-ecb6f7541dce","year":2020},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-07T13:01:45.072087Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.772938Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:9fbc1fb51335887df3fe674545ff0c8c7590ae6318ace97b70d84bc0c14b09d2","observation_id":"21d0f4e1-c2ea-4a6d-8575-36f75976bcd0","resolution":{"observed_at":"2026-08-06T14:47:29.089788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:29.081705Z","title":"Finediving: A fine - grained dataset for procedure-aware action quality assessment,","venue":null,"work_id":"b9417aa0-07b5-481a-9f53-726410d9d2aa","year":2022},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-07T13:01:45.072087Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.775051Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:447c66c64ca59947a5c3c421066a652427a5ebf9d3a60fdb1d581f1db3eb45cf","observation_id":"35700ec6-dfc7-473b-8984-aab3d5f17bf9","resolution":{"observed_at":"2026-08-06T14:47:29.083763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:29.075722Z","title":"Tacticai: An AI assistant for football tactics,","venue":null,"work_id":"e9ba2f8f-e9e8-4f8e-8c79-fee0714f8f67","year":2024},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-07T13:01:45.072087Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.776961Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:f0d7f2693361c87172d073f90168c2d95b393a47ba97dab908256c3448e16178","observation_id":"3d7bb799-2d82-4796-b9fd-f7259c4d6e1c","resolution":{"observed_at":"2026-08-06T14:47:29.077698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:29.069380Z","title":"VARS: Video assistant referee system for automated soccer decision making from multiple views,","venue":null,"work_id":"96d16c52-fe56-4a89-93b5-efae7f44c37a","year":2023},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-07T13:01:45.072087Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.778846Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:2374e8c6b8439d1d7b0aabb40e4502b92f86f4cb24638c8312b2d15668e02d38","observation_id":"96745f7f-0097-49c8-af54-2e418a36fc36","resolution":{"observed_at":"2026-08-06T14:47:29.071515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:29.063959Z","title":"X -VARS: Introducing explainability in football refereeing with multimodal large language models,","venue":null,"work_id":"b120eba4-4ee1-405d-a59a-e73e62cf4fab","year":2024},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-07T13:01:45.072087Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.780649Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:6703c0b8a6983d2de4e1e43b7983b10060903262a54057fd90401a3517ab2b72","observation_id":"18204d28-eecd-429a-89a7-660da1fa7d85","resolution":{"observed_at":"2026-08-06T14:47:29.065929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:28.782472Z","title":"Sports-QA: A large -scale video question answering benchmark for complex and professional sports,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-07T13:01:45.072087Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.782472Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:234763a6a0db209429f1e3c4d60aa4cc94a55034b48f090e4de964c2c4e21761","observation_id":"19ac599a-1c98-46cc-b946-2036d5ea9ff0","resolution":{"observed_at":"2026-08-06T14:47:28.782472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:29.058442Z","title":"SportQA: A benchmark for sports understanding in large language models,","venue":null,"work_id":"001549e3-0fd4-4c0c-b4aa-83986436f449","year":2024},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-07T13:01:45.072087Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.784339Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:c00bd319e229015c6ec5374cc2796757f52530a78f43ed48198f6b68f8b86c9a","observation_id":"1e851dbc-fdf2-424a-a7fb-05e4c106ecd6","resolution":{"observed_at":"2026-08-06T14:47:29.060399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08474","last_updated":"2025-03-14T19:32:04Z","snapshot_observed_at":"2026-08-07T04:00:22.894117Z","submitted_at":"2024-10-11T02:58:38Z","title":"SPORTU: A Comprehensive Sports Understanding Benchmark for Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08474","snapshot_observed_at":"2026-08-06T14:47:28.786186Z","title":"SportU: A comprehensive sports understanding benchmark for multimodal large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-07T13:01:45.072087Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.786186Z"},"links":{"cited_paper":"/paper/2410.08474","citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:7277cb1c917dd7be15faae147014231ddae7c5972620847b8f08324aaf9a8195","observation_id":"5c80b69f-ef7f-4e47-a145-9fe7c26de692","resolution":{"observed_at":"2026-08-06T14:47:28.786186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:29.052703Z","title":"Flamingo: a visual language model for few -shot learning,","venue":null,"work_id":"66b2b4c3-b1d0-4aab-a39d-fbf855a771b1","year":2022},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-07T13:01:45.072087Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.788390Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:de2575e54dd6793657354b6c9ce63c207902143e690a32143efc4f93ec69d8e6","observation_id":"05827de8-aa86-48d4-b09d-4a6f57139e35","resolution":{"observed_at":"2026-08-06T14:47:29.054842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:29.047071Z","title":"BLIP: Bootstrapping language-image pre-training for unified vision-language understanding and generation,","venue":null,"work_id":"0fced7fa-b0af-4eab-b1b9-2848bbbf1949","year":2022},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-07T13:01:45.072087Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.790361Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:94a5a08ea655c2c47cbf9679be8afbf91e3e10f177f9ff98a6293bcefec92c9e","observation_id":"6326f665-380b-4582-b3d0-ee35e9d3a584","resolution":{"observed_at":"2026-08-06T14:47:29.049117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:29.041346Z","title":"BLIP -2: Bootstrapping language- image pre -training with frozen image encoders and large language models,","venue":null,"work_id":"0278043f-e2c9-4446-930b-7c517ad8c614","year":2023},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-07T13:01:45.072087Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.792353Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:788a62b9eb58f2b38a8196b04f3faf8b0eae436a1772b9f8fb86ca1b90cc13c2","observation_id":"27132ff3-fe73-447b-85dc-23a36b03cca7","resolution":{"observed_at":"2026-08-06T14:47:29.043418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:29.035525Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"91625e70-b659-4c21-9fc6-97922c51ea96","year":2021},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-07T13:01:45.072087Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.794410Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:e020dddeba8f07aaf9f326b0393cfdad6b83c51714d345f1af615b45d1279614","observation_id":"1e314612-64b6-4c4f-bfae-a239a2f1a818","resolution":{"observed_at":"2026-08-06T14:47:29.037574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:29.029726Z","title":"Sigmoid loss for language image pre -training,","venue":null,"work_id":"1b3ada7c-f25e-468c-b0ec-1bb0ee4a3b88","year":2023},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-07T13:01:45.072087Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.796296Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:107e7f6132133bd466b6e9a5bf095b2f811ec664a0770cb6916843d221595dec","observation_id":"c3e888dd-8ada-490a-b844-0a4a727806c1","resolution":{"observed_at":"2026-08-06T14:47:29.031708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:29.024020Z","title":"MVBench: A comprehensive multi-modal video understanding benchmark,","venue":null,"work_id":"92b8c862-b5db-43de-b0fc-6bf858d8ec86","year":2024},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-07T13:01:45.072087Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.798156Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:6c2febf13f394548db03ce0811f6e19cc2b7d843606f340d6183387d430f4cba","observation_id":"8cd9abe6-d824-4158-9990-45f7127f4079","resolution":{"observed_at":"2026-08-06T14:47:29.026208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:29.018192Z","title":"Llama -vid: An image is worth 2 tokens in large language models,","venue":null,"work_id":"5b563a7b-96b8-4519-8fd4-05a662ee2c3d","year":2024},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-07T13:01:45.072087Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.799820Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:482e6e9eff409ffa13a44c9a46709598044def836a6aa903c132809af9673e11","observation_id":"09140373-a5f7-4ad0-adf8-01dfc9870cf4","resolution":{"observed_at":"2026-08-06T14:47:29.020360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:29.012317Z","title":"Video-llama: An instruction-tuned audio- visual language model for video understanding,","venue":null,"work_id":"5be5988c-b934-4d41-a2c8-74cb2f75f668","year":2023},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-07T13:01:45.072087Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.801681Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:8409a35b44a844cae98513b20b2c94d07f65eba1d6806152583bbaa97804dd79","observation_id":"8613031e-91c7-49b0-9caf-e3f67a6c1907","resolution":{"observed_at":"2026-08-06T14:47:29.014390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:29.006482Z","title":"Temporal alignment networks for long-term video,","venue":null,"work_id":"04b4842e-2656-410a-9863-ccac9ca573ed","year":2022},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-07T13:01:45.072087Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.803498Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:e49b1fde2cb8e3fc5cec39ca8832e83adbbfa59f386efa08f51e41e591e3fcb7","observation_id":"b5588f34-ed5d-4267-aedc-2f891d43403c","resolution":{"observed_at":"2026-08-06T14:47:29.008523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:29.000219Z","title":"Multi-sentence grounding for long -term instructional video,","venue":null,"work_id":"3930deb5-b616-4bff-b007-0be67900f93b","year":2024},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-07T13:01:45.072087Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.805361Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:260ed461bac52e80df19e57d8a5488235bc7ca111ab080b184717a89ed5780c2","observation_id":"94b8b072-21f6-433a-b120-af04d79c59e9","resolution":{"observed_at":"2026-08-06T14:47:29.002751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:28.994324Z","title":"Panda- 70M: Captioning 70M videos with multiple cross -modality teachers,","venue":null,"work_id":"e6f0b1ea-e498-4225-aec0-32292580d303","year":2024},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-07T13:01:45.072087Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.807354Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:d7b4ff930a846d0653f13e9f982b5dcefb90f1b0d7407d1112d0492b567c871e","observation_id":"b3295252-d1f3-4c72-8202-08f2a77f17de","resolution":{"observed_at":"2026-08-06T14:47:28.996492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:28.988071Z","title":"Vid2seq: Large -scale pretraining of a visual language model for dense video captioning,","venue":null,"work_id":"b6f8e313-1759-40aa-8bdd-e259341e5d40","year":2023},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-07T13:01:45.072087Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.809252Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:da29d9fec1ff24b0f3c53d6d470da89526b5b5b89f5441ba8d870b578bcc2292","observation_id":"a1e043d5-b327-4f58-97d0-c7c0245eea61","resolution":{"observed_at":"2026-08-06T14:47:28.990368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:28.981963Z","title":"Streaming dense video captioning,","venue":null,"work_id":"e938a7e1-305f-4709-a5bf-7a09992b7b25","year":2024},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-07T13:01:45.072087Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.811016Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:71045bcc42f3dd45ef485a8f969128eefa9db0d137af04271d22ee118b31c6de","observation_id":"542eae72-54e7-47eb-a817-15cb45c4713e","resolution":{"observed_at":"2026-08-06T14:47:28.984046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:28.975869Z","title":"Autoad: Movie description in context,","venue":null,"work_id":"51feca92-7361-44ad-aac1-4fe35600c180","year":2023},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-07T13:01:45.072087Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.812820Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:01b7fc50c238a84a8b32bff773563516e3b246015e544b27ed15904d1adeb811","observation_id":"8c1bb864-2069-46bd-ad3c-82db58b13626","resolution":{"observed_at":"2026-08-06T14:47:28.978020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:28.969784Z","title":"Autoad II: The sequel —who, when, and what in movie audio description,","venue":null,"work_id":"45864313-1bc3-4b62-b536-b0ea36b2255c","year":2023},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-07T13:01:45.072087Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.814682Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:90694ad2a131c52fff64765a4d663c26a21474df2ac587df781eb2835ecc89d6","observation_id":"2287eebb-0f85-4024-bd33-826f84e35ab4","resolution":{"observed_at":"2026-08-06T14:47:28.971953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:28.963377Z","title":"Autoad III: The prequel —back to the pixels,","venue":null,"work_id":"a004e318-1100-4d6d-9876-bbc67ff643e0","year":2024},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-07T13:01:45.072087Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.816566Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:db21313a5d195875dfc65d97b5f2b159192de5b335b92d9a933c1c8e2afaea4c","observation_id":"b3b75a8e-7dfc-4aaa-9db7-271e0fde46ba","resolution":{"observed_at":"2026-08-06T14:47:28.965659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:47:28.955951Z","title":"NSVA Subset: Basketball Video -Text Dataset,","venue":null,"work_id":"6ae3fd56-4da3-4e25-8ca9-ff80b52ea760","year":2025},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-07T13:01:45.072087Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.818411Z"},"links":{"citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:88f9e5f48d6c462b22e94b4388170c4817ba06863fc6a51d63454b8991e25b1d","observation_id":"225b382c-0702-4d58-aeff-48fbc85917e1","resolution":{"observed_at":"2026-08-06T14:47:28.959004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T13:01:45.072087Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":3,"verified_fuzzy":34},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 0 inbound Pith citation observations for arXiv:2507.17844."}