{"as_of":"2026-08-22T21:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:97a9ca77720b6393adad964b2037b9a7186576f8bc2f0c8dfba731f5b8c854ab","coverage":[{"denominator":250,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T19:37:41.849450Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.09151/citation-record","integrity":"/paper/2509.09151/integrity","json":"/paper/2509.09151/citation-record.json","paper":"/paper/2509.09151"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.562439Z","title":"Large-scale video classification with convolutional neural networks,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.562439Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:fa81a154e5047b2e91a8a769c62b27fe6d04116a61e88f66fee4b72c8a109804","observation_id":"af737d4e-a076-4b85-807d-542a4c852b3e","resolution":{"observed_at":"2026-08-04T19:37:41.562439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.566161Z","title":"Learning spatiotemporal features with 3d convolutional networks,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.566161Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:326e6fc95b53efb8e63dfd2b107d8e560d2a297667d490b86f91bebaad42303d","observation_id":"3cf5d4d4-2926-499f-8c04-c9f76b5665c2","resolution":{"observed_at":"2026-08-04T19:37:41.566161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.568966Z","title":"Slowfast networks for video recognition,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.568966Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:53bed4c83f8dfc19e75293bf910eda3066ddc984cdc275db3d742cb826ed1cdb","observation_id":"b7b83d8b-aaa4-4957-8ed0-89dbe96e8c9c","resolution":{"observed_at":"2026-08-04T19:37:41.568966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.572025Z","title":"Motion meets attention: Video motion prompts,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.572025Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:7fcab49d8005614085e4c43d304ca90ad771690b3a878f7316113c3f50e261f5","observation_id":"61ed61d3-9c5c-4a18-9fff-f604b1d8a41c","resolution":{"observed_at":"2026-08-04T19:37:41.572025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.574797Z","title":"Taylor videos for action recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.574797Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:aba18c0c46fa9529093f484b40ed56294d36b4b1ff5ebfac790000483dc96e32","observation_id":"6a9fe7c2-6a88-4b2e-b361-8a1710f8472c","resolution":{"observed_at":"2026-08-04T19:37:41.574797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.578114Z","title":"Learnable expansion of graph operators for multi-modal feature fusion,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.578114Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:9f55a0135c9c52b802ce78754962bf71c2ba06c6eaf672c364187a4ee376a0d4","observation_id":"698eff6a-6fdd-4dd2-aa22-1c94c745bf3b","resolution":{"observed_at":"2026-08-04T19:37:41.578114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.580999Z","title":"Meet jeanie: a similarity measure for 3d skeleton sequences via temporal-viewpoint alignment,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.580999Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:0aa72833ee10c8164c35d49a4785c9cc438f09fb9f530dd529c92f6b3cb019f8","observation_id":"bc36bfda-5915-4ca3-8b9e-d8733b267178","resolution":{"observed_at":"2026-08-04T19:37:41.580999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.583680Z","title":"Evolving skeletons: Motion dynamics in action recognition,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.583680Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:cd3927f84beecc17c45cf90291d85893188596eb084d379f7ad65175a6f8cbfc","observation_id":"88974bff-5613-40a0-a9d5-c013942bb74a","resolution":{"observed_at":"2026-08-04T19:37:41.583680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.586255Z","title":"Feature hallucination for self-supervised action recognition,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.586255Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:0dcf750c3c94a34e56c2af14532a8ae01e0a187147b750812de3133f643d5605","observation_id":"d5f942de-b118-4514-ad83-2a2d41453837","resolution":{"observed_at":"2026-08-04T19:37:41.586255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.589156Z","title":"Do language models understand time?","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.589156Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:e2681d12292e55bc2fef96b1b020c3ed6dc132ab1b7dc68ab5259b417f76c48e","observation_id":"aa1e96b8-b01f-4e79-801a-75d6ac127e2a","resolution":{"observed_at":"2026-08-04T19:37:41.589156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18298","last_updated":"2024-12-24T09:05:37Z","snapshot_observed_at":"2026-08-21T15:05:18.668090Z","submitted_at":"2024-12-24T09:05:37Z","title":"Quo Vadis, Anomaly Detection? LLMs and VLMs in the Spotlight","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18298","snapshot_observed_at":"2026-08-04T19:37:41.591934Z","title":"Quo vadis, anomaly detection? llms and vlms in the spotlight,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.591934Z"},"links":{"cited_paper":"/paper/2412.18298","citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:35ebf8623f4bad8163f0ad823fe44c033eb68c046c7ae89f0fd52a6eb12764b7","observation_id":"a144318c-9692-4e1a-b4cc-a8343442d465","resolution":{"observed_at":"2026-08-04T19:37:41.591934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.595267Z","title":"The journey of action recognition,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.595267Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:c85d181fa3ca962c06de307c5a1f743de02e9278280d18225715ea574b378629","observation_id":"e564258f-e0eb-4074-8427-11388387187a","resolution":{"observed_at":"2026-08-04T19:37:41.595267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.598047Z","title":"Representation-centric survey of skeletal action recognition and the anubis benchmark,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.598047Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:5a4fd2d0ce40baf2554f5fb3a37337b6ac8cc722856bc4f100554577e60302e6","observation_id":"05e508ef-6369-42da-b8dc-847b6e89cf23","resolution":{"observed_at":"2026-08-04T19:37:41.598047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03770","last_updated":"2024-05-06T18:09:48Z","snapshot_observed_at":"2026-08-16T13:54:55.899708Z","submitted_at":"2024-05-06T18:09:48Z","title":"Foundation Models for Video Understanding: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03770","snapshot_observed_at":"2026-08-04T19:37:41.600749Z","title":"Foundation models for video understanding: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.600749Z"},"links":{"cited_paper":"/paper/2405.03770","citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:9ed808360d3d7b6c87e4249c890a7578ff6ba22d558bb07560a68cc20b5bb1aa","observation_id":"217712fc-9fa7-468a-8a99-833d6bb663f6","resolution":{"observed_at":"2026-08-04T19:37:41.600749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.603790Z","title":"Video understanding with large language models: A survey,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.603790Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:e9bef2f27a27f46a45dc9f28b449c1419e831b386773e5edabacc38031f80cbd","observation_id":"6885caf8-9ccd-4b8a-bb03-9733f743dce4","resolution":{"observed_at":"2026-08-04T19:37:41.603790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-20T22:03:51.775198Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-04T19:37:41.606822Z","title":"The kinetics human action video dataset,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.606822Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:051a184247c19311c0881f90d96b68982e4032369583dee3b76cace0124c5e5a","observation_id":"3a40fdea-d68d-43ba-86ac-02ca168bea99","resolution":{"observed_at":"2026-08-04T19:37:41.606822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.610179Z","title":"The” something something","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.610179Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:9bd844a51f344ed4fb780523455b4862e3c2e1cf8364cbf788b784878160e675","observation_id":"f95e75f5-7ea5-4e24-af56-dbd9cb00ae5a","resolution":{"observed_at":"2026-08-04T19:37:41.610179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.612970Z","title":"Activi- tynet: A large-scale video benchmark for human activity understanding,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.612970Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:63bdfb302574922e642f307bb2ec890ef56bed54a14b8c3c36fd1009260dc154","observation_id":"f2f0f853-6642-498a-adf2-59609f1058df","resolution":{"observed_at":"2026-08-04T19:37:41.612970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.615770Z","title":"Hollywood in homes: Crowdsourcing data collection for activity understanding,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.615770Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:0e9748cd12b4ab052e6d95f446e19182872059914c969c3fa8282ef4fdb5feac","observation_id":"1ebc26bc-7b7d-4b17-9189-c162a414c5c0","resolution":{"observed_at":"2026-08-04T19:37:41.615770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.09626","last_updated":"2018-04-30T16:57:00Z","snapshot_observed_at":"2026-08-14T19:22:02.247619Z","submitted_at":"2018-04-25T15:30:27Z","title":"Charades-Ego: A Large-Scale Dataset of Paired Third and First Person Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.09626","snapshot_observed_at":"2026-08-04T19:37:41.618568Z","title":"Charades-ego: A large-scale dataset of paired third and first person videos,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.618568Z"},"links":{"cited_paper":"/paper/1804.09626","citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:c28263ad78906e25d611bd10e138b389c2107b7be461cb4f72b7c1bff2ce067a","observation_id":"d1c36766-1ff9-4d51-a775-fae9c971cb8b","resolution":{"observed_at":"2026-08-04T19:37:41.618568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.621704Z","title":"Ava: A video dataset of spatio-temporally localized atomic visual actions,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.621704Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:7323aafc8377d4ba3c35ecc8e81063a254095c1e24c656412926047b70035990","observation_id":"1f3b6bb5-81c6-46bb-be11-5340198aa558","resolution":{"observed_at":"2026-08-04T19:37:41.621704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.624382Z","title":"Rescaling egocentric vision: Collection, pipeline and challenges for epic-kitchens- 100,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.624382Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:4d5b998a65d2d65d088b9c1c1ba62bf161dca48efc90f74ab42df8eb5a025c77","observation_id":"81b15cac-a4d8-427a-a154-3a2047258c66","resolution":{"observed_at":"2026-08-04T19:37:41.624382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.626977Z","title":"Graph based skeleton motion representation and similarity measurement for action recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.626977Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:6460863d015e4b24bf666abb8aef1cc16cf9a5228e0565b1c89e157852262869","observation_id":"58436897-7102-4e39-b35d-b1844c8ad7a7","resolution":{"observed_at":"2026-08-04T19:37:41.626977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.629850Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.629850Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:1d575b458b519129f6ebc239ad5bedeed7f6a3c16a45950f7a7a741d2caf2a0c","observation_id":"c7b717d8-4c90-4cf4-be6c-e95a231864d8","resolution":{"observed_at":"2026-08-04T19:37:41.629850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.632560Z","title":"Non-local neural networks,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.632560Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:b1695fc8731221b88c68d152e1d7053d02dfa7e68c28ca49ba1aaa64f1babd18","observation_id":"409b2f64-7add-48cc-b93e-907490fc1b3f","resolution":{"observed_at":"2026-08-04T19:37:41.632560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.635238Z","title":"Spatial temporal graph convolutional networks for skeleton-based action recognition,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.635238Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:b266799f708e798ad10398f5362d8876bf3c8a1210e2a6c35b8d578b8af7be87","observation_id":"805c6334-b76e-4731-8353-3d4e1412f939","resolution":{"observed_at":"2026-08-04T19:37:41.635238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.637882Z","title":"Vivit: A video vision transformer,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.637882Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:7083637e2a41d56bc2239ecc9fa710515478ff0ffa672f4e423cb4893335c3a3","observation_id":"34a16798-62c1-4b3b-bb86-7acda8cb0242","resolution":{"observed_at":"2026-08-04T19:37:41.637882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.640602Z","title":"Is space-time attention all you need for video understanding?","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.640602Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:d3f129262e07c350e1b6b75afe7db9c6f3bd5b1181da91f5cc2afc4407e1205d","observation_id":"fac54d79-ad37-4493-a215-5d8ba1158541","resolution":{"observed_at":"2026-08-04T19:37:41.640602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.643269Z","title":"Videomae: Masked autoencoders are data-efficient learners for self-supervised video pre- training,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.643269Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:c1c18041d3c363ffe1d3158f1bb9c786d0650670e3adb43b287206c2486015f9","observation_id":"1df2569b-70fe-4751-bfb6-68b4ae774b40","resolution":{"observed_at":"2026-08-04T19:37:41.643269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-08-19T18:30:11.337554Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-04T19:37:41.645943Z","title":"Internvideo: General video foundation models via gen- erative and discriminative learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.645943Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:37a3db2169dee2021be679517e503a36aa6f8496656a54dcaeb2fb9c6e682128","observation_id":"a0fc6081-e0ab-4d7b-aab9-69f4f9ca65f5","resolution":{"observed_at":"2026-08-04T19:37:41.645943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.648984Z","title":"Videomae v2: Scaling video masked autoencoders with dual masking,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.648984Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:0a711c36183e96103642bc23e261558aa78ac56dd3a978c9246de8ff89a0e474","observation_id":"55acbbb5-9c64-4323-b605-b92249014f24","resolution":{"observed_at":"2026-08-04T19:37:41.648984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.651787Z","title":"Internvideo2: Scaling foundation models for multimodal video understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.651787Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:cc2a0655d8a35d31107aa6fca7e36b5f6015b5db9ac7361304f6f08d5651583c","observation_id":"18331253-4077-4f84-a368-b481ae0ab25b","resolution":{"observed_at":"2026-08-04T19:37:41.651787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-08-16T21:21:44.768787Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-04T19:37:41.654342Z","title":"Ucf101: A dataset of 101 human actions classes from videos in the wild,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.654342Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:84316986b88b1b2c6d085d4719e507f93ee22c0cdb53d71ce459d753cd6ddaf9","observation_id":"8197175e-9cfb-4a28-8582-471dc2d84705","resolution":{"observed_at":"2026-08-04T19:37:41.654342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.657439Z","title":"Hmdb: a large video database for human motion recognition,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.657439Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:1aa8d114f76d1599a5b288ba3f78d3be586bd2817d97db8602f71ba4258627f3","observation_id":"16c3da7b-43bb-4d12-aed1-a73a304493db","resolution":{"observed_at":"2026-08-04T19:37:41.657439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.660022Z","title":"A spatio-temporal descriptor based on 3d-gradients,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.660022Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:067a0b760be78562a3a7fb32957d767ddf31d1c97fd90332adc5d3e00f08e46f","observation_id":"35516b6a-f3be-4ac2-a7d1-686491f95699","resolution":{"observed_at":"2026-08-04T19:37:41.660022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.662771Z","title":"Action recognition with improved trajectories,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.662771Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:8a216071361ecc9fea95493aa900dba9e5732427777997d98048b945ca9d029e","observation_id":"5a8a63d9-f1f4-456a-a99c-f4a1312c2794","resolution":{"observed_at":"2026-08-04T19:37:41.662771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.665375Z","title":"Scaling egocentric vision: The epic-kitchens dataset,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.665375Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:d9d4c20abf3b9e3ac3ecf2787a407d0c7bb2aad60e4c314fc3d05bafb25e0a10","observation_id":"63fc5404-8e68-459b-8621-267e1d8f186e","resolution":{"observed_at":"2026-08-04T19:37:41.665375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.667946Z","title":"Two-stream convolutional networks for action recognition in videos,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.667946Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:3f9ab4fdd2f996af16c38c388a128fa9d3cf5cd8853aba19414f33e9e20ce37c","observation_id":"ad772c31-d47f-48bf-91cc-bcf662bebb83","resolution":{"observed_at":"2026-08-04T19:37:41.667946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.670604Z","title":"Omnivl: One foundation model for image-language and video-language tasks,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.670604Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:2356a4120368359052b68a7a97228be8978e6f9383cb72d755793ef600c30b2b","observation_id":"d2dae815-9191-46da-885b-c4957829917f","resolution":{"observed_at":"2026-08-04T19:37:41.670604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.673640Z","title":"Visionllm v2: An end-to-end generalist multimodal large language model for hundreds of vision-language tasks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.673640Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:078707b05e67862ee664d8132b7dc83c1a6f320e0216e269ecc61e94511473cd","observation_id":"dcf3a715-2126-4325-8124-ed369c523a1d","resolution":{"observed_at":"2026-08-04T19:37:41.673640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.676601Z","title":"Timechat: A time-sensitive multimodal large language model for long video understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.676601Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:5d3fb995e475c6bba8b2fc6898d13fefff0235c90426ef623c78cfa62b777f2f","observation_id":"435b8b26-c420-4acd-a4e5-dba506fbf4f0","resolution":{"observed_at":"2026-08-04T19:37:41.676601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-08-13T11:53:19.464291Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-04T19:37:41.679514Z","title":"Videollama 3: Frontier multimodal foundation models for image and video understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.679514Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:1deff3e22f6a7caacede89c33563864ed3aa7974006a06e5dff8d35aad01132a","observation_id":"9b5490e0-2e3a-4634-999e-122cbdad0bbe","resolution":{"observed_at":"2026-08-04T19:37:41.679514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.682433Z","title":"Unified-io 2: Scaling autoregressive multimodal models with vision language audio and action,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.682433Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:872c9408928fc6ebda44d30e1220c593a6ce80a21fe444d70a873ebf0da89821","observation_id":"5207923e-f815-4db3-9b59-2e52ba6f6ad1","resolution":{"observed_at":"2026-08-04T19:37:41.682433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.685162Z","title":"Masked feature prediction for self-supervised visual pre-training,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.685162Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:4b235ce5871686d76da685a12e769e2998503f81379c6b37d4ecb1a2debeac3f","observation_id":"4dcda8f1-40f6-49e0-868c-1270c6a1440d","resolution":{"observed_at":"2026-08-04T19:37:41.685162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.687849Z","title":"Transductive zero-shot action recog- nition by word-vector embedding,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.687849Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:96309c867eccacfb2f27dd1365b4cfc05a46a27229a1f855be5aaf533f9e7b0d","observation_id":"77021111-4909-4dfc-8655-dbb89abc8b61","resolution":{"observed_at":"2026-08-04T19:37:41.687849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.690645Z","title":"Out-of-distribution detection for generalized zero-shot action recognition,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.690645Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:657124ae5bcf19d8acdf96096818e67add420ce01695a2d9d4ca16251f9c8e6b","observation_id":"6219dd9c-0f4b-4d6b-bf6c-d006c4927ebd","resolution":{"observed_at":"2026-08-04T19:37:41.690645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.693367Z","title":"Few-shot action recognition with permutation-invariant attention,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.693367Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:597147e7c8d78d6c288406c8cd302fb584eb8a58cb79f926335415c01701a163","observation_id":"d7526746-074c-4203-a8ec-2f782c923469","resolution":{"observed_at":"2026-08-04T19:37:41.693367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-08-18T03:30:52.103954Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-08-04T19:37:41.696663Z","title":"Actionclip: A new paradigm for video action recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.696663Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:67182ee6dbe5944d7cb44a16137da4b3c919fbb8ba79e88877e8de21ac1891c1","observation_id":"d81fe392-c880-4688-9e6e-3676c10a83e5","resolution":{"observed_at":"2026-08-04T19:37:41.696663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.699682Z","title":"Temporal-relational crosstransformers for few-shot action recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.699682Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:ddbffb084ae8dd4c1997c119dca0b292bec9005efc1ae03459ff482df5caab7b","observation_id":"0853462e-8aa3-42fd-bbba-fb31e8679276","resolution":{"observed_at":"2026-08-04T19:37:41.699682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.702438Z","title":"Temporal-viewpoint transportation plan for skeletal few-shot action recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.702438Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:1fc89966d6bd8fcfd754ea42cbf945816461ac2219ae2094ab9d6fe8e05a6018","observation_id":"77d5d7f8-c3a1-4acc-9e7a-a51fe6cd4de3","resolution":{"observed_at":"2026-08-04T19:37:41.702438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.705135Z","title":"Uncertainty-dtw for time series and sequences,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.705135Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:aa1927b508158ca10e2114bcc261cd66df6270fa28c596150ddfed81433d7f6a","observation_id":"d1dfd0bd-09fc-4b29-bac9-645a425db9ef","resolution":{"observed_at":"2026-08-04T19:37:41.705135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1708.02300","last_updated":"2017-08-07T20:50:24Z","snapshot_observed_at":"2026-08-14T20:42:41.722907Z","submitted_at":"2017-08-07T20:50:24Z","title":"Reinforced Video Captioning with Entailment Rewards","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1708.02300","snapshot_observed_at":"2026-08-04T19:37:41.707954Z","title":"Reinforced video captioning with entail- ment rewards,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.707954Z"},"links":{"cited_paper":"/paper/1708.02300","citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:d1c63a3f5a8e37893b67910bc120554fc36ac0b8f5e8e8ff1a24fe140215a2a2","observation_id":"525169ae-a5e4-403a-b3a6-d6cd8e947381","resolution":{"observed_at":"2026-08-04T19:37:41.707954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.710825Z","title":"Embodied question answering,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.710825Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:4d7b69a5d6602027cbe6cef6e647ee53024b1d38012ce86b01ab89d924111012","observation_id":"ff198091-dbd3-4222-a246-9883e9874bfa","resolution":{"observed_at":"2026-08-04T19:37:41.710825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.713506Z","title":"Merlot: Multimodal neural script knowledge models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.713506Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:2e7b61ee260fb28cfeb4e25ec9d9c24fdcb4b63f6c3ee1fcc3b6758e3b2b11a8","observation_id":"107ce85e-d625-49ce-a115-a097141dbf44","resolution":{"observed_at":"2026-08-04T19:37:41.713506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.716087Z","title":"Flamingo: a visual language model for few-shot learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.716087Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:32042de253f303ff5f0f609ae7aea2f1fd977cf0ac727b8ff781bafcd90db4e9","observation_id":"cf8a4492-20c5-4de6-9030-5872e0641fe7","resolution":{"observed_at":"2026-08-04T19:37:41.716087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.719093Z","title":"Human action recognition from various data modalities: A review,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.719093Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:4d66f94d27ec5f798625aaece69177f7ca2bf70a920ff3d80f268e5be10df89b","observation_id":"f2bbb6d3-55b3-4173-b271-9799c40e42b6","resolution":{"observed_at":"2026-08-04T19:37:41.719093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05615","last_updated":"2026-05-12T03:37:41Z","snapshot_observed_at":"2026-08-13T06:13:12.956934Z","submitted_at":"2024-06-09T02:36:28Z","title":"Video-Language Understanding: A Survey from Model Architecture, Model Training, and Data Perspectives","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05615","snapshot_observed_at":"2026-08-04T19:37:41.721882Z","title":"Video-language understanding: A survey from model architecture, model training, and data perspectives,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.721882Z"},"links":{"cited_paper":"/paper/2406.05615","citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:f72ac6142e6e97c42aa28bc2bf8101dc254e7874661b76381b5441064383f21a","observation_id":"acd93843-1245-4273-9ddf-fc8d3bb2bc92","resolution":{"observed_at":"2026-08-04T19:37:41.721882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.724813Z","title":"Video question answering: A survey of the state-of-the-art,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.724813Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:746c662b09ac84a705ce351e70b70d4887045ade0bac48a6959d7696765297bb","observation_id":"0c106935-f0ae-487d-9b55-44be443ebbff","resolution":{"observed_at":"2026-08-04T19:37:41.724813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16038","last_updated":"2024-01-30T14:37:10Z","snapshot_observed_at":"2026-08-16T14:23:14.163704Z","submitted_at":"2024-01-30T14:37:10Z","title":"A Survey on Generative AI and LLM for Video Generation, Understanding, and Streaming","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16038","snapshot_observed_at":"2026-08-04T19:37:41.730222Z","title":"A survey on generative ai and llm for video generation, understanding, and streaming,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.730222Z"},"links":{"cited_paper":"/paper/2404.16038","citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:d9d15c5bbf99b0fb455cdf915df1b040f27598a437bfc0a3d5e6759f29496825","observation_id":"31bcdc0b-7e56-40b2-81a7-758c6c21f8e3","resolution":{"observed_at":"2026-08-04T19:37:41.730222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.733204Z","title":"Human activity analysis: A review,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.733204Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:7e76e94a864cfffed31202b264cb977fb2b07d18314271ef7f6f2413fbdfbe10","observation_id":"c2c92449-c826-482c-a6e2-524519aeb595","resolution":{"observed_at":"2026-08-04T19:37:41.733204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.735946Z","title":"Going deeper into action recognition: A survey,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.735946Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:b32787615dd12ef7592388a4292f99731c018ebdfd66b80fd115c0b42039b908","observation_id":"fd60c122-08a2-4ac8-a417-484c94867174","resolution":{"observed_at":"2026-08-04T19:37:41.735946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.738840Z","title":"A survey on video-based human action recognition: recent updates, datasets, challenges, and applications,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.738840Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:80ecb365bd002cd0a6a1ab8a859d4116206223e0e708299e0cf51a32736aaec5","observation_id":"7484f816-5a30-4e7a-9785-c74dc3bc7b56","resolution":{"observed_at":"2026-08-04T19:37:41.738840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.05700","last_updated":"2022-09-13T02:57:05Z","snapshot_observed_at":"2026-08-19T17:19:41.877999Z","submitted_at":"2022-09-13T02:57:05Z","title":"Vision Transformers for Action Recognition: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.05700","snapshot_observed_at":"2026-08-04T19:37:41.742070Z","title":"Vision transformers for action recognition: A survey,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.742070Z"},"links":{"cited_paper":"/paper/2209.05700","citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:1c6a7d99d27a990bce16b7c65bd0103ac5b85c2e3f547ad0da7b97edf22d9fcf","observation_id":"b9ed3d35-625b-44b0-a307-ecee01b7523f","resolution":{"observed_at":"2026-08-04T19:37:41.742070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.745553Z","title":"Video transformers: A survey,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.745553Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:50a0833b620442e3dcdba7bc9423ab0b94370a6cd3bd7c38e48d4095719e5d62","observation_id":"554aeb2d-04fa-4b0d-a5d9-afeedeadee1a","resolution":{"observed_at":"2026-08-04T19:37:41.745553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.749025Z","title":"End-to-end learning of visual representations from uncurated instruc- tional videos,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.749025Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:8c0487606f0642b136477f1a31bb4f2a0f1a706c7fdbd648cf95fc6ff9fc16d0","observation_id":"08c4997d-03ab-4165-8fc9-7f2f7dec14ee","resolution":{"observed_at":"2026-08-04T19:37:41.749025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.751971Z","title":"Multimodal learning with transform- ers: A survey,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.751971Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:663f8e2545955d23e5f6473a9453d5e1647cd245e609eeb323354b07655b743b","observation_id":"874c92ce-cc18-49f2-8bf4-abb8e70106f2","resolution":{"observed_at":"2026-08-04T19:37:41.751971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.755142Z","title":"A survey on human activity recognition from videos,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.755142Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:4f8315eb1269fb1838fe8269d0fd3ff68525e4e58d9aaa0f64b6644886cd2d4a","observation_id":"52a66120-939a-45d9-9441-3f6016525276","resolution":{"observed_at":"2026-08-04T19:37:41.755142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.758367Z","title":"A comparative review of recent kinect-based action recognition algorithms,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.758367Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:bf2610c664084b31b3154ce6ef7d5328b1d2edd44653ce59b0e3d47a54560178","observation_id":"c39646f6-9189-41a6-8854-4eecc7651061","resolution":{"observed_at":"2026-08-04T19:37:41.758367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.761547Z","title":"Skeleton- based action recognition with shift graph convolutional network,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.761547Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:ff739e9b6fba9e5c25ede8d5f8aff2ed5e6f9db3746c229f816237bba2856c4d","observation_id":"8054463e-bc0c-48d7-9725-c6400020047f","resolution":{"observed_at":"2026-08-04T19:37:41.761547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.764684Z","title":"Graph convo- lutional neural network for human action recognition: A comprehensive survey,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.764684Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:664406564a7e297f37dc90ca7b8f3b727a82491eaf124b112ce69a20658c88f9","observation_id":"25a293b3-e079-4a0d-a344-0898308c7d7e","resolution":{"observed_at":"2026-08-04T19:37:41.764684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.767528Z","title":"A survey on deep learning for skeleton-based human animation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.767528Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:8dbe5e6abc3c3242a1ababab8bc51127ee090b5218ded36338eac0bbb501530f","observation_id":"6fc55875-7abb-4e8e-82f8-0766c7cbc3cc","resolution":{"observed_at":"2026-08-04T19:37:41.767528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.770265Z","title":"A survey on 3d skeleton-based action recognition using learning method,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.770265Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:ea37c51f5196448ca7751211b3fbb03bd914c95f51c7de92d0e69b64f5e5ca4e","observation_id":"f2b88aff-6e0c-40e3-9551-cae65747091a","resolution":{"observed_at":"2026-08-04T19:37:41.770265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.772962Z","title":"Self-supervised visual feature learning with deep neural networks: A survey,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.772962Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:09c47fc316be2eaa35ca6dc50704aced027d81605e4f1209e5f7b325ba57f130","observation_id":"6139f1af-29f4-43bf-ba9b-efdd8eff4bad","resolution":{"observed_at":"2026-08-04T19:37:41.772962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.775806Z","title":"Self- supervised learning: Generative or contrastive,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.775806Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:a82267eb7e18e16dea9e36358e699dc0ee91a199a7e717aae2063eedb996c7ff","observation_id":"5fb5a8a2-c48f-44e3-a6a8-51fa303abafd","resolution":{"observed_at":"2026-08-04T19:37:41.775806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.778740Z","title":"Self-supervised representation learning: Introduction, advances, and challenges,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.778740Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:65559e0f76985476618339e68e2f7468eb6243a6384ce62a278aef698be44a71","observation_id":"e0adc5e7-5e0c-4b80-a685-b9b809160857","resolution":{"observed_at":"2026-08-04T19:37:41.778740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.781602Z","title":"Deep generative models: Survey,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.781602Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:f43f3c4586fac146f09c3cd70ed7d486aaa62b2c98b75181dfd29757327efc6d","observation_id":"d67e78c3-3907-435c-ad8d-98a6ffdf97ae","resolution":{"observed_at":"2026-08-04T19:37:41.781602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.784280Z","title":"A survey of multimodal deep generative models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.784280Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:4ab60bf4a75509a3867ce5284ce7e17c74fa1746de2f08dcee12f02c12dacd16","observation_id":"08df6e10-aa14-4c6d-a590-a69f6797d422","resolution":{"observed_at":"2026-08-04T19:37:41.784280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.787325Z","title":"Sora as an agi world model? a complete survey on text-to-video generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.787325Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:96c6c4636546910564b6d71a47cf47f2b97b56455142ae8e2a9ec50f961c6891","observation_id":"51bc42a8-cf82-4859-8e68-c361b0f90c19","resolution":{"observed_at":"2026-08-04T19:37:41.787325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.790189Z","title":"A survey on video diffusion models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.790189Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:cd0ab278a900b14da23077cae7a287d5a8ba412804e6438c860c2be7828faf82","observation_id":"6ff27288-f786-48c8-8049-70c983c38830","resolution":{"observed_at":"2026-08-04T19:37:41.790189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.792842Z","title":"Benchmarking a multimodal and multiview and interactive dataset for human action recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.792842Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:f1a247d34d041f30efe46469fbd21fe01b2d3e65ad8c878ee7ad8f9d3352118c","observation_id":"348cf097-dd21-4269-8785-def3e3d856c4","resolution":{"observed_at":"2026-08-04T19:37:41.792842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.796479Z","title":"Video benchmarks of human action datasets: a review,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.796479Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:60ae3aa9a96b2cff3ede68e31027b1650a5ae4dff3c31dafd33d244b5d0ab829","observation_id":"7f2df4d5-0dd3-43a9-8481-1f67f0a90918","resolution":{"observed_at":"2026-08-04T19:37:41.796479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.799528Z","title":"A review of convolutional-neural-network- based action recognition,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.799528Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:1307686eff4d4ba8726e75f02f35c19d90f2f69a05d4b3c3a97caf54c309591a","observation_id":"76cd93f5-0b11-400a-bf4f-7bdce5c6c16a","resolution":{"observed_at":"2026-08-04T19:37:41.799528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.802273Z","title":"Benchmarking micro-action recognition: Dataset, methods, and applications,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.802273Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:e1e18b7068f61a8e2631c1579d25b62380545776f544517b0a5ad3963d0b93c3","observation_id":"a2eb788e-7db7-40e4-9911-5d1d70a88faa","resolution":{"observed_at":"2026-08-04T19:37:41.802273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.805214Z","title":"An outlook into the future of egocentric vision,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.805214Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:5386c5ba1ab6fe077c6f1d3922b5e26ce0ef4717ba4bea5ebb90e3e4e67502e4","observation_id":"c8df63e0-75e7-40e0-859c-8218a3bcf36f","resolution":{"observed_at":"2026-08-04T19:37:41.805214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.807877Z","title":"A survey of content-aware video analysis for sports,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.807877Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:f28ca348bc52b5b54548df9f3ef1ee9f0a34679e8fbbfbc65aaf816566725336","observation_id":"a8f6e50b-f237-40bc-b825-469bc8b99776","resolution":{"observed_at":"2026-08-04T19:37:41.807877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.810764Z","title":"Video transcoding: an overview of various techniques and research issues,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.810764Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:c62e8195ab2ef43e7ea070d62959b1a3dc85975ca64910481c4b3b39ee8c9ed2","observation_id":"b21731e8-c9c5-4fa2-9186-d7403273ec4b","resolution":{"observed_at":"2026-08-04T19:37:41.810764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.813690Z","title":"Video description: A survey of methods, datasets, and evaluation metrics,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.813690Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:dcb72215a2debaefb5ff7d5fa9cd6636f454bd4769e3ad0e371999d46dfe8a1f","observation_id":"d3c6fe3b-a3b8-43fc-a3db-87bc48f4fde5","resolution":{"observed_at":"2026-08-04T19:37:41.813690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.816412Z","title":"Generative multi- view human action recognition,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.816412Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:63877c054fc6c32a8e4f0da94da3ef54d608309b1f3a44a3aeafb75fef245c92","observation_id":"df6379d3-78a0-4078-b712-6fb025e639e8","resolution":{"observed_at":"2026-08-04T19:37:41.816412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.819066Z","title":"Human action recognition and prediction: A survey,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.819066Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:10b034742da98ce88210cb325ee9e40fd28a49edfd6fd04ead4e596d5cb0f2d2","observation_id":"4eeb544d-2cbb-4849-968a-e1c744b4f1d1","resolution":{"observed_at":"2026-08-04T19:37:41.819066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.821755Z","title":"Video generative adversarial networks: a review,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.821755Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:1c0d731612c30cb1998d26781827ff007647772e7dd4322611e822fc0576cffb","observation_id":"2cb1cf0d-6d3f-45a2-bfae-96ee2912e6d2","resolution":{"observed_at":"2026-08-04T19:37:41.821755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.824426Z","title":"Search-map-search: a frame selection paradigm for action recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.824426Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:8a794bea2be1c2c836ca4791a33b7928d76009ec0385d907e0d4c4bdc7933230","observation_id":"7227d4e1-5845-42db-bd91-084c134eb6f5","resolution":{"observed_at":"2026-08-04T19:37:41.824426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.827055Z","title":"Self-supervised learning for videos: A survey,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.827055Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:8f0866208632d9b2a75f32ac74cc77fab4ee0ce39e562d0e85390b8b8b7d5803","observation_id":"466a9ec3-f511-4ccc-9a82-7bea40bf394a","resolution":{"observed_at":"2026-08-04T19:37:41.827055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.829719Z","title":"On space-time interest points,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.829719Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:2ed34e6e61a7498feb4e738ad00dea21cdad5e46fcef0551fd828332cdb22a19","observation_id":"83d239b4-12f3-4dd2-ad6b-717589ed63cb","resolution":{"observed_at":"2026-08-04T19:37:41.829719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.832545Z","title":"Histograms of oriented gradients for human detection,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.832545Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:d680218d1e8d923c5c68ae2552360ccbb6f5b963f77581a60ca99af7928db8e4","observation_id":"7a54a205-b635-4054-a346-79755aa9367a","resolution":{"observed_at":"2026-08-04T19:37:41.832545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.835545Z","title":"Dense trajectories and motion boundary descriptors for action recognition,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.835545Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:814a2c6aafb41fb13fde01be4f79118e1cd48dd26e54d003de0384a3047dd1ad","observation_id":"16a61d7f-0eb9-4fd2-8d50-675aa9e0a063","resolution":{"observed_at":"2026-08-04T19:37:41.835545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.838250Z","title":"Transformers in vision: A survey,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.838250Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:208fb528ffba61a5a7e44483be06fa14c6b1ac01934d13e964ace7a0c673c0ee","observation_id":"232b5f38-071b-48e5-bd29-c93db579818b","resolution":{"observed_at":"2026-08-04T19:37:41.838250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.07274","last_updated":"2018-11-26T04:56:31Z","snapshot_observed_at":"2026-08-15T10:58:31.329286Z","submitted_at":"2017-01-25T11:52:11Z","title":"Deep Reinforcement Learning: An Overview","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.07274","snapshot_observed_at":"2026-08-04T19:37:41.840934Z","title":"Deep reinforcement learning: An overview,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.840934Z"},"links":{"cited_paper":"/paper/1701.07274","citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:3ed51a142a7322d881e819ef9b58aea667628e250cb213a0886d783b07dd91e3","observation_id":"238925de-89ca-4b9a-8802-0201e4604e44","resolution":{"observed_at":"2026-08-04T19:37:41.840934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.843803Z","title":"Deep reinforcement learning: A brief survey,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.843803Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:9f43a30c7d37339f12f18efbcfbde6251a6e29d73b7a49cf5cc51d6d93057961","observation_id":"ce44ac83-9d05-471c-887f-f45921c23157","resolution":{"observed_at":"2026-08-04T19:37:41.843803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.846721Z","title":"Continual lifelong learning with neural networks: A review,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.846721Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:9af20996944a9ca759df70fee1cfc65b64405bcc8ce0a45c83959af12fad0e1a","observation_id":"dd59018d-85cd-4943-bd36-770cc3f106ce","resolution":{"observed_at":"2026-08-04T19:37:41.846721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:41.849450Z","title":"Federated machine learning: Concept and applications,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.849450Z"},"links":{"citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:f5b4eb5809f0bef70843cfdded32d4e220204c4ccb8860dac95e53d861ca5b70","observation_id":"f13ee776-fed0-471b-9cd0-df84cc97350a","resolution":{"observed_at":"2026-08-04T19:37:41.849450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T10:48:06.285046Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":250},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 100 of 250 outbound references and 0 inbound Pith citation observations for arXiv:2509.09151."}