{"as_of":"2026-08-09T00:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:55f8704bd12caac56af63172e872055d8801e0a9ae5323402b9a466340ae5d4e","coverage":[{"denominator":176,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T13:18:19.326446Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.07277/citation-record","integrity":"/paper/2502.07277/integrity","json":"/paper/2502.07277/citation-record.json","paper":"/paper/2502.07277"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1609.08675","last_updated":"2016-09-27T21:21:49Z","snapshot_observed_at":"2026-08-06T22:24:48.588621Z","submitted_at":"2016-09-27T21:21:49Z","title":"YouTube-8M: A Large-Scale Video Classification Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.08675","snapshot_observed_at":"2026-08-08T13:18:18.875726Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:18.875726Z"},"links":{"cited_paper":"/paper/1609.08675","citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:74fc899e365c416e087ba0c1d0a02a82daa75aca85e28b953cfb7849254b426a","observation_id":"03b1c034-fb50-459d-815a-650241535e44","resolution":{"observed_at":"2026-08-08T13:18:18.875726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:18.881199Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:18.881199Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:2ad09aaf16ca0a0aa1045881a156b15b0709b1d3acc1223bb3358258d6c055e1","observation_id":"c9aa2804-c60b-48f7-9ea5-d8b21269e9f7","resolution":{"observed_at":"2026-08-08T13:18:18.881199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:18.885784Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:18.885784Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:b61ac92088aeabd2bb1d438da0c5709f9b7312a83f5e0f34fe3f3e86e19445e0","observation_id":"ccb02128-861a-4e6a-b4a7-a947d9bd5800","resolution":{"observed_at":"2026-08-08T13:18:18.885784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:18.890408Z","title":null,"venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:18.890408Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:d4678b278f260a23bb49e0d2bc0d811183fdc43b8efdd019c309c2e5af7f3e15","observation_id":"4e1675c4-a6c9-49e8-a0b1-ca83386d43c7","resolution":{"observed_at":"2026-08-08T13:18:18.890408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:18.895054Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:18.895054Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:b86498177692ad4b2a0ffc1ffc062b9aa459e17e825c3c3f87c18185f72f68b7","observation_id":"5cc8eb73-5f1e-4d51-8d38-d9d21e29df8a","resolution":{"observed_at":"2026-08-08T13:18:18.895054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:18.899626Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:18.899626Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:ad8f4c8575cfc0530031d4e7bd011a1cf1db2b8ce5d549060e8e3a431afd6ab3","observation_id":"feeac180-f195-420e-ad7a-b59e1e893354","resolution":{"observed_at":"2026-08-08T13:18:18.899626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:18.904684Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:18.904684Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:182ea5f151793cdad314f1a428e9cc1be5f0a1b45f378585508619f280147b5d","observation_id":"30f9fd64-adcb-41e6-8bcc-7aab39fe21c0","resolution":{"observed_at":"2026-08-08T13:18:18.904684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:18.909040Z","title":null,"venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:18.909040Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:e6660b13ed7846b7b936d5e7846801284cfda2e2a684a61d77dfd0639ae200bb","observation_id":"53bdccef-f92e-4539-96c9-3eaca7c3347d","resolution":{"observed_at":"2026-08-08T13:18:18.909040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:18.913509Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:18.913509Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:b97c331d4b2335dddede58395ee17c483b1fd2e9498a5cd7dd7bd8cdaa2762f5","observation_id":"aea3d358-cd1f-4213-afee-5703c7eae363","resolution":{"observed_at":"2026-08-08T13:18:18.913509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:18.917806Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:18.917806Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:65d5565bdc912cba3e2649a28124c510a4b8f0420ebad06d916bd43c51c1574d","observation_id":"116bf1ac-3ca4-4e83-910e-3cfb964f39a1","resolution":{"observed_at":"2026-08-08T13:18:18.917806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:18.922345Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:18.922345Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:bfc23fafc2edc190fc086679ea5316418af483ace68d41b6eb0c52fcb9742876","observation_id":"1cf4ff39-31de-4066-80c2-b1697f1bf9fa","resolution":{"observed_at":"2026-08-08T13:18:18.922345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:18.926708Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:18.926708Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:873fcca13bb0491a4e89ff812f52d60fceab633547b6db9d3e13b693603db4a0","observation_id":"dae034f8-42ed-403b-8c81-fff4fb1034b9","resolution":{"observed_at":"2026-08-08T13:18:18.926708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:18.931035Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:18.931035Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:2ea3357091a0a68a4891f62c56c538c91da2af028d1dee258ce1b4864509fc6b","observation_id":"90dc38aa-a7a1-4930-a584-e06b7e3e4311","resolution":{"observed_at":"2026-08-08T13:18:18.931035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:18.935160Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:18.935160Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:fa9209e285d92cd838cd49b8edf3c33fb9e1489418dfd8f985e2bba8a9b596fc","observation_id":"6197ba79-91cd-4bc1-b9ea-7ea56a175efa","resolution":{"observed_at":"2026-08-08T13:18:18.935160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:18.939378Z","title":null,"venue":null,"work_id":null,"year":1986},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:18.939378Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:2c7cb03660814eef61fa84c2ea395403666796815176790e8a16bf71ff2dd419","observation_id":"8044d169-ba0b-4b50-b7ce-cdd90117e708","resolution":{"observed_at":"2026-08-08T13:18:18.939378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:18.943639Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:18.943639Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:bb4de9978c06131bf448257b658168a7e324d58c1ea9442b33028f30dff0ad42","observation_id":"6cfbd7bb-dd76-4195-a484-dd38c4098c15","resolution":{"observed_at":"2026-08-08T13:18:18.943639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:18.948138Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:18.948138Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:634aa8f4563a6d10fe74f5a1efbb4262e13e6b2409360c6c5f5f75c18b180711","observation_id":"6fdde36d-ba21-40b1-8d96-f6aa89a87bc4","resolution":{"observed_at":"2026-08-08T13:18:18.948138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.01340","last_updated":"2018-08-03T20:17:05Z","snapshot_observed_at":"2026-07-06T06:54:00.483796Z","submitted_at":"2018-08-03T20:17:05Z","title":"A Short Note about Kinetics-600","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.01340","snapshot_observed_at":"2026-08-08T13:18:18.952554Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:18.952554Z"},"links":{"cited_paper":"/paper/1808.01340","citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:a5a54d072fb98abde7f2e4413ff166312a9381c86df2161cffe4dd926c2a9faf","observation_id":"1a91fe38-a35f-4a8f-8e4f-11aa0c5d9c72","resolution":{"observed_at":"2026-08-08T13:18:18.952554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.06987","last_updated":"2022-10-17T19:58:40Z","snapshot_observed_at":"2026-07-06T08:08:03.081236Z","submitted_at":"2019-07-15T12:58:21Z","title":"A Short Note on the Kinetics-700 Human Action Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.06987","snapshot_observed_at":"2026-08-08T13:18:18.957190Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:18.957190Z"},"links":{"cited_paper":"/paper/1907.06987","citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:e99f256bec0d8e55af222aba6438a61fb38bf7cf54450868bcd012877a04d53d","observation_id":"042e2124-c026-4ef7-8339-3bb1b9fd6919","resolution":{"observed_at":"2026-08-08T13:18:18.957190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:18.961805Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:18.961805Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:9f8303dc2617197119791b71938b0eefd6658370bbdd2e7d7538a4f2d6e52590","observation_id":"fe21af71-39ff-42d7-bf77-c42c769f78fb","resolution":{"observed_at":"2026-08-08T13:18:18.961805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:18.966076Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:18.966076Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:07dc85c268bd65d0289be0e69b944ad92b1053da5a7dcd79a0e0c89f129bb5da","observation_id":"7fae9771-cf25-4c99-b4a7-65c29bf2ed43","resolution":{"observed_at":"2026-08-08T13:18:18.966076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:18.970519Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:18.970519Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:f7a73846894a4a90e119b75a98762a6723c89a3f770074700d36ba527ece9bc3","observation_id":"d9d3016c-72f0-4d0d-9b85-d9ae855bbd68","resolution":{"observed_at":"2026-08-08T13:18:18.970519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-08-08T13:18:18.974768Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:18.974768Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:7de0a26565f43fdccc8bafe8e9b26e92f301643c85e3545b776191b96c7d95cb","observation_id":"5b769fe4-4d07-428c-a9d5-8968fd32bbb5","resolution":{"observed_at":"2026-08-08T13:18:18.974768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1406.1078","last_updated":"2014-09-03T00:25:02Z","snapshot_observed_at":"2026-07-06T03:45:28.546418Z","submitted_at":"2014-06-03T17:47:08Z","title":"Learning Phrase Representations using RNN Encoder-Decoder for Statistical Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1406.1078","snapshot_observed_at":"2026-08-08T13:18:18.979516Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:18.979516Z"},"links":{"cited_paper":"/paper/1406.1078","citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:1faf6716895b883dd899cffb9aca56c51437c7a595d0db631566fc8cbd3a0d51","observation_id":"63b5765e-dc52-40d5-a5d8-c82c19fc57c3","resolution":{"observed_at":"2026-08-08T13:18:18.979516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.14794","last_updated":"2022-11-19T12:45:21Z","snapshot_observed_at":"2026-08-08T20:36:21.234658Z","submitted_at":"2020-09-30T17:09:09Z","title":"Rethinking Attention with Performers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.14794","snapshot_observed_at":"2026-08-08T13:18:18.984250Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:18.984250Z"},"links":{"cited_paper":"/paper/2009.14794","citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:7d589369c2256465d0356c899f39772df1514dcfa63b44db16bc2fe55e597a1c","observation_id":"7ebbc50f-9ea1-436e-9ded-b451f1baaafd","resolution":{"observed_at":"2026-08-08T13:18:18.984250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:18.988981Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:18.988981Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:e1c43e67ce4327c342a88bcad30fc095befcdab8392ee36ff2eb7073d69c8766","observation_id":"c2691d2c-dd10-473d-851b-b63f44ef8505","resolution":{"observed_at":"2026-08-08T13:18:18.988981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.03584","last_updated":"2020-01-10T09:06:09Z","snapshot_observed_at":"2026-08-08T18:22:25.821248Z","submitted_at":"2019-11-08T23:48:38Z","title":"On the Relationship between Self-Attention and Convolutional Layers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.03584","snapshot_observed_at":"2026-08-08T13:18:18.993238Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:18.993238Z"},"links":{"cited_paper":"/paper/1911.03584","citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:32119435a8d9c2355d9f3e40d2a4918b46025d0bf7794fb61b09b70666716e68","observation_id":"aeefb886-3e16-46c8-8d22-34be6485a512","resolution":{"observed_at":"2026-08-08T13:18:18.993238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:18.997937Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:18.997937Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:8bcf26cd9fa2dafb5ad28c613cfa6b4785aec46104112bad996a7f23ab2605a3","observation_id":"1acd541b-5138-45f7-8c6f-6e75a3e66e1c","resolution":{"observed_at":"2026-08-08T13:18:18.997937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:19.002531Z","title":null,"venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.002531Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:4f829132fad3a08f15994328587fca2e015b5b56d917ffcdae83d8b6b1056bd7","observation_id":"5f1e5fbf-53ba-4445-a9af-7f9835521ed2","resolution":{"observed_at":"2026-08-08T13:18:19.002531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-08T13:18:19.007028Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.007028Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:e0d4516a87de041c9f2d106a7e2dbe69706b2cccd01a30da7af1eef56fa8dadf","observation_id":"9896b5d4-1fdb-4539-9a43-b429a7230ab5","resolution":{"observed_at":"2026-08-08T13:18:19.007028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.11451","last_updated":"2020-12-15T06:53:39Z","snapshot_observed_at":"2026-08-02T17:59:36.591823Z","submitted_at":"2019-04-25T16:49:13Z","title":"Large Scale Holistic Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.11451","snapshot_observed_at":"2026-08-08T13:18:19.011643Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.011643Z"},"links":{"cited_paper":"/paper/1904.11451","citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:262a48e8812c41d57b5358e5c730b6b0a01e985ced989418de29e435443d290b","observation_id":"5adaf9ba-3252-41a3-b07e-08f7acc71fc5","resolution":{"observed_at":"2026-08-08T13:18:19.011643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:19.016143Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.016143Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:3f2a20cff4c973fab81440f646d1e8ea9cd1a8d7e45b72607bebd96ced1834d4","observation_id":"341bc730-b934-4120-9c2b-cf05f367c10c","resolution":{"observed_at":"2026-08-08T13:18:19.016143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:19.020759Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.020759Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:d7ceb086989f3a20f8dd9d8e490ad69ebbc7784412a8e4ddd8ac4e1218524bd9","observation_id":"c2edb4c1-6773-44ea-8f45-aff576df484a","resolution":{"observed_at":"2026-08-08T13:18:19.020759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:19.025017Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.025017Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:be40e23174a074cf6eaeb67d2febeac170bc5c1c3c573b56da87352f9d864ced","observation_id":"e03abccf-ee02-402b-a244-1405c003a664","resolution":{"observed_at":"2026-08-08T13:18:19.025017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-08T13:18:19.029242Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.029242Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:9641be6c0056a05956e1424cc9a18af602db28275be592db2005169bc10c2065","observation_id":"41482a33-9674-477a-b15e-b21ad818bfd3","resolution":{"observed_at":"2026-08-08T13:18:19.029242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:19.033878Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.033878Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:2f9e8093d664657deabd3b12387e79b3b8fddfbb85feacd62edb84d7e8f758f3","observation_id":"1bc92d07-b912-48ef-9055-f62ea3a76433","resolution":{"observed_at":"2026-08-08T13:18:19.033878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:19.038385Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.038385Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:02e8f7047378f9b734921836d3c9f591b26d47b6f5b35411c1e0d15206ac097c","observation_id":"0ba0d1c2-1888-4759-b740-736d667b3be3","resolution":{"observed_at":"2026-08-08T13:18:19.038385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:19.042777Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.042777Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:a5d8e344599446d7bcd27524c133957b1b761134749622aa4168481ee211b8c8","observation_id":"97713d70-235a-477c-b487-9754df512836","resolution":{"observed_at":"2026-08-08T13:18:19.042777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:19.047199Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.047199Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:58e7cd0525d306c73d37efcaee8a06ca6ef0d836dba3b2cf67e6f4fa2a099c7a","observation_id":"9cafe004-2f0d-4c25-aba3-d411421039d9","resolution":{"observed_at":"2026-08-08T13:18:19.047199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:19.051703Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.051703Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:42f23fa0f19af18b1ebd775e75a2d4b7a0d3364e9dcdccc837c61a03252bd99c","observation_id":"a9ff2277-832b-472f-8ca8-cd99cbb5f6b4","resolution":{"observed_at":"2026-08-08T13:18:19.051703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:19.056500Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.056500Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:9116fc3f369514191792995d1590289f0b9281fd1420920be938b9ea80feeff6","observation_id":"2a53a5f3-88c2-4efc-962e-3721daee2f9a","resolution":{"observed_at":"2026-08-08T13:18:19.056500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:19.060854Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.060854Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:bb5c63486afc6e8f4450384d08e9ab14f9a53957e13fc82076875ea3d1540e6a","observation_id":"041aaa36-29f7-4f9b-820a-98c721da162e","resolution":{"observed_at":"2026-08-08T13:18:19.060854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:19.065213Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.065213Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:f9fac9798c0e7ea0e330508493872fd426e0359803e6d54f171364aa4aeba8a0","observation_id":"b7b23731-fa7f-4178-8b74-46b8aecb9a96","resolution":{"observed_at":"2026-08-08T13:18:19.065213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:19.069769Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.069769Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:12ac661d90051181ecf4e9ab2ea993aed28770cb1407f59a172df0333061b11f","observation_id":"a9ca0d5f-167c-4d9d-81ce-fe6ff675736a","resolution":{"observed_at":"2026-08-08T13:18:19.069769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:19.074113Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.074113Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:af0fd7d4d3a44b7528399606ff0d409e26cfd87c06b2f09ac814c9a56fae6b4e","observation_id":"0c674c6c-936a-4e80-8e20-f325efad6586","resolution":{"observed_at":"2026-08-08T13:18:19.074113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:19.078548Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.078548Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:ea7d7e2c5be2ce96c2b41bcfd511dd7677dc183a1f00d62a35cdc238929069a8","observation_id":"48f182e4-e407-48c8-a344-543cde09e3ad","resolution":{"observed_at":"2026-08-08T13:18:19.078548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:19.082887Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.082887Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:0949dcb6b88e8c76d03b9e620519d380c4ea3c2685d2f6db30f10a8453935b94","observation_id":"e3114de1-f70e-4f86-ae81-13eb20834c16","resolution":{"observed_at":"2026-08-08T13:18:19.082887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:19.087145Z","title":null,"venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.087145Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:b5cda2ddc8f304c15a1e7341e149fd3b52b848a109d0ab3c0d7c3b381689b6a7","observation_id":"b8568dfc-68c4-4ab0-b50f-819176d74dfd","resolution":{"observed_at":"2026-08-08T13:18:19.087145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:19.091744Z","title":"something something","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.091744Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:57adab8ff7b6c93f6ec02791d09db3a7359cbe7c9aa08c59fab12d455d7cd203","observation_id":"0d9d3089-6ca3-4ef0-99ba-84b68fcd4e11","resolution":{"observed_at":"2026-08-08T13:18:19.091744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:19.096189Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.096189Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:bcd1e97110d2de93fd531ffead938916bba4d19950cabd9c7032d1da46af48a0","observation_id":"a3a8c51e-b6ba-484e-a6b9-b419fa1cb12a","resolution":{"observed_at":"2026-08-08T13:18:19.096189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:19.100706Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.100706Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:5867bedcbbca455561c824ecfe6d76e91a35fcd77c19a77e166fbe7b1d760a36","observation_id":"8f9fcaa4-b46a-4592-bcb1-f074be42e58c","resolution":{"observed_at":"2026-08-08T13:18:19.100706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:19.105138Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.105138Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:d938f3ddf7c883284dcf7cf28bdf2b26ab7c35a075a9ae9cde99ccdf3872ef12","observation_id":"b39a7ea7-4336-4d59-a455-0f1973adecca","resolution":{"observed_at":"2026-08-08T13:18:19.105138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:19.109607Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.109607Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:563d59b50c42d78c5fac8c40db6e80370c047e903c776584f79b26e719283184","observation_id":"f885d242-9bb6-4374-975e-002e07466669","resolution":{"observed_at":"2026-08-08T13:18:19.109607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:19.113959Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.113959Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:18908d6fb1503991ac28d3693ad11c1262928615385d7d81625692a3769d7e14","observation_id":"7eed4717-b48c-4ed8-b824-88659a044aa2","resolution":{"observed_at":"2026-08-08T13:18:19.113959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:19.118483Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.118483Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:97f52df80e8036328957096ff0152db7877f37481eebae15274ef02d330c0655","observation_id":"49749d54-9741-4aa8-903b-8060c31fa4fc","resolution":{"observed_at":"2026-08-08T13:18:19.118483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:19.122971Z","title":null,"venue":null,"work_id":null,"year":1988},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.122971Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:8172fa83e64edab33a2bae61afcdbb2cdfff8be06c981b3abc1b309deab77dd0","observation_id":"755c5a37-54ce-4573-aca9-1eed4410052b","resolution":{"observed_at":"2026-08-08T13:18:19.122971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:19.127500Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.127500Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:b103e60477ee54881a1036d21c653205354835df876c61958cbc1b5f2ae68e8e","observation_id":"c07fa529-f032-417a-8a6e-5d0cbf0eb9fa","resolution":{"observed_at":"2026-08-08T13:18:19.127500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.12180","last_updated":"2019-12-20T13:27:27Z","snapshot_observed_at":"2026-08-06T23:06:09.224235Z","submitted_at":"2019-12-20T13:27:27Z","title":"Axial Attention in Multidimensional Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.12180","snapshot_observed_at":"2026-08-08T13:18:19.131765Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.131765Z"},"links":{"cited_paper":"/paper/1912.12180","citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:75358612e9fd993dc2d57e9bac7b91e8aa716208861b2c195e15b37f329738b9","observation_id":"222f5da2-de4f-408f-bd51-486da6e3cab4","resolution":{"observed_at":"2026-08-08T13:18:19.131765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:19.136374Z","title":null,"venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.136374Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:391f1aebd396fecf978e989d7e2cfddfd4945dac1280d5d10144153ccfc0435d","observation_id":"b94e21f5-c6a1-49b7-a3bf-ed3c4498cb4f","resolution":{"observed_at":"2026-08-08T13:18:19.136374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:19.140842Z","title":null,"venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.140842Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:d27a9de8e021c878807fc89e76011db2a58942ece71e42ab78a2fb19ff5b0c19","observation_id":"d66af203-2b95-4d0d-9ce5-b1370945ff4d","resolution":{"observed_at":"2026-08-08T13:18:19.140842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:19.145171Z","title":null,"venue":null,"work_id":null,"year":1981},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.145171Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:904562f24d6414ab0f9d1ef32081e5134138bad425bd5b62dc42e887e4d78d1b","observation_id":"22d57a6a-33b9-4bbd-a0b5-6468701fb49d","resolution":{"observed_at":"2026-08-08T13:18:19.145171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:19.149648Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.149648Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:1246fcdc57f23308f7d0bac5ed30a0c48b09afd7d2752e81bcfa3f82c6c0d06d","observation_id":"3c90112d-e394-4c7f-9872-18ab9352f6a4","resolution":{"observed_at":"2026-08-08T13:18:19.149648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:19.154822Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.154822Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:9310f39e2dfed802a7a2756f855bb306231a23b392550c705b15a94e7a1a85e8","observation_id":"570b7aa8-2204-4d43-b908-f9ddfe854db1","resolution":{"observed_at":"2026-08-08T13:18:19.154822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:19.159320Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.159320Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:83582e521887f5146889621d2c39a023caa9e452bf85232cbbb1891b40e932b6","observation_id":"dfeacef1-e8e8-41ef-b585-86f575e03c55","resolution":{"observed_at":"2026-08-08T13:18:19.159320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:19.164314Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.164314Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:21ebe6f8d856bbc64964fc285da9ffd15be8c782aa71086846cbb4a64823bf5c","observation_id":"1ca1c77c-d293-45f0-8af3-aba1647f5d63","resolution":{"observed_at":"2026-08-08T13:18:19.164314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:19.169005Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.169005Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:62c8128ac231582cea49f0e740caa582f13795d7edd4ec401c90563f3d9e60b7","observation_id":"9cb75cf2-3850-4e3d-b3f6-1efd684b6082","resolution":{"observed_at":"2026-08-08T13:18:19.169005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:19.173410Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.173410Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:7b1e42be8a86b26ef2d9be79b47a467114bc01fbc0de1997aef513e5e864c69b","observation_id":"b6fe41a4-0174-4bac-8360-22bc429b7431","resolution":{"observed_at":"2026-08-08T13:18:19.173410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:19.178000Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.178000Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:aa130296540faa46a8f60301205dad3253adb737b56defd8ba58772800bdff59","observation_id":"b3ae4fb4-3482-46fd-8cce-b21423836a0d","resolution":{"observed_at":"2026-08-08T13:18:19.178000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:19.182700Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.182700Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:b2b47fbcc6bc8b7572a32daaeae0ed3d18173404b5916421652d108a5de7b00b","observation_id":"d553f810-ed51-40b9-afa8-912426fa48e0","resolution":{"observed_at":"2026-08-08T13:18:19.182700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-08T17:46:50.107463Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-08T13:18:19.187363Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.187363Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:00f4e88f7c7a7b6737501d592781d18ed541cc5392b575120dc0f4de0fac4d81","observation_id":"bc1a8ea5-09ee-4b2c-93de-9219d656e534","resolution":{"observed_at":"2026-08-08T13:18:19.187363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:19.192155Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.192155Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:24e242398be09601f0d1bb0b91bcde4e4fb0e7dd19e8e22551f06230f823a605","observation_id":"8036fe13-5bc3-494b-a118-4c389202f352","resolution":{"observed_at":"2026-08-08T13:18:19.192155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:19.196772Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.196772Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:f99299df16da6e233728e7e418d9c37035189dab058f8dcbe16ba9c8067f00b7","observation_id":"d82bfaaa-cb97-4c5d-9b22-09e4bf8201af","resolution":{"observed_at":"2026-08-08T13:18:19.196772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.04451","last_updated":"2020-02-18T16:01:18Z","snapshot_observed_at":"2026-07-06T08:50:12.690900Z","submitted_at":"2020-01-13T18:38:28Z","title":"Reformer: The Efficient Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.04451","snapshot_observed_at":"2026-08-08T13:18:19.201779Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.201779Z"},"links":{"cited_paper":"/paper/2001.04451","citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:da2163735bba1118ae4ff7ce8b364af37be1157de4550cca518c38be5a031867","observation_id":"70a0c7bb-2cc0-41be-806a-f00e21fe31ac","resolution":{"observed_at":"2026-08-08T13:18:19.201779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:19.206616Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.206616Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:95805f3fa0636eba6d002d8a243fafa29c9aa83eaeb6ba84813756826302e249","observation_id":"a0d1e259-768a-4a68-a840-65ac3e8b19b8","resolution":{"observed_at":"2026-08-08T13:18:19.206616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:19.211070Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.211070Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:e73f31a0de7f903d28c7b3791c6cbb2fb6464cd2f332b61ed09855314f8eb9a4","observation_id":"d2b00054-5c4d-47fb-9215-660690b72e91","resolution":{"observed_at":"2026-08-08T13:18:19.211070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.04432","last_updated":"2021-03-07T08:38:49Z","snapshot_observed_at":"2026-08-05T10:47:30.622671Z","submitted_at":"2021-02-08T18:45:06Z","title":"Colorization Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.04432","snapshot_observed_at":"2026-08-08T13:18:19.215446Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.215446Z"},"links":{"cited_paper":"/paper/2102.04432","citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:e5d5c604db1f913e2d822d73d0ad79be5951f688079e25bd485e840d28bc6c2f","observation_id":"4c1f2a7e-43ff-4cab-acb5-091ac387bc85","resolution":{"observed_at":"2026-08-08T13:18:19.215446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:19.220066Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.220066Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:daca0605c0826666b9d9ac4a61e393034d32cc87678e7c94a7d7a80f666f5fa5","observation_id":"09e472eb-3dfc-4b7f-942a-c95379f82ad2","resolution":{"observed_at":"2026-08-08T13:18:19.220066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:19.224635Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.224635Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:521e0c0a746c13e4c57cb938f1b8caefd90bb60613cd379806a383b0ca9000d1","observation_id":"e387bb17-89e2-4345-9fcd-f005e4e50204","resolution":{"observed_at":"2026-08-08T13:18:19.224635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:19.228934Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.228934Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:352afccf25ee5048c0d97a6fc1fcad50d4bafc72dff59d46f65ae63961238677","observation_id":"5ab421e6-ac74-4c73-ad69-7667f0ffc752","resolution":{"observed_at":"2026-08-08T13:18:19.228934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.13433","last_updated":"2019-09-30T02:35:49Z","snapshot_observed_at":"2026-07-06T08:25:34.719654Z","submitted_at":"2019-09-30T02:35:49Z","title":"Deep Amortized Clustering","version":1},"cited_work":{"arxiv_id":"1909.13433","doi":null,"metadata_source":"pith","pith_arxiv_id":"1909.13433","snapshot_observed_at":"2026-08-08T13:18:19.966210Z","title":"Deep Amortized Clustering","venue":"cs.LG","work_id":"12bb162a-c400-4bde-8080-9ffb5d755734","year":2019},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.233531Z"},"links":{"cited_paper":"/paper/1909.13433","citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:bfd84ee181817b22694b82981fdcbbc9650dc723f76900fac3eb68c9d0c7d517","observation_id":"7eedba7b-c9e8-40bc-b7ec-e9815bad71cb","resolution":{"observed_at":"2026-08-08T13:18:19.971132Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00214","last_updated":"2020-05-20T17:40:28Z","snapshot_observed_at":"2026-08-09T00:23:40.293592Z","submitted_at":"2020-05-01T04:17:14Z","title":"The AVA-Kinetics Localized Human Actions Video Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00214","snapshot_observed_at":"2026-08-08T13:18:19.238341Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.238341Z"},"links":{"cited_paper":"/paper/2005.00214","citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:bf1491ba941ad7f41732a571c9254d52848f9abd2de33b30d5ff89105d3f769c","observation_id":"b0333049-2055-49d2-8586-450b11b41444","resolution":{"observed_at":"2026-08-08T13:18:19.238341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:19.243277Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.243277Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:5b2bd31b024d272fc13efa30cefe3c62ea3a54ffafb1b4f7a7f767f9b381d311","observation_id":"a6e4f03c-f711-4566-96cb-8a333bc201c8","resolution":{"observed_at":"2026-08-08T13:18:19.243277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:19.247668Z","title":null,"venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.247668Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:c1332412de572cfe6df6ff01040c9c33b5b4f2e27b77049b79cdd6ea84544b64","observation_id":"698d3c3a-6717-41df-b83e-4c8628c51069","resolution":{"observed_at":"2026-08-08T13:18:19.247668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:19.252357Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.252357Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:064811fd6b1f2150140c9324de0eb39ca30a8535d50681f9417d766fbfd3545a","observation_id":"afbc3762-bbb5-4486-8794-d302cc64be4d","resolution":{"observed_at":"2026-08-08T13:18:19.252357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:19.257050Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.257050Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:f7f81d3a4b9d71c82c20c79bdaeb0f2cbfada9ea0dac59975166cd50ab40a81b","observation_id":"2540b5c4-911b-43e2-840c-d0e20a18f8bb","resolution":{"observed_at":"2026-08-08T13:18:19.257050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:19.261729Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.261729Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:5c83674f2568ef4062798f6031ca61fabbcdd47613b6f0af445e46d386029962","observation_id":"314cda81-5afd-4344-a255-aafe794358ec","resolution":{"observed_at":"2026-08-08T13:18:19.261729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:19.266336Z","title":null,"venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.266336Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:0a25aea437f04830b6fc059034678192b24901f556252cd3891439c3a19a6b95","observation_id":"fc50382e-5181-492c-9cbe-d6b4e582305a","resolution":{"observed_at":"2026-08-08T13:18:19.266336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:19.270988Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.270988Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:a870ecbd2d6c2eac028d7b8d0c225a0f1b210909a4381436207f79c028f76066","observation_id":"dd439bbc-266b-44b4-b51b-ca6e16d5ecae","resolution":{"observed_at":"2026-08-08T13:18:19.270988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01127","last_updated":"2019-12-02T23:26:43Z","snapshot_observed_at":"2026-07-06T08:41:33.489468Z","submitted_at":"2019-12-02T23:26:43Z","title":"BERT for Large-scale Video Segment Classification with Test-time Augmentation","version":1},"cited_work":{"arxiv_id":"1912.01127","doi":null,"metadata_source":"pith","pith_arxiv_id":"1912.01127","snapshot_observed_at":"2026-08-08T13:18:19.929103Z","title":"BERT for Large-scale Video Segment Classification with Test-time Augmentation","venue":"cs.CV","work_id":"0f9c416d-d44b-4936-876a-af7aee9677fd","year":2019},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.275683Z"},"links":{"cited_paper":"/paper/1912.01127","citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:37ffde3b85f018609ac2e16e9106939bd3395f9f9eddd01a87425129d09f312c","observation_id":"2c195584-f89e-42a4-862f-df7a66bc5f85","resolution":{"observed_at":"2026-08-08T13:18:19.934594Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-08T13:18:19.280320Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.280320Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:82058825d315ca4adee4475df9db9cd5c55a64250698d9895687302b5f2c655d","observation_id":"d217fd4b-1a7a-4430-8300-5d1a312e31da","resolution":{"observed_at":"2026-08-08T13:18:19.280320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:19.284901Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.284901Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:855d2be82dc187d4771bc27d8f3f971d97860652cf9a317236cdc90dcf573265","observation_id":"d9646f72-bde9-4240-a1bf-33b7d876dac9","resolution":{"observed_at":"2026-08-08T13:18:19.284901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:19.289365Z","title":null,"venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.289365Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:338a63323fb3acd4c519e235d4ee0c19018e474e732190664454f2aab368ad77","observation_id":"2a1e6fbf-f091-4b74-a811-0bd50965da80","resolution":{"observed_at":"2026-08-08T13:18:19.289365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:19.293884Z","title":null,"venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.293884Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:062bd8ec33cde1fb0df9d47c89819884a83db0749410102f514336bdcfb8a710","observation_id":"2d4c5fad-9a9d-490c-be20-416ff786f5fc","resolution":{"observed_at":"2026-08-08T13:18:19.293884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.06905","last_updated":"2018-03-05T12:30:37Z","snapshot_observed_at":"2026-07-06T05:47:48.793448Z","submitted_at":"2017-06-21T13:49:14Z","title":"Learnable pooling with Context Gating for video classification","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.06905","snapshot_observed_at":"2026-08-08T13:18:19.298546Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.298546Z"},"links":{"cited_paper":"/paper/1706.06905","citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:df949437193201a5ad1e28acdbec24ceb9e657d8cf298b2a0258afedc9549463","observation_id":"4a273f80-0778-4371-886f-f4ad30c5f640","resolution":{"observed_at":"2026-08-08T13:18:19.298546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:19.303310Z","title":null,"venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.303310Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:964fcff0954b1bed30d76fdc7d2df5090b97922c59b7ed2b9a9172d0e57c5307","observation_id":"a8a53d4d-fd95-456f-8c12-a01aed8fffc8","resolution":{"observed_at":"2026-08-08T13:18:19.303310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:19.307823Z","title":null,"venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.307823Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:d28fe6195acf5310a78d911bc5efc30577b5963e5a72555a062d5b4c1064177a","observation_id":"f7d6e71b-90b0-4782-b8c8-cf268ce54ef5","resolution":{"observed_at":"2026-08-08T13:18:19.307823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:19.312633Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.312633Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:d269c438b5e236c7fbc47d5beef315f21a561ae05cad31b1cefcfbd2b9243ae2","observation_id":"a886288f-4255-4bff-b686-106d63f89146","resolution":{"observed_at":"2026-08-08T13:18:19.312633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:19.317034Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.317034Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:94af5cbfaad0b0d655552239087f1a969c42f26f5ecd977d359a44f7683ca1b9","observation_id":"b1f8dde7-c664-4947-9770-836deea2f3d5","resolution":{"observed_at":"2026-08-08T13:18:19.317034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:19.321841Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.321841Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:e4c55202d9dfde626c1659d0e422e929e5abe33da6deb6a9be52f3dba255e2b9","observation_id":"de5ec823-bad4-4914-98d7-0b134fd5e59b","resolution":{"observed_at":"2026-08-08T13:18:19.321841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:18:19.326446Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:19.326446Z"},"links":{"citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:5989aa246120f29318d109319de120e3a73e442c462b6e140abc050fdd4eed82","observation_id":"95b43875-0eea-4640-91ae-644f02e2774a","resolution":{"observed_at":"2026-08-08T13:18:19.326446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":98,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":176},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 100 of 176 outbound references and 0 inbound Pith citation observations for arXiv:2502.07277."}