{"as_of":"2026-08-08T09:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6d37125a9c57b643daa305056759acc3b7de3ce5b815019bb84317ee3cbbd66d","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:42:21.811848Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.16701/citation-record","integrity":"/paper/2506.16701/integrity","json":"/paper/2506.16701/citation-record.json","paper":"/paper/2506.16701"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:22.516651Z","title":"Action genome: Actions as compositions of spatio- temporal scene graphs","venue":null,"work_id":"9e0d2cb3-f7ad-47fc-ada9-2ff568fb36c0","year":2020},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:19.034906Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:cf450c3173e2975cae6e44023cd184973feb8bec139470c8a18a3681dbb498e1","observation_id":"b72c9351-9ef0-465e-b48e-f1ce3130d5c8","resolution":{"observed_at":"2026-08-06T23:42:22.520530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-06T23:42:19.144627Z","title":"OPT: Open pre-trained transformer language models.ArXiv, abs/2205.01068, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:19.144627Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:38d138abb7d4effccd3c6013f121d6b45476f31e9f58cc6fd833a1f648ba4856","observation_id":"33a8dfb9-c426-4331-85c2-628f14f2c224","resolution":{"observed_at":"2026-08-06T23:42:19.144627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-06T23:42:19.256942Z","title":"Roberta: A robustly optimized BERT pretraining approach.CoRR, abs/1907.11692, 2019","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:19.256942Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:82194122756e23d9f87b992885b4eea36a7cad1cf6b2ffce702e3384da709820","observation_id":"f8c50662-bf37-4081-9d4d-80586bc74098","resolution":{"observed_at":"2026-08-06T23:42:19.256942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:22.505000Z","title":"Chatgpt-4o, 2024","venue":null,"work_id":"5fe21f43-b4d3-40ed-9bfd-9c14900860d1","year":2024},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:19.370286Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:4e5799f55d28310da4388951feaf8e9440bed01e19bd7ad774827b6323fe0a5e","observation_id":"78e5ac41-9a02-42fd-9a94-117b65d18d08","resolution":{"observed_at":"2026-08-06T23:42:22.508520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:22.493653Z","title":"Gemini 2.0 flash, 2024","venue":null,"work_id":"d41b1dc2-d9b1-4ed5-a909-e5e7e0bf7026","year":2024},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:19.505819Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:981415a4470ba7be47d5955a2489df59558098a8f03f644a7be4ed31018f7f61","observation_id":"20c30f0a-6199-46e8-b882-0cbeac9c7b31","resolution":{"observed_at":"2026-08-06T23:42:22.497191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:22.474843Z","title":"Qwen2.5- vl technical report, 2025","venue":null,"work_id":"67f0759b-c4af-4913-bd12-4dd1fc53e47b","year":2025},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:19.665627Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:013245c6018b6989fdfdb17f1e31c58399bbf4842ce4b2510303d8aeece5ff0c","observation_id":"a01dcf5b-733c-4f47-ad8c-b86ba066d818","resolution":{"observed_at":"2026-08-06T23:42:22.484668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:22.460117Z","title":"Prompting visual-language models for efficient video understanding","venue":null,"work_id":"c2b7d778-0c02-4294-a07a-c69101cb6820","year":2022},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:19.780660Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:5e27627c490c918f2a0fe4eceff1a0cfdf2227ac760220312c4d934c9d9819e4","observation_id":"373aa4ee-a0f3-4b4f-af5b-ad4fc7eb3c53","resolution":{"observed_at":"2026-08-06T23:42:22.465022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:22.442414Z","title":"Llms are good action recognizers","venue":null,"work_id":"d9d3733d-6dfe-4053-96e3-bb2347491cdf","year":2024},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:19.851409Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:51b1cb59ffe67212215b0308322a1a1f04f6ac55dea04af988b461c0ad2c5a3e","observation_id":"239205f9-1874-448e-a453-9ab9238b2366","resolution":{"observed_at":"2026-08-06T23:42:22.451449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:22.426718Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":"56c4741b-0917-4bff-96f2-f314fd6566c8","year":2024},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:20.001362Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:10f4196d6f1571ebe8dd1452f0f8d49f5dedb277b4059d37a2aa41b0ba2f72ef","observation_id":"04db58d5-6d67-424b-bbdd-7b8eff7218e1","resolution":{"observed_at":"2026-08-06T23:42:22.430934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:22.408942Z","title":"M-llm based video frame selec- tion for efficient video understanding","venue":null,"work_id":"73ef788a-e641-48c8-8384-f7c6374c85ac","year":2025},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:20.132309Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:0e6d9671f893686b1f5e8c57ef6ac23e201e9143217637e4f308bed1eb0fb5c4","observation_id":"d9c25835-2ced-4e4d-8a4c-7fafab3cb869","resolution":{"observed_at":"2026-08-06T23:42:22.418534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08585","last_updated":"2025-04-24T17:42:16Z","snapshot_observed_at":"2026-08-07T18:43:01.306583Z","submitted_at":"2025-03-11T16:21:23Z","title":"HierarQ: Task-Aware Hierarchical Q-Former for Enhanced Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08585","snapshot_observed_at":"2026-08-06T23:42:20.273161Z","title":"Hierarq: Task-aware hierarchical q-former for enhanced video understanding.arXiv preprint arXiv:2503.08585, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:20.273161Z"},"links":{"cited_paper":"/paper/2503.08585","citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:e4e767990268bc1d8aa9c1c5e096afb1a904c2be5c8505d34f627c57fe79632f","observation_id":"0db42020-bc5d-4b84-bfe1-195443b6a256","resolution":{"observed_at":"2026-08-06T23:42:20.273161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:22.382064Z","title":"Two-stream con- volutional networks for action recognition in videos","venue":null,"work_id":"2eff8914-cb68-40c2-869c-174b3f6c3a30","year":null},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:20.354728Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:1aea24da77c55e23bfa8b32eca5af629ad8880ff3437e56d0ff54cc01652ad56","observation_id":"cb149e37-2dad-424f-9e59-0b8fafce6447","resolution":{"observed_at":"2026-08-06T23:42:22.385943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:22.369822Z","title":"Temporal segment networks for action recognition in videos.IEEE Transactions on Pattern Analysis and Machine Intelligence, 41(11):2740– 2755, 2019","venue":null,"work_id":"6c5fbe2e-07b7-4603-b6af-7db794491baf","year":2019},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:20.427751Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:2c562dce876af62f6b00462f98bd694abff284459d9d70fdb8ee1ba0a1331037","observation_id":"259051f0-9365-45ca-b031-1b99d5ba3968","resolution":{"observed_at":"2026-08-06T23:42:22.374140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:22.355874Z","title":"Learning spatiotemporal features with 3d convolutional networks","venue":null,"work_id":"cf555671-7bd9-4901-84b4-5d57d82f29de","year":2015},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:20.486930Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:e66e76cd8c2f479f17a03685f3b678072430a1b536b20460d9c6a71750ba9119","observation_id":"284c16f2-3140-4f03-9820-0cd072e8dd07","resolution":{"observed_at":"2026-08-06T23:42:22.360639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:22.343835Z","title":"Quo vadis, action recognition? A new model and the kinetics dataset","venue":null,"work_id":"2efa37d0-2375-42a5-8dcf-5d71893fcec5","year":2017},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:20.570357Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:d4ad132a39b3b4c996b3fe9b7d3ec2f95a5119a7ac5294703e98dd7a3978106c","observation_id":"b1b3f256-2266-4cea-bdc4-10175834fbc6","resolution":{"observed_at":"2026-08-06T23:42:22.347775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:22.331846Z","title":"Smeulders","venue":null,"work_id":"3628978b-91d9-40ca-a1e3-bd623c527354","year":2019},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:20.634188Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:8bc54630c58d5be95db8c0b374fe5b3fd53713cd849a703ae30843872645d3f6","observation_id":"786b4f0b-98ff-44c7-b9f0-b03b7d76232e","resolution":{"observed_at":"2026-08-06T23:42:22.335524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:22.317751Z","title":"Slowfast networks for video recognition","venue":null,"work_id":"bba979a9-d5df-4388-bd0e-104ace2b316a","year":2019},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:20.732330Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:32a84465eff65eb3fee7c943fd9daadce3d4a9825505dbd4e78b62a2344391e3","observation_id":"53831e79-1ec1-4d5f-b53d-b1ce24f67bbb","resolution":{"observed_at":"2026-08-06T23:42:22.322239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:22.303647Z","title":null,"venue":null,"work_id":"5f3680a9-2fa9-4660-bded-b21e76ab9388","year":2020},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:20.811147Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:79cffb9680b5a6796b7aadb8f2d8c4ef5126d5839aa68db521e328d06e3e397a","observation_id":"64d244a2-55d8-420c-8cd6-4fdb5da3b246","resolution":{"observed_at":"2026-08-06T23:42:22.308568Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:22.287789Z","title":"Tokenlearner: Adaptive space- time tokenization for videos","venue":null,"work_id":"8a663a3b-1525-4417-8bd6-42610f0ec5c4","year":2021},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:20.821125Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:ee3ea958a6c531e6c752f6f079b5436f8242d137bb2665c6e0f4a1dd714a1d6b","observation_id":"44aab4ff-dcef-4ac7-9517-6380c2b044cc","resolution":{"observed_at":"2026-08-06T23:42:22.293076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1612.03975","last_updated":"2018-12-11T16:27:17Z","snapshot_observed_at":"2026-07-06T05:22:25.273447Z","submitted_at":"2016-12-12T23:54:52Z","title":"ConceptNet 5.5: An Open Multilingual Graph of General Knowledge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.03975","snapshot_observed_at":"2026-08-06T23:42:20.983666Z","title":"Conceptnet 5.5: An open multilingual graph of general knowledge.CoRR, abs/1612.03975, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:20.983666Z"},"links":{"cited_paper":"/paper/1612.03975","citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:62ca6cf033b1bd042367792d46064a0d82be3e4df3ce91e150803f546d241884","observation_id":"c3ec7672-fe3d-4eb1-97aa-ee2ba973dbd7","resolution":{"observed_at":"2026-08-06T23:42:20.983666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00146","last_updated":"2019-02-07T19:52:21Z","snapshot_observed_at":"2026-07-06T07:11:55.047580Z","submitted_at":"2018-10-31T22:57:51Z","title":"ATOMIC: An Atlas of Machine Commonsense for If-Then Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.00146","snapshot_observed_at":"2026-08-06T23:42:21.078067Z","title":"Smith, and Yejin Choi","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:21.078067Z"},"links":{"cited_paper":"/paper/1811.00146","citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:a6772a03f0e2bf8d4b9faeab5df36e7e4e183c151b4c9337c113a7fac9014f5c","observation_id":"0a4e7caf-2a1f-4f04-87ff-69fc0c041152","resolution":{"observed_at":"2026-08-06T23:42:21.078067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:22.244436Z","title":"We- bChild 2.0 : Fine-grained commonsense knowledge distilla- tion","venue":null,"work_id":"f6655374-81b3-4941-bc66-4d592b02c1f1","year":2017},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:21.192655Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:731272a8a6327de526c0162c859a662025ba8f4e53158381d46d5e69ad02ec86","observation_id":"6e20bce3-48c2-4f9a-a53b-ae7be4ed1c08","resolution":{"observed_at":"2026-08-06T23:42:22.271807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:22.223011Z","title":"COMET: Com- monsense transformers for automatic knowledge graph con- struction","venue":null,"work_id":"690baad8-a36d-4aa3-a26c-398ac94004d2","year":2019},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:21.287096Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:f3f6be616c3f53d0ff7d3fbbd1680ddc0cf881a6fa28500d24eac415d5535a20","observation_id":"990f1d3b-7972-4649-bcdb-6f1381f3ae86","resolution":{"observed_at":"2026-08-06T23:42:22.233158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:22.209414Z","title":"Hwang, Liwei Jiang, Ronan Le Bras, Ximing Lu, Sean Welleck, and Yejin Choi","venue":null,"work_id":"ad7141ee-4444-4bc9-95dd-9c428da5928f","year":2022},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:21.306892Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:17368a0ca29aeb903aa3b83a8f062192a3907bf93243742571499d42e4670364","observation_id":"2c46a1d6-4e5e-4fe1-b9bc-faeb99f209f8","resolution":{"observed_at":"2026-08-06T23:42:22.213346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:22.189901Z","title":"Conditional prompt learning for vision-language models","venue":null,"work_id":"f0c2ffb5-da6a-446a-996c-9d691889a4a2","year":2022},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:21.444572Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:674a75243b6020a6e0baf7a17a725e54758449595a03b084d66c1818522899e5","observation_id":"eb5cccf0-a671-4502-a497-e36f674092a3","resolution":{"observed_at":"2026-08-06T23:42:22.194019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:22.168411Z","title":"Prompt distribution learning","venue":null,"work_id":"218781c5-30f3-434e-8239-a69f3b8a8e62","year":2022},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:21.544753Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:06075821b31690d41c505fce05100d5602ec0291917ca3f93d740071e275517c","observation_id":"6f5971ea-0443-4a1d-95db-f1e2e582866b","resolution":{"observed_at":"2026-08-06T23:42:22.173041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:21.574755Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:21.574755Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:17060f3d537dc3c862eb436f17a1dfa039a1b182a1b9c166ed2ac6beafbe593c","observation_id":"7b6802c2-d0dc-4f3b-a310-e6ab3adf4e31","resolution":{"observed_at":"2026-08-06T23:42:21.574755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:22.146239Z","title":"Denseclip: Language-guided dense prediction with context- aware prompting","venue":null,"work_id":"75696661-ac71-4f8a-8ff5-bcaf42f9c217","year":2022},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:21.633977Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:c5d5e7be635cd9a53ce4b3f02f94e478f7649c6e8a5c8175fdc7e717a5d00e0b","observation_id":"b9fe3d8f-922b-4af2-a320-e0060a24cc92","resolution":{"observed_at":"2026-08-06T23:42:22.151063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:22.132856Z","title":"Expanding language-image pretrained models for general video recognition","venue":null,"work_id":"87b06106-8e86-4965-a9d4-9af5b5b384a8","year":2022},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:21.742005Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:5dc5d0ca2bb09ca62b68bacec1a6a2a1cd662580ee07aa3c8c32a20d3cef5f60","observation_id":"58ea54c6-2266-46b1-8fb9-d96decd84584","resolution":{"observed_at":"2026-08-06T23:42:22.137255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:22.117827Z","title":"Learning to prompt for continual learning","venue":null,"work_id":"307320cf-6b1b-434a-bc75-d4eba19a13d8","year":2022},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:21.745915Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:2db07f5e8fc48814f69979fe774c2ed412521e5d7dbd2f8d462017c01c9f9865","observation_id":"e16178ab-908b-460c-8c71-61bebae55ae0","resolution":{"observed_at":"2026-08-06T23:42:22.122393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:22.105534Z","title":"Visual prompt tuning","venue":null,"work_id":"4ba83b5d-d9b0-4355-8ea5-0d6dce018ae7","year":2022},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:21.749643Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:d0c28fdd181ef9cdbac3659081fb6f430c2509040aa521b7120fdd8b7a22e58c","observation_id":"e60e9bb0-1d7c-461e-a67e-361fec39616a","resolution":{"observed_at":"2026-08-06T23:42:22.109828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:22.091422Z","title":"Videobert: A joint model for video and language representation learning","venue":null,"work_id":"7e3b7d68-1e14-4dd9-b7d3-7ee544172390","year":2019},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:21.756955Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:86bfa486f40f71737a447151226ab34265a25c11e5117307df23149d5aecaa29","observation_id":"626eb1b9-c04f-45cf-84c3-95f5616aca36","resolution":{"observed_at":"2026-08-06T23:42:22.096230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:22.063912Z","title":"Language models are few- shot learners","venue":null,"work_id":"8ad5f283-7c0b-4b10-afba-1650732cf86b","year":1901},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:21.763188Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:2612a6f29e60b72c2006ed9e28bc57d0b11450890ff657c97c1338c24acab923","observation_id":"f7615d3c-ec66-474b-b69c-708751fcd5ac","resolution":{"observed_at":"2026-08-06T23:42:22.075878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:22.051242Z","title":"Le, and Christo- pher D","venue":null,"work_id":"5c461c2c-8b90-4b93-962f-368f8f59a3b8","year":2020},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:21.768055Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:32e03b015f84939ba692e58a50d80d0e13bf0153af9d4275a6cd750cec66597b","observation_id":"edc83934-8674-4252-8dd8-09a0bd6a8aa6","resolution":{"observed_at":"2026-08-06T23:42:22.054885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:22.037958Z","title":"Multimodal few-shot learn- ing with frozen language models.Proc","venue":null,"work_id":"3cc53874-28dc-47e7-91b1-14767fc829e6","year":2021},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:21.772487Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:31d47f17ddf6cd393106f5ce31eb2c65aff489ffebce8328ade22caf17774d9b","observation_id":"ad77e2ab-4f84-44c4-9a81-51ecbd5c80a6","resolution":{"observed_at":"2026-08-06T23:42:22.042786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:22.014746Z","title":"UNIFIEDQA: Crossing format boundaries with a single QA system","venue":null,"work_id":"bf997c98-1f1d-4442-9d06-36d5b2c765d2","year":2020},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:21.777249Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:8ab82c6af123503441dca113d1ce99c42a72aefa56e070c83dd059caf4520a27","observation_id":"79406379-5f3b-4823-aa3b-eb5e72351b8e","resolution":{"observed_at":"2026-08-06T23:42:22.019630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:22.001453Z","title":"Few-shot text generation with natural language instructions","venue":null,"work_id":"d9f21715-1bd3-4b7d-8518-36f31bd08381","year":2021},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:21.781863Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:285bb13259acf8b97d1e8f11d8b0b7f3ecd838690a1027c4ffe462b4988c55e5","observation_id":"e08c08b5-1488-4201-afdf-32b8fcefbaaf","resolution":{"observed_at":"2026-08-06T23:42:22.005297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:21.983651Z","title":"Generating action-conditioned prompts for open-vocabulary video action recognition","venue":null,"work_id":"581827aa-25df-4b44-84f5-98e429531c64","year":2024},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:21.786252Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:fed29b3fa1130289cef855c2b3ab1451b2da581260cb383cd78fb15b1489e122","observation_id":"67d8d725-f251-4fa0-acce-d060c304a619","resolution":{"observed_at":"2026-08-06T23:42:21.987818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:21.969148Z","title":"Kronecker mask and interpretive prompts are language-action video learners","venue":null,"work_id":"09f3e469-2f9d-4941-aad9-4770cdb8a16f","year":2025},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:21.790912Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:313e7ead5d5b11864f8cd549188e17fa714fa24a609ce85b9d335bb6e5efddcb","observation_id":"2e59d9d7-4bd7-43b6-9229-22b0bd086f9c","resolution":{"observed_at":"2026-08-06T23:42:21.973922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:21.956687Z","title":"Visual semantic role labeling for video understanding","venue":null,"work_id":"475c6814-5c48-4b41-85dd-7416a58842aa","year":2021},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:21.794614Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:997f637e29f9b8b92088a2b258a19fa7ec1dc3eb41262499d71c73b71f573220","observation_id":"ad2c47ed-e007-499d-bad7-4a94f141ceae","resolution":{"observed_at":"2026-08-06T23:42:21.960619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-06T23:42:21.799058Z","title":"Learning transferable vi- sual models from natural language supervision.ArXiv, abs/2103.00020, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:21.799058Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:9855bf9bc1d0533ec0df12243ac84404823b674284264b38321ce731aad49e12","observation_id":"8d9974a3-f7ec-40c7-b23f-fb6a181a81b6","resolution":{"observed_at":"2026-08-06T23:42:21.799058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:21.941652Z","title":"Flava: A foundational language and vision alignment model","venue":null,"work_id":"8ac8af78-2e67-4d51-89be-6b469c425653","year":2022},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:21.807905Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:6c89c536a331ece84003f7a0af2212d46bbea42897bb874d0c314d58acb810e1","observation_id":"cb55a17d-2ff0-4de0-9d46-7fc584a684b9","resolution":{"observed_at":"2026-08-06T23:42:21.947281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1604.01753","last_updated":"2016-07-26T22:49:22Z","snapshot_observed_at":"2026-08-05T16:01:24.330553Z","submitted_at":"2016-04-06T19:56:04Z","title":"Hollywood in Homes: Crowdsourcing Data Collection for Activity Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1604.01753","snapshot_observed_at":"2026-08-06T23:42:21.811848Z","title":"close the door","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:21.811848Z"},"links":{"cited_paper":"/paper/1604.01753","citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:39eee6f8f0111dcd906dbf6ccf1488f7ed80cbec169903a5ca85ba40e1bb06cc","observation_id":"83e83f57-78f2-4534-b8fb-0af7dffdfdea","resolution":{"observed_at":"2026-08-06T23:42:21.811848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":0,"verified_fuzzy":34},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2506.16701."}