{"as_of":"2026-08-09T18:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6f277b78110eb053f59ff8068fe981af9d8e651f587b54a02eb17c35cc020fff","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T04:37:09.891480Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.03549/citation-record","integrity":"/paper/2502.03549/integrity","json":"/paper/2502.03549/citation-record.json","paper":"/paper/2502.03549"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:37:10.572182Z","title":"The low-rank bottleneck is vital, because it may lead to that many rows of the attention map are seriously homogenized","venue":null,"work_id":"41a417eb-c493-4699-a38b-ea1078cd17bc","year":2017},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T18:05:27.309665Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.867432Z"},"links":{"citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:825e47dc106ae1a20c7d3340c1606ce977af1bd846f1a1795aec24e9eb660e26","observation_id":"e39f4487-2931-45ab-926b-e28f2997a924","resolution":{"observed_at":"2026-08-09T04:37:10.576953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:37:10.740139Z","title":"Tom Brown, Benjamin Mann, Nick Ryder, Melanie Subbiah, Jared D Kaplan, Prafulla Dhariwal, Arvind Neelakantan, Pranav Shyam, Girish Sastry, Amanda Askell, et al","venue":null,"work_id":"719a214f-9424-4981-8f9e-81cf6cb0616d","year":1901},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T18:05:27.309665Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.602158Z"},"links":{"citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:f65117452dc5325ce0f734502c91b1d4fc0c27daaf1e7219cdabe9cb533b92a3","observation_id":"30e31daa-6937-46b5-b0b1-25fcb9582777","resolution":{"observed_at":"2026-08-09T04:37:10.744593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:37:10.472615Z","title":"24 Published as a conference paper at ICLR 2025 5","venue":null,"work_id":"680b85a6-3b58-4825-87f6-de95d74cdf48","year":2025},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T18:05:27.309665Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.882418Z"},"links":{"citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:f9e9bb6e2ab62dc5737d13dcf4af745cfddc687d4c8a3e4389c9795f55cfd412","observation_id":"1e078e8e-1313-4eae-abd3-59f0b552184b","resolution":{"observed_at":"2026-08-09T04:37:10.534172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:37:10.314701Z","title":"Question to ChatGPT: 1 Cutting in the kitchen","venue":null,"work_id":"afaa3913-f3a5-4730-935c-e047ba2ff8bc","year":2024},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T18:05:27.309665Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.886807Z"},"links":{"citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:a1dba587a15f1a3c5941f995da46e2783e370e46b5593a0754f8b499e8cac28d","observation_id":"29884104-94be-499e-8b19-d477871bdfb4","resolution":{"observed_at":"2026-08-09T04:37:10.385360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.13921","last_updated":"2022-05-12T01:27:40Z","snapshot_observed_at":"2026-08-08T10:08:57.896975Z","submitted_at":"2021-04-28T17:58:57Z","title":"Open-vocabulary Object Detection via Vision and Language Knowledge Distillation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.13921","snapshot_observed_at":"2026-08-09T04:37:09.633834Z","title":"Open-vocabulary object detection via vision and language knowledge distillation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T18:05:27.309665Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.633834Z"},"links":{"cited_paper":"/paper/2104.13921","citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:f30ba7ca8b93707590e60b716bb276bc12a3bc69132a359afcd701c75394d0e6","observation_id":"cee28ea6-30d4-404f-8dd0-d0beb9fd9a48","resolution":{"observed_at":"2026-08-09T04:37:09.633834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:37:10.702663Z","title":"Ssan: Separable self-attention network for video representation learning","venue":null,"work_id":"35e195ec-f017-4b75-8539-9cee70c43d54","year":2025},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T18:05:27.309665Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.639269Z"},"links":{"citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:78608faf1b68e81f46d741cb3970f680254f2a4e7332197a9d90d4efd0266424","observation_id":"bf103ac1-24f3-4d49-a753-fbcf689133ba","resolution":{"observed_at":"2026-08-09T04:37:10.707354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09141","last_updated":"2021-06-16T21:36:36Z","snapshot_observed_at":"2026-08-09T09:32:55.082368Z","submitted_at":"2021-06-16T21:36:36Z","title":"Probing Image-Language Transformers for Verb Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09141","snapshot_observed_at":"2026-08-09T04:37:09.644104Z","title":"Probing image-language transformers for verb under- standing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T18:05:27.309665Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.644104Z"},"links":{"cited_paper":"/paper/2106.09141","citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:8c072f99a2956711b3a3b151d0aefecc51c1400c982d316aa6471616ccd207d7","observation_id":"bf8c7b70-2d00-44d5-886a-5f08865214a8","resolution":{"observed_at":"2026-08-09T04:37:09.644104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:37:10.689022Z","title":"Frozen clip models are efficient video learners","venue":null,"work_id":"6d00a694-ab68-4640-9a5b-f0ca5d329ec1","year":2025},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T18:05:27.309665Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.659340Z"},"links":{"citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:3d34c8d746806396db70ac0eb1030ebf4724f6d7517a8038dc7cc3394807a510","observation_id":"d8c7360e-8155-4571-994f-905f8d27a155","resolution":{"observed_at":"2026-08-09T04:37:10.693708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:37:10.674004Z","title":"Fine-tuned clip models are efficient video learners","venue":null,"work_id":"0dadda7d-971a-4549-a137-60443cb277e2","year":2025},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T18:05:27.309665Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.688091Z"},"links":{"citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:9be004afbc98c5b87f7db85eb4ee76c5d52cbdc193e58fce324be8393fa0b424","observation_id":"8d4a05d5-0734-4cce-81a5-001d1e0bbe43","resolution":{"observed_at":"2026-08-09T04:37:10.679530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-07-06T03:01:10.229407Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-09T04:37:09.706572Z","title":"Ucf101: A dataset of 101 human actions classes from videos in the wild","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T18:05:27.309665Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.706572Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:277a5834e3bafab534a7de1a79beaccb4ca887e7049f119b55105cc927216c86","observation_id":"17f4bbeb-d622-4727-9fd4-a82cd8d8c95d","resolution":{"observed_at":"2026-08-09T04:37:09.706572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.05743","last_updated":"2019-09-27T21:59:59Z","snapshot_observed_at":"2026-08-07T11:03:21.673722Z","submitted_at":"2019-06-13T15:03:52Z","title":"Learning Video Representations using Contrastive Bidirectional Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.05743","snapshot_observed_at":"2026-08-09T04:37:09.765177Z","title":"Learning video representations using contrastive bidirectional transformer","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T18:05:27.309665Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.765177Z"},"links":{"cited_paper":"/paper/1906.05743","citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:e2ee0fad3e6ff14101e8dfc337b5c432b97d383e085457d416bde4c7a852e731","observation_id":"4ba2c31b-bb45-4bbd-88b7-a88902eb8966","resolution":{"observed_at":"2026-08-09T04:37:09.765177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-09T04:37:09.784435Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T18:05:27.309665Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.784435Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:59d253b0072cabd6ef463434c3f4c51a3bca445b068bdfa6774b638a83ae6171","observation_id":"189d7143-2681-42f8-b109-8eeb513f617b","resolution":{"observed_at":"2026-08-09T04:37:09.784435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:37:10.659471Z","title":"Clipasso: Semantically-aware object sketching","venue":null,"work_id":"65eda1cc-adb9-400a-9ee0-1d9e84656911","year":2025},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T18:05:27.309665Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.804493Z"},"links":{"citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:718b96894dd6829fe6271197e069f0121007f993fda14f50e825b7fc8d96fb76","observation_id":"4c9f1f86-30b4-46ae-b74c-958f828cef35","resolution":{"observed_at":"2026-08-09T04:37:10.664290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:37:10.644751Z","title":"Alternative semantic representations for zero-shot human action recog- nition","venue":null,"work_id":"981670de-6da5-4e04-b373-da1cad3d52ba","year":2017},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T18:05:27.309665Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.824240Z"},"links":{"citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:06c54582a0ed3a5a6508296c79ea288ea8a044ac23159d0c1e4fdc0393d5b9ce","observation_id":"1233edc1-6f33-470a-ad29-d29257a74c55","resolution":{"observed_at":"2026-08-09T04:37:10.649678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.14084","last_updated":"2021-10-01T15:13:27Z","snapshot_observed_at":"2026-08-04T06:58:39.755482Z","submitted_at":"2021-09-28T23:01:51Z","title":"VideoCLIP: Contrastive Pre-training for Zero-shot Video-Text Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.14084","snapshot_observed_at":"2026-08-09T04:37:09.828306Z","title":"Videoclip: Contrastive pre-training for zero-shot video-text understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T18:05:27.309665Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.828306Z"},"links":{"cited_paper":"/paper/2109.14084","citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:f265e8fcfcd88c436188b54b73e2de99d9fe83f8482f8dde1bac3821da530cb5","observation_id":"48be1796-333d-469a-afc5-bb86bdcd62a5","resolution":{"observed_at":"2026-08-09T04:37:09.828306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:37:10.629871Z","title":"Multi-task zero-shot action recognition with prioritised data augmentation","venue":null,"work_id":"1a8eb65d-0f80-48fd-a8cc-bc8161cbf190","year":2016},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T18:05:27.309665Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.832884Z"},"links":{"citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:cd1d9ef9734dcac0230ec7813a560fb562f6f093e2620a16c24b4c4d451e4dad","observation_id":"68564d2e-5f15-4512-b3a0-539c2841273a","resolution":{"observed_at":"2026-08-09T04:37:10.634794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03024","last_updated":"2023-02-06T18:59:17Z","snapshot_observed_at":"2026-08-03T18:56:56.378342Z","submitted_at":"2023-02-06T18:59:17Z","title":"AIM: Adapting Image Models for Efficient Video Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.03024","snapshot_observed_at":"2026-08-09T04:37:09.837333Z","title":"Aim: Adapting image models for efficient video action recognition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T18:05:27.309665Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.837333Z"},"links":{"cited_paper":"/paper/2302.03024","citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:9cb96d909bc5117bd6fa76b2a059deae4794f13c32a44b3cd92d91bd283f6f79","observation_id":"379eb698-d417-405d-9f65-11510a95ebc1","resolution":{"observed_at":"2026-08-09T04:37:09.837333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-08-09T04:37:09.841758Z","title":"Florence: A new foundation model for computer vision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T18:05:27.309665Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.841758Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:f9d78558791abf09c6bccc22bd86aa0f46514513484e467a6f8507c73e848ccb","observation_id":"2161c4e0-612f-4dcc-a496-766d5770fb8f","resolution":{"observed_at":"2026-08-09T04:37:09.841758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.07175","last_updated":"2021-12-14T05:41:39Z","snapshot_observed_at":"2026-08-09T14:39:26.125187Z","submitted_at":"2021-12-14T05:41:39Z","title":"Co-training Transformer with Videos and Images Improves Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.07175","snapshot_observed_at":"2026-08-09T04:37:09.846651Z","title":"Co-training transformer with videos and images improves action recognition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T18:05:27.309665Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.846651Z"},"links":{"cited_paper":"/paper/2112.07175","citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:ea5b35ccb31a83eb33a7c5b0c439ca505816ebf4e50800c9656d972d4310a40e","observation_id":"8ff8d952-8172-4892-8a76-e4246122f55e","resolution":{"observed_at":"2026-08-09T04:37:09.846651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:37:10.614207Z","title":"Learning a deep embedding model for zero-shot learning","venue":null,"work_id":"378b2482-26a9-4c8e-9a54-262d21831a66","year":2025},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T18:05:27.309665Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.851597Z"},"links":{"citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:448d17284e61d1ca1bdf6f6ad8919e39136118fea8b5fcf6c2d2043222066b34","observation_id":"67f53610-4f3e-43d2-8685-a23343577c2d","resolution":{"observed_at":"2026-08-09T04:37:10.619242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:37:10.586751Z","title":"always be full rank","venue":null,"work_id":"6291ffb1-0e16-49ba-b2a6-b0c744bdffc4","year":2025},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T18:05:27.309665Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.862379Z"},"links":{"citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:6b277b1018000ce6509836a1abbbc2c2a22cb38c5ca1a59e9d00b3841c138ce3","observation_id":"4ee53428-791e-44c5-b502-350d806c42d2","resolution":{"observed_at":"2026-08-09T04:37:10.590705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:37:10.557475Z","title":null,"venue":null,"work_id":"c899f239-dd5e-44cf-a2af-b3c38ce19fae","year":2025},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T18:05:27.309665Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.872839Z"},"links":{"citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:80b326f2eac88c8111ba287f62bb399ecdcdd4a3b92454b76cebc8ab2b1f92c6","observation_id":"200f7ef2-5a07-4254-a8fd-6c20240743a9","resolution":{"observed_at":"2026-08-09T04:37:10.561677Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:37:10.206427Z","title":"For cases generated by Imagen, in Fig","venue":null,"work_id":"d0e6dc25-4b43-4da9-989d-32f55c24f852","year":2017},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T18:05:27.309665Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.891480Z"},"links":{"citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:fd872b7c9dacd6050818fcda8a62b52f8e1df7ce59a9751ace74bfc357fa8423","observation_id":"cd7a408c-c186-4d38-9883-ff73944cb9e5","resolution":{"observed_at":"2026-08-09T04:37:10.242416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:37:10.544092Z","title":"The evaluation is conducted three times","venue":null,"work_id":"92c61bc4-598e-4866-aa7d-2ee5ca173751","year":2024},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T18:05:27.309665Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":600,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.877802Z"},"links":{"citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:3b970015f91eeaa587154ec0dc953fe96577efb4a45415f7fc46dec00614b7b8","observation_id":"e18cf98f-99a8-4f0d-8d28-d574c381e5b1","resolution":{"observed_at":"2026-08-09T04:37:10.548244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-09T04:37:09.623418Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T18:05:27.309665Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.623418Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:d47d3e0216c0a53f7e6ae8f973a92a2381167c8e47a7a768aa00b88c922be55d","observation_id":"16a8fbbd-67f1-4c20-a0a6-08fdd3b4d172","resolution":{"observed_at":"2026-08-09T04:37:09.623418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.04676","last_updated":"2022-02-08T16:36:12Z","snapshot_observed_at":"2026-08-04T03:00:58.368363Z","submitted_at":"2022-01-12T20:02:32Z","title":"UniFormer: Unified Transformer for Efficient Spatiotemporal Representation Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.04676","snapshot_observed_at":"2026-08-09T04:37:09.654476Z","title":"Unicoder-vl: A universal encoder for vision and language by cross-modal pre-training","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T18:05:27.309665Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.654476Z"},"links":{"cited_paper":"/paper/2201.04676","citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:1c89ed1be3f8cfa9911af2961d35c5b343cce8950ff6bd4a216196824be4921c","observation_id":"f2dfe5d4-36b7-4d08-9b0b-344002d1ea88","resolution":{"observed_at":"2026-08-09T04:37:09.654476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.08530","last_updated":"2020-02-18T02:59:17Z","snapshot_observed_at":"2026-08-08T09:19:20.381840Z","submitted_at":"2019-08-22T17:59:30Z","title":"VL-BERT: Pre-training of Generic Visual-Linguistic Representations","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.08530","snapshot_observed_at":"2026-08-09T04:37:09.737902Z","title":"Vl-bert: Pre-training of generic visual-linguistic representations","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T18:05:27.309665Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.737902Z"},"links":{"cited_paper":"/paper/1908.08530","citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:63c8b9a8413c2776f2e5f905f198870deb393b2930f3d81f5270e35740209c8f","observation_id":"5d69a116-17cb-4aaa-96e2-85e47d273369","resolution":{"observed_at":"2026-08-09T04:37:09.737902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-08T17:46:50.107463Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-09T04:37:09.649514Z","title":"The kinetics human action video dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T18:05:27.309665Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.649514Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:82f156a78cf6f43b0dcb9801593ffca6f269ac51d085a5fe8b5bf35c3c999e0c","observation_id":"e430e668-dc8c-474e-b363-2c660d5577ae","resolution":{"observed_at":"2026-08-09T04:37:09.649514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-07-06T11:48:42.000083Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-08-09T04:37:09.819109Z","title":"Actionclip: A new paradigm for video action recognition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T18:05:27.309665Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.819109Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:1b1a2f294e7e308b436697cb123d1b6709168139ee7f6946cff9858d200ef6e5","observation_id":"04503e34-8e11-4846-8e67-8a304247919c","resolution":{"observed_at":"2026-08-09T04:37:09.819109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.01340","last_updated":"2018-08-03T20:17:05Z","snapshot_observed_at":"2026-07-06T06:54:00.483796Z","submitted_at":"2018-08-03T20:17:05Z","title":"A Short Note about Kinetics-600","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.01340","snapshot_observed_at":"2026-08-09T04:37:09.606955Z","title":"A short note about kinetics-600","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T18:05:27.309665Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.606955Z"},"links":{"cited_paper":"/paper/1808.01340","citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:d04f3a0206d13866f95e152a75f8f3ad7c1a3661f19f56cbd8cd8b170bdfb498","observation_id":"d063b408-6141-46ae-866c-f2d5f89d9bb1","resolution":{"observed_at":"2026-08-09T04:37:09.606955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:37:10.599976Z","title":null,"venue":null,"work_id":"cf287bb0-9728-4608-bf60-121cc2659c89","year":2020},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T18:05:27.309665Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.856868Z"},"links":{"citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:593125ec22262b468d9c063bb362dc7d70446760b9e4f26bffbd48ff3f4b45fc","observation_id":"04db9eee-fad7-499b-953e-b5d3a774339c","resolution":{"observed_at":"2026-08-09T04:37:10.604170Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2008.12432","last_updated":"2020-08-28T01:44:01Z","snapshot_observed_at":"2026-08-08T23:11:53.542523Z","submitted_at":"2020-08-28T01:44:01Z","title":"All About Knowledge Graphs for Actions","version":1},"cited_work":{"arxiv_id":"2008.12432","doi":null,"metadata_source":"pith","pith_arxiv_id":"2008.12432","snapshot_observed_at":"2026-08-09T04:37:10.141048Z","title":"All About Knowledge Graphs for Actions","venue":"cs.CV","work_id":"a085fb70-0662-43a5-81f3-5abb08572e70","year":2020},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T18:05:27.309665Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.628515Z"},"links":{"cited_paper":"/paper/2008.12432","citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:dc4549ae59e3acf354c42ed9c9af46ca5199c9aff235fd1f7afb7b726c0446d3","observation_id":"7282830b-f4e7-44d8-b555-e2eb1ac68c8b","resolution":{"observed_at":"2026-08-09T04:37:10.148462Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:37:10.725764Z","title":"Ost: Refining text knowledge with optimal spatio-temporal descriptor for general video recognition","venue":null,"work_id":"3db7679e-1de7-444b-acf3-8161e4b51929","year":2025},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T18:05:27.309665Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.612768Z"},"links":{"citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:97e67b026fd8a62c0dd83309b6278fa17e4c4d899c16c9a1b828e5b785bca0d2","observation_id":"18879d0e-89d6-4d49-8471-9459c318a785","resolution":{"observed_at":"2026-08-09T04:37:10.730280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-09T04:37:09.663562Z","title":"Gpt-4 technical report, https://arxiv.org/abs/2303.08774,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T18:05:27.309665Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.663562Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:6d60580c6c8abaa474dd50f79101d01751b347e31033e21175cc408078f0ee3c","observation_id":"8d9cb6af-c5f0-49bf-8617-bc48dcad3c95","resolution":{"observed_at":"2026-08-09T04:37:09.663562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:37:09.618483Z","title":"Imagenet: A large-scale hi- erarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T18:05:27.309665Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.618483Z"},"links":{"citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:24dc02736ecd2e43f806997381cff4025b01bf601a4049155982144407658383","observation_id":"34eb9f1f-4ddb-4be1-9c7f-4ddebeba97b8","resolution":{"observed_at":"2026-08-09T04:37:09.618483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-09T04:37:09.596768Z","title":"Zeynep Akata, Florent Perronnin, Zaid Harchaoui, and Cordelia Schmid","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T18:05:27.309665Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.596768Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:63d356dd88d83990a340aa063cf3a91ace06c8313c077bd3351097523b0c94f2","observation_id":"63b0ca20-0bfd-4aea-9f86-eb9b99f9e19e","resolution":{"observed_at":"2026-08-09T04:37:09.596768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T18:05:27.309665Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":1,"verified_fuzzy":15},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 0 inbound Pith citation observations for arXiv:2502.03549."}