{"as_of":"2026-08-13T06:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7be22f72ba143b3b70d5b48d91dc6408415110ff72780180e1aa6f99f8fc9fdb","coverage":[{"denominator":66,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":66,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T14:08:42.308404Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.15628/citation-record","integrity":"/paper/2411.15628/integrity","json":"/paper/2411.15628/citation-record.json","paper":"/paper/2411.15628"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T14:08:40.821947Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:40.821947Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:2ec533f5eac2d436ce351a930043bfe95a7b1006630ce3e612e42e30c74169cc","observation_id":"bc9bc2a2-bd41-45fd-a3e5-6572c2935db5","resolution":{"observed_at":"2026-08-12T14:08:40.821947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:45.525963Z","title":"Ht-step: Aligning instructional articles with how-to videos.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":"8c79c4c6-9670-468b-b324-8dde76dbc169","year":2024},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:40.888612Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:58a85e66f59f602a77ccb87efbf0514b878197e6392bfd22c0f6b3375241d253","observation_id":"eb663771-06c0-4920-b6a0-434d580c9460","resolution":{"observed_at":"2026-08-12T14:08:45.540893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:45.434154Z","title":"Exploring synonyms as context in zero-shot action recognition","venue":null,"work_id":"f6f53384-36df-46d4-9580-bf15752f4a11","year":2016},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:40.995780Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:a731f89e083209773d84f5b651e0bd666d2a37c72b380a8b8358588f27a06ec9","observation_id":"96065e79-07ec-478b-a35d-a020b140eec8","resolution":{"observed_at":"2026-08-12T14:08:45.472400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:45.420273Z","title":"Hiervl: Learning hierarchical video- language embeddings","venue":null,"work_id":"2723f836-a0c6-433c-aa90-d41ba84bf156","year":2023},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.016803Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:75c742a03b990b775b16edaa2972c318fc1032eeae6ea31bc5fd478f5e59df76","observation_id":"84fa500b-d883-473c-b707-e4b8e2c44fa2","resolution":{"observed_at":"2026-08-12T14:08:45.425059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:45.405234Z","title":"The ikea asm dataset: Understanding people assem- bling furniture through actions, objects and pose","venue":null,"work_id":"b2ae6150-d81e-4678-a44e-83e7b3a55ad0","year":2021},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.022207Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:4d0e95ca7876517eb45c2a62e6bb02f5cb997b8a81301a888de7d2d10535e6cf","observation_id":"732405b6-5ed4-4b7a-9f92-fae80af0857d","resolution":{"observed_at":"2026-08-12T14:08:45.409979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:45.391212Z","title":"Is space-time attention all you need for video understanding? In ICML, volume 2, page 4, 2021","venue":null,"work_id":"e5880528-7694-4401-9eaa-86fccc0c83fb","year":2021},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.027101Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:f3313b8c6d51bc0a615b5f309214a10951a55a12caca78b4ba244284b2474638","observation_id":"e7551e14-bab1-4879-b945-d862870784d2","resolution":{"observed_at":"2026-08-12T14:08:45.396127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:45.355709Z","title":"Rethinking zero-shot video classification: End-to-end training for realistic applications","venue":null,"work_id":"4001f1fe-96ca-43a3-8f13-2d2a2b553dc0","year":2020},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.083324Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:a90a2e6e539c286d60cd60b705fb78f7273da4e7232bfe29087890a0ddfd679c","observation_id":"80e0cd83-12ec-4d51-a6d1-3e5312a09955","resolution":{"observed_at":"2026-08-12T14:08:45.381534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:45.294498Z","title":"Regen: A good generative zero-shot video classifier should be rewarded","venue":null,"work_id":"eabe0bb5-0e9b-4284-bae6-191fd3c9cbae","year":2023},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.090381Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:3566350850510c775dcd1b54bbc11a0c1e22083e6b66db102a045e368ef4a447","observation_id":"ff4d3c15-0b5a-44a9-8445-fed95ac1fa51","resolution":{"observed_at":"2026-08-12T14:08:45.299158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:45.279702Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset","venue":null,"work_id":"ceec4f9a-2eff-4319-bb8c-5ef0e0c660fa","year":2017},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.094991Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:3251924198428fca3b1e171ca3de9a8257f884445c85727a4b4b0b5da1e620fe","observation_id":"9a249bd3-7f50-4a03-b916-3db3601cda56","resolution":{"observed_at":"2026-08-12T14:08:45.285381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:45.166912Z","title":"Elaborative rehearsal for zero-shot action recognition","venue":null,"work_id":"2258370b-7a02-4ff8-a465-152a8101a72c","year":2021},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.101071Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:4fb5064d4d3fa42fc7eb2cde9874701af08cbe75f25f182a2e525d3d35ace3d5","observation_id":"74109dde-6953-4ac5-bf01-dbd2129eacc2","resolution":{"observed_at":"2026-08-12T14:08:45.268691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-12T14:08:41.148077Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.148077Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:273a7b8d43ca89c098b80d8237a7e18a32597991a714cb809222e70d991bb4c0","observation_id":"b606cf03-a89a-4827-a2cf-a92ae546cf73","resolution":{"observed_at":"2026-08-12T14:08:41.148077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:45.152889Z","title":"Teaching structured vision & language concepts to vision & language models","venue":null,"work_id":"f0856c67-c724-4071-bad0-8d8d0ccf1617","year":2023},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.215173Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:17a0590dc4770c95bfbaf2a0637006f4dd91c363e65e91b38afb5fa45754eab2","observation_id":"11326423-3c91-49f8-92de-fb0fedaa099c","resolution":{"observed_at":"2026-08-12T14:08:45.157402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:45.127773Z","title":"Step- former: Self-supervised step discovery and localization in instructional videos","venue":null,"work_id":"a0c5f6d8-5982-49d7-84a6-3558e892ae72","year":2023},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.240189Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:7d3c7668d2f907ef1950c79019d09ecac183aa2e7baaa90783ab99c914655c1e","observation_id":"a75dd326-4fb5-44bc-8847-7ade7db59dda","resolution":{"observed_at":"2026-08-12T14:08:45.142507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:44.977890Z","title":"Zero-shot action recognition in videos: A survey","venue":null,"work_id":"8d10fb1e-4a2b-4b30-9b70-d588217ba54a","year":2021},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.244645Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:ca8bd1fab9b955303c46f84b0a9ffbf8d34b2729bccd440dbc194a40b2156528","observation_id":"2fec3f59-f902-4123-84b1-945a3c7abf3e","resolution":{"observed_at":"2026-08-12T14:08:45.071841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:44.964005Z","title":"Ms-tcn: Multi-stage tem- poral convolutional network for action segmentation","venue":null,"work_id":"fceb1830-b12c-4448-9a3f-3b033d88943e","year":2019},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.329232Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:1de525a35271c89f42a22809b317079b3aa059360df389ddd6c1c39162f2a6d5","observation_id":"7d0628ee-9900-45d8-868a-4c71a8f9d486","resolution":{"observed_at":"2026-08-12T14:08:44.968430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:44.947414Z","title":"Learning to recognize objects in egocentric activities","venue":null,"work_id":"95d287a3-5409-4bba-98fe-023d6eb3e238","year":2011},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.421730Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:d760aa20ac5104e3ae863169b8c487997b130aa0df9c06a6b8dd499b2e832366","observation_id":"bea9a6b6-a870-40a8-bd16-a779afd8df73","resolution":{"observed_at":"2026-08-12T14:08:44.953527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:44.931580Z","title":"Slowfast networks for video recognition","venue":null,"work_id":"59bab41a-2e41-4aca-9470-82c46ae5f673","year":2019},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.502547Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:0e19bdcb9cc1835c16621fb4c9dfe58ad004f550cca6fac12c51428a964bdec5","observation_id":"d9e4b6be-e75c-4f34-9bd5-bfb91ebfc51d","resolution":{"observed_at":"2026-08-12T14:08:44.936844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:44.913208Z","title":"Prego: online mistake detection in procedural ego- centric videos","venue":null,"work_id":"0ce5256e-e2fd-4d6a-ad6e-92c1b4cccc45","year":2024},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.535699Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:95c645382a5653829749ea7056137bc29a0304cb758e89cf17a49eb4ae344063","observation_id":"9e8b1f8f-6ab6-4707-8485-c0dbb80803cd","resolution":{"observed_at":"2026-08-12T14:08:44.921960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:44.779630Z","title":"Improving zero-shot gen- eralization and robustness of multi-modal models","venue":null,"work_id":"9e12a985-2d50-4484-9228-9ef4762650d3","year":2023},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.558624Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:70270bac1e1991fc85e870bb0a023491ca439ab2d141169a36f16bffdb0863e2","observation_id":"1d271bf2-ada1-4cb9-81a9-db6c660651a9","resolution":{"observed_at":"2026-08-12T14:08:44.821681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:44.764647Z","title":"Weakly-supervised action segmentation and unseen error detection in anomalous instructional videos","venue":null,"work_id":"f19e19fc-098d-4938-9844-bd4786e5d66e","year":2023},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.563967Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:e372b32a51c5ad8b93e1320650f9a9279387f9e63a8315839bd3c22479401e9e","observation_id":"0d3393ef-0247-49d9-9225-eb6b77159975","resolution":{"observed_at":"2026-08-12T14:08:44.769725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:44.749899Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":"7af971bc-15ec-42f7-a444-5ff07922acd8","year":2022},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.569698Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:324487dc75d673eb44612e7caf047a07f55bd278d784c04ce2ef58534d3a5a91","observation_id":"7263b4e0-2589-4854-b751-0c54a2799b8f","resolution":{"observed_at":"2026-08-12T14:08:44.754663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:41.620096Z","title":"Temporal alignment networks for long-term video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.620096Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:0295ed032f3e790cfc6ec3062013e00205036232729862ef02bb354fde231a76","observation_id":"90c21025-a295-4590-91b0-ee49897d6703","resolution":{"observed_at":"2026-08-12T14:08:41.620096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09141","last_updated":"2021-06-16T21:36:36Z","snapshot_observed_at":"2026-08-10T03:10:05.954912Z","submitted_at":"2021-06-16T21:36:36Z","title":"Probing Image-Language Transformers for Verb Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09141","snapshot_observed_at":"2026-08-12T14:08:41.680083Z","title":"Probing image-language transformers for verb understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.680083Z"},"links":{"cited_paper":"/paper/2106.09141","citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:36e863bd9cb37f26aa5a6292612929cab21faaa6b185f86d6c25e6f78ffae5cf","observation_id":"fa393e83-200d-46a6-825e-39e6971c9c23","resolution":{"observed_at":"2026-08-12T14:08:41.680083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:44.677095Z","title":"Clover: Towards a unified video-language alignment and fusion model","venue":null,"work_id":"f744e252-609b-428b-8b94-5724d91f6ac5","year":2023},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.709050Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:39875a15573521dd907a0612f93f43924ba641f1c89db5ddd6d839d25251a6ed","observation_id":"ac89540c-787a-4938-a1f6-9275e2aa9601","resolution":{"observed_at":"2026-08-12T14:08:44.722893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:44.634606Z","title":"Fine-grained generalized zero-shot learning via dense attribute-based attention","venue":null,"work_id":"fa8f9b93-80e5-4392-a7a9-cead9db659af","year":2020},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.714001Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:2684a29d47083283a4f73ca7cf9155b304c8caa4e752baa213b3b353ff06b0b6","observation_id":"be5709eb-168f-4b2c-940d-cbf8a686689b","resolution":{"observed_at":"2026-08-12T14:08:44.639994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:44.618554Z","title":"Objects2action: Classifying and localiz- ing actions without any video example","venue":null,"work_id":"3879fcc0-d486-481d-8d24-00326825c025","year":2015},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.718983Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:9b0737b19860c9d09d986e7a206a04fb5f9b1edb458bdc264ca350fde32c92c0","observation_id":"74b88be9-9871-4bae-b5b4-d24e6670ea2b","resolution":{"observed_at":"2026-08-12T14:08:44.624457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:44.595212Z","title":"Prompting visual-language models for efficient video understanding","venue":null,"work_id":"b8d1aa05-d002-464a-93e1-c10b24814115","year":2022},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.723234Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:c888ab856674ef6cba318cf9a0a611c660ab8f58a6ae539120758e9f0f322f1e","observation_id":"e9921a13-86a5-40c0-af2e-6a837086a824","resolution":{"observed_at":"2026-08-12T14:08:44.606588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:44.477551Z","title":"Error detection in egocentric procedural task videos","venue":null,"work_id":"0fb86685-8bce-464d-9ff3-13e706fe0147","year":2024},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.783002Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:16ba653428e5966d4624e6d0eeac3906c8a64d1f160f66e51ac3e4d1c7e63a89","observation_id":"df167b3c-640b-476e-92fe-196eaf923582","resolution":{"observed_at":"2026-08-12T14:08:44.535690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:44.463195Z","title":"Align and prompt: Video-and-language pre-training with entity prompts","venue":null,"work_id":"b7efb82a-9cd9-4a61-82e9-e3c8a7daf81d","year":2022},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.825070Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:c50818b5da5fc9cf503e8f524693c3b9d52e9ed377f8d5ec6beaaf57c588760c","observation_id":"e749117b-00d5-444c-995e-e6de40abf633","resolution":{"observed_at":"2026-08-12T14:08:44.468170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:44.434479Z","title":"Cross-modal representation learning for zero- shot action recognition","venue":null,"work_id":"389f2d15-37e2-4a00-a664-6fe48103a322","year":2022},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.829748Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:189d61e074ec44dad3e05c8eea20e04a638c00017918b8545a47832a18c19e63","observation_id":"2a32aef5-e3fe-42f0-bfeb-c374ee904f9f","resolution":{"observed_at":"2026-08-12T14:08:44.453055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:44.279562Z","title":"Match, expand and im- prove: Unsupervised finetuning for zero-shot action recog- nition with language knowledge","venue":null,"work_id":"49b61378-ef29-44c8-b685-f6533dc02410","year":2023},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.834114Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:ec7886502f5205790f556ea8bec28bfd358926449439c77df42b92b2d81a15f5","observation_id":"8b00805e-9d19-4f0d-93f4-716827babb06","resolution":{"observed_at":"2026-08-12T14:08:44.354680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:41.838632Z","title":"Learning to recognize procedural activities with distant supervision","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.838632Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:7201ec44bf6fde75fccbd6379cc6404120ca84450b10df604320ee74e4bd2a77","observation_id":"bb8f3bb8-0369-4a79-ba98-800b5391f2a3","resolution":{"observed_at":"2026-08-12T14:08:41.838632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:44.254897Z","title":"Out-of-distribution detection for gener- alized zero-shot action recognition","venue":null,"work_id":"473e3667-d77b-4a4d-b95f-2bae9fd2a9ca","year":2019},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.917429Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:74eb416a82ce24d6584400ebd2d36421a235142fd2709b608e65c129ebb70b45","observation_id":"56a4e60a-3ba5-486c-b277-0223da873a3d","resolution":{"observed_at":"2026-08-12T14:08:44.260818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:41.922633Z","title":"Learning to ground instructional articles in videos through narrations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.922633Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:a7e1f53da9ba4185b5ae28f55765c426ce5039a9414afd7d4ee91d062b9ce0be","observation_id":"f768d3f8-f83e-4dc0-8c91-00a35ec1b7e3","resolution":{"observed_at":"2026-08-12T14:08:41.922633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:44.228184Z","title":"Object priors for classifying and localizing unseen actions","venue":null,"work_id":"80c6ccef-0361-4b72-bf3c-0c3647af8941","year":1954},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.927079Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:46f4e0a9e78f8c67ead2831ea97346e7be21b30b949b29eea5b2d80a1e81eee8","observation_id":"392843a1-d2b0-42bc-a566-d817eda44526","resolution":{"observed_at":"2026-08-12T14:08:44.233566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:44.162248Z","title":"End-to-end learning of visual representations from uncurated instruc- tional videos","venue":null,"work_id":"7f9106c2-6299-4ef5-ab1a-11b6e7f2c3ca","year":2020},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.931494Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:ddf6ff7184171604026ab1fc31538157c0dc21043c5263e6679cde4777a00f51","observation_id":"f7caf8e7-e8af-42fc-8c45-92f4ced659d3","resolution":{"observed_at":"2026-08-12T14:08:44.205632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:44.145896Z","title":"Howto100m: Learning a text-video embedding by watching hundred million narrated video clips, 2019","venue":null,"work_id":"16ed2e88-3006-4292-a4de-745c7724a0a5","year":2019},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.936116Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:32a705f9eded994385b52341bb6a5d7d3a556b98357fb2d944e9fefbaaae0726","observation_id":"5439a55e-bf2d-4057-9040-60008bbf1ecc","resolution":{"observed_at":"2026-08-12T14:08:44.151592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1301.3781","last_updated":"2013-09-07T00:30:40Z","snapshot_observed_at":"2026-07-06T03:04:11.148340Z","submitted_at":"2013-01-16T18:24:43Z","title":"Efficient Estimation of Word Representations in Vector Space","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1301.3781","snapshot_observed_at":"2026-08-12T14:08:41.941389Z","title":"Efficient estimation of word representations in vector space","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.941389Z"},"links":{"cited_paper":"/paper/1301.3781","citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:f830fd434d58a9ce3809f63c4b9a274c26378d816f2378957de0bbaf0e47a648","observation_id":"d6fba638-7398-40f5-8d77-219f0861028d","resolution":{"observed_at":"2026-08-12T14:08:41.941389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:44.039336Z","title":"Verbs in action: Improving verb understanding in video-language models","venue":null,"work_id":"a1c083f7-7d65-4476-a712-48e3e8a034d2","year":2023},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.946220Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:6f66c820bba161504c559ce12497082d612bb5e6ad56baccfc19574cdc1da938","observation_id":"f35a470c-b545-4034-a694-4679b5b08965","resolution":{"observed_at":"2026-08-12T14:08:44.123711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:44.022610Z","title":"Spoken moments: Learning joint audio-visual representations from video descriptions","venue":null,"work_id":"6480464f-2789-4959-936a-bf0b99ec8f8e","year":2021},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.951307Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:df563c6b7bac8028b038e8509546c42c378f6152fb0c4d5255c2c3abdda4d1ae","observation_id":"366828e0-c3b9-4c9c-a70b-1df0eefb606c","resolution":{"observed_at":"2026-08-12T14:08:44.028356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:43.946787Z","title":"Zero-shot temporal action detection via vision-language prompting","venue":null,"work_id":"c5b48ab5-71d9-4e2d-b2ce-b63893dd7ef6","year":2022},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.996161Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:e2ba19e71a17bbf706254b3b9e6681d6d96e87c5726c0185b4ce43afd13a28ca","observation_id":"c20dc994-7087-4b41-9e42-0a02bfd86572","resolution":{"observed_at":"2026-08-12T14:08:44.007255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:43.890510Z","title":"Expanding language-image pretrained models for gen- eral video recognition","venue":null,"work_id":"edc0c18f-3a06-4bba-b8d1-1624be903130","year":2022},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:42.021559Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:f9ebe8238bc155ae0898a7ed3d58131f3cc8fd7e49c58d72bdba8954348186de","observation_id":"15acba4f-6f76-4565-bc7e-44d4020b9676","resolution":{"observed_at":"2026-08-12T14:08:43.896043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:43.840299Z","title":"Learning multimodal representations for unseen activities","venue":null,"work_id":"428dbbd6-7611-49da-a8c6-3b5e4e631350","year":2020},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:42.027762Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:8a7280934bf07826d9fa4d975f4768e56f8e614d13df7307f5bcbaa0ed8c9c41","observation_id":"f86fbf1e-492b-422a-8aa7-857260a243b9","resolution":{"observed_at":"2026-08-12T14:08:43.867587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:43.756591Z","title":"Egovlpv2: Egocentric video-language pre-training with fusion in the backbone","venue":null,"work_id":"1b1ac8b0-fa8d-4586-846b-db4dc2427118","year":2023},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:42.032409Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:2fb63f0421e1b5a772bda5e4eec260460212e9046492c6ee0ecf8cc71b82f25a","observation_id":"4cc7ed0a-b02c-45a6-9cab-ef19423003a3","resolution":{"observed_at":"2026-08-12T14:08:43.761687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:42.043056Z","title":"What does a platypus look like? generating customized prompts for zero-shot image classification","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:42.043056Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:8359a0eec7f2deb0eec865707d2f72cd4342ad97121b16cad8977d529aa48dab","observation_id":"5efc7eac-01e5-4a80-a6f9-02e7aae9ae5e","resolution":{"observed_at":"2026-08-12T14:08:42.043056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:43.713306Z","title":"Alignment-uniformity aware representation learning for zero-shot video classifica- tion","venue":null,"work_id":"fab9dfc4-fd9a-4b2f-b01e-ae0c25d81e11","year":null},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:42.090035Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:60f64aee1474497a9f7b09efb5624ffaad5769056272c85aaa0695415dd6f5ed","observation_id":"68d4deaf-c8e6-4719-bcb3-44f0b725a8b2","resolution":{"observed_at":"2026-08-12T14:08:43.736529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:43.590860Z","title":"Rethinking zero-shot action recognition: Learning from latent atomic actions","venue":null,"work_id":"68de3a02-fde2-4093-8500-dd51cc56ea3d","year":2022},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:42.101490Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:0eb7d1d5c2ec1e322f85bd24c4d53557827272fbb344f2fe3bc6ea78f6c859a2","observation_id":"08ddf227-795d-407f-a990-67c7f1f1ef5e","resolution":{"observed_at":"2026-08-12T14:08:43.648754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:42.105973Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:42.105973Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:e9917c6d3a1f32963413e0b519012f7d591c6cba50b785837d61044401f9eb01","observation_id":"28f404fb-d0db-4909-bc7a-7117967cc0c3","resolution":{"observed_at":"2026-08-12T14:08:42.105973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:43.547936Z","title":"Language-based action concept spaces improve video self-supervised learn- ing","venue":null,"work_id":"3596c2a7-6bee-4b82-b917-5de55d66b82b","year":2023},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:42.110115Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:7f1b3beb5dc62b4e1b4e9c1f3b81e1181cda551477f0dea2ccd6f2a201e3eb12","observation_id":"d556de65-a245-475d-94c7-ea542c650a66","resolution":{"observed_at":"2026-08-12T14:08:43.568529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:43.424779Z","title":"Fine-tuned clip models are efficient video learners","venue":null,"work_id":"06f2b8fd-f72e-4dee-b581-cdb538294596","year":2023},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:42.114311Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:f7ab77c2445c9151a5e47b586fe24a7d89bf0e590be077c99af4f88a1f882aed","observation_id":"60c15b2d-c2ce-4b4c-abcd-b2b204a7c148","resolution":{"observed_at":"2026-08-12T14:08:43.480138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.07635","last_updated":"2022-07-15T17:50:51Z","snapshot_observed_at":"2026-07-06T13:31:50.015965Z","submitted_at":"2022-07-15T17:50:51Z","title":"Is a Caption Worth a Thousand Images? A Controlled Study for Representation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.07635","snapshot_observed_at":"2026-08-12T14:08:42.119921Z","title":"Is a caption worth a thousand im- ages? a controlled study for representation learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:42.119921Z"},"links":{"cited_paper":"/paper/2207.07635","citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:e83323c86d98df77520b005c9a28f280ebcb1feb197d356d834916864c0122b4","observation_id":"91ad1310-2332-43cf-933a-e037b138d7c1","resolution":{"observed_at":"2026-08-12T14:08:42.119921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:43.409288Z","title":"As- sembly101: A large-scale multi-view video dataset for un- derstanding procedural activities","venue":null,"work_id":"731e5282-1722-4f10-b98d-3f7f0f8050ea","year":2022},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:42.126043Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:3bbcbd54066c16c68b82bc46d5b346238fea3879f66e1be80fe6e17980e0761c","observation_id":"2aaf919a-3816-4afe-bbb6-cd3f35a5bd35","resolution":{"observed_at":"2026-08-12T14:08:43.414332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:43.379628Z","title":"Mpnet: Masked and permuted pre-training for language understanding","venue":null,"work_id":"1c738df2-1fda-44ea-a103-4e98ac80c537","year":2020},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:42.157706Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:93cce19e753fbdad4d76cdd5dd6f836c76a3bbb2dfd744c948d06fb51fda71c2","observation_id":"230c78fd-ddb1-42ee-9656-e57fd4294125","resolution":{"observed_at":"2026-08-12T14:08:43.398085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:43.263365Z","title":"Coin: A large-scale dataset for comprehensive instructional video analysis","venue":null,"work_id":"a41778df-1d73-469d-bc0f-9333343c8c99","year":2019},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:42.184990Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:f37a6957011f5b438c019948e618f9a93ee2c28e228ed513fec9c2e0259fd722","observation_id":"43391558-a256-44fc-9939-dd713ce37841","resolution":{"observed_at":"2026-08-12T14:08:43.295076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-08-12T22:18:23.713183Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-08-12T14:08:42.189536Z","title":"Actionclip: A new paradigm for video action recognition","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:42.189536Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:294465d73297ae5e9ece6af871bab6fb9e592d7fd4f2bda060253051c7b5ffda","observation_id":"04979466-8c37-4949-a8df-3dead8f8a0aa","resolution":{"observed_at":"2026-08-12T14:08:42.189536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:43.170817Z","title":"Vilta: Enhancing vision-language pre-training through textual augmentation","venue":null,"work_id":"7059ca1c-2a50-46dd-a6d1-706f8b3e8f4a","year":2023},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:42.193948Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:3b96dbd15f17709871f3c050e1fce435540daaa48ce8e2f97cbd5a3972d21d44","observation_id":"b9aa2de1-0f43-4a3e-9a2b-0f8408ebdcb6","resolution":{"observed_at":"2026-08-12T14:08:43.235796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:43.072361Z","title":"Pax- ion: Patching action knowledge in video-language founda- tion models","venue":null,"work_id":"ce7156fb-98a8-4ea2-a495-5017137fa06c","year":2024},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:42.198093Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:45bf6691a38bd08231e53d6f0ff9fec5b9dd5db3fcd23da62288f04f9e659060","observation_id":"c871377a-b35e-4725-98b1-44ce9e340e4f","resolution":{"observed_at":"2026-08-12T14:08:43.152810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:43.040331Z","title":"Zero-shot event detection using multi-modal fusion of weakly supervised concepts","venue":null,"work_id":"70fc98f2-a9a3-407f-af56-4c36bd6effd7","year":2014},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:42.202643Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:e32269fc83af88fb55f5e7099b99c4b9f60f3955aa0e2d9e41ff4d252a242248","observation_id":"002a0166-01aa-4425-8f9b-4ebf5272c2d3","resolution":{"observed_at":"2026-08-12T14:08:43.059961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:42.890892Z","title":"Cap4video: What can auxiliary captions do for text-video retrieval? In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages 10704–10713, 2023","venue":null,"work_id":"270987dd-f048-4737-94a4-71966e8df0a3","year":2023},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:42.207694Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:6f84eadb2bc6dd51aacec24d9d0aac71aaa1a0582e596a3185d7ba4b08460840","observation_id":"fa7edda3-578f-463d-942c-58c3ed6cb094","resolution":{"observed_at":"2026-08-12T14:08:42.945797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:42.866059Z","title":"Revisiting clas- sifier: Transferring vision-language models for video recog- nition","venue":null,"work_id":"fd35bd81-5d26-4c5c-8462-755531a1884e","year":2023},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:42.213370Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:b8f2a515a810cc24f03cca1d50eed620fa1b6d5aaeeefeb6248c585f954eb205","observation_id":"d8a3b65a-cb63-4822-9401-d98af018659b","resolution":{"observed_at":"2026-08-12T14:08:42.879421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:42.775062Z","title":"Bidirectional cross- modal knowledge exploration for video recognition with pre-trained vision-language models","venue":null,"work_id":"f892c1fd-e293-429c-abdd-9afc09ff14eb","year":2023},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:42.227643Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:902b6e10c484d0bfbb4e7bf3e8f2b76d577b7f6ad4ed625e87096e380f98b13e","observation_id":"d61984bc-1b77-4ae9-894d-e0c97895b061","resolution":{"observed_at":"2026-08-12T14:08:42.835387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:42.633642Z","title":"Generative action description prompts for skeleton-based action recognition","venue":null,"work_id":"3bc6a19f-f308-4b3e-968b-9dc500d45636","year":2023},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:42.259861Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:f7d1ce1b02054f68333a1271120edb67c02620101f7737b65cb4fb170861d046","observation_id":"cb7ad621-edbc-4d41-8701-0aad67f7b9c2","resolution":{"observed_at":"2026-08-12T14:08:42.651926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.14084","last_updated":"2021-10-01T15:13:27Z","snapshot_observed_at":"2026-08-04T06:58:39.755482Z","submitted_at":"2021-09-28T23:01:51Z","title":"VideoCLIP: Contrastive Pre-training for Zero-shot Video-Text Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.14084","snapshot_observed_at":"2026-08-12T14:08:42.293896Z","title":"Videoclip: Contrastive pre-training for zero-shot video-text understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:42.293896Z"},"links":{"cited_paper":"/paper/2109.14084","citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:b251cdf8ea50d504fc283aaa2065bacda55aa1d6edac3016cadcfb4ab5ca71e5","observation_id":"31beffb7-5a7b-4c4d-b56c-48ca0150bb0e","resolution":{"observed_at":"2026-08-12T14:08:42.293896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:42.617817Z","title":"Movie genre classification by language augmentation and shot sampling","venue":null,"work_id":"7114f943-4014-46ab-8d41-2965b1f0a9e4","year":2024},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:42.298672Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:e3344b3ad06b6aced4561cb4bbdb73e2be824ff66551ea819580df64d6559014","observation_id":"cb277bc7-0b42-4946-9107-b6beed78ed43","resolution":{"observed_at":"2026-08-12T14:08:42.622826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:42.469278Z","title":"Learning video representations from large lan- guage models","venue":null,"work_id":"916ce107-6b59-4138-b3a6-dcf99a49b9be","year":2023},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:42.303134Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:06c539c9d157ba4cfb43a5fa2e663f6cc6791b2d2ccae264c6dd4f7aa005b6bc","observation_id":"5cbe71b3-35a1-47ab-b07f-abd064bcdac0","resolution":{"observed_at":"2026-08-12T14:08:42.566586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:42.450135Z","title":"Learning procedure-aware video represen- tation from instructional videos and their narrations","venue":null,"work_id":"c55e2722-e2e0-4824-a0fe-18b8d449e056","year":2023},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:42.308404Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:6390ba99fd324b4d7583f1f0b0672de9ea2b32d415e3768d29d7bb0a0351582d","observation_id":"79a20398-21bc-4633-ad0f-c8d514f8455c","resolution":{"observed_at":"2026-08-12T14:08:42.457418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T22:20:11.670705Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos"},"reference_resolution":{"displayed":66,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":0,"verified_fuzzy":54},"total_outbound_references":66},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 0 inbound Pith citation observations for arXiv:2411.15628."}