{"as_of":"2026-08-20T09:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:95b5c2d8a34943bac59e506dbe04872f124467d844d90d06a2e0b3e7505595da","coverage":[{"denominator":91,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":91,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T19:14:34.495197Z","state":"measured"},{"denominator":91,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":91,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.10922/citation-record","integrity":"/paper/2411.10922/integrity","json":"/paper/2411.10922/citation-record.json","paper":"/paper/2411.10922"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:33.897362Z","title":"Bridg- ing the gap between object and image-level representations for open-vocabulary detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:33.897362Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:1ac70d661e18a6bf7aac15dc28567d74c310ef1fc2fd1433d2eb8f7f30e0caf8","observation_id":"db3981e3-74ce-482e-bbb4-dd3ac75ca216","resolution":{"observed_at":"2026-08-12T19:14:33.897362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:33.902105Z","title":"End- to-end object detection with transformers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:33.902105Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:0f4e6c49aa276db36df7958c038a2cbe504d9e3dbec0fd5fcd41a40a589dc50d","observation_id":"17fc7182-20d2-41c2-95e3-017c4828fb4d","resolution":{"observed_at":"2026-08-12T19:14:33.902105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:33.908058Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:33.908058Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:92f596d3fd0d79ace0b6422e1702ebb8c169ce71685b39032ca9e885bfd42266","observation_id":"b03136e5-d99e-44cd-bf34-03704abbffe5","resolution":{"observed_at":"2026-08-12T19:14:33.908058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:33.913872Z","title":"Generic attention- model explainability for interpreting bi-modal and encoder- decoder transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:33.913872Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:f1e9d17c653a18964630ac18c32cd4566381b7cd34e47e749f8e584764743187","observation_id":"b891a697-38a8-4291-87b8-3a0063cc9ca9","resolution":{"observed_at":"2026-08-12T19:14:33.913872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16118","last_updated":"2023-03-28T16:40:47Z","snapshot_observed_at":"2026-08-17T22:34:04.405739Z","submitted_at":"2023-03-28T16:40:47Z","title":"CycleACR: Cycle Modeling of Actor-Context Relations for Video Action Detection","version":1},"cited_work":{"arxiv_id":"2303.16118","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.16118","snapshot_observed_at":"2026-08-12T19:14:34.733634Z","title":"CycleACR: Cycle Modeling of Actor-Context Relations for Video Action Detection","venue":"cs.CV","work_id":"9c872405-06e9-4f9b-be35-fa5b15111a05","year":2023},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:33.920517Z"},"links":{"cited_paper":"/paper/2303.16118","citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:ece3866324045af1b368df2688c1c1f1f0cac368654bbc3853dcaa327fce959a","observation_id":"eaa2407a-400c-4507-8cbb-083426c58af3","resolution":{"observed_at":"2026-08-12T19:14:34.741882Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:33.926112Z","title":"Efficient video action detection with token dropout and context refinement","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:33.926112Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:53eb6244e35d62ea20a51fc313cb96804e69fc79fd05b0b22d3e33fad475e488","observation_id":"e5f1f7ba-2173-4c7a-a937-a29ce4570943","resolution":{"observed_at":"2026-08-12T19:14:33.926112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:33.931019Z","title":"Watch only once: An end-to-end video action detection framework","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:33.931019Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:cce2fe3cba142c4639a86f7dd075b24ebead9ea598b4715978faf936acaace16","observation_id":"751bcd4b-75e4-4952-9bb9-4b5230a32a7a","resolution":{"observed_at":"2026-08-12T19:14:33.931019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:33.938524Z","title":"Gabriellav2: Towards better generalization in surveillance videos for ac- tion detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:33.938524Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:deb0a1c8b749364eef778543d1059eae66e91106797592a0183f91b2866c994a","observation_id":"e35feb40-0671-4a36-b17c-bee968bc33d5","resolution":{"observed_at":"2026-08-12T19:14:33.938524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:33.942737Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:33.942737Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:37e31ea60b9c5e341f6715dd18413c108547372e49aef7f734fc419ed7f33be0","observation_id":"899f6d60-3d9a-423f-95ef-a1f52c97fe31","resolution":{"observed_at":"2026-08-12T19:14:33.942737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:33.947581Z","title":"Learning to prompt for open-vocabulary ob- ject detection with vision-language model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:33.947581Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:76c21afe5db7389581de8f2e53d6ba4784bf54ad79bef4d5a752e4f0d5ccc40e","observation_id":"98a2ede4-d1b3-4ed4-89fc-1cc8556ffbad","resolution":{"observed_at":"2026-08-12T19:14:33.947581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:33.953166Z","title":"Holistic interaction transformer network for action detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:33.953166Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:bb05d8ed2ec28b58be9c164100028104cdcbd21c5991b2322115f4d71f19b487","observation_id":"fbd0b121-fc8f-4d39-82ed-b4a83da6c90e","resolution":{"observed_at":"2026-08-12T19:14:33.953166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:33.958245Z","title":"X3d: Expanding architectures for efficient video recognition","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:33.958245Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:f80f11ff773efe3ae34cdaa68d6e6f594f118be30b8526e2bd4ab7324e2bb3ac","observation_id":"bbbb3167-c1e4-4cb3-9bdd-c19cd89a3440","resolution":{"observed_at":"2026-08-12T19:14:33.958245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:36.299123Z","title":"Slowfast networks for video recognition","venue":null,"work_id":"d49c5e38-76a2-4c08-a872-57c8b7cbc21d","year":2019},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:33.962864Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:a5ea9e1746f7f06b7f500076a11c4e0e65524d9d00722fc56047e2329ae05e85","observation_id":"e1d8fe21-be1c-4d83-bd36-40bd9b5e3e62","resolution":{"observed_at":"2026-08-12T19:14:36.305254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:36.284600Z","title":"Clip-adapter: Better vision-language models with feature adapters","venue":null,"work_id":"45877d46-516f-4770-8707-343249f39103","year":2023},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:33.968625Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:9f818b1d7e6a276b30229c3b24c0f8b992c867d9df0ba2d88dd4b2a23a5900a7","observation_id":"39c3202b-f348-4ef9-9528-cdfa635e7663","resolution":{"observed_at":"2026-08-12T19:14:36.289572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:36.270927Z","title":"Adamixer: A fast-converging query-based object detector","venue":null,"work_id":"b47e7af8-4549-41b5-a8f2-ae852f4f3e63","year":2022},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:33.972844Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:d729051bbbe9fa3b601700593516703b295f057aab91d82e872235872332f989","observation_id":"6c8f9fde-1643-4644-a992-a20489ee6010","resolution":{"observed_at":"2026-08-12T19:14:36.275566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:36.255655Z","title":"Video action transformer network","venue":null,"work_id":"fbc1ea46-80ac-4b18-984d-18578903196e","year":null},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:33.978719Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:7462443c902b33c7deb2e2409a74bddd8e56e4b803143096f1cc12aaa648e6bd","observation_id":"3647d439-e593-4e2e-9808-f6f413784297","resolution":{"observed_at":"2026-08-12T19:14:36.261882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:36.241642Z","title":"Ava: A video dataset of spatio-temporally localized atomic visual actions","venue":null,"work_id":"d8078fab-f42e-4f8e-a8d4-b09e0aaa40c1","year":2018},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:33.984004Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:f800b842691ed19e5036ef548df77dd0cd7a005c584c73cbee2ead37d40125cf","observation_id":"ada785ec-8665-41e8-a8f3-868448bcf185","resolution":{"observed_at":"2026-08-12T19:14:36.245927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:36.228439Z","title":"Mask r-cnn","venue":null,"work_id":"6bdc53b1-22ae-4d28-b2cf-aafbdf2c6f57","year":2017},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:33.989696Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:271133af0fe026e5893c51540afc3a5ce9ba69f056fc908fc2edaa689a7c23ba","observation_id":"0948440f-5a6f-41f8-b49b-dbc1d9aef6cd","resolution":{"observed_at":"2026-08-12T19:14:36.233579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:36.215209Z","title":"Mask r-cnn","venue":null,"work_id":"a334f1b2-a06b-4ba0-886d-df6d28f2da8b","year":2017},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:33.997303Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:ab2d8c03e26f25fb7a37c8f2d671203ca02fb2dd9379be8e6eaa52c0beb4151a","observation_id":"8dcb99de-b9f4-4ade-afba-f62d7bb1d01e","resolution":{"observed_at":"2026-08-12T19:14:36.219321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:36.200082Z","title":"Interaction-aware prompting for zero-shot spatio-temporal action detection","venue":null,"work_id":"593ebba3-c965-4d8b-8f6f-48f234e75e7e","year":2023},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.002986Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:659adbce59dba6377cce47845a5521e37f24595492f032d54790564371bc6589","observation_id":"b7ff74fc-5739-40ef-81bb-4a05f78aa929","resolution":{"observed_at":"2026-08-12T19:14:36.204945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:36.186576Z","title":"Towards understanding ac- tion recognition","venue":null,"work_id":"5ee7756a-18ad-447b-b80f-7619030dd2f0","year":2013},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.008057Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:2f0b9901dae3f43caddbfd3a9489885b04e59171bb7eab020c897d4e7ed958bc","observation_id":"c0f167db-0d6f-4c01-b12b-11a15a5744f7","resolution":{"observed_at":"2026-08-12T19:14:36.191381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:36.170344Z","title":"Prompting visual-language models for efficient video understanding","venue":null,"work_id":"a38f9c8b-7e37-4b3b-bb8b-7bf650599863","year":2022},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.014997Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:331adb158d6422f4f571ed7386b37c15e71fbf6ce305e1e2181e660758e000b1","observation_id":"48bfafee-2a01-41bd-a998-cac1e8fb3254","resolution":{"observed_at":"2026-08-12T19:14:36.174641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:36.157677Z","title":"Prompting visual-language models for efficient video understanding","venue":null,"work_id":"f11eba7d-636e-401c-8b5b-0b8d040b48e3","year":2022},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.021273Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:40a4f7668addaf792e86a75cbaac1494bd668c1eeacf3534d7154ee61363cddf","observation_id":"3f2e8739-d94a-49ee-8651-719104ac68a4","resolution":{"observed_at":"2026-08-12T19:14:36.162136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:36.143047Z","title":"Action tubelet detector for spatio- temporal action localization","venue":null,"work_id":"02ea0117-3af8-4f5f-bd70-6e178d9d3393","year":2017},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.026541Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:588e7442eb3ccbf6c722890e3aabd91d746ff23788332c6d6a796b6e9cf41c8d","observation_id":"58b2af96-fcf7-41c8-b199-885dd85a5e02","resolution":{"observed_at":"2026-08-12T19:14:36.147873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:36.128862Z","title":"Region- aware pretraining for open-vocabulary object detection with vision transformers","venue":null,"work_id":"bb470beb-e7ba-4ce2-a69d-841307c23138","year":2023},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.032374Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:32d4666b84cc797a6c9627dd5d6b5a0e0e2dd01eea679c45c562bf12bd14d91c","observation_id":"f4cf0649-040f-417d-80a7-279a2b3bd1cd","resolution":{"observed_at":"2026-08-12T19:14:36.133135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.06644","last_updated":"2021-10-18T12:53:47Z","snapshot_observed_at":"2026-08-16T18:26:44.584458Z","submitted_at":"2019-11-15T14:09:47Z","title":"You Only Watch Once: A Unified CNN Architecture for Real-Time Spatiotemporal Action Localization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.06644","snapshot_observed_at":"2026-08-12T19:14:34.042842Z","title":"You only watch once: A unified cnn architecture for real- time spatiotemporal action localization","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.042842Z"},"links":{"cited_paper":"/paper/1911.06644","citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:3fd6011683bf140c51e7b03d3e3611be922958e26f5dde687262dd0a94f9659e","observation_id":"13de2aab-4ba6-495f-9b9c-b9dac35bac06","resolution":{"observed_at":"2026-08-12T19:14:34.042842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:36.110201Z","title":"F-vlm: Open-vocabulary object detection upon frozen vision and language models","venue":null,"work_id":"187bfada-ad56-4e80-9479-a0764557a5e9","year":2022},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.053125Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:2be82906ef63eb71cee16d9ce00b48d8188145044be7379df083a5f2833a3da3","observation_id":"627737ca-7693-4dc1-aec4-a29fc32d4c5d","resolution":{"observed_at":"2026-08-12T19:14:36.115041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:36.091572Z","title":"Multisports: A multi-person video dataset of spatio-temporally localized sports actions","venue":null,"work_id":"0a83ff7e-8691-48ee-a84e-6e58e25ed6a8","year":2021},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.057827Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:8eed1669457e11d4282661047f9ac858c9dd92d7567bc57379aa9da12a636e16","observation_id":"a6de3308-f534-4333-adba-57ddb94b64a6","resolution":{"observed_at":"2026-08-12T19:14:36.099488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:36.077724Z","title":"Exploring plain vision transformer backbones for object de- tection","venue":null,"work_id":"d54952c4-a1cd-47da-94ab-3b9e95863436","year":2022},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.062023Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:d9082ec808c6275b5143dee5d6156efe4e010083b2ab014bc87ce46db08e3480","observation_id":"992132a9-a5a3-44d3-a65c-db8ca27af360","resolution":{"observed_at":"2026-08-12T19:14:36.082400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05653","last_updated":"2024-09-16T09:10:00Z","snapshot_observed_at":"2026-08-20T05:41:58.194925Z","submitted_at":"2023-04-12T07:16:55Z","title":"A Closer Look at the Explainability of Contrastive Language-Image Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05653","snapshot_observed_at":"2026-08-12T19:14:34.072739Z","title":"Clip surgery for better explainability with enhancement in open- vocabulary tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.072739Z"},"links":{"cited_paper":"/paper/2304.05653","citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:04526e3ea5f0903deaee0858b00989f6099235bd5f0542b423790cc3c0833955","observation_id":"d6060094-1d26-4859-9fa5-e6c7837ca89c","resolution":{"observed_at":"2026-08-12T19:14:34.072739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.07046","last_updated":"2022-11-27T01:07:52Z","snapshot_observed_at":"2026-08-16T16:32:24.439918Z","submitted_at":"2022-09-15T05:01:03Z","title":"Exploring Visual Interpretability for Contrastive Language-Image Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.07046","snapshot_observed_at":"2026-08-12T19:14:34.090090Z","title":"Exploring visual interpretability for con- trastive language-image pre-training","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.090090Z"},"links":{"cited_paper":"/paper/2209.07046","citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:b1f24594eec8fbf19ee43fcf7b1c99ac95ba9c40c6e6905d2391714c58e8cc3c","observation_id":"6d5d97d2-4307-47ec-bd8c-6a10c6b79641","resolution":{"observed_at":"2026-08-12T19:14:34.090090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:36.060358Z","title":"Open-vocabulary semantic segmentation with mask-adapted clip","venue":null,"work_id":"5756b8fa-9b45-45fd-8368-d84c385b1109","year":2023},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.095188Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:07de1ef5c76e1c591aefe2963488233bf1f1197788777150396695cbc0facb33","observation_id":"4d102cf0-b0a6-4361-bb6a-81b2b6873817","resolution":{"observed_at":"2026-08-12T19:14:36.064805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:36.044836Z","title":"Learning object-language alignments for open-vocabulary object de- tection","venue":null,"work_id":"a515e73e-0611-453e-a300-e2268d2ac27d","year":2022},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.106098Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:2c7137871c4b8268f844bc6076b2c702aad6b4f570582ae2cf69bf0f712de5a9","observation_id":"64abda54-12b0-469d-9f22-61e2b7c3dd2a","resolution":{"observed_at":"2026-08-12T19:14:36.050592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:36.031248Z","title":"Frozen clip models are efficient video learners","venue":null,"work_id":"eaf83763-b39d-4f17-bccc-f8306417321e","year":2022},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.119730Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:ae08f3c93d76331acb19620b29d49fe093db9262c5972fc486a27ccb398b465e","observation_id":"782e6c26-1364-4b98-9f88-2eaa67143b93","resolution":{"observed_at":"2026-08-12T19:14:36.036110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:36.015033Z","title":"Revisiting temporal modeling for clip-based image-to-video knowledge transferring","venue":null,"work_id":"f5c47568-ed2d-4d15-a22b-8152bb7ba87c","year":2023},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.125878Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:6d6620fbfb8c0ffec912a297a0120ecf07bb9d514a4998af8bdc3d538352fd7d","observation_id":"fdf89e7f-b712-4165-84cc-0524b34cb94b","resolution":{"observed_at":"2026-08-12T19:14:36.020826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:35.994301Z","title":"Revisiting temporal modeling for clip-based image-to-video knowledge transferring","venue":null,"work_id":"990dca82-78e9-4a6e-983c-9cd7ea65cc14","year":2023},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.131528Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:2b3b4c2539132d8fb9b66a52e41c877a2f70f1476aa03bf8410b76e397022733","observation_id":"83cf222f-01f6-4fc0-b64d-7d5bc2a43bf3","resolution":{"observed_at":"2026-08-12T19:14:36.002043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-08-19T16:02:58.628969Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-12T19:14:34.142444Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.142444Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:cf757a1df519847c22ba460724717ee8f5912cab975190762a8ebe10d520ecef","observation_id":"5e553e47-f158-4342-b759-54babcbf0257","resolution":{"observed_at":"2026-08-12T19:14:34.142444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:34.147093Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.147093Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:6e00456fa96b8bbb78ef5c65e5a6eb679b1739503f7cd363274222690ae280a4","observation_id":"c08765bf-906b-45d3-8e29-d86035509d44","resolution":{"observed_at":"2026-08-12T19:14:34.147093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:35.962645Z","title":"Verbs in action: Improv- ing verb understanding in video-language models","venue":null,"work_id":"829dbe09-7739-44b3-984f-9d5ab601d15d","year":2023},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.152280Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:d996f2466d2521bc4f49c4c802e655d6fbab9634a3584c77e29681fbfca02c76","observation_id":"79e3dd92-e866-4dcc-8f9f-485a8a455d83","resolution":{"observed_at":"2026-08-12T19:14:35.967268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:35.946571Z","title":"Zero-shot temporal action detection via vision-language prompting","venue":null,"work_id":"6cbdfa2d-4a34-4cde-baf4-a4d6230e6171","year":2022},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.167226Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:b99eda8353f7b75b91c0dfb1a99c4f3440dece0af8acc77dd94d4c76b41c2e06","observation_id":"aa9df3ab-1c93-4e5c-af9e-c2f424e757b2","resolution":{"observed_at":"2026-08-12T19:14:35.953181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:35.918829Z","title":"Zero-shot temporal action detection via vision-language prompting","venue":null,"work_id":"49e8866e-6e61-4808-b444-8688b22151a0","year":2022},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.173557Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:86590de8d8e9d2ae28fa79395c65d29d6415cc00269e93db2ab6e6af6b0f3254","observation_id":"0db54a28-09cc-447f-80f8-dedade732fd3","resolution":{"observed_at":"2026-08-12T19:14:35.925219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:35.899749Z","title":"Expanding language-image pretrained models for gen- eral video recognition","venue":null,"work_id":"cea87f95-0365-4427-ab27-f3c4d029f683","year":2022},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.179499Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:daf347fa624c3b6602955a6ba13a5ac022d2e2aada20fafb5fc88b5fc5eb968d","observation_id":"9944dc8b-70e2-4561-9129-f828df311ed2","resolution":{"observed_at":"2026-08-12T19:14:35.905040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:35.880076Z","title":"Expanding language-image pretrained models for gen- eral video recognition","venue":null,"work_id":"1e076f44-bba5-493e-8826-fcbb46aa4446","year":2022},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.185592Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:d4306d498e2066e614a9f308e2755c8b4f4a685efbd652ef96867dc486d77121","observation_id":"ebb2f9c1-454b-48a6-9593-05de32ece069","resolution":{"observed_at":"2026-08-12T19:14:35.886681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T19:14:34.199421Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.199421Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:c418ca6227ae1ba31a2de3ee2ed28fc8c830382659ff1ae1ed4a9d3cbbe0d668","observation_id":"d4e87b73-854e-4aee-b8e7-adb107377104","resolution":{"observed_at":"2026-08-12T19:14:34.199421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:35.864956Z","title":"Actor-context-actor relation net- work for spatio-temporal action localization","venue":null,"work_id":"da0992e7-ce16-4aa6-a4dd-45d02f02c9b5","year":2021},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.203815Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:fd61c09b268df464903710f98beda3faf8156591e253a6f12142b2d45536ea2f","observation_id":"3da5c551-d16e-4ac1-ae8c-614c9c120058","resolution":{"observed_at":"2026-08-12T19:14:35.870041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:35.849839Z","title":"St-adapter: Parameter-efficient image-to-video transfer learning","venue":null,"work_id":"a458d0ed-0aa7-4bca-9089-355a368aa97c","year":2022},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.210893Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:24ef1d0d9964b7bf68cc3ef476c0130a9c75cad4898e895bd8fb1fdf0d650cfc","observation_id":"81dffbc5-8af5-4945-94d0-0e49a45e975f","resolution":{"observed_at":"2026-08-12T19:14:35.854822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:35.829559Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"bf98c4e3-4777-4e23-b7c3-3359ac7e32cb","year":2021},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.221147Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:4200eb0b2f6f882a0e8ee09874a14a4c479da2e8002ca6cf0800a6a0ad3d2f03","observation_id":"b5874fa3-658e-4643-a83d-ff134bca9207","resolution":{"observed_at":"2026-08-12T19:14:35.836146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:35.806281Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"c6768677-59b8-4261-9058-0e307dc4472d","year":2021},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.226553Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:fdcb0ec066a5b716a7615b86f262c9bd6cd2e3669c18ac652a64496fbc1f215a","observation_id":"4d2e88c0-1bb0-42e1-9891-0f9add2444a0","resolution":{"observed_at":"2026-08-12T19:14:35.813548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:35.791258Z","title":"Fine-tuned clip models are efficient video learners","venue":null,"work_id":"b38bc7c7-1962-4322-a98b-76f9ef2ae6ca","year":2023},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.235051Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:6dc6cc902f122cd01126f2ed2da592a722c2e6d4504eeb28d57219f0c1599eb7","observation_id":"2aae92bd-2bf9-4752-8b8f-0f0205d3967c","resolution":{"observed_at":"2026-08-12T19:14:35.796054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:35.775456Z","title":"Open-vocabulary temporal action detection with off-the-shelf image-text features","venue":null,"work_id":"542025cd-0efc-4593-acd1-99f270118286","year":null},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.248648Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:d463c54ee278c18b712ca9fd07867b1d3825e40e90987f8aaaa0b4b6971de1f9","observation_id":"e253c8d0-066f-41b0-9685-f289a970ef83","resolution":{"observed_at":"2026-08-12T19:14:35.780311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:34.253502Z","title":"Faster r-cnn: Towards real-time object detection with region proposal networks","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.253502Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:7098c2b9fc35666b241113bba66adf71a2b251c5ff377549b3717af3c038ca02","observation_id":"083eb89f-447a-48a8-8054-c1df10550bad","resolution":{"observed_at":"2026-08-12T19:14:34.253502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:34.257602Z","title":"Generalized in- tersection over union: A metric and a loss for bounding box regression","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.257602Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:0be63b74f947feb13aace84c602a9df1055aa3def41badb159a9d5616563d481","observation_id":"724675cb-153f-4780-b4b2-a6798463402a","resolution":{"observed_at":"2026-08-12T19:14:34.257602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:35.737205Z","title":"Sparse DETR: Efficient end-to-end object detec- tion with learnable sparsity","venue":null,"work_id":"a94d9a1d-bba1-4317-a54d-c7cfaea24620","year":2022},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.261894Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:09c10de63b2dea61930feee9ec176c79b01a72a2143bdfdd4ed7849b9210e4b6","observation_id":"59106dfc-b53e-4ec7-88b5-be3eeeb0d5b6","resolution":{"observed_at":"2026-08-12T19:14:35.743383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:35.721499Z","title":"Hi- era: A hierarchical vision transformer without the bells-and- whistles","venue":null,"work_id":"95877903-f72e-4a4b-b2b3-239013239ce5","year":2023},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.267147Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:fa24731ee11af9d816478a28aa17c97fcd29162a65884b6480092a83eebd5058","observation_id":"f93e6906-a7cc-4ba2-9da8-4af4973beca9","resolution":{"observed_at":"2026-08-12T19:14:35.726724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:35.698123Z","title":"Grad-cam: Visual explanations from deep networks via gradient-based localization","venue":null,"work_id":"2f0df00a-51dd-4766-a169-d043f9af193a","year":2017},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.271341Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:52889556561d72fe88b6417515329785cfc8cbe37a480c3cc61c3ffb9777ac3c","observation_id":"91d9c389-3853-478b-9aa6-f4b0d78c39f5","resolution":{"observed_at":"2026-08-12T19:14:35.703196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:35.683918Z","title":"Road: The road event awareness dataset for autonomous driving","venue":null,"work_id":"e06d6915-6aa3-4ede-8c0f-b8bd1fb849d4","year":2023},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.275944Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:490bfab5ee2e6aeb1726f17a7b5f27fb747f83171808d70823fb0741ea897a73","observation_id":"5bdd13fe-1598-41bc-b9a9-e7c8978c548c","resolution":{"observed_at":"2026-08-12T19:14:35.688783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:35.664641Z","title":"Ucf101: A dataset of 101 human actions classes from videos in the wild","venue":null,"work_id":"8946e9a7-d588-494d-839a-ec11d19f1db5","year":2012},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.280753Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:751017069d8c5ee38042a6a4a36ce22747032a4e773c1841d98c7626b139dd9f","observation_id":"c60eda70-48eb-4399-bea5-d0e95325d959","resolution":{"observed_at":"2026-08-12T19:14:35.670972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:35.647942Z","title":"Actor-centric relation network","venue":null,"work_id":"473b7615-2de0-4b52-a48f-3fb4397352f7","year":2018},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.286480Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:9cb0d6ea8882cabc7ea206051b18b8f09491a11fa1ffe85cb159b318b800cf6b","observation_id":"9e8d9b78-66a6-4176-b7c2-12f4eb1c56f1","resolution":{"observed_at":"2026-08-12T19:14:35.654926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:35.614189Z","title":"Relational action forecasting","venue":null,"work_id":"ad0acca1-8210-43a6-af85-d9490bd926f0","year":2019},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.292836Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:cc3922f3e67ef378fe53e0bbcc21688b9fd22278ea27ff40da88825b6a46122a","observation_id":"e6691d63-bfe3-4569-b800-587c8c19d26e","resolution":{"observed_at":"2026-08-12T19:14:35.620142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:35.588886Z","title":"Sparse r-cnn: End-to-end object detec- tion with learnable proposals","venue":null,"work_id":"4e6ec7c0-8369-445c-af29-0c16de16e096","year":null},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.300260Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:f16a760791512f46560d1f1b297fd1a1271d6f0576b28089a75fe56fff9c5f05","observation_id":"2d2becb4-77a4-4488-9e45-fb5cf60f330a","resolution":{"observed_at":"2026-08-12T19:14:35.596591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:35.570147Z","title":"Asynchronous interaction aggregation for action detection","venue":null,"work_id":"c83f43c7-6143-486c-be9e-01744ddf8fa8","year":2020},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.308022Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:3a759affd8b6899279e408f0f55c1fa2420059baea2b68315ec4a3062c984a93","observation_id":"f3b7da0b-fc8a-4876-8656-6f785bd2d0ec","resolution":{"observed_at":"2026-08-12T19:14:35.576476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:35.553665Z","title":"Mlp-mixer: An all-mlp architecture for vision","venue":null,"work_id":"788bfe83-0355-4329-9694-4addb5e6dc7b","year":2021},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.317360Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:58540620026de4183afa3bc9973e51398159f1c0dbd0542d60b1e44f78edef0b","observation_id":"9b3ac7e4-8a5e-4709-a9a6-a0f99214bebb","resolution":{"observed_at":"2026-08-12T19:14:35.558998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:35.531280Z","title":"Attention is all you need","venue":null,"work_id":"0c34a7ad-5f68-4389-88dd-c254fc0e3e1a","year":2017},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.321857Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:fde7cf244abc954e4f4e77374c350cd7cd028d6a6951b58394ff5a560e31f66d","observation_id":"d4ded328-8ca6-40d1-8e5d-ea4b27506309","resolution":{"observed_at":"2026-08-12T19:14:35.540707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-08-18T03:30:52.103954Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-08-12T19:14:34.333164Z","title":"Actionclip: A new paradigm for video action recognition","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.333164Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:98bb6eadd28c0c60a5ea19e7da4f6a55b32b09d16de19cacae0994f1faa5b253","observation_id":"2862efa0-b746-4ef8-8848-e4580b94e97a","resolution":{"observed_at":"2026-08-12T19:14:34.333164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:35.489596Z","title":"Vita-clip: Video and text adaptive clip via multimodal prompting","venue":null,"work_id":"92df2cbc-b887-4e53-a4d6-437a5803ff9b","year":2023},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.337888Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:ec207d5ac8d7f2252616a1d51ff4ee9020133f5d0bff205bbe53ec84606b854e","observation_id":"cef25c1c-96cf-4f48-a3cf-a785f982f251","resolution":{"observed_at":"2026-08-12T19:14:35.501357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:35.470978Z","title":"Open-vclip: Transforming clip to an open-vocabulary video model via interpolated weight optimization","venue":null,"work_id":"7082d85e-bac2-44bd-8d79-249eaf98e44c","year":null},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.342182Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:9f532d14a3d56e8bb3d12d7f78def45b8a57c5728fe7696f14886b37299c8ae0","observation_id":"49b02c60-0397-4add-bb39-60f46e93c4b0","resolution":{"observed_at":"2026-08-12T19:14:35.477256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:35.454087Z","title":"Long-term feature banks for detailed video understanding","venue":null,"work_id":"13599972-22a7-4e2c-8b50-538f9514a593","year":null},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.346537Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:dd5375476672f4b57a6b63cf5b68ddacfa0bea3e6ee97e57a47a558477babcd8","observation_id":"22930374-aaaa-4cb5-bc82-56616bdefd0b","resolution":{"observed_at":"2026-08-12T19:14:35.460235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:35.437731Z","title":"Context-aware rcnn: A baseline for ac- tion detection in videos","venue":null,"work_id":"7e9e876f-b982-4bb0-84d4-c6e6ed296e63","year":2020},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.351318Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:54617918665009f0d6bd3aadff33f7a95ff0e60412e340ee64ddc36155bae8ec","observation_id":"81150c78-644c-49be-82a4-af4bbc0f6241","resolution":{"observed_at":"2026-08-12T19:14:35.442768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15880","last_updated":"2024-02-01T08:31:59Z","snapshot_observed_at":"2026-08-16T20:12:44.248326Z","submitted_at":"2023-06-28T02:33:06Z","title":"Towards Open Vocabulary Learning: A Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15880","snapshot_observed_at":"2026-08-12T19:14:34.355336Z","title":"Towards open vocab- ulary learning: A survey","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.355336Z"},"links":{"cited_paper":"/paper/2306.15880","citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:3a93f3de05d6039f5bb3c99fd2e9f854742daa489c2e7a891e4c94ad3251b8d9","observation_id":"fa01248c-5077-4de8-8e0e-ca3bf8273f72","resolution":{"observed_at":"2026-08-12T19:14:34.355336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:35.420442Z","title":"Stmixer: A one-stage sparse action detector","venue":null,"work_id":"626ca168-9e66-45cb-931b-9268d67aacc1","year":2023},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.360234Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:e62dd4a107e6cf5598bb48050528713f33a6f102f08dc293dc0f0c624d500f8b","observation_id":"512e006d-b5fa-4039-8c0f-5ce3411677e8","resolution":{"observed_at":"2026-08-12T19:14:35.425422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:35.401036Z","title":"Stmixer: A one-stage sparse action detector","venue":null,"work_id":"c7be25d2-6492-4d34-beb8-f4c864e50f28","year":2023},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.364807Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:a3b56461738cc407277c0ab0781446e44442064ede44698ef16417f8b51aa264","observation_id":"6ed96869-fb21-4314-ad30-5ee6828fb25e","resolution":{"observed_at":"2026-08-12T19:14:35.405882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10832","last_updated":"2024-05-17T14:52:47Z","snapshot_observed_at":"2026-08-18T12:36:39.894124Z","submitted_at":"2024-05-17T14:52:47Z","title":"Open-Vocabulary Spatio-Temporal Action Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10832","snapshot_observed_at":"2026-08-12T19:14:34.369317Z","title":"Open-vocabulary spatio-temporal action detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.369317Z"},"links":{"cited_paper":"/paper/2405.10832","citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:5fe435522796d3e3aaa62adaa6a9c080533601835a508cb26fae32bc3ac3c662","observation_id":"6228390b-7bcb-49f7-b9e7-eb4aeaf4a8f0","resolution":{"observed_at":"2026-08-12T19:14:34.369317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:35.385444Z","title":"Cora: Adapting clip for open-vocabulary detection with region prompting and anchor pre-matching","venue":null,"work_id":"b8b255a6-f377-4abd-a879-41afbfa5c94c","year":2023},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.374056Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:3545ed276abfcc07bb186ecaab61c95b6569d3626c49d033a692d2a24d835d82","observation_id":"a450ad62-ef08-4428-a427-86f9125e5f3a","resolution":{"observed_at":"2026-08-12T19:14:35.390028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:35.370123Z","title":"Clip-vip: Adapting pre- trained image-text model to video-language representation alignment","venue":null,"work_id":"935a9e2b-dbf0-4981-a97c-1711358b296e","year":2022},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.378372Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:3b791eb577b75aacd11e5313d7d72c81c04d56f0802f9bf6d2ee53c62fdfcbf9","observation_id":"4a15141a-cc08-4019-9d1f-55152793a02b","resolution":{"observed_at":"2026-08-12T19:14:35.375890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:35.353544Z","title":"Clip-vip: Adapting pre- trained image-text model to video-language representation alignment","venue":null,"work_id":"5dc9a3a4-591a-43db-9bf2-f50168733f69","year":2022},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.382792Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:503a164a3b8425eeb2153c4ceeb3aaae359270c839b91660fa79e21aefcb9c05","observation_id":"5576a9a8-ab22-4929-9de9-141a61b7f618","resolution":{"observed_at":"2026-08-12T19:14:35.359394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:35.335785Z","title":"Unloc: A unified framework for video localization tasks","venue":null,"work_id":"bdad80e3-74d2-49bb-be05-aa30a21a6a66","year":2023},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.389183Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:2ff578774d76f340b9dcf7dfb483ad7897bdd1735850fe53ed242c5297ad976a","observation_id":"c1dde812-30d6-474c-a4db-8f8112fc3d92","resolution":{"observed_at":"2026-08-12T19:14:35.342125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:35.311883Z","title":"Detecting human actions in surveillance videos","venue":null,"work_id":"d8fc5d02-c6d6-486b-92df-9849f788c7ea","year":2009},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.398600Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:acbbbbc5ab4f4d86a70be0dc0a7a1168cee4aeeae617e42ff2f6253b79cd92f8","observation_id":"6a60e58f-1d3a-480f-ad50-8620f40144e3","resolution":{"observed_at":"2026-08-12T19:14:35.323223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:35.276183Z","title":"Contextualized spatio-temporal contrastive learning with self-supervision","venue":null,"work_id":"57789432-f93e-4408-b02e-468ccea5983a","year":2022},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.404552Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:04b0209dc0e9d710d31c09848954259aad642b314857705f5c9f4ebe4ddf34c4","observation_id":"ee6e3520-08f2-4373-9558-c55e4b34417c","resolution":{"observed_at":"2026-08-12T19:14:35.286810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:35.250249Z","title":"Vision-based garbage dumping action detection for real-world surveillance platform.ETRI Journal, 41(4):494–505, 2019","venue":null,"work_id":"8a47f1c4-eb1d-4909-bbba-01d0a5bf3d84","year":2019},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.412125Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:5c63451f7a3cfa9817bf3929f87f435ce9790d7958be9bc25bf3aba8ab806ca4","observation_id":"1a35debf-220f-4151-9dcf-e3d2c372e435","resolution":{"observed_at":"2026-08-12T19:14:35.259768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:35.219812Z","title":"Open-vocabulary detr with conditional matching","venue":null,"work_id":"8065ff0d-ce4b-4e11-9b96-271031ac9174","year":2022},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.418542Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:630c3e628683cc61afa72dfcc26be049180ead767651e5db200f19d11c134773","observation_id":"ba00c246-766c-4df0-9b77-2e412d624b1c","resolution":{"observed_at":"2026-08-12T19:14:35.227399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:35.183223Z","title":"Open-vocabulary object detection using captions","venue":null,"work_id":"a874c35e-721b-45dc-b5e3-bc6e0de40f95","year":2021},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.428209Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:c34e8338eec331e1dab1d939a98efc466849a1627d0fb4491c79e4310b7d3c8e","observation_id":"778c0bbe-b2f3-4369-b6e5-55093f7d3d82","resolution":{"observed_at":"2026-08-12T19:14:35.195512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:35.162735Z","title":"Open-vocabulary object detection using captions","venue":null,"work_id":"dbc2130e-3f7e-4309-b071-cb72d7c390db","year":2021},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.432539Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:0acc799d35a09a4e28cb2f4afb96726ef84d58baa36fd5cabc1d869d725a0f32","observation_id":"c3229a69-53c5-4c6a-b995-cd6e3a770985","resolution":{"observed_at":"2026-08-12T19:14:35.168723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:35.131769Z","title":"From recognition to cognition: Visual commonsense reason- ing","venue":null,"work_id":"f5d5239a-1df0-4acf-b3e7-46667982eafd","year":2019},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.443045Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:a47f242dc5c0135ef6d27a532ad5d69214e942e412a59a5848a72724538dbef0","observation_id":"f94dff5c-4afc-40ef-b6f8-8bf85f6e1a47","resolution":{"observed_at":"2026-08-12T19:14:35.139140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:35.083209Z","title":"Vinvl: Revisiting visual representations in vision-language models","venue":null,"work_id":"0bc8d5e3-5a80-44a4-8e09-639aabd4d890","year":2021},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.449259Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:af2aa0fbff1e9fae4424c51af1597af4375a45d9d8d1ab17ebb0e46bd7c50326","observation_id":"c2e45b16-72d3-4443-9478-a1e903d3ec23","resolution":{"observed_at":"2026-08-12T19:14:35.089742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:35.056952Z","title":"Tuber: Tubelet transformer for video action detection","venue":null,"work_id":"316a8141-5937-4c46-b974-8f62833cde90","year":2022},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.453982Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:553bd3477740fcd00ef78ffb87424d40ca7195e068d59120b0cfde34eff9d257","observation_id":"2316d72b-c42a-4441-a29f-faeed5df7917","resolution":{"observed_at":"2026-08-12T19:14:35.065261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11975","last_updated":"2023-04-24T10:15:31Z","snapshot_observed_at":"2026-08-16T15:38:14.044216Z","submitted_at":"2023-04-24T10:15:31Z","title":"MRSN: Multi-Relation Support Network for Video Action Detection","version":1},"cited_work":{"arxiv_id":"2304.11975","doi":null,"metadata_source":"pith","pith_arxiv_id":"2304.11975","snapshot_observed_at":"2026-08-12T19:14:34.551015Z","title":"MRSN: Multi-Relation Support Network for Video Action Detection","venue":"cs.CV","work_id":"df4d1caa-adce-4b43-9f68-9820e8b77dd2","year":2023},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.460035Z"},"links":{"cited_paper":"/paper/2304.11975","citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:f3a209d3132aaf345c44e693a039935a805eca2a5c2c8790c49e64c2af50cbb1","observation_id":"fb604aaf-58c5-40a6-8b26-0a72517c0866","resolution":{"observed_at":"2026-08-12T19:14:34.558149Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:35.032772Z","title":"Regionclip: Region-based language-image pretraining","venue":null,"work_id":"3b0c7ed4-5a66-4ca7-b617-858c473938c0","year":null},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.472500Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:07a59e7c2411352154acde4c82174826d3fda54c17ca95eda1160fe9e0077589","observation_id":"bf65d351-a680-4c7c-a476-f51acb3f9e45","resolution":{"observed_at":"2026-08-12T19:14:35.040683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:34.996001Z","title":"Learning deep features for discrimi- native localization","venue":null,"work_id":"6bd30f3f-c8a7-4e16-b372-8018e5cdfdb5","year":2016},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.477338Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:74459c0c167ec45a8cac04db7358b6ec89491a6c74e4dde87a5a3c696d9d4254","observation_id":"8f0230f2-e4ce-4cdc-98e5-cc72b0593fee","resolution":{"observed_at":"2026-08-12T19:14:35.005673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:34.482606Z","title":"Learning to prompt for vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.482606Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:fffeb3f4dffe9659e59ab2cda5cc49e30b639f03f3e3ed86d68863381795e447","observation_id":"2a8ecf9d-e5b1-4f1f-9cea-074b3d180b78","resolution":{"observed_at":"2026-08-12T19:14:34.482606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:34.487802Z","title":"Zegclip: Towards adapting clip for zero-shot se- mantic segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.487802Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:1b06f5e8cd3241b33893f2fc82a5df8a3ae92d1313a40b1bab02a54a3e2bd2ea","observation_id":"7d972e5f-770b-48e3-93a5-930a182a96a3","resolution":{"observed_at":"2026-08-12T19:14:34.487802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:34.754941Z","title":"For the action type {CLS}, what are the visual descriptions? Please respond with a list of 16 short sentences","venue":null,"work_id":"e0c79b62-b9b9-451c-8199-0c1ea1670414","year":2023},"citing_paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-12T19:14:34.495197Z"},"links":{"citing_paper":"/paper/2411.10922"},"observation_digest":"sha256:d438aea47d5fc32409615ccea7c06dfd73655343f957f95bda739b29c767e2c4","observation_id":"6347dfc0-d29f-4afe-915d-746364a3c506","resolution":{"observed_at":"2026-08-12T19:14:34.950581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.10922","last_updated":"2024-11-17T00:39:59Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T12:07:09.452224Z","submitted_at":"2024-11-17T00:39:59Z","title":"Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection"},"reference_resolution":{"displayed":91,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":2,"verified_fuzzy":65},"total_outbound_references":91},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 91 of 91 outbound references and 0 inbound Pith citation observations for arXiv:2411.10922."}