{"as_of":"2026-08-10T08:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:52cecec8d5e91d675ae8ae8585541617783a70f8f40b4d36c82abdb45b831dfd","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T14:57:12.636325Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T14:57:12.479732Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-08T14:57:12.816902Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2502.06631","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.06631","snapshot_observed_at":"2026-08-08T14:57:12.816902Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","venue":"cs.CV","work_id":"02a51316-af6c-4d39-9a0b-2bc916d0d7d3","year":2025},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.479732Z"},"links":{"cited_paper":"/paper/2502.06631","citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:ed921ebce03ff491b746431479ce55b784bf853a2bac5378e085c5f649d7fd27","observation_id":"0696ad96-3d03-4398-baa9-416714377ac5","resolution":{"observed_at":"2026-08-08T14:57:12.824486Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.06631/citation-record","integrity":"/paper/2502.06631/integrity","json":"/paper/2502.06631/citation-record.json","paper":"/paper/2502.06631"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2502.06631","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.06631","snapshot_observed_at":"2026-08-08T14:57:12.816902Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","venue":"cs.CV","work_id":"02a51316-af6c-4d39-9a0b-2bc916d0d7d3","year":2025},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.479732Z"},"links":{"cited_paper":"/paper/2502.06631","citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:ed921ebce03ff491b746431479ce55b784bf853a2bac5378e085c5f649d7fd27","observation_id":"0696ad96-3d03-4398-baa9-416714377ac5","resolution":{"observed_at":"2026-08-08T14:57:12.824486Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:57:13.264276Z","title":"Conformal Predictions Providing reliable confidence estimates for predictions made by deep learning models is essential in many applications","venue":null,"work_id":"37651488-6881-437e-a94d-14b273381149","year":null},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.486097Z"},"links":{"citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:746bb92906ebd4bfe64626bdeedfc24955b5f00c0d7e4de0a0c8a2358877ae45","observation_id":"14ddd180-af64-41a0-8915-b6c19d18bcd8","resolution":{"observed_at":"2026-08-08T14:57:13.269711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:57:13.248182Z","title":"Experimental settings We conduct our experiments using three video clip datasets: HMDB51 (51 classes) [23], UCF101 (101 classes) [24] and Kinetics400 (400 classes) [20]","venue":null,"work_id":"93f02b02-840c-4782-b610-69c90bc9a827","year":null},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.491485Z"},"links":{"citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:8f7fb8ec4fa69e692ff07e6a703fb8c6837798adfcf4d088e20652a8f5596de3","observation_id":"937c3d2d-80a0-4e38-ba04-34cc503621e2","resolution":{"observed_at":"2026-08-08T14:57:13.253420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:57:13.216730Z","title":"Red dots mark 1/τ∗, our estimate for minimizing tail size, while green dots indicate the true optimum 1/τopt when it differs","venue":null,"work_id":"5427ba3e-881c-40e1-8ff6-2aa494a3bd21","year":null},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.502192Z"},"links":{"citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:ddc3484948fccfd955e138e35dc29147a72ec4801d74998b418959d2e8de175f","observation_id":"a4dc4bf8-b50e-4c10-974f-14b4c4860548","resolution":{"observed_at":"2026-08-08T14:57:13.222306Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:57:13.200992Z","title":null,"venue":null,"work_id":"929cd8b6-fa27-4969-9829-2c73269644bc","year":null},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.507668Z"},"links":{"citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:7a7e4e9d222041be830857b4916ceb1cdf5667123dd1cc4dc4ce7c2fa89120e5","observation_id":"d271ec38-87e0-4102-b171-7f46843b75e1","resolution":{"observed_at":"2026-08-08T14:57:13.205996Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:57:13.103373Z","title":"Behavior recognition via sparse spatio-temporal features,","venue":null,"work_id":"30ff5447-ac20-46d7-9ce4-822873623e47","year":2005},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.538451Z"},"links":{"citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:35a56fe8d4496c4c03076601de3576b524eb72c937e307f0971aeea9f2db664a","observation_id":"26d32a1e-c5df-4c3a-9808-2337a5e9288e","resolution":{"observed_at":"2026-08-08T14:57:13.108366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:57:13.184900Z","title":"Fast user-guided video object segmen- tation by interaction-and-propagation networks,","venue":null,"work_id":"5c93937b-f09f-465f-8206-e1921b59b6e6","year":2019},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.512849Z"},"links":{"citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:a66871ef882b47f8c2efaf3ee090d7ac021d68b8eed45f01bbb45b77eb50a7d3","observation_id":"e53a7350-a19a-46af-bf66-01c5b696be03","resolution":{"observed_at":"2026-08-08T14:57:13.190000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:57:13.168751Z","title":"Human-in-the-loop vehicle reid,","venue":null,"work_id":"b91c05f8-6a0c-4b67-bf48-a767513f9051","year":2023},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.517839Z"},"links":{"citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:2fabbb8d815c8fb3f1286fa4ec87b90fb862c68bfb776cabf3a1aebe5b3ae4ff","observation_id":"d623cd3e-30ec-4323-b602-6198080154fa","resolution":{"observed_at":"2026-08-08T14:57:13.173741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:57:13.153019Z","title":"Surveillance video querying with a human-in-the-loop,","venue":null,"work_id":"45af1b8a-cc5f-4e74-904e-f74e40382fbc","year":2020},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.523018Z"},"links":{"citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:8c2ac465de4494253c87ad2ba61c1508f8c440bc8ee48da291c2eef94dafc092","observation_id":"db002e33-79c5-412c-be50-1a43bcc1e030","resolution":{"observed_at":"2026-08-08T14:57:13.157968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:57:13.135560Z","title":"De- signing decision support systems using counterfactual prediction sets,","venue":null,"work_id":"73c05a54-036c-4039-9414-98e51693d99a","year":2024},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.528008Z"},"links":{"citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:5b4cb2a3b71cf1f7adf3568832165b4d758b183a410682dfb18a68e7d44294ee","observation_id":"2bf64a99-9bb0-400a-8ffc-ef1fb4a94a89","resolution":{"observed_at":"2026-08-08T14:57:13.140776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:57:13.119505Z","title":"Conformal prediction sets improve human de- cision making,","venue":null,"work_id":"b6f5bc0b-974c-4dcc-a742-f1158d906e05","year":2024},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.532984Z"},"links":{"citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:b494bf06584682f4d9fe0c2b35bef1fb6b2e2a76654a003ce2229e33fde5b67e","observation_id":"983ee99c-06c2-4e4e-a30d-dc7291c60a6e","resolution":{"observed_at":"2026-08-08T14:57:13.124735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:57:13.021785Z","title":"Learning transferable visual models from natural lan- guage supervision,","venue":null,"work_id":"2619a314-8c7f-4445-ad41-c7268e1b997a","year":2021},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.568095Z"},"links":{"citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:4d537f7f57db82d23721beb96b5d64756fae9221b58c42367aa8e01af3cfb26d","observation_id":"b0c089b6-f903-40ce-836e-ad89ca43de0b","resolution":{"observed_at":"2026-08-08T14:57:13.027326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:57:13.087251Z","title":"Temporal segment networks: Towards good practices for deep ac- tion recognition,","venue":null,"work_id":"1c356c38-7895-4e5e-9d9f-513c3a4ce4bf","year":2016},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.543548Z"},"links":{"citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:bda4f9853eaccf7bb3a44f2b7fff95b75b30634ae6d3af96abaaec75dd2b4a3b","observation_id":"e0520cae-d70e-437d-9a80-e678ddd82761","resolution":{"observed_at":"2026-08-08T14:57:13.092733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:57:13.071271Z","title":"Slowfast networks for video recog- nition,","venue":null,"work_id":"ef337d24-c577-48f7-8e5b-01e760b8688c","year":2019},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.548509Z"},"links":{"citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:5e673fa439fe10dc874cede68f8c8c707ab4853b9ac1d9ca629ae1724701662c","observation_id":"40a9001d-cfa5-414b-892c-87b68362b7ef","resolution":{"observed_at":"2026-08-08T14:57:13.076522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:57:13.054883Z","title":"Stm: Spatiotemporal and motion en- coding for action recognition,","venue":null,"work_id":"ed3521aa-1bf6-44d3-9457-72a881854523","year":2019},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.553338Z"},"links":{"citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:72230d3d2db4f6ddc858c3aa6dd488a98551cb90778c39cefac54b0d3655d9a5","observation_id":"f5c9e6ea-c327-487b-b214-588895d3b2a0","resolution":{"observed_at":"2026-08-08T14:57:13.060036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:57:13.038698Z","title":"Vivit: A video vision transformer,","venue":null,"work_id":"a6dcc7b5-93b3-46b0-9e97-8aa39ff051cf","year":2021},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.558219Z"},"links":{"citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:c58cfc9874732fe4ff71341ade4212aee07bfa14e18144b1f3ca40cf6ad2b600","observation_id":"1c500f2c-4430-4e4f-8aa2-aea9dcb298ac","resolution":{"observed_at":"2026-08-08T14:57:13.043979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-07-06T11:48:42.000083Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-08-08T14:57:12.562855Z","title":"Ac- tionclip: A new paradigm for video action recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.562855Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:5e7c29d70dbdec4fae7be54508e8fa8d1ca7ae7f0f524ce00131b99043f38fc8","observation_id":"db75da33-556d-40dd-8625-aa56000599e1","resolution":{"observed_at":"2026-08-08T14:57:12.562855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:57:12.939433Z","title":"An electronic nose-based assistive diagnostic prototype for lung cancer detection with conformal prediction,","venue":null,"work_id":"2eb78dc7-2a41-43a4-ae5a-89c708ed9462","year":2020},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.597946Z"},"links":{"citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:5e1c9985a983a581d22b5c001111dca0b31af1c0f7dc4e4e4e4075024f64bed3","observation_id":"7f5472a1-8231-4ad2-ba2e-fc17ed0bcccf","resolution":{"observed_at":"2026-08-08T14:57:12.944526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:57:12.572903Z","title":"Are foundation models for computer vision good conformal predictors?,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.572903Z"},"links":{"citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:dc316b4a5d359fcf312014a2ab1540e0e0bd6d65a9ba69bb8a5c90a129483208","observation_id":"b923805b-bfda-4892-b4ee-f3ecc20ef08e","resolution":{"observed_at":"2026-08-08T14:57:12.572903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:57:13.005752Z","title":"On the rate of gain of information,","venue":null,"work_id":"e9c2cb82-54ca-4004-a822-605a9e992946","year":1952},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.577660Z"},"links":{"citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:0523b99c553f70266ab2df961dcb343355df0e7d7d1f100146bf1044eaf5ecf7","observation_id":"1ed4e0fd-0643-484b-98cf-27143aa82821","resolution":{"observed_at":"2026-08-08T14:57:13.010707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:57:12.988672Z","title":"Selection from alphabetic and numeric menu trees using a touch screen: breadth, depth, and width,","venue":null,"work_id":"61e6ce90-93fc-43a4-a0dc-521f860adef6","year":1985},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.583346Z"},"links":{"citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:e8bc92d411f30131c00765ff4b0da78ea38cfc10ee6f47ea9513892e62ea482e","observation_id":"a24f7d33-6532-45e0-b602-fb6ae52e3661","resolution":{"observed_at":"2026-08-08T14:57:12.994010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:57:12.972649Z","title":"29, Springer, 2005","venue":null,"work_id":"3b87203d-9594-4eec-bd2f-9be16ea4747e","year":2005},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.588442Z"},"links":{"citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:4b581e23bf37be65109fa0a68c75f3123cfa7f62a81c19803ff96e9daed1ce8c","observation_id":"da4e27eb-11d8-4d45-bc02-038e32f85a63","resolution":{"observed_at":"2026-08-08T14:57:12.977618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:57:12.955300Z","title":"Least ambiguous set-valued classifiers with bounded error levels,","venue":null,"work_id":"45c179f2-cc79-42ca-84e3-ff5d8a8de4e6","year":2019},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.593351Z"},"links":{"citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:5b5ed466773a2688534b5cef030a5d03dccdfec926893b94d1f4a2a66879d96a","observation_id":"721a98cc-f580-44f3-ad99-72371ade35c7","resolution":{"observed_at":"2026-08-08T14:57:12.961553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-07-06T03:01:10.229407Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-08T14:57:12.626354Z","title":"Ucf101: A dataset of 101 human ac- tions classes from videos in the wild,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.626354Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:547d16ce8309bd1ae707d5d748b7be4ea47c4592200f39c8244b33be4e4caae3","observation_id":"6646e6a3-2c74-42a6-8ec3-0cdf63832d99","resolution":{"observed_at":"2026-08-08T14:57:12.626354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:57:13.233016Z","title":null,"venue":null,"work_id":"e175b76d-4ad9-44ea-8d16-f5a06fe2b637","year":null},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.496797Z"},"links":{"citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:d7a4546355df4681ae47221b35d994c1ce02d1f4715f67efb2666a5ea27213cc","observation_id":"e8f59025-c1f8-483f-9807-cf3da5364aad","resolution":{"observed_at":"2026-08-08T14:57:13.237883Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:57:12.923466Z","title":"Dense trajectories and motion bound- ary descriptors for action recognition,","venue":null,"work_id":"00d90a36-38c7-4ec1-819b-5d55638da6ec","year":2013},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.602719Z"},"links":{"citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:7a7ca2d73bba619beba4a5a2d75ce5cbf94e72ff44d9fa2b597f7c274f492009","observation_id":"b09704fd-e233-4b1d-a05d-12750ded83d7","resolution":{"observed_at":"2026-08-08T14:57:12.928675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:57:12.904915Z","title":"Quo vadis, ac- tion recognition? a new model and the kinetics dataset,","venue":null,"work_id":"64e76724-5e6f-4873-bc63-97187bd22c97","year":2017},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.607464Z"},"links":{"citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:2ff6c7151a3b44a96af6f40ba91931043558f2f2a6aa09b34012328471ec262c","observation_id":"bf0d9c6c-9e8d-4b62-9611-04c033e18da2","resolution":{"observed_at":"2026-08-08T14:57:12.910729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:57:12.888196Z","title":"Expanding language-image pre- trained models for general video recognition,","venue":null,"work_id":"e014b84c-573c-49ab-b42c-024f53d82ae6","year":2022},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.612212Z"},"links":{"citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:c46e8b053f63f17d9753cec6bca016d2a15c9d93b36822c077a7c52c57ff14e6","observation_id":"0eea96b6-72fb-453c-84f4-41be3bb39538","resolution":{"observed_at":"2026-08-08T14:57:12.894085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:57:12.871175Z","title":"Fine-tuned clip models are efficient video learners,","venue":null,"work_id":"ef77430a-52b8-438d-9663-d91a66434580","year":2023},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.616854Z"},"links":{"citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:9b534b6bdb82a2d2fa21fb84d799014410fb09e9bb2264d35d5e84ddebbeeac2","observation_id":"da2774e8-bb9f-449c-a0f4-21fb6629e4d9","resolution":{"observed_at":"2026-08-08T14:57:12.876493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:57:12.853684Z","title":"Hmdb: A large video database for human motion recognition,","venue":null,"work_id":"666bb78b-6733-45c5-a6d8-f95990711796","year":2011},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.621764Z"},"links":{"citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:dd8076c02fea519364b1f0c77463fb38b0e078e9a852404cba8a12007e3af5c9","observation_id":"68c96306-e637-4d2b-8e1e-a2fb307bdab1","resolution":{"observed_at":"2026-08-08T14:57:12.858847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:57:12.836825Z","title":"On sequence learning models: Open-loop control not strictly guided by hick’s law,","venue":null,"work_id":"40946708-f510-4b34-88ea-b98354f16fd5","year":2016},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.631485Z"},"links":{"citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:aa244c51d8c28cdb157ed9d7092322b3647df0bb458a56d2ccfbd53342fb2ebb","observation_id":"3f56ef6a-da66-46bb-ae9a-b5593bf1c613","resolution":{"observed_at":"2026-08-08T14:57:12.842209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-08-09T19:13:53.289650Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-08-08T14:57:12.636325Z","title":"Eva- clip-18b: Scaling clip to 18 billion parameters,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.636325Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:cb75e79087078dbf9bb86f03dc1e1d275f31a7f7d4e6321eff48479e2f0f1aa2","observation_id":"6bf53bbe-ea34-459b-95a4-8b2c145abedf","resolution":{"observed_at":"2026-08-08T14:57:12.636325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":1,"verified_fuzzy":24},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 1 inbound Pith citation observation for arXiv:2502.06631."}