{"as_of":"2026-08-07T15:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7f0141583a0fe9a8895fcbee04e1a1e30ed2dee4701c57439af367bd0fd15660","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":7,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":7,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:03:08.926468Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T18:23:51.204442Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2012.06567","last_updated":"2020-12-11T18:54:08Z","snapshot_observed_at":"2026-07-06T10:23:36.805486Z","submitted_at":"2020-12-11T18:54:08Z","title":"A Comprehensive Study of Deep Video Action Recognition","version":1},"cited_work":{"arxiv_id":"2012.06567","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2012.06567","snapshot_observed_at":"2026-06-29T18:23:51.204442Z","title":"A comprehensive study of deep video action recognition","venue":null,"work_id":"f6859362-6d85-4be9-9742-7e84d3fa18be","year":2012},"citing_paper":{"arxiv_id":"2410.18717","last_updated":"2026-05-04T11:21:05Z","snapshot_observed_at":"2026-08-06T03:30:40.083854Z","submitted_at":"2024-10-24T13:22:33Z","title":"Low-Latency Video Anonymization for Crowd Anomaly Detection: Privacy Versus Performance","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-23T18:25:44.799112Z"},"links":{"cited_paper":"/paper/2012.06567","citing_paper":"/paper/2410.18717"},"observation_digest":"sha256:6cb984bbfd81d57398abfedcbd4a293be8b0b00015e1e7420967509a73803c3d","observation_id":"735d3440-32fe-49d3-b768-2f8d059bb947","resolution":{"observed_at":"2026-05-23T18:28:19.001700Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.06567","last_updated":"2020-12-11T18:54:08Z","snapshot_observed_at":"2026-07-06T10:23:36.805486Z","submitted_at":"2020-12-11T18:54:08Z","title":"A Comprehensive Study of Deep Video Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.06567","snapshot_observed_at":"2026-08-06T21:03:08.926468Z","title":"A comprehensive study of deep video action recognition.arXiv preprint arXiv:2012.06567, 2020","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.02997","last_updated":"2025-07-01T22:53:41Z","snapshot_observed_at":"2026-08-06T20:54:40.528615Z","submitted_at":"2025-07-01T22:53:41Z","title":"What to Do Next? Memorizing skills from Egocentric Instructional Video","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:03:08.926468Z"},"links":{"cited_paper":"/paper/2012.06567","citing_paper":"/paper/2507.02997"},"observation_digest":"sha256:6c266569a257dc3e2247c88553992c526b1edd3a858f16857e394e074caa17b0","observation_id":"a61ab16e-617c-4862-a10d-3ac3da5b4032","resolution":{"observed_at":"2026-08-06T21:03:08.926468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.06567","last_updated":"2020-12-11T18:54:08Z","snapshot_observed_at":"2026-07-06T10:23:36.805486Z","submitted_at":"2020-12-11T18:54:08Z","title":"A Comprehensive Study of Deep Video Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.06567","snapshot_observed_at":"2026-08-05T23:32:17.622367Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-06T10:35:41.875223Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.622367Z"},"links":{"cited_paper":"/paper/2012.06567","citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:dfdc7b3613aa0610f9c394b36e207c66b0eea5e28e3f06663a51eac0d4dc2a57","observation_id":"a1115ff8-dc7e-4c5d-b44e-ff31a2438b41","resolution":{"observed_at":"2026-08-05T23:32:17.622367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.06567","last_updated":"2020-12-11T18:54:08Z","snapshot_observed_at":"2026-07-06T10:23:36.805486Z","submitted_at":"2020-12-11T18:54:08Z","title":"A Comprehensive Study of Deep Video Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.06567","snapshot_observed_at":"2026-08-05T05:12:54.460881Z","title":"Manmatha, and Mu Li","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2509.05695","last_updated":"2025-09-06T12:11:43Z","snapshot_observed_at":"2026-08-06T23:57:26.683702Z","submitted_at":"2025-09-06T12:11:43Z","title":"Leveraging Vision-Language Large Models for Interpretable Video Action Recognition with Semantic Tokenization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T05:12:54.460881Z"},"links":{"cited_paper":"/paper/2012.06567","citing_paper":"/paper/2509.05695"},"observation_digest":"sha256:f040de1484f9908e8ab36d5d0c214fcf0d702a8c36a65855117cd7affc26f9d1","observation_id":"168a7747-f835-4501-906a-29f09152926e","resolution":{"observed_at":"2026-08-05T05:12:54.460881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.06567","last_updated":"2020-12-11T18:54:08Z","snapshot_observed_at":"2026-07-06T10:23:36.805486Z","submitted_at":"2020-12-11T18:54:08Z","title":"A Comprehensive Study of Deep Video Action Recognition","version":1},"cited_work":{"arxiv_id":"2012.06567","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2012.06567","snapshot_observed_at":"2026-06-29T18:23:51.204442Z","title":"A comprehensive study of deep video action recognition","venue":null,"work_id":"f6859362-6d85-4be9-9742-7e84d3fa18be","year":2012},"citing_paper":{"arxiv_id":"2511.15578","last_updated":"2025-11-19T16:09:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-19T16:09:38Z","title":"AVATAAR: Agentic Video Answering via Temporal Adaptive Alignment and Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-17T20:18:19.580156Z"},"links":{"cited_paper":"/paper/2012.06567","citing_paper":"/paper/2511.15578"},"observation_digest":"sha256:c6653ce31e7a70b96571d4cf2795c7dd016a19f31a580d4e58fe8d7a408b7dcd","observation_id":"9d01e54a-3ce2-40d0-aff1-53a055647e03","resolution":{"observed_at":"2026-05-17T20:20:11.813025Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.06567","last_updated":"2020-12-11T18:54:08Z","snapshot_observed_at":"2026-07-06T10:23:36.805486Z","submitted_at":"2020-12-11T18:54:08Z","title":"A Comprehensive Study of Deep Video Action Recognition","version":1},"cited_work":{"arxiv_id":"2012.06567","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2012.06567","snapshot_observed_at":"2026-06-29T18:23:51.204442Z","title":"A comprehensive study of deep video action recognition","venue":null,"work_id":"f6859362-6d85-4be9-9742-7e84d3fa18be","year":2012},"citing_paper":{"arxiv_id":"2606.27777","last_updated":"2026-06-26T07:06:34Z","snapshot_observed_at":"2026-07-07T00:01:59.695342Z","submitted_at":"2026-06-26T07:06:34Z","title":"TRUST: Efficient Abdominal Trauma Recognition via Image-to-Ultrasound-Video Transfer Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-29T05:08:02.242341Z"},"links":{"cited_paper":"/paper/2012.06567","citing_paper":"/paper/2606.27777"},"observation_digest":"sha256:112ec14bcae302d1d766d9aaf62367290064b934dc3c831a99aa63f0a575d003","observation_id":"d9a1d30a-67d0-4183-bb3c-e1b2329784ec","resolution":{"observed_at":"2026-06-29T18:23:51.205822Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.06567","last_updated":"2020-12-11T18:54:08Z","snapshot_observed_at":"2026-07-06T10:23:36.805486Z","submitted_at":"2020-12-11T18:54:08Z","title":"A Comprehensive Study of Deep Video Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.06567","snapshot_observed_at":"2026-08-05T22:10:41.654548Z","title":"arXiv preprint arXiv:2012.06567 , year=","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2608.03269","last_updated":"2026-08-04T07:46:28Z","snapshot_observed_at":"2026-08-07T14:25:45.693113Z","submitted_at":"2026-08-04T07:46:28Z","title":"Efficient Video Dataset Distillation via Cluster-Guided Prototype Blending","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T22:10:41.654548Z"},"links":{"cited_paper":"/paper/2012.06567","citing_paper":"/paper/2608.03269"},"observation_digest":"sha256:4e0319575088f90d24d233cc68a55a322f700713a93bd2c1c4788976ddbcd764","observation_id":"8c62c160-30cc-4b2b-b040-a835b7ec13d9","resolution":{"observed_at":"2026-08-05T22:10:41.654548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2012.06567/citation-record","integrity":"/paper/2012.06567/integrity","json":"/paper/2012.06567/citation-record.json","paper":"/paper/2012.06567"},"outbound":[],"paper":{"arxiv_id":"2012.06567","last_updated":"2020-12-11T18:54:08Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T10:23:36.805486Z","submitted_at":"2020-12-11T18:54:08Z","title":"A Comprehensive Study of Deep Video Action Recognition"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 7 inbound Pith citation observations for arXiv:2012.06567."}