{"as_of":"2026-08-21T07:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:42a34666ebb0ee2869aa49039ac0b4d2e1a2066ec39895e23df5f873fcb2175f","coverage":[{"denominator":12,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:04:05.713834Z","state":"measured"},{"denominator":12,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":12,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.13458/citation-record","integrity":"/paper/2506.13458/integrity","json":"/paper/2506.13458/citation-record.json","paper":"/paper/2506.13458"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:04:05.668809Z","title":"URL: \" 'urlintro :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.13458","last_updated":"2025-06-16T13:15:02Z","snapshot_observed_at":"2026-08-18T13:24:36.744821Z","submitted_at":"2025-06-16T13:15:02Z","title":"Leveraging Vision-Language Pre-training for Human Activity Recognition in Still Images","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T20:04:05.668809Z"},"links":{"citing_paper":"/paper/2506.13458"},"observation_digest":"sha256:29f39ad28cba9cb739c31f171c061ebdc69e7a59671f16a93efa2a3e4dab1a33","observation_id":"4ea3692e-0764-437f-9a79-6498f175c86a","resolution":{"observed_at":"2026-08-15T20:04:05.668809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:04:05.673224Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.13458","last_updated":"2025-06-16T13:15:02Z","snapshot_observed_at":"2026-08-18T13:24:36.744821Z","submitted_at":"2025-06-16T13:15:02Z","title":"Leveraging Vision-Language Pre-training for Human Activity Recognition in Still Images","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T20:04:05.673224Z"},"links":{"citing_paper":"/paper/2506.13458"},"observation_digest":"sha256:b23002a505adc39f7bffcdc0cfe131eb43a6ff0591026c548910296e33072408","observation_id":"55db126f-9e24-4cb6-92e5-306255312b7e","resolution":{"observed_at":"2026-08-15T20:04:05.673224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03214","last_updated":"2025-01-08T16:10:20Z","snapshot_observed_at":"2026-08-16T14:03:44.750847Z","submitted_at":"2024-04-04T05:39:09Z","title":"LeGrad: An Explainability Method for Vision Transformers via Feature Formation Sensitivity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03214","snapshot_observed_at":"2026-08-15T20:04:05.677202Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13458","last_updated":"2025-06-16T13:15:02Z","snapshot_observed_at":"2026-08-18T13:24:36.744821Z","submitted_at":"2025-06-16T13:15:02Z","title":"Leveraging Vision-Language Pre-training for Human Activity Recognition in Still Images","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T20:04:05.677202Z"},"links":{"cited_paper":"/paper/2404.03214","citing_paper":"/paper/2506.13458"},"observation_digest":"sha256:5366fc088a34ed03fddfb553d4f59d6b2b2732096991bc94dc50c8b4f9983913","observation_id":"d199879a-032a-45f2-aafe-80b19f53c96b","resolution":{"observed_at":"2026-08-15T20:04:05.677202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-15T20:04:05.681327Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.13458","last_updated":"2025-06-16T13:15:02Z","snapshot_observed_at":"2026-08-18T13:24:36.744821Z","submitted_at":"2025-06-16T13:15:02Z","title":"Leveraging Vision-Language Pre-training for Human Activity Recognition in Still Images","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T20:04:05.681327Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2506.13458"},"observation_digest":"sha256:fb6646d486c0d80b4aefccd25374f3ca5df20ed4087c9151cbf5bcd770d485ed","observation_id":"184e942d-4966-4f05-bfab-98d4a650bf68","resolution":{"observed_at":"2026-08-15T20:04:05.681327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1502.03167","last_updated":"2015-03-02T20:44:12Z","snapshot_observed_at":"2026-08-12T21:01:12.961874Z","submitted_at":"2015-02-11T01:44:18Z","title":"Batch Normalization: Accelerating Deep Network Training by Reducing Internal Covariate Shift","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1502.03167","snapshot_observed_at":"2026-08-15T20:04:05.685545Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.13458","last_updated":"2025-06-16T13:15:02Z","snapshot_observed_at":"2026-08-18T13:24:36.744821Z","submitted_at":"2025-06-16T13:15:02Z","title":"Leveraging Vision-Language Pre-training for Human Activity Recognition in Still Images","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T20:04:05.685545Z"},"links":{"cited_paper":"/paper/1502.03167","citing_paper":"/paper/2506.13458"},"observation_digest":"sha256:c0bf93c5510900c84f51fb6c9497e470517c3da11486b68fe23e8d663a6969d9","observation_id":"6b92f081-d958-4863-9a2e-34787bdd3fc5","resolution":{"observed_at":"2026-08-15T20:04:05.685545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:04:05.689524Z","title":"Lecun, L","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2506.13458","last_updated":"2025-06-16T13:15:02Z","snapshot_observed_at":"2026-08-18T13:24:36.744821Z","submitted_at":"2025-06-16T13:15:02Z","title":"Leveraging Vision-Language Pre-training for Human Activity Recognition in Still Images","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T20:04:05.689524Z"},"links":{"citing_paper":"/paper/2506.13458"},"observation_digest":"sha256:6beec5729c7e67c5d855394dd7b51d811918587c1434bb9a2213d450d4d8929a","observation_id":"5cfeb47c-7ee2-4d6f-b074-895e571caa25","resolution":{"observed_at":"2026-08-15T20:04:05.689524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:04:05.693378Z","title":"Bengio, and Geoffrey Hinton","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.13458","last_updated":"2025-06-16T13:15:02Z","snapshot_observed_at":"2026-08-18T13:24:36.744821Z","submitted_at":"2025-06-16T13:15:02Z","title":"Leveraging Vision-Language Pre-training for Human Activity Recognition in Still Images","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T20:04:05.693378Z"},"links":{"citing_paper":"/paper/2506.13458"},"observation_digest":"sha256:d3f0536cdccfcaa773c6ab3cca1f020900a89f78632be14e64189bf62a5e6fb9","observation_id":"aa9ed83c-c0d8-425c-ad00-a7411753c496","resolution":{"observed_at":"2026-08-15T20:04:05.693378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1405.0312","last_updated":"2015-02-21T01:48:49Z","snapshot_observed_at":"2026-08-21T02:14:04.953864Z","submitted_at":"2014-05-01T21:43:32Z","title":"Microsoft COCO: Common Objects in Context","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1405.0312","snapshot_observed_at":"2026-08-15T20:04:05.697291Z","title":"Lawrence Zitnick, and Piotr Dollár","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.13458","last_updated":"2025-06-16T13:15:02Z","snapshot_observed_at":"2026-08-18T13:24:36.744821Z","submitted_at":"2025-06-16T13:15:02Z","title":"Leveraging Vision-Language Pre-training for Human Activity Recognition in Still Images","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T20:04:05.697291Z"},"links":{"cited_paper":"/paper/1405.0312","citing_paper":"/paper/2506.13458"},"observation_digest":"sha256:c67187953be2361e23ceb22772f0cd9ffa7fdc81fc8c71318d0574bbb5d8d6b2","observation_id":"970cb47e-d881-45a3-a9ca-e2447d066451","resolution":{"observed_at":"2026-08-15T20:04:05.697291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.08458","last_updated":"2015-12-02T18:06:03Z","snapshot_observed_at":"2026-08-20T05:06:23.408777Z","submitted_at":"2015-11-26T17:45:01Z","title":"An Introduction to Convolutional Neural Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.08458","snapshot_observed_at":"2026-08-15T20:04:05.701605Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.13458","last_updated":"2025-06-16T13:15:02Z","snapshot_observed_at":"2026-08-18T13:24:36.744821Z","submitted_at":"2025-06-16T13:15:02Z","title":"Leveraging Vision-Language Pre-training for Human Activity Recognition in Still Images","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T20:04:05.701605Z"},"links":{"cited_paper":"/paper/1511.08458","citing_paper":"/paper/2506.13458"},"observation_digest":"sha256:d19775420ff080044fa8d5753e76bd59cb1936992286ac53f9c0efa7619a15d9","observation_id":"ffd638f4-86a0-4274-bf0b-b86480e7b0c2","resolution":{"observed_at":"2026-08-15T20:04:05.701605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01703","last_updated":"2019-12-03T22:06:05Z","snapshot_observed_at":"2026-07-06T08:41:49.632205Z","submitted_at":"2019-12-03T22:06:05Z","title":"PyTorch: An Imperative Style, High-Performance Deep Learning Library","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.01703","snapshot_observed_at":"2026-08-15T20:04:05.705684Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.13458","last_updated":"2025-06-16T13:15:02Z","snapshot_observed_at":"2026-08-18T13:24:36.744821Z","submitted_at":"2025-06-16T13:15:02Z","title":"Leveraging Vision-Language Pre-training for Human Activity Recognition in Still Images","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T20:04:05.705684Z"},"links":{"cited_paper":"/paper/1912.01703","citing_paper":"/paper/2506.13458"},"observation_digest":"sha256:7727402e291bb63cb231260efabd20fa87c7ef34596ebff711df6f244f1047d5","observation_id":"193430aa-65fa-4c96-a984-eddc89017e3d","resolution":{"observed_at":"2026-08-15T20:04:05.705684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-15T20:04:05.709879Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.13458","last_updated":"2025-06-16T13:15:02Z","snapshot_observed_at":"2026-08-18T13:24:36.744821Z","submitted_at":"2025-06-16T13:15:02Z","title":"Leveraging Vision-Language Pre-training for Human Activity Recognition in Still Images","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T20:04:05.709879Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2506.13458"},"observation_digest":"sha256:fae53c28ccaff2488782de4ec66c5cab295a231c45d507fb0fba4585b47cd813","observation_id":"6c5f843e-6896-4597-b5bf-073bc34b7724","resolution":{"observed_at":"2026-08-15T20:04:05.709879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-15T20:04:05.713834Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13458","last_updated":"2025-06-16T13:15:02Z","snapshot_observed_at":"2026-08-18T13:24:36.744821Z","submitted_at":"2025-06-16T13:15:02Z","title":"Leveraging Vision-Language Pre-training for Human Activity Recognition in Still Images","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T20:04:05.713834Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2506.13458"},"observation_digest":"sha256:b4dd2fcbb265e525fca08c2c220b19819e79fefaf9ebcc3f4be6bb3cd58276a7","observation_id":"25c19370-cf0e-4e32-a69b-6306e4c2f82b","resolution":{"observed_at":"2026-08-15T20:04:05.713834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.13458","last_updated":"2025-06-16T13:15:02Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T13:24:36.744821Z","submitted_at":"2025-06-16T13:15:02Z","title":"Leveraging Vision-Language Pre-training for Human Activity Recognition in Still Images"},"reference_resolution":{"displayed":12,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":12},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 12 of 12 outbound references and 0 inbound Pith citation observations for arXiv:2506.13458."}