{"as_of":"2026-08-08T04:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a7e77bc7aae7238aa17e64efc01d4004a4138019062487f94d99c37027880801","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T17:45:25.588833Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.15903/citation-record","integrity":"/paper/2508.15903/integrity","json":"/paper/2508.15903/citation-record.json","paper":"/paper/2508.15903"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:45:29.012933Z","title":"Human action recognition from various data modalities: A review,","venue":null,"work_id":"1d182555-b0e2-46a1-928a-6a53504a8fdf","year":2023},"citing_paper":{"arxiv_id":"2508.15903","last_updated":"2025-08-21T18:03:16Z","snapshot_observed_at":"2026-08-05T17:45:22.643146Z","submitted_at":"2025-08-21T18:03:16Z","title":"VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:23.060592Z"},"links":{"citing_paper":"/paper/2508.15903"},"observation_digest":"sha256:cc737d481643539012438071d5af0db44deb3e8640f200cd958336bbb4001156","observation_id":"30546734-549b-421e-9c22-975274f512e2","resolution":{"observed_at":"2026-08-05T17:45:29.123621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:45:28.873613Z","title":"2d versus 3d convolutional spiking neural networks trained with unsupervised STDP for human ac- tion recognition,","venue":null,"work_id":"456f0196-14dd-425d-b0b4-8abc32f60801","year":2022},"citing_paper":{"arxiv_id":"2508.15903","last_updated":"2025-08-21T18:03:16Z","snapshot_observed_at":"2026-08-05T17:45:22.643146Z","submitted_at":"2025-08-21T18:03:16Z","title":"VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:23.146665Z"},"links":{"citing_paper":"/paper/2508.15903"},"observation_digest":"sha256:3336b8b780f3dc1fd5e25d2fbc1c53d9c8793f3e4ab342e6975961bfb941f4fb","observation_id":"d252faa4-4aab-465e-b185-618752afe075","resolution":{"observed_at":"2026-08-05T17:45:28.949894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:45:28.718038Z","title":"Overview of the transformer-based models for NLP tasks,","venue":null,"work_id":"69de7b0a-2b23-4000-901d-426cb7149629","year":2020},"citing_paper":{"arxiv_id":"2508.15903","last_updated":"2025-08-21T18:03:16Z","snapshot_observed_at":"2026-08-05T17:45:22.643146Z","submitted_at":"2025-08-21T18:03:16Z","title":"VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:23.228078Z"},"links":{"citing_paper":"/paper/2508.15903"},"observation_digest":"sha256:539a666c500dbfb45aebc42243a78b00f4cda3b6b0ccf85aa849efbae8a4a9db","observation_id":"e50b3ee1-68e1-40bf-8e19-38eda428f0c7","resolution":{"observed_at":"2026-08-05T17:45:28.789963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:45:23.362858Z","title":"A survey on large language model (LLM) security and privacy: The good, the bad, and the ugly,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.15903","last_updated":"2025-08-21T18:03:16Z","snapshot_observed_at":"2026-08-05T17:45:22.643146Z","submitted_at":"2025-08-21T18:03:16Z","title":"VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:23.362858Z"},"links":{"citing_paper":"/paper/2508.15903"},"observation_digest":"sha256:ef726d98e5d2045e6322233be8defec6bad20acecfa31b2039a290ea7f0ccdea","observation_id":"75379562-ca53-4ae5-9323-5bcc340240f1","resolution":{"observed_at":"2026-08-05T17:45:23.362858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:45:28.561001Z","title":"Lvlm-ehub: A comprehensive evaluation bench- mark for large vision-language models,","venue":null,"work_id":"eed29d68-8675-4f49-9eae-b07b4d481edb","year":2025},"citing_paper":{"arxiv_id":"2508.15903","last_updated":"2025-08-21T18:03:16Z","snapshot_observed_at":"2026-08-05T17:45:22.643146Z","submitted_at":"2025-08-21T18:03:16Z","title":"VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:23.471682Z"},"links":{"citing_paper":"/paper/2508.15903"},"observation_digest":"sha256:9d0521d3419f7fa665dcfca971c677a29a6a23097c25aa9f267972b0f6614b0e","observation_id":"393296a3-aa62-407b-9c96-27bfb523ed99","resolution":{"observed_at":"2026-08-05T17:45:28.625634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:45:23.600178Z","title":"Visual in-context learning for large vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15903","last_updated":"2025-08-21T18:03:16Z","snapshot_observed_at":"2026-08-05T17:45:22.643146Z","submitted_at":"2025-08-21T18:03:16Z","title":"VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:23.600178Z"},"links":{"citing_paper":"/paper/2508.15903"},"observation_digest":"sha256:61eadd3ef653236a062ceb0fc9760522345373d2a833e28bdee416fa253846e5","observation_id":"b93cb2b3-2c7e-46dc-a229-4e7af91113e1","resolution":{"observed_at":"2026-08-05T17:45:23.600178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:45:23.702577Z","title":"Weak to strong generalization for large language models with multi-capabilities,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.15903","last_updated":"2025-08-21T18:03:16Z","snapshot_observed_at":"2026-08-05T17:45:22.643146Z","submitted_at":"2025-08-21T18:03:16Z","title":"VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:23.702577Z"},"links":{"citing_paper":"/paper/2508.15903"},"observation_digest":"sha256:32beba715668157100e83f7ce6a3286de109e9b7a94a562a64ccd2a51321c014","observation_id":"9f7e4b3b-4da5-4477-ab48-b442500aef50","resolution":{"observed_at":"2026-08-05T17:45:23.702577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:45:28.358914Z","title":"Llava-more: A comparative study of llms and visual backbones for enhanced visual instruction tuning,","venue":null,"work_id":"2cbe052c-3142-4a6d-9565-30a48df7e112","year":2025},"citing_paper":{"arxiv_id":"2508.15903","last_updated":"2025-08-21T18:03:16Z","snapshot_observed_at":"2026-08-05T17:45:22.643146Z","submitted_at":"2025-08-21T18:03:16Z","title":"VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:23.829216Z"},"links":{"citing_paper":"/paper/2508.15903"},"observation_digest":"sha256:66865ba2842f7333500f4c8d2c3e1d33325c3fed5bca452b8cfe56bf0ad26968","observation_id":"c2c5cd88-7f4b-4abf-a9a9-6be46a81d246","resolution":{"observed_at":"2026-08-05T17:45:28.462300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:45:28.143393Z","title":"Adaptive prompt: Unlocking the power of visual prompt tuning,","venue":null,"work_id":"4bff299b-4d3a-4d9f-8948-44dde261aeca","year":2025},"citing_paper":{"arxiv_id":"2508.15903","last_updated":"2025-08-21T18:03:16Z","snapshot_observed_at":"2026-08-05T17:45:22.643146Z","submitted_at":"2025-08-21T18:03:16Z","title":"VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:23.958129Z"},"links":{"citing_paper":"/paper/2508.15903"},"observation_digest":"sha256:8b85e6458bc435fe3f62fca23b808a8a687fe527922dc286c48cf83f66de5937","observation_id":"beb377fc-8139-40d5-8afe-405dedf492f2","resolution":{"observed_at":"2026-08-05T17:45:28.243612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:45:27.978970Z","title":"NTU RGB+D: A large scale dataset for 3d human activity analysis,","venue":null,"work_id":"072313bc-06fa-44e4-bfbc-37b33786a777","year":2016},"citing_paper":{"arxiv_id":"2508.15903","last_updated":"2025-08-21T18:03:16Z","snapshot_observed_at":"2026-08-05T17:45:22.643146Z","submitted_at":"2025-08-21T18:03:16Z","title":"VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:24.084139Z"},"links":{"citing_paper":"/paper/2508.15903"},"observation_digest":"sha256:8b4d8009ca3e18c6ef59313b54a2cd449e060d8e8940f8287f3756da929b730d","observation_id":"4bdffa8b-4257-4b3c-b07d-b184751a1123","resolution":{"observed_at":"2026-08-05T17:45:28.046819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:45:24.168894Z","title":"Human action recognition and prediction: A survey,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.15903","last_updated":"2025-08-21T18:03:16Z","snapshot_observed_at":"2026-08-05T17:45:22.643146Z","submitted_at":"2025-08-21T18:03:16Z","title":"VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:24.168894Z"},"links":{"citing_paper":"/paper/2508.15903"},"observation_digest":"sha256:3ab1f859cba3daffb16f9cd0bd2d6f34259bd8221212f77fa817b01e47d37a8e","observation_id":"4e6dc61f-30be-4c19-9a88-f3b716458e0a","resolution":{"observed_at":"2026-08-05T17:45:24.168894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:45:27.811586Z","title":"A comprehensive study of deep video action recognition,","venue":null,"work_id":"8088ce61-8947-45d7-a6ef-ad0cc767f669","year":2020},"citing_paper":{"arxiv_id":"2508.15903","last_updated":"2025-08-21T18:03:16Z","snapshot_observed_at":"2026-08-05T17:45:22.643146Z","submitted_at":"2025-08-21T18:03:16Z","title":"VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:24.257880Z"},"links":{"citing_paper":"/paper/2508.15903"},"observation_digest":"sha256:d9516a3d59c3428418742af8901dafa0ad702a7b65895b45aec4b55accdd61ef","observation_id":"2361002e-23bb-49df-8111-06a8d05a507e","resolution":{"observed_at":"2026-08-05T17:45:27.884575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:45:27.692981Z","title":"Action recognition based on efficient deep feature learning in the spatio-temporal domain,","venue":null,"work_id":"5cccc4a8-1b1c-4d75-b590-273e8167e730","year":2016},"citing_paper":{"arxiv_id":"2508.15903","last_updated":"2025-08-21T18:03:16Z","snapshot_observed_at":"2026-08-05T17:45:22.643146Z","submitted_at":"2025-08-21T18:03:16Z","title":"VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:24.356694Z"},"links":{"citing_paper":"/paper/2508.15903"},"observation_digest":"sha256:25f0ff1fbf364de6ed449ac3e087a496b5aa16c050f29b3bec44b70e22c17ee0","observation_id":"79808f44-f637-4276-a7fe-b7fa2f194032","resolution":{"observed_at":"2026-08-05T17:45:27.720535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:45:24.437028Z","title":"Cross-fiber spatial-temporal co-enhanced networks for video action recognition,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.15903","last_updated":"2025-08-21T18:03:16Z","snapshot_observed_at":"2026-08-05T17:45:22.643146Z","submitted_at":"2025-08-21T18:03:16Z","title":"VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:24.437028Z"},"links":{"citing_paper":"/paper/2508.15903"},"observation_digest":"sha256:7cfd428653973a3cbfb5826f1cb66c136701aaf73ec09810c1571c6a376919d3","observation_id":"e7ebe177-7957-4a59-a98a-6e0c5f04b272","resolution":{"observed_at":"2026-08-05T17:45:24.437028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:45:24.563094Z","title":"Mutually reinforced spatio-temporal convolutional tube for human action recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.15903","last_updated":"2025-08-21T18:03:16Z","snapshot_observed_at":"2026-08-05T17:45:22.643146Z","submitted_at":"2025-08-21T18:03:16Z","title":"VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:24.563094Z"},"links":{"citing_paper":"/paper/2508.15903"},"observation_digest":"sha256:ff6223a40368ee6083571dd226bb5fb8f6e431ecf660cb03fe770d7044f723b3","observation_id":"d38b2284-ef73-454c-8d50-24c3e7f36bde","resolution":{"observed_at":"2026-08-05T17:45:24.563094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:45:24.625203Z","title":"Multi-scale spatial- temporal integration convolutional tube for human action recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.15903","last_updated":"2025-08-21T18:03:16Z","snapshot_observed_at":"2026-08-05T17:45:22.643146Z","submitted_at":"2025-08-21T18:03:16Z","title":"VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:24.625203Z"},"links":{"citing_paper":"/paper/2508.15903"},"observation_digest":"sha256:64d843ef3e7f22e6877f8af6f095b0414ddacb6214e7acc897c8cc0d7f1f9883","observation_id":"1b2ad58e-545b-4a36-8881-17ec5cec0e07","resolution":{"observed_at":"2026-08-05T17:45:24.625203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:45:27.487936Z","title":"Long-term temporal convolutions for action recognition,","venue":null,"work_id":"353f67b8-71b1-4de5-889d-73c4791dee78","year":2018},"citing_paper":{"arxiv_id":"2508.15903","last_updated":"2025-08-21T18:03:16Z","snapshot_observed_at":"2026-08-05T17:45:22.643146Z","submitted_at":"2025-08-21T18:03:16Z","title":"VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:24.707195Z"},"links":{"citing_paper":"/paper/2508.15903"},"observation_digest":"sha256:6a0dabbc6be9497d92290ad978950f3595570f419b32633e9aeea398c5efe97c","observation_id":"5a6e302f-a6d6-43c0-a56b-c4ee621fe105","resolution":{"observed_at":"2026-08-05T17:45:27.583506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:45:27.265289Z","title":"Finegym: A hierarchical video dataset for fine-grained action understanding,","venue":null,"work_id":"a4b92b00-60c4-4ab3-bd8c-680042808d7c","year":2020},"citing_paper":{"arxiv_id":"2508.15903","last_updated":"2025-08-21T18:03:16Z","snapshot_observed_at":"2026-08-05T17:45:22.643146Z","submitted_at":"2025-08-21T18:03:16Z","title":"VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:24.810896Z"},"links":{"citing_paper":"/paper/2508.15903"},"observation_digest":"sha256:aeeb9ee25f0356adb5489913b2bb695e2c16e5a37f261d8ec91d9e6ba79acce3","observation_id":"ec2b4758-7c2f-4a5c-9952-0cd638e80b82","resolution":{"observed_at":"2026-08-05T17:45:27.375395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:45:27.044252Z","title":"End-to-end video-level representation learning for action recognition,","venue":null,"work_id":"47a7f86c-d7ca-4a30-abe7-cbcef5836341","year":2018},"citing_paper":{"arxiv_id":"2508.15903","last_updated":"2025-08-21T18:03:16Z","snapshot_observed_at":"2026-08-05T17:45:22.643146Z","submitted_at":"2025-08-21T18:03:16Z","title":"VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:24.875343Z"},"links":{"citing_paper":"/paper/2508.15903"},"observation_digest":"sha256:3f5a09d130deb422a2403c331e2145a046a4e35e41e195dd6ef65483de6ba5fd","observation_id":"6cc55d62-1891-4051-8279-ad907b4c8366","resolution":{"observed_at":"2026-08-05T17:45:27.153608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:45:26.854165Z","title":"Stnet: Local and global spatial-temporal modeling for action recogni- tion,","venue":null,"work_id":"95d3deef-e8f8-4c2e-9c11-52859463b7fe","year":2019},"citing_paper":{"arxiv_id":"2508.15903","last_updated":"2025-08-21T18:03:16Z","snapshot_observed_at":"2026-08-05T17:45:22.643146Z","submitted_at":"2025-08-21T18:03:16Z","title":"VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:24.943847Z"},"links":{"citing_paper":"/paper/2508.15903"},"observation_digest":"sha256:e00fdcc069c30536d61cb756c3d80247bd35e17604c54d17a255aac8e6bb4ff0","observation_id":"9ba7246f-d83e-48b7-9661-d24dd9c51378","resolution":{"observed_at":"2026-08-05T17:45:26.955176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:45:26.670415Z","title":"A survey on efficient vision-language models,","venue":null,"work_id":"c4ab43c4-ec29-404c-a9c1-d03406d22518","year":2025},"citing_paper":{"arxiv_id":"2508.15903","last_updated":"2025-08-21T18:03:16Z","snapshot_observed_at":"2026-08-05T17:45:22.643146Z","submitted_at":"2025-08-21T18:03:16Z","title":"VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:25.030702Z"},"links":{"citing_paper":"/paper/2508.15903"},"observation_digest":"sha256:9e014ecdcd914ba52db4ebeb92538ec9536b0e0689d0b120d38dd2ae7d971f4c","observation_id":"f36d86e0-9f0b-4436-b838-d6922f39f59e","resolution":{"observed_at":"2026-08-05T17:45:26.739960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:45:26.503591Z","title":"Cheap and quick: Efficient vision-language instruction tuning for large language models,","venue":null,"work_id":"7e31fa29-3bb8-478f-b726-720e29f00b1f","year":2023},"citing_paper":{"arxiv_id":"2508.15903","last_updated":"2025-08-21T18:03:16Z","snapshot_observed_at":"2026-08-05T17:45:22.643146Z","submitted_at":"2025-08-21T18:03:16Z","title":"VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:25.141410Z"},"links":{"citing_paper":"/paper/2508.15903"},"observation_digest":"sha256:1a5ebe07616bffdffdd0ec8df20de752d3cb2f48c25ad1b71a6309d0c9926bc0","observation_id":"60923db0-71b2-4be5-a736-e99c2b677598","resolution":{"observed_at":"2026-08-05T17:45:26.578959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:45:26.300000Z","title":"PEFT A2Z: parameter-efficient fine-tuning survey for large language and vision models,","venue":null,"work_id":"eaf6b551-2c9c-415f-b365-7225b00d5608","year":2025},"citing_paper":{"arxiv_id":"2508.15903","last_updated":"2025-08-21T18:03:16Z","snapshot_observed_at":"2026-08-05T17:45:22.643146Z","submitted_at":"2025-08-21T18:03:16Z","title":"VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:25.221123Z"},"links":{"citing_paper":"/paper/2508.15903"},"observation_digest":"sha256:12612fa8d1b99255f7d6920a7dfe66fdc6698f4e40e2a300c4f4f07d0379807f","observation_id":"5ea32719-ee71-46ea-b40b-b0638e01085c","resolution":{"observed_at":"2026-08-05T17:45:26.404939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:45:26.115345Z","title":"Visualgpt: Data- efficient adaptation of pretrained language models for image captioning,","venue":null,"work_id":"07b2b54d-17ad-490c-9931-c75263b8ef34","year":2022},"citing_paper":{"arxiv_id":"2508.15903","last_updated":"2025-08-21T18:03:16Z","snapshot_observed_at":"2026-08-05T17:45:22.643146Z","submitted_at":"2025-08-21T18:03:16Z","title":"VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:25.317266Z"},"links":{"citing_paper":"/paper/2508.15903"},"observation_digest":"sha256:e2a0e5acd174269704f5c0c7044f5dbc99e98df5d06546003a70ca6e1c68cb58","observation_id":"fa2bd55c-8085-4894-a159-46f8e5e017c8","resolution":{"observed_at":"2026-08-05T17:45:26.204200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:45:25.915407Z","title":"Multi-modal large language models are effective vision learners,","venue":null,"work_id":"fe833356-e26f-4fe8-a06b-263e7a81f511","year":2025},"citing_paper":{"arxiv_id":"2508.15903","last_updated":"2025-08-21T18:03:16Z","snapshot_observed_at":"2026-08-05T17:45:22.643146Z","submitted_at":"2025-08-21T18:03:16Z","title":"VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:25.381519Z"},"links":{"citing_paper":"/paper/2508.15903"},"observation_digest":"sha256:13db573abedc3466b5ad909b3796cab08477018408f29dfd04612fe60e6f2064","observation_id":"ed8435e0-1800-4210-b87d-c91cf362d305","resolution":{"observed_at":"2026-08-05T17:45:25.997782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01377","last_updated":"2025-06-02T09:56:36Z","snapshot_observed_at":"2026-08-06T08:18:28.668841Z","submitted_at":"2025-01-02T17:37:20Z","title":"Improving Medical Large Vision-Language Models with Abnormal-Aware Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01377","snapshot_observed_at":"2026-08-05T17:45:25.477587Z","title":"Improving medical large vision- language models with abnormal-aware feedback,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.15903","last_updated":"2025-08-21T18:03:16Z","snapshot_observed_at":"2026-08-05T17:45:22.643146Z","submitted_at":"2025-08-21T18:03:16Z","title":"VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:25.477587Z"},"links":{"cited_paper":"/paper/2501.01377","citing_paper":"/paper/2508.15903"},"observation_digest":"sha256:41b7271227e48e1e9a580a8c640f9c7b32209ae62aee7126087d8a369b8dcd2e","observation_id":"1280096c-bfe2-4c67-938d-9ca493b7f1bb","resolution":{"observed_at":"2026-08-05T17:45:25.477587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:45:25.723971Z","title":"Aligngpt: Multi-modal large language models with adaptive alignment capability,","venue":null,"work_id":"462a7f37-f765-47d4-b05e-3d4b193d7b82","year":2024},"citing_paper":{"arxiv_id":"2508.15903","last_updated":"2025-08-21T18:03:16Z","snapshot_observed_at":"2026-08-05T17:45:22.643146Z","submitted_at":"2025-08-21T18:03:16Z","title":"VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:25.588833Z"},"links":{"citing_paper":"/paper/2508.15903"},"observation_digest":"sha256:5a652b7d3ecb41db5bffcd9507581b668019acc17687923743e4e80027e44fc2","observation_id":"0e97a3f1-20f4-44d3-a72d-793938ec7988","resolution":{"observed_at":"2026-08-05T17:45:25.836109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.15903","last_updated":"2025-08-21T18:03:16Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-05T17:45:22.643146Z","submitted_at":"2025-08-21T18:03:16Z","title":"VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":0,"verified_fuzzy":19},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:2508.15903."}