{"as_of":"2026-08-07T18:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a0e1b2631bfaa2361cdc934c952c256a8ffa142be67113f4908c7b814771e2e6","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T16:55:04.858493Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.17442/citation-record","integrity":"/paper/2508.17442/integrity","json":"/paper/2508.17442/citation-record.json","paper":"/paper/2508.17442"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:55:09.373636Z","title":"Human action recognition and prediction: A survey,","venue":null,"work_id":"6d7eb78e-afd3-46a4-ac0b-76c8227dd28c","year":2018},"citing_paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","snapshot_observed_at":"2026-08-05T16:55:02.238788Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:02.710999Z"},"links":{"citing_paper":"/paper/2508.17442"},"observation_digest":"sha256:3d14ecc34aae6d34b36944da09c223a1b773b5ef47fb8b6e49d10652cb2f2ef4","observation_id":"3f1d62b3-e4ff-44e3-88cc-74fe63ac909f","resolution":{"observed_at":"2026-08-05T16:55:09.377306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:55:09.362472Z","title":"How would autonomous vehicles behave in real-world crash scenarios?","venue":null,"work_id":"81991c67-4699-4cfb-b04a-d86ec9e49963","year":2024},"citing_paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","snapshot_observed_at":"2026-08-05T16:55:02.238788Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:02.768294Z"},"links":{"citing_paper":"/paper/2508.17442"},"observation_digest":"sha256:62648e4f52c16774bf615879678e5fd21fb129978651903b8b51f72b7541affb","observation_id":"ca917620-26f2-4f5a-a9ef-15b7c3fb264e","resolution":{"observed_at":"2026-08-05T16:55:09.365851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:55:09.308865Z","title":"Crash-based safety testing of autonomous vehicles: Insights from generating safety- critical scenarios based on in-depth crash data,","venue":null,"work_id":"d5b156a1-48c6-4dfa-8fb9-536fd00a7698","year":2025},"citing_paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","snapshot_observed_at":"2026-08-05T16:55:02.238788Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:02.849541Z"},"links":{"citing_paper":"/paper/2508.17442"},"observation_digest":"sha256:54a4d4e57d3464ae0a62c45dd3c2260773dd8bf6f69ca9e377786e4335a8f357","observation_id":"f23be0e3-7c48-4726-b026-9ec4087861db","resolution":{"observed_at":"2026-08-05T16:55:09.355542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:55:09.011309Z","title":"Diffcrash: Leveraging denoising diffusion probabilistic models to expand high- risk testing scenarios using in-depth crash data,","venue":null,"work_id":"2e90b1fc-4d1b-4f20-b2d1-7979b4639b77","year":2025},"citing_paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","snapshot_observed_at":"2026-08-05T16:55:02.238788Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:02.930306Z"},"links":{"citing_paper":"/paper/2508.17442"},"observation_digest":"sha256:92a7114e20014a0a5d6b857d3623ff3218719961356fdd2de3af1d5d3c8edea7","observation_id":"3c4d22bc-9847-4c6b-be31-85d70a0292ae","resolution":{"observed_at":"2026-08-05T16:55:09.181785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:55:08.791347Z","title":"Search-to-crash: Generating safety-critical scenarios from in-depth crash data for testing autonomous vehicles,","venue":null,"work_id":"65a1df9d-9ddd-4c45-b1ac-e738963dca3c","year":2025},"citing_paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","snapshot_observed_at":"2026-08-05T16:55:02.238788Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:03.044456Z"},"links":{"citing_paper":"/paper/2508.17442"},"observation_digest":"sha256:c9ded3fa6f342fa3a7e9cebe6f8e5a92796c7ab0d010527f30e3499b1cbf47c9","observation_id":"6bf11373-c719-4f82-8435-1b6698d8172d","resolution":{"observed_at":"2026-08-05T16:55:08.901226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:55:08.620859Z","title":"Visual features of interme- diate complexity and their use in classification,","venue":null,"work_id":"c0eed1b2-adbb-43d3-a312-e86e4b09c8a8","year":2002},"citing_paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","snapshot_observed_at":"2026-08-05T16:55:02.238788Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:03.140644Z"},"links":{"citing_paper":"/paper/2508.17442"},"observation_digest":"sha256:7de8110ba6ea1b7f66887265479abfec3f01725414f65fe6d37cd90baf140c7d","observation_id":"b35bfb34-040c-4576-8ba5-94b3c409ed6b","resolution":{"observed_at":"2026-08-05T16:55:08.705485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:55:03.247944Z","title":"Visual in-context learning for large vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","snapshot_observed_at":"2026-08-05T16:55:02.238788Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:03.247944Z"},"links":{"citing_paper":"/paper/2508.17442"},"observation_digest":"sha256:2b3f2411b77cb29d2f41b81a73868e85ab234fdb18bf7bc0d90fea0e0afcf119","observation_id":"0bf434c0-2c9b-4dc3-bd96-29e13993419b","resolution":{"observed_at":"2026-08-05T16:55:03.247944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:55:08.453394Z","title":"Weak to strong generalization for large language models with multi-capabilities,","venue":null,"work_id":"a7f0b6de-7d27-4d11-a43e-ec8f8409f88f","year":2025},"citing_paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","snapshot_observed_at":"2026-08-05T16:55:02.238788Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:03.335362Z"},"links":{"citing_paper":"/paper/2508.17442"},"observation_digest":"sha256:a6c35946c7566b99ded971707fca733e6871f98ebac838e41b8b03897e352dad","observation_id":"9211e064-77c1-4010-bfdf-c90ba7e07438","resolution":{"observed_at":"2026-08-05T16:55:08.527606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:55:03.423729Z","title":"A survey on large language model (LLM) security and privacy: The good, the bad, and the ugly,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","snapshot_observed_at":"2026-08-05T16:55:02.238788Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:03.423729Z"},"links":{"citing_paper":"/paper/2508.17442"},"observation_digest":"sha256:6eb71476e88e9c6493f8d09e76ed903bcdc1fbe5797b4bac342f5797b99e14f3","observation_id":"224aaed7-67a0-4e16-a210-5ce0c1e3997f","resolution":{"observed_at":"2026-08-05T16:55:03.423729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:55:08.268112Z","title":"Cbr-net: Cascade boundary refinement network for action detection: Submission to activitynet challenge 2020 (task 1),","venue":null,"work_id":"6da7f559-f51f-4b79-aac0-96f7ff4489bb","year":2020},"citing_paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","snapshot_observed_at":"2026-08-05T16:55:02.238788Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:03.530428Z"},"links":{"citing_paper":"/paper/2508.17442"},"observation_digest":"sha256:b6cb0b73731ce0b863ab74c5c21aa7445f8d6f146fa5beec4c552e8cd4ad389a","observation_id":"d4a7da62-e621-486a-9fa3-16dc0b86d2cd","resolution":{"observed_at":"2026-08-05T16:55:08.342940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:55:08.034079Z","title":"Fineaction: A fine- grained video dataset for temporal action localization,","venue":null,"work_id":"0edfdfc4-a128-40d0-b2bc-6e3d69b8d6bb","year":2022},"citing_paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","snapshot_observed_at":"2026-08-05T16:55:02.238788Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:03.602521Z"},"links":{"citing_paper":"/paper/2508.17442"},"observation_digest":"sha256:d5295e93dd3af19bca477f4479d2bdf04def8daaef73ea34f8e1dada918b9c12","observation_id":"03899956-4933-490a-a4c7-629d929cd2a9","resolution":{"observed_at":"2026-08-05T16:55:08.146218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:55:07.855964Z","title":"The THUMOS challenge on action recognition for videos","venue":null,"work_id":"0e3b5172-0c75-419a-89e6-1d562e390a8f","year":2017},"citing_paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","snapshot_observed_at":"2026-08-05T16:55:02.238788Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:03.718104Z"},"links":{"citing_paper":"/paper/2508.17442"},"observation_digest":"sha256:fe260e5c07afecd9b190c09967057837fd8f4cd08f3516233bd6df31f4bd08af","observation_id":"ef41a983-1680-4f33-b553-8d6fb8d8fe5b","resolution":{"observed_at":"2026-08-05T16:55:07.940537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:55:07.640436Z","title":"A survey on temporal action localization,","venue":null,"work_id":"99cdbcb2-d801-43b9-897e-e005f3a9be4b","year":2020},"citing_paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","snapshot_observed_at":"2026-08-05T16:55:02.238788Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:03.778064Z"},"links":{"citing_paper":"/paper/2508.17442"},"observation_digest":"sha256:11f343a1440b7ddf3feae811d779663c13a3be81f1c7ca753ed87c0635b87b12","observation_id":"a7b9a5fe-129e-4185-9f99-899b1726cfc1","resolution":{"observed_at":"2026-08-05T16:55:07.725629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:55:07.402505Z","title":"Tallformer: Temporal action localization with a long-memory transformer,","venue":null,"work_id":"28447789-c8ba-476f-9d0e-dcf5af39b0a7","year":2022},"citing_paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","snapshot_observed_at":"2026-08-05T16:55:02.238788Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:03.844680Z"},"links":{"citing_paper":"/paper/2508.17442"},"observation_digest":"sha256:04b7aab414286fa8ac98a5ecc99b98f93893ebb4dbb900a251114ef8e3e9c1da","observation_id":"9382a4f2-34cd-4395-8309-5206f9e61901","resolution":{"observed_at":"2026-08-05T16:55:07.524109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:55:07.242289Z","title":"Cross-fiber spatial-temporal co-enhanced networks for video action recognition,","venue":null,"work_id":"6766e264-a299-483b-a1e3-5626bddfc71f","year":2019},"citing_paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","snapshot_observed_at":"2026-08-05T16:55:02.238788Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:03.899195Z"},"links":{"citing_paper":"/paper/2508.17442"},"observation_digest":"sha256:49ca3e63e0d0d10471bae30d9d851581a9345cfbf954dd0f645a498cd4aeed33","observation_id":"f3f02e0a-06f0-4cdf-b677-c39fa59aa05a","resolution":{"observed_at":"2026-08-05T16:55:07.294764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:55:07.140378Z","title":"Mutually reinforced spatio-temporal convolutional tube for human action recognition","venue":null,"work_id":"78524330-4a55-421f-b905-be18ab2ab011","year":2019},"citing_paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","snapshot_observed_at":"2026-08-05T16:55:02.238788Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:03.980769Z"},"links":{"citing_paper":"/paper/2508.17442"},"observation_digest":"sha256:0fd9f5c01513b9d098b9294cf47e59dc327c7c50c61c7c1674a2b0c2f73e0efe","observation_id":"ac0b2a75-226b-45d7-b09d-38dcca55f0db","resolution":{"observed_at":"2026-08-05T16:55:07.192111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:55:06.958786Z","title":"Multi-scale spatial- temporal integration convolutional tube for human action recognition,","venue":null,"work_id":"59d22860-6969-4d46-b31e-00f9bec2690b","year":2021},"citing_paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","snapshot_observed_at":"2026-08-05T16:55:02.238788Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:04.066995Z"},"links":{"citing_paper":"/paper/2508.17442"},"observation_digest":"sha256:e3d8af0836bac27e791f6c64b9a04a657f139be06fa7398289c37996d638d3bf","observation_id":"02d844f6-21ee-476a-8b3b-42c23c94aa4b","resolution":{"observed_at":"2026-08-05T16:55:07.050514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:55:06.850244Z","title":"Cross-video contextual knowledge exploration and exploitation for ambiguity reduction in weakly supervised temporal action localization,","venue":null,"work_id":"43f51ec4-a950-48b3-8621-9457326b119a","year":2024},"citing_paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","snapshot_observed_at":"2026-08-05T16:55:02.238788Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:04.094400Z"},"links":{"citing_paper":"/paper/2508.17442"},"observation_digest":"sha256:9a89032ef2594a1364339624c7ecd1960b1788c7df4d1abaa3e8c975ed890fde","observation_id":"567dc6b1-2132-407c-9605-a08dc09a600b","resolution":{"observed_at":"2026-08-05T16:55:06.901413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:55:06.670389Z","title":"Trigger is not sufficient: Exploiting frame-aware knowledge for implicit event argument extraction,","venue":null,"work_id":"ca52b3ce-663e-4856-9edf-f65232b10c3f","year":2021},"citing_paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","snapshot_observed_at":"2026-08-05T16:55:02.238788Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:04.157516Z"},"links":{"citing_paper":"/paper/2508.17442"},"observation_digest":"sha256:27accd99c8e56448db19c6fe4a0ef44e808bbca7b6afe2d16470719a102aa102","observation_id":"0f799125-56a3-4d42-bd85-2a1197b630a1","resolution":{"observed_at":"2026-08-05T16:55:06.793739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:55:06.544400Z","title":"Guide the many-to-one assignment: Open informa- tion extraction via iou-aware optimal transport,","venue":null,"work_id":"ddae3110-0535-498d-b410-b5fb1cdde826","year":2023},"citing_paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","snapshot_observed_at":"2026-08-05T16:55:02.238788Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:04.215955Z"},"links":{"citing_paper":"/paper/2508.17442"},"observation_digest":"sha256:902728980d48c2455efce80632a05abf7119d476d6fff9d39009f749c2112635","observation_id":"d4beb4ae-e0ac-4bd4-80e5-35d32144f7e8","resolution":{"observed_at":"2026-08-05T16:55:06.618967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:55:06.338004Z","title":"Video activity localisation with uncertainties in temporal boundary,","venue":null,"work_id":"4038fc4c-91e5-472f-9f30-a3c3fb49fc42","year":2022},"citing_paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","snapshot_observed_at":"2026-08-05T16:55:02.238788Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:04.236450Z"},"links":{"citing_paper":"/paper/2508.17442"},"observation_digest":"sha256:38c76950a3a2578fc160a909d817ca73a8e8c16c932fab0fcb3fad54b309bd6b","observation_id":"53ef3b59-ce1f-4abe-b2b6-42c2904fb1cb","resolution":{"observed_at":"2026-08-05T16:55:06.438970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:55:06.241981Z","title":"Exploring the reasoning abilities of multimodal large language models (mllms): A comprehensive survey on emerging trends in multimodal reasoning,","venue":null,"work_id":"01b52335-81d7-4a13-8fa1-a9a84b07e92a","year":2024},"citing_paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","snapshot_observed_at":"2026-08-05T16:55:02.238788Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:04.290223Z"},"links":{"citing_paper":"/paper/2508.17442"},"observation_digest":"sha256:2267744a07028811bb45be464270c437c61038af2e622a933b72cfe63e5fb4de","observation_id":"ea17fdfa-a670-4471-85df-f46710cca323","resolution":{"observed_at":"2026-08-05T16:55:06.310617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:55:06.057133Z","title":"How vision-language tasks benefit from large pre-trained models: A survey,","venue":null,"work_id":"cc5b744b-b23d-4490-9ee9-b043dee28c21","year":2024},"citing_paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","snapshot_observed_at":"2026-08-05T16:55:02.238788Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:04.314652Z"},"links":{"citing_paper":"/paper/2508.17442"},"observation_digest":"sha256:83d2e4cb7bcce5ff6eb0df863d1c0b16487d57ea410a27c6791267ed78cdbf7b","observation_id":"551a893b-fd60-4b3e-a6f2-1f062e4f7392","resolution":{"observed_at":"2026-08-05T16:55:06.167646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:55:05.907221Z","title":"From linguistic giants to sensory maestros: A survey on cross-modal reasoning with large language models,","venue":null,"work_id":"6ccaebd4-e71f-439d-aef5-b6a1055eae0b","year":2024},"citing_paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","snapshot_observed_at":"2026-08-05T16:55:02.238788Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:04.373024Z"},"links":{"citing_paper":"/paper/2508.17442"},"observation_digest":"sha256:66f4b5d83c68a4a48091dc9704c7d73e51cd5ef12c996ebe0b2409c583ac3b30","observation_id":"ad1ced01-72c5-4aaf-8cad-4b5b40f9fa1e","resolution":{"observed_at":"2026-08-05T16:55:05.993465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:55:05.762252Z","title":"A systematic survey of prompt engineering on vision-language foundation models,","venue":null,"work_id":"51f261cd-148b-4950-a2fe-4bfeec348a28","year":2023},"citing_paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","snapshot_observed_at":"2026-08-05T16:55:02.238788Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:04.457379Z"},"links":{"citing_paper":"/paper/2508.17442"},"observation_digest":"sha256:0563d6fd1971d0f86e1515cf67e0e016f1de59a21fa5113f988223dde9048b29","observation_id":"f94019dc-ab73-426b-a526-9fd2d4d125db","resolution":{"observed_at":"2026-08-05T16:55:05.845189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:55:05.589639Z","title":"Evaluating multimodal vision- language model prompting strategies for visual question answering in road scene understanding,","venue":null,"work_id":"0be8df0f-a966-438f-93b0-ca34ba7e2865","year":2025},"citing_paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","snapshot_observed_at":"2026-08-05T16:55:02.238788Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:04.548139Z"},"links":{"citing_paper":"/paper/2508.17442"},"observation_digest":"sha256:c506c5f8275492a482bb17e8e738579e3aab4b5ffe7ed867d2103e62b63b4af2","observation_id":"950d90b7-9a6d-4b03-923f-f2ae9d0f4cc6","resolution":{"observed_at":"2026-08-05T16:55:05.669528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:55:05.420276Z","title":"Towards grounded visual spatial reasoning in multi-modal vision language models,","venue":null,"work_id":"22000da2-42cd-4061-89f3-eda6eecb318c","year":2023},"citing_paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","snapshot_observed_at":"2026-08-05T16:55:02.238788Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:04.608059Z"},"links":{"citing_paper":"/paper/2508.17442"},"observation_digest":"sha256:4c3bfad950d3d55a9e3c1b1d15ad4a2d0576793517dce89fc1ea0d0d46f5ab5c","observation_id":"4b5364e7-7739-4df5-9ba8-15d560a207f0","resolution":{"observed_at":"2026-08-05T16:55:05.509382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:55:05.292903Z","title":"Enhancing advanced visual reasoning ability of large language models,","venue":null,"work_id":"b263b3dc-6f5d-4b15-9f22-241143d355b4","year":2024},"citing_paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","snapshot_observed_at":"2026-08-05T16:55:02.238788Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:04.641263Z"},"links":{"citing_paper":"/paper/2508.17442"},"observation_digest":"sha256:2dac98d533d0329cc548ecc447c712d1b588fdd455bcc1d3cee74b1d3a22b340","observation_id":"51bb8a7c-3808-432c-b3e3-95078126c0b1","resolution":{"observed_at":"2026-08-05T16:55:05.335787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01377","last_updated":"2025-06-02T09:56:36Z","snapshot_observed_at":"2026-08-06T08:18:28.668841Z","submitted_at":"2025-01-02T17:37:20Z","title":"Improving Medical Large Vision-Language Models with Abnormal-Aware Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01377","snapshot_observed_at":"2026-08-05T16:55:04.691360Z","title":"Improving medical large vision- language models with abnormal-aware feedback,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","snapshot_observed_at":"2026-08-05T16:55:02.238788Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:04.691360Z"},"links":{"cited_paper":"/paper/2501.01377","citing_paper":"/paper/2508.17442"},"observation_digest":"sha256:efe0c647163b6f50162994c8d436b97feec9da5799ffaf748e316b26598d000d","observation_id":"3357097d-1759-4009-8866-21e72b58ae99","resolution":{"observed_at":"2026-08-05T16:55:04.691360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:55:05.135683Z","title":"Chain-of-specificity: Enhancing task-specific constraint adherence in large language models,","venue":null,"work_id":"33e9dd1c-19e1-4143-a2cc-2ea96bc14833","year":2025},"citing_paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","snapshot_observed_at":"2026-08-05T16:55:02.238788Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:04.745657Z"},"links":{"citing_paper":"/paper/2508.17442"},"observation_digest":"sha256:98c44db317793e89f30923afc28555ee7e3fdb64c5a3c679a403d2b280185bcb","observation_id":"ce6576ed-c6cb-49b3-8ca9-b10ef9db3a17","resolution":{"observed_at":"2026-08-05T16:55:05.221014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:55:05.009715Z","title":"Lvlm-ehub: A comprehensive evaluation bench- mark for large vision-language models,","venue":null,"work_id":"8d0db7b8-06e6-4e77-9831-30ff41fc5307","year":2025},"citing_paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","snapshot_observed_at":"2026-08-05T16:55:02.238788Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:04.858493Z"},"links":{"citing_paper":"/paper/2508.17442"},"observation_digest":"sha256:d246b47b6ecad108b298f297c3a34fd08f0bacc88b5b8c0d0014807a58a49344","observation_id":"f4f25b48-e5c4-4bb2-bae9-b8d309399ca6","resolution":{"observed_at":"2026-08-05T16:55:05.054392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-05T16:55:02.238788Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":3,"verified_exact":0,"verified_fuzzy":28},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2508.17442."}