{"as_of":"2026-08-08T07:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e6589671acfc7a20bb8cc4733ce4ab31b832e48457000f0c978c672e82b6559c","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T11:49:12.454087Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.22369/citation-record","integrity":"/paper/2507.22369/integrity","json":"/paper/2507.22369/citation-record.json","paper":"/paper/2507.22369"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"3479.36620","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:14.811309Z","title":"A chatgpt-based approach for questions generation in higher education,","venue":null,"work_id":"afc44dac-aba5-4355-949a-08a152ce148d","year":2024},"citing_paper":{"arxiv_id":"2507.22369","last_updated":"2025-09-02T02:23:20Z","snapshot_observed_at":"2026-08-06T11:49:08.783080Z","submitted_at":"2025-07-30T04:25:14Z","title":"Exploring the Application of Visual Question Answering (VQA) for Classroom Activity Monitoring","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T11:49:09.102483Z"},"links":{"citing_paper":"/paper/2507.22369"},"observation_digest":"sha256:fc49fef1e2fb42d74bd5b0097ae3fcc57ade0823aa1726834b017cfdd13b6405","observation_id":"da1c715d-b9d2-42be-9909-59ebe72646d7","resolution":{"observed_at":"2026-08-06T11:49:14.944252Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"0116.20901","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:14.522212Z","title":"Using learning analytics to assess students’ behavior in open-ended programming tasks,","venue":null,"work_id":"abe72bb5-57df-4e27-a98e-016aeb2be742","year":2011},"citing_paper":{"arxiv_id":"2507.22369","last_updated":"2025-09-02T02:23:20Z","snapshot_observed_at":"2026-08-06T11:49:08.783080Z","submitted_at":"2025-07-30T04:25:14Z","title":"Exploring the Application of Visual Question Answering (VQA) for Classroom Activity Monitoring","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T11:49:09.165676Z"},"links":{"citing_paper":"/paper/2507.22369"},"observation_digest":"sha256:ef0be39ad57d9a75c72a13503543197d3cbf834ae2a2d093a451af3149b71c20","observation_id":"bfa9626f-4697-43d0-9efd-6e910235c343","resolution":{"observed_at":"2026-08-06T11:49:14.605536Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:18.247673Z","title":"Ta-student vqa: Multi-agents training by self-questioning,","venue":null,"work_id":"f136b854-0c75-4fb8-99f8-590b2d592f51","year":2020},"citing_paper":{"arxiv_id":"2507.22369","last_updated":"2025-09-02T02:23:20Z","snapshot_observed_at":"2026-08-06T11:49:08.783080Z","submitted_at":"2025-07-30T04:25:14Z","title":"Exploring the Application of Visual Question Answering (VQA) for Classroom Activity Monitoring","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T11:49:09.259652Z"},"links":{"citing_paper":"/paper/2507.22369"},"observation_digest":"sha256:f80e0e96689407482d40571006ea0e17afe6ec1326bd3310a7d4790e588cf86b","observation_id":"50159e76-bdf9-4ae7-92fd-e3016a4a60a4","resolution":{"observed_at":"2026-08-06T11:49:18.403119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:17.965319Z","title":"Bozkir, C","venue":null,"work_id":"680d0ef6-ca21-4466-af40-cb46969b659f","year":2025},"citing_paper":{"arxiv_id":"2507.22369","last_updated":"2025-09-02T02:23:20Z","snapshot_observed_at":"2026-08-06T11:49:08.783080Z","submitted_at":"2025-07-30T04:25:14Z","title":"Exploring the Application of Visual Question Answering (VQA) for Classroom Activity Monitoring","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T11:49:09.358836Z"},"links":{"citing_paper":"/paper/2507.22369"},"observation_digest":"sha256:5295b89eb922bab2aef65f4395282118a55e6dc277bee07b1c443601ff4e9834","observation_id":"c6845e70-a543-4a93-9e0a-094e609879e8","resolution":{"observed_at":"2026-08-06T11:49:18.111605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:17.582673Z","title":"What is visual question answering (vqa)?","venue":null,"work_id":"d1a41d92-8791-456f-b07c-8e3f540382e2","year":2023},"citing_paper":{"arxiv_id":"2507.22369","last_updated":"2025-09-02T02:23:20Z","snapshot_observed_at":"2026-08-06T11:49:08.783080Z","submitted_at":"2025-07-30T04:25:14Z","title":"Exploring the Application of Visual Question Answering (VQA) for Classroom Activity Monitoring","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T11:49:09.450587Z"},"links":{"citing_paper":"/paper/2507.22369"},"observation_digest":"sha256:73d9bee9ec0f19b5767018e41997f333c944139a5eb8fae0ce47c6831a797cae","observation_id":"082d6326-045f-4c59-9d95-e66065c068da","resolution":{"observed_at":"2026-08-06T11:49:17.740668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2024.10227","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:14.189813Z","title":"From image to language: A critical analysis of visual question answering (vqa) approaches, challenges, and opportunities,","venue":null,"work_id":"dc8079e8-361f-435c-948b-744f3322eca6","year":2024},"citing_paper":{"arxiv_id":"2507.22369","last_updated":"2025-09-02T02:23:20Z","snapshot_observed_at":"2026-08-06T11:49:08.783080Z","submitted_at":"2025-07-30T04:25:14Z","title":"Exploring the Application of Visual Question Answering (VQA) for Classroom Activity Monitoring","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T11:49:09.563963Z"},"links":{"citing_paper":"/paper/2507.22369"},"observation_digest":"sha256:8248595e9f16618d0aa244bc4e9e78cbc49cb46ac79cda9aeddbdab267784a46","observation_id":"66397703-cac3-4cab-8d04-c41d3fd072be","resolution":{"observed_at":"2026-08-06T11:49:14.335749Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:17.285746Z","title":"Aiqam’25: The 2nd acm workshop on ai-powered ques- tion answering systems for multimedia,","venue":null,"work_id":"d4fe9462-41e9-4ffe-805d-0e83d4d221ad","year":2025},"citing_paper":{"arxiv_id":"2507.22369","last_updated":"2025-09-02T02:23:20Z","snapshot_observed_at":"2026-08-06T11:49:08.783080Z","submitted_at":"2025-07-30T04:25:14Z","title":"Exploring the Application of Visual Question Answering (VQA) for Classroom Activity Monitoring","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T11:49:09.641167Z"},"links":{"citing_paper":"/paper/2507.22369"},"observation_digest":"sha256:04a96adbe2f5f96854e1b2cd1d332d81b22fed113669e9b0377eebf77e22338c","observation_id":"172b2f2a-8464-46ed-9c8c-57c36b8879ec","resolution":{"observed_at":"2026-08-06T11:49:17.424197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07825","last_updated":"2024-09-09T11:08:17Z","snapshot_observed_at":"2026-07-06T15:26:42.770863Z","submitted_at":"2023-05-13T02:46:41Z","title":"Student Classroom Behavior Detection based on YOLOv7-BRA and Multi-Model Fusion","version":2},"cited_work":{"arxiv_id":"2305.07825","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.07825","snapshot_observed_at":"2026-08-06T11:49:13.851153Z","title":"Student Classroom Behavior Detection based on YOLOv7-BRA and Multi-Model Fusion","venue":"cs.CV","work_id":"1a0ad39b-d6c6-41c8-9e82-964dc7e903e7","year":2023},"citing_paper":{"arxiv_id":"2507.22369","last_updated":"2025-09-02T02:23:20Z","snapshot_observed_at":"2026-08-06T11:49:08.783080Z","submitted_at":"2025-07-30T04:25:14Z","title":"Exploring the Application of Visual Question Answering (VQA) for Classroom Activity Monitoring","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T11:49:09.721364Z"},"links":{"cited_paper":"/paper/2305.07825","citing_paper":"/paper/2507.22369"},"observation_digest":"sha256:e7b1e1ee21b1845cc9ea06bf2f2cb8ca1dbe51a449c77a54cb7f995c5c81bccc","observation_id":"273fbb73-aaab-4285-baaa-7a44d337e720","resolution":{"observed_at":"2026-08-06T11:49:14.002056Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:16.963869Z","title":"Yolo-cbd: Classroom behavior detection method based on behavior feature extraction and aggregation,","venue":null,"work_id":"ce79d57a-0d3c-44ea-8a71-4bf9a23fb3ff","year":2025},"citing_paper":{"arxiv_id":"2507.22369","last_updated":"2025-09-02T02:23:20Z","snapshot_observed_at":"2026-08-06T11:49:08.783080Z","submitted_at":"2025-07-30T04:25:14Z","title":"Exploring the Application of Visual Question Answering (VQA) for Classroom Activity Monitoring","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T11:49:09.807729Z"},"links":{"citing_paper":"/paper/2507.22369"},"observation_digest":"sha256:740e0e677ffe0fc7283504cb8128073e6925e58f8d0f897a3beaa4a728aaec86","observation_id":"a9f4fcff-05d6-4575-8309-3e7b83321421","resolution":{"observed_at":"2026-08-06T11:49:17.132250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:16.651185Z","title":"Student behavior detection in the classroom based on improved yolov8,","venue":null,"work_id":"dce614a1-04b2-489a-a1e3-2cccfa3dfc72","year":2023},"citing_paper":{"arxiv_id":"2507.22369","last_updated":"2025-09-02T02:23:20Z","snapshot_observed_at":"2026-08-06T11:49:08.783080Z","submitted_at":"2025-07-30T04:25:14Z","title":"Exploring the Application of Visual Question Answering (VQA) for Classroom Activity Monitoring","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T11:49:09.884396Z"},"links":{"citing_paper":"/paper/2507.22369"},"observation_digest":"sha256:ae79f7b42462fb6fb5d07011dac2046bab78a9999d62d92f14d98178d7062d9c","observation_id":"18856815-c111-4a0b-911a-c3d26c60f975","resolution":{"observed_at":"2026-08-06T11:49:16.801435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02522","last_updated":"2024-09-09T11:01:25Z","snapshot_observed_at":"2026-08-04T06:29:37.059837Z","submitted_at":"2023-10-04T01:43:46Z","title":"SCB-Dataset3: A Benchmark for Detecting Student Classroom Behavior","version":2},"cited_work":{"arxiv_id":"2310.02522","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.02522","snapshot_observed_at":"2026-08-06T11:49:13.579370Z","title":"SCB-Dataset3: A Benchmark for Detecting Student Classroom Behavior","venue":"cs.CV","work_id":"54e659d5-c1ae-45ef-9fbb-d724265d57d4","year":2023},"citing_paper":{"arxiv_id":"2507.22369","last_updated":"2025-09-02T02:23:20Z","snapshot_observed_at":"2026-08-06T11:49:08.783080Z","submitted_at":"2025-07-30T04:25:14Z","title":"Exploring the Application of Visual Question Answering (VQA) for Classroom Activity Monitoring","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T11:49:09.963250Z"},"links":{"cited_paper":"/paper/2310.02522","citing_paper":"/paper/2507.22369"},"observation_digest":"sha256:228f34be97e04b40fdf3d963232ed58f2a672df3a555a7f0232082056d82df8a","observation_id":"6253777b-d6e2-4dae-9d39-adb9a3c88c89","resolution":{"observed_at":"2026-08-06T11:49:13.710573Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2023.10364","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:13.441482Z","title":"Context understanding in computer vision: A survey,","venue":null,"work_id":"497d61d0-6508-4a90-a1f4-86b598ca0347","year":2023},"citing_paper":{"arxiv_id":"2507.22369","last_updated":"2025-09-02T02:23:20Z","snapshot_observed_at":"2026-08-06T11:49:08.783080Z","submitted_at":"2025-07-30T04:25:14Z","title":"Exploring the Application of Visual Question Answering (VQA) for Classroom Activity Monitoring","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T11:49:10.047632Z"},"links":{"citing_paper":"/paper/2507.22369"},"observation_digest":"sha256:589fb360934223bf23ecf46d44e45093a45975ae52331cea543ffaeb2d389971","observation_id":"7fd56365-1507-4e38-b698-06641cd28d59","resolution":{"observed_at":"2026-08-06T11:49:13.513388Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:16.355857Z","title":"Multimodal research in vision and language: A review of current and emerging trends,","venue":null,"work_id":"9f61a4c0-de01-46d1-8af5-51325ae4aafa","year":2022},"citing_paper":{"arxiv_id":"2507.22369","last_updated":"2025-09-02T02:23:20Z","snapshot_observed_at":"2026-08-06T11:49:08.783080Z","submitted_at":"2025-07-30T04:25:14Z","title":"Exploring the Application of Visual Question Answering (VQA) for Classroom Activity Monitoring","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T11:49:10.151833Z"},"links":{"citing_paper":"/paper/2507.22369"},"observation_digest":"sha256:d008e3a6830a73700b1fe01182744006fd6371b10015b1e63946fabd5accc4c2","observation_id":"b7e1bfc1-f7b7-4bab-8144-fa2bd631730c","resolution":{"observed_at":"2026-08-06T11:49:16.508917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-06T11:49:10.236114Z","title":"Videollama 2: Advancing spatial-temporal modeling and audio understanding in video-llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22369","last_updated":"2025-09-02T02:23:20Z","snapshot_observed_at":"2026-08-06T11:49:08.783080Z","submitted_at":"2025-07-30T04:25:14Z","title":"Exploring the Application of Visual Question Answering (VQA) for Classroom Activity Monitoring","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T11:49:10.236114Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2507.22369"},"observation_digest":"sha256:9314e55ff511025a3f53dc485308b20593588f64ddce89583b897d82b5e74e1c","observation_id":"87f07c28-b9ed-43be-9035-c76b07d3e1c6","resolution":{"observed_at":"2026-08-06T11:49:10.236114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-06T11:49:10.330852Z","title":"Videollama 3: Frontier multimodal foundation models for image and video understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22369","last_updated":"2025-09-02T02:23:20Z","snapshot_observed_at":"2026-08-06T11:49:08.783080Z","submitted_at":"2025-07-30T04:25:14Z","title":"Exploring the Application of Visual Question Answering (VQA) for Classroom Activity Monitoring","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T11:49:10.330852Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2507.22369"},"observation_digest":"sha256:ee288089a6e27266a76e6cd2374c53f59a8d5f0c80ae6d41b16e2db8867ea436","observation_id":"3f3bc963-f088-48a5-be70-96115c8b0a94","resolution":{"observed_at":"2026-08-06T11:49:10.330852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-08-06T11:49:10.455295Z","title":"Nvila: Efficient frontier visual language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22369","last_updated":"2025-09-02T02:23:20Z","snapshot_observed_at":"2026-08-06T11:49:08.783080Z","submitted_at":"2025-07-30T04:25:14Z","title":"Exploring the Application of Visual Question Answering (VQA) for Classroom Activity Monitoring","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T11:49:10.455295Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2507.22369"},"observation_digest":"sha256:94c8860a1dc035dbee1bf6c1ade71585ba608ebeb4c0244d15b1167631049238","observation_id":"94e994f1-c11d-493c-8020-9568fcb97295","resolution":{"observed_at":"2026-08-06T11:49:10.455295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-06T11:49:10.580707Z","title":"Qwen3 technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22369","last_updated":"2025-09-02T02:23:20Z","snapshot_observed_at":"2026-08-06T11:49:08.783080Z","submitted_at":"2025-07-30T04:25:14Z","title":"Exploring the Application of Visual Question Answering (VQA) for Classroom Activity Monitoring","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T11:49:10.580707Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2507.22369"},"observation_digest":"sha256:87564fe4909c5877e662334ebe0611e96143060d7df01e08c2c64e2177756d08","observation_id":"a6e19850-b108-4317-85f5-398bf8fbb498","resolution":{"observed_at":"2026-08-06T11:49:10.580707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.11471","last_updated":"2024-02-18T08:00:19Z","snapshot_observed_at":"2026-08-06T23:46:22.347744Z","submitted_at":"2023-07-21T10:12:09Z","title":"Robust Visual Question Answering: Datasets, Methods, and Future Challenges","version":2},"cited_work":{"arxiv_id":"2307.11471","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.11471","snapshot_observed_at":"2026-08-06T11:49:13.140765Z","title":"Robust Visual Question Answering: Datasets, Methods, and Future Challenges","venue":"cs.CV","work_id":"c50937cf-2233-4bdd-a82f-c4ff3ed472be","year":2023},"citing_paper":{"arxiv_id":"2507.22369","last_updated":"2025-09-02T02:23:20Z","snapshot_observed_at":"2026-08-06T11:49:08.783080Z","submitted_at":"2025-07-30T04:25:14Z","title":"Exploring the Application of Visual Question Answering (VQA) for Classroom Activity Monitoring","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T11:49:10.673303Z"},"links":{"cited_paper":"/paper/2307.11471","citing_paper":"/paper/2507.22369"},"observation_digest":"sha256:967ee964c223ac389f68db2a4867b669f51e63384ff63bb04521dbd9d42f1a0a","observation_id":"8329c023-ad6f-44bb-9fb1-3eb3df8299c0","resolution":{"observed_at":"2026-08-06T11:49:13.185067Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.jcp.2018.08","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:12.621928Z","title":"Dgm: A deep learning algorithm for solving partial differential equations,","venue":null,"work_id":"4fc5209d-3428-4847-814f-39d26579b595","year":2018},"citing_paper":{"arxiv_id":"2507.22369","last_updated":"2025-09-02T02:23:20Z","snapshot_observed_at":"2026-08-06T11:49:08.783080Z","submitted_at":"2025-07-30T04:25:14Z","title":"Exploring the Application of Visual Question Answering (VQA) for Classroom Activity Monitoring","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T11:49:10.832725Z"},"links":{"citing_paper":"/paper/2507.22369"},"observation_digest":"sha256:b2842c4fc43f4f4d3ed258127f51ff46a1079b4076c747882a1299a1596fb5e7","observation_id":"c86e692d-789b-4f69-8ec7-09b5650146a0","resolution":{"observed_at":"2026-08-06T11:49:12.707648Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1704.04497","last_updated":"2017-12-03T04:46:42Z","snapshot_observed_at":"2026-08-05T04:01:00.125464Z","submitted_at":"2017-04-14T17:57:01Z","title":"TGIF-QA: Toward Spatio-Temporal Reasoning in Visual Question Answering","version":3},"cited_work":{"arxiv_id":"1704.04497","doi":null,"metadata_source":"pith","pith_arxiv_id":"1704.04497","snapshot_observed_at":"2026-08-06T11:49:12.980227Z","title":"TGIF-QA: Toward Spatio-Temporal Reasoning in Visual Question Answering","venue":"cs.CV","work_id":"e8112406-df32-4985-8857-513c40e05c58","year":2017},"citing_paper":{"arxiv_id":"2507.22369","last_updated":"2025-09-02T02:23:20Z","snapshot_observed_at":"2026-08-06T11:49:08.783080Z","submitted_at":"2025-07-30T04:25:14Z","title":"Exploring the Application of Visual Question Answering (VQA) for Classroom Activity Monitoring","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T11:49:10.964780Z"},"links":{"cited_paper":"/paper/1704.04497","citing_paper":"/paper/2507.22369"},"observation_digest":"sha256:7aee90e54068f7a9a1f962a857e3fce3bb470624a604ce20573671171fc0b8ad","observation_id":"ac41428a-5f73-4398-bab1-b3f81bd8aee1","resolution":{"observed_at":"2026-08-06T11:49:13.071161Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:15.997102Z","title":"Tgif-qa: Toward spatio-temporal reasoning in visual question answering,","venue":null,"work_id":"da4a9f39-63b3-4467-ae86-aabe472c45c4","year":2017},"citing_paper":{"arxiv_id":"2507.22369","last_updated":"2025-09-02T02:23:20Z","snapshot_observed_at":"2026-08-06T11:49:08.783080Z","submitted_at":"2025-07-30T04:25:14Z","title":"Exploring the Application of Visual Question Answering (VQA) for Classroom Activity Monitoring","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T11:49:11.139045Z"},"links":{"citing_paper":"/paper/2507.22369"},"observation_digest":"sha256:7e8c442b3b5baf45da99da3534bcbbf8a289e26aeb397d1edb770368a1936b98","observation_id":"a7c69714-6669-4023-91f3-41fc4f442d8c","resolution":{"observed_at":"2026-08-06T11:49:16.144755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.00451","last_updated":"2021-08-12T15:15:32Z","snapshot_observed_at":"2026-07-06T10:19:28.469761Z","submitted_at":"2020-12-01T12:59:20Z","title":"Just Ask: Learning to Answer Questions from Millions of Narrated Videos","version":3},"cited_work":{"arxiv_id":"2012.00451","doi":null,"metadata_source":"pith","pith_arxiv_id":"2012.00451","snapshot_observed_at":"2026-08-06T11:49:12.825093Z","title":"Just Ask: Learning to Answer Questions from Millions of Narrated Videos","venue":"cs.CV","work_id":"6255b820-2071-4508-9174-1be21a649125","year":2020},"citing_paper":{"arxiv_id":"2507.22369","last_updated":"2025-09-02T02:23:20Z","snapshot_observed_at":"2026-08-06T11:49:08.783080Z","submitted_at":"2025-07-30T04:25:14Z","title":"Exploring the Application of Visual Question Answering (VQA) for Classroom Activity Monitoring","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T11:49:11.284882Z"},"links":{"cited_paper":"/paper/2012.00451","citing_paper":"/paper/2507.22369"},"observation_digest":"sha256:0fc01342ab7975dd96c4e90eb42290f5d4dc44df0cda5d25c39bb04225ededc9","observation_id":"3f55c5db-20d2-4e66-8dc5-c298322dab9b","resolution":{"observed_at":"2026-08-06T11:49:12.896967Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.02467","last_updated":"2019-06-06T08:08:14Z","snapshot_observed_at":"2026-07-06T07:58:24.206559Z","submitted_at":"2019-06-06T08:08:14Z","title":"ActivityNet-QA: A Dataset for Understanding Complex Web Videos via Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.02467","snapshot_observed_at":"2026-08-06T11:49:11.492167Z","title":"Activitynet-qa: A dataset for understanding complex web videos via question answering,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.22369","last_updated":"2025-09-02T02:23:20Z","snapshot_observed_at":"2026-08-06T11:49:08.783080Z","submitted_at":"2025-07-30T04:25:14Z","title":"Exploring the Application of Visual Question Answering (VQA) for Classroom Activity Monitoring","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T11:49:11.492167Z"},"links":{"cited_paper":"/paper/1906.02467","citing_paper":"/paper/2507.22369"},"observation_digest":"sha256:e54de54e2ae4ed82aecd4a9ddd18c9cc8f838270ff70369253bd74cf91a84ae5","observation_id":"0a665a11-5416-4657-9207-cc3c57325f73","resolution":{"observed_at":"2026-08-06T11:49:11.492167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.01225","last_updated":"2022-11-02T05:25:06Z","snapshot_observed_at":"2026-07-30T11:11:52.165985Z","submitted_at":"2022-03-02T16:34:09Z","title":"Video Question Answering: Datasets, Algorithms and Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.01225","snapshot_observed_at":"2026-08-06T11:49:11.706652Z","title":"Video question answering: Datasets, algorithms and challenges,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.22369","last_updated":"2025-09-02T02:23:20Z","snapshot_observed_at":"2026-08-06T11:49:08.783080Z","submitted_at":"2025-07-30T04:25:14Z","title":"Exploring the Application of Visual Question Answering (VQA) for Classroom Activity Monitoring","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T11:49:11.706652Z"},"links":{"cited_paper":"/paper/2203.01225","citing_paper":"/paper/2507.22369"},"observation_digest":"sha256:8ca3d317facbeb41dae922fa59c14eece19726f27295a9bc6a0f08a0cedd6108","observation_id":"93e3928d-95fa-4a33-b987-0437019a3569","resolution":{"observed_at":"2026-08-06T11:49:11.706652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:15.686655Z","title":"Visual question answering: from early developments to recent advances – a survey,","venue":null,"work_id":"ebb57aae-79b4-47b4-b867-e9b510c65cde","year":null},"citing_paper":{"arxiv_id":"2507.22369","last_updated":"2025-09-02T02:23:20Z","snapshot_observed_at":"2026-08-06T11:49:08.783080Z","submitted_at":"2025-07-30T04:25:14Z","title":"Exploring the Application of Visual Question Answering (VQA) for Classroom Activity Monitoring","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T11:49:11.928261Z"},"links":{"citing_paper":"/paper/2507.22369"},"observation_digest":"sha256:ed836d0d8a97a03427690117c2bd90ce24e21a9eb22d52011715bd160c27cace","observation_id":"b8dcd05e-2c98-4c7c-b63a-b8e306497127","resolution":{"observed_at":"2026-08-06T11:49:15.831804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:15.365167Z","title":"ROUGE: A package for automatic evaluation of summaries,","venue":null,"work_id":"553ca0a0-049b-4d73-b680-14240f58118e","year":2004},"citing_paper":{"arxiv_id":"2507.22369","last_updated":"2025-09-02T02:23:20Z","snapshot_observed_at":"2026-08-06T11:49:08.783080Z","submitted_at":"2025-07-30T04:25:14Z","title":"Exploring the Application of Visual Question Answering (VQA) for Classroom Activity Monitoring","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T11:49:12.241279Z"},"links":{"citing_paper":"/paper/2507.22369"},"observation_digest":"sha256:58adfb563c545bc20e1a775f51fa57d5e82f2a54bc200155bb3e89516a21f36f","observation_id":"f3f5dfde-aa62-4a88-8622-969b2d7d29eb","resolution":{"observed_at":"2026-08-06T11:49:15.502193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:15.001878Z","title":"A detailed comparative analysis of automatic neural metrics for machine translation: Bleurt & bertscore,","venue":null,"work_id":"fbf4d394-1061-4974-92f6-261bee0f5783","year":2025},"citing_paper":{"arxiv_id":"2507.22369","last_updated":"2025-09-02T02:23:20Z","snapshot_observed_at":"2026-08-06T11:49:08.783080Z","submitted_at":"2025-07-30T04:25:14Z","title":"Exploring the Application of Visual Question Answering (VQA) for Classroom Activity Monitoring","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T11:49:12.454087Z"},"links":{"citing_paper":"/paper/2507.22369"},"observation_digest":"sha256:7504fee213781aad77da6b7b2328fa1d46a28f45d932efb33d2f60647a689053","observation_id":"b577440f-c4a1-48ba-966a-dd1f5bfe33dc","resolution":{"observed_at":"2026-08-06T11:49:15.155360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03939","last_updated":"2025-01-11T14:21:37Z","snapshot_observed_at":"2026-07-06T20:17:43.203959Z","submitted_at":"2025-01-07T17:00:35Z","title":"Visual question answering: from early developments to recent advances -- a survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03939","snapshot_observed_at":"2026-08-06T11:49:12.091321Z","title":"Available: https://arxiv.org/abs/2501.03939","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22369","last_updated":"2025-09-02T02:23:20Z","snapshot_observed_at":"2026-08-06T11:49:08.783080Z","submitted_at":"2025-07-30T04:25:14Z","title":"Exploring the Application of Visual Question Answering (VQA) for Classroom Activity Monitoring","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T11:49:12.091321Z"},"links":{"cited_paper":"/paper/2501.03939","citing_paper":"/paper/2507.22369"},"observation_digest":"sha256:43716968689157de39344812a4070b699b442e751df2a48ca7633f43b4f65b8b","observation_id":"5edc97a2-1a59-45a9-97ed-5f2aef7440ad","resolution":{"observed_at":"2026-08-06T11:49:12.091321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.22369","last_updated":"2025-09-02T02:23:20Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T11:49:08.783080Z","submitted_at":"2025-07-30T04:25:14Z","title":"Exploring the Application of Visual Question Answering (VQA) for Classroom Activity Monitoring"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":7,"verified_exact":6,"verified_fuzzy":11},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 0 inbound Pith citation observations for arXiv:2507.22369."}