{"as_of":"2026-08-07T09:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e38da5753ad8c2fab6329a80fe710b44ab0f185928fe2937930eb018f1e89fd6","coverage":[{"denominator":127,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T20:23:07.705686Z","state":"measured"},{"denominator":103,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":103,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-03T16:37:06.384435Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T16:38:39.619743Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2511.20272","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.20272","snapshot_observed_at":"2026-07-07T02:16:00.259742Z","title":"arXiv preprint arXiv:2511.20272 (2025)","venue":null,"work_id":"bd1a8bce-bb09-41a8-9371-0a9cc5be5e55","year":2025},"citing_paper":{"arxiv_id":"2606.05769","last_updated":"2026-06-04T06:53:19Z","snapshot_observed_at":"2026-08-03T03:37:13.228116Z","submitted_at":"2026-06-04T06:53:19Z","title":"Imagine Before You Predict: Interleaved Latent Visual Reasoning for Video Event Prediction","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-06-28T02:46:50.373450Z"},"links":{"cited_paper":"/paper/2511.20272","citing_paper":"/paper/2606.05769"},"observation_digest":"sha256:060f4a7bf5b8bdbb1a74a071358989ce331bec3fa269b8530a1c2c293ba9bab6","observation_id":"243b57be-37fc-49e0-b526-59420390fa47","resolution":{"observed_at":"2026-07-07T02:16:00.259742Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2511.20272","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.20272","snapshot_observed_at":"2026-07-07T02:16:00.259742Z","title":"arXiv preprint arXiv:2511.20272 (2025)","venue":null,"work_id":"bd1a8bce-bb09-41a8-9371-0a9cc5be5e55","year":2025},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":289,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"cited_paper":"/paper/2511.20272","citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:a43bc2f06b68a7202a744824e8d3d89e00fe93beb95f9a0f2c6fe8c9e9740d5a","observation_id":"9e3662f1-eca9-4aa7-bc4c-f4783f099257","resolution":{"observed_at":"2026-07-07T02:16:00.259742Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2511.20272","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.20272","snapshot_observed_at":"2026-07-07T02:16:00.259742Z","title":"arXiv preprint arXiv:2511.20272 (2025)","venue":null,"work_id":"bd1a8bce-bb09-41a8-9371-0a9cc5be5e55","year":2025},"citing_paper":{"arxiv_id":"2607.01667","last_updated":"2026-07-02T03:47:45Z","snapshot_observed_at":"2026-08-05T09:34:18.453279Z","submitted_at":"2026-07-02T03:47:45Z","title":"Temporal and Cross-Modal Alignment for Enhanced Audiovisual Video Captioning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-03T16:37:06.384435Z"},"links":{"cited_paper":"/paper/2511.20272","citing_paper":"/paper/2607.01667"},"observation_digest":"sha256:334f8a9cc0f77df02b14ea0bf1fc9dfde24c46f7033430a841286073a9972f61","observation_id":"d83de7e4-9f52-4e18-acfc-1e5e5fef7c06","resolution":{"observed_at":"2026-07-07T02:16:00.259742Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2511.20272/citation-record","integrity":"/paper/2511.20272/integrity","json":"/paper/2511.20272/citation-record.json","paper":"/paper/2511.20272"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-03T20:22:59.834670Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T20:22:59.834670Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:788785f7b491362ab7462b05bd2335a0ed77a6905001ae911f8214ac1932babf","observation_id":"1c2785ed-4cd7-488a-8e38-8df42133fc3d","resolution":{"observed_at":"2026-08-03T20:22:59.834670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:22:59.937363Z","title":"On seeing stuff: The perception of materials by humans and machines","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T20:22:59.937363Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:ca5ec5140279745a186ca068897409b42e8d03d2203d1fabe8fe6a0278b10d4a","observation_id":"0e4113ed-1a88-4f11-bed2-153b4d47d61b","resolution":{"observed_at":"2026-08-03T20:22:59.937363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:00.093535Z","title":"Vqa: Visual question answering","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:00.093535Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:de40dc94569fadecc468f98946a1ff0d2c940996a2225478870c332387cd398d","observation_id":"40d649dd-1e16-41bd-ad37-01207a4f42b5","resolution":{"observed_at":"2026-08-03T20:23:00.093535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:00.331240Z","title":"Eye-contact, distance and affiliation.Sociometry, pages 289–304, 1965","venue":null,"work_id":null,"year":1965},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:00.331240Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:e9e9cb224986dc6444d926932e83cfb2d1c724f07f2c61d7866c5ff8e719e850","observation_id":"d19b8ecb-31a9-4742-8a73-f796e7c8d198","resolution":{"observed_at":"2026-08-03T20:23:00.331240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-03T20:23:00.406527Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:00.406527Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:20856d29699a0884425b9c820fd39530194df4c44409b2134bbd3869174ebf00","observation_id":"14fda1d8-9815-4d28-9671-ecacd20eb630","resolution":{"observed_at":"2026-08-03T20:23:00.406527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:00.484396Z","title":"Representing the existence and the lo- cation of hidden objects: Object permanence in 6-and 8- month-old infants.Cognition, 23(1):21–41, 1986","venue":null,"work_id":null,"year":1986},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:00.484396Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:02bdb770025de713deae48ae7f1581deb57b70c9465fcb746fd74926141d2807","observation_id":"1dae183b-ab4f-4652-9b30-8dcee8737c6d","resolution":{"observed_at":"2026-08-03T20:23:00.484396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:00.572585Z","title":"theory of mind","venue":null,"work_id":null,"year":1985},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:00.572585Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:56791f4c7389c014e7c5976db3bd6eccc3ac49a3dc16549e5b859413a1d679b1","observation_id":"c53a5db6-45f7-4cc0-8170-3321c28fdfa7","resolution":{"observed_at":"2026-08-03T20:23:00.572585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.08897","last_updated":"2022-01-12T08:19:29Z","snapshot_observed_at":"2026-07-06T12:09:19.763667Z","submitted_at":"2021-11-17T04:27:01Z","title":"ARKitScenes: A Diverse Real-World Dataset For 3D Indoor Scene Understanding Using Mobile RGB-D Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.08897","snapshot_observed_at":"2026-08-03T20:23:00.688451Z","title":"Arkitscenes: A di- verse real-world dataset for 3d indoor scene understanding using mobile rgb-d data.arXiv preprint arXiv:2111.08897,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:00.688451Z"},"links":{"cited_paper":"/paper/2111.08897","citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:888c0a72866a78e0bf7bac3a77dc47e074b9ed965fd27be4b9facdef752aedd7","observation_id":"858ff559-25c1-4076-bb04-fd8184e2384b","resolution":{"observed_at":"2026-08-03T20:23:00.688451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09849","last_updated":"2025-06-11T15:21:16Z","snapshot_observed_at":"2026-08-07T04:36:27.926352Z","submitted_at":"2025-06-11T15:21:16Z","title":"IntPhys 2: Benchmarking Intuitive Physics Understanding In Complex Synthetic Environments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09849","snapshot_observed_at":"2026-08-03T20:23:00.771656Z","title":"Intphys 2: Benchmarking intuitive physics understand- ing in complex synthetic environments.arXiv preprint arXiv:2506.09849, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:00.771656Z"},"links":{"cited_paper":"/paper/2506.09849","citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:0e8d1a93ed1dc7b8b3e23c534e33f43aa13f7a7098734fffb06c00a9f11d8b0f","observation_id":"98860f4a-b3b8-4ce3-91d0-263f87216e4c","resolution":{"observed_at":"2026-08-03T20:23:00.771656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:00.854703Z","title":"Routledge, 1995","venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:00.854703Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:ed8bc2103f99eb218884f351208eff30835ee864391f3c028908024872ebd7ec","observation_id":"0d473e7b-2837-4ab2-b10e-58c29a3aeabb","resolution":{"observed_at":"2026-08-03T20:23:00.854703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:00.937721Z","title":"Activitynet: A large-scale video benchmark for human activity understanding","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:00.937721Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:b66446683cc7c2da8bcf4f916fe900757715cbde602593aa54a5241081e8e711","observation_id":"0c586aa5-8c9d-4252-b923-e4201d3f038e","resolution":{"observed_at":"2026-08-03T20:23:00.937721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:00.971832Z","title":"Rextime: A benchmark suite for reasoning-across-time in videos.Advances in Neural In- formation Processing Systems, 37:28662–28673, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:00.971832Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:17603e8c7e0b3043a098ace0c12b87488a1325f29206e28c95f221fe8da6a018","observation_id":"4715a1fd-4758-4444-81f4-330e1b44d5c2","resolution":{"observed_at":"2026-08-03T20:23:00.971832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:01.064028Z","title":"Are we on the right way for evaluating large vision-language models?Advances in Neural Infor- mation Processing Systems, 37:27056–27087, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:01.064028Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:af197d59c9057b2e55ce99517b5a673e051ec397a94dee2330711103b78efe04","observation_id":"f61da4e4-5d2f-474c-8887-1cd84e193873","resolution":{"observed_at":"2026-08-03T20:23:01.064028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:01.175032Z","title":"Video-holmes: Can mllm think like holmes for complex video reasoning?, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:01.175032Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:fb63c040543e5c3b69bbacee262a68373179640aaa0a4052b469b9465bf826d3","observation_id":"96d07928-9fd3-4a1b-a2cd-89e6c7c79f24","resolution":{"observed_at":"2026-08-03T20:23:01.175032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-03T20:23:01.290978Z","title":"Videollama 2: Advancing spatial- temporal modeling and audio understanding in video-llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:01.290978Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:eb0f411850b946896f43741481810c239672b0b797710a091657c033ca15ac04","observation_id":"ed3b046b-4305-4e84-b01a-dee2201bcd7b","resolution":{"observed_at":"2026-08-03T20:23:01.290978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:01.403982Z","title":"Le, Sergey Levine, and Yi Ma","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:01.403982Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:605960219b585d889271097a0e03be76c99d42eee21cde2e770030ff5069dc7e","observation_id":"cbe8be57-de9b-4f62-8e83-9a4890fa0284","resolution":{"observed_at":"2026-08-03T20:23:01.403982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:01.472386Z","title":"Whatever next? predictive brains, situated agents, and the future of cognitive science.Behavioral and brain sciences, 36(3):181–204, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:01.472386Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:2329393da2d11c2e934a0f351b04d621b1120a3cfb96348c2bb50651e51a9adf","observation_id":"f2bc5c7d-9545-4df6-9dde-7ab60c9cf8a1","resolution":{"observed_at":"2026-08-03T20:23:01.472386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-03T20:23:01.531512Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodal- ity, long context, and next generation agentic capabilities","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:01.531512Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:20aa90499f01915f0e50c47d92fe5f9ccddacf831293fd2f5b729b5a1c5ef5fe","observation_id":"7e7f228a-2550-4553-9916-365f8ead4e66","resolution":{"observed_at":"2026-08-03T20:23:01.531512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:01.579499Z","title":"Instructblip: Towards general- purpose vision-language models with instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:01.579499Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:7950af9bcd56842874cac3490d75a0dcd45772f334312238bd34853cc729e332","observation_id":"5223b74d-761a-450a-9ae5-af8fed1c7b9a","resolution":{"observed_at":"2026-08-03T20:23:01.579499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:01.643970Z","title":"MIT press, 1987","venue":null,"work_id":null,"year":1987},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:01.643970Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:1109b6a64bf326b1270fe95fc5d15e20692e1d6bbbb646b000ea532aaaf606db","observation_id":"ca6d9e86-e844-4883-b7c6-7f82d5ec0538","resolution":{"observed_at":"2026-08-03T20:23:01.643970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:01.727373Z","title":"The llama 3 herd of models.arXiv e-prints, pages arXiv–2407,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:01.727373Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:6153b63cc9d32cd75a540a7e4b8e323ed4cec0c906808000186eefd6f01825c5","observation_id":"35bb7093-aff4-45a3-ba58-47c1837078ba","resolution":{"observed_at":"2026-08-03T20:23:01.727373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:01.812885Z","title":"An argument for basic emotions.Cognition & emotion, 6(3-4):169–200, 1992","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:01.812885Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:e2809dfd2f276c3d4cf183e2623f8d0053f8fac3450041b8a2e9dec441d6ccb7","observation_id":"049c5852-561a-4b6b-9c0a-9ad9ce89d05c","resolution":{"observed_at":"2026-08-03T20:23:01.812885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:01.869913Z","title":"Unreal engine.https : / / www","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:01.869913Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:8c418cee0987eb7b87ef69fed6b226581676c6bb598409c1044a924d23b4c849","observation_id":"15443549-ad36-4cf8-a9df-f10b57c5db37","resolution":{"observed_at":"2026-08-03T20:23:01.869913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21776","snapshot_observed_at":"2026-08-03T20:23:01.923190Z","title":"Video-r1: Reinforcing video reasoning in mllms.arXiv preprint arXiv:2503.21776, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:01.923190Z"},"links":{"cited_paper":"/paper/2503.21776","citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:e0296bc96cce7f4d255d54a5bac99383f372914354cd2b70a2a98b2dd7d5d914","observation_id":"0141789d-b487-475d-867e-941fac8706f2","resolution":{"observed_at":"2026-08-03T20:23:01.923190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:02.003342Z","title":"Material perception.Annual review of vision science, 3:365–388, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:02.003342Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:9afe46d8ebbf03d2ffbd6fae57219759ea97f4d52cf4ac21a0e40316ce6c39ae","observation_id":"df25d2c5-5169-468f-a084-b69b1fc46b41","resolution":{"observed_at":"2026-08-03T20:23:02.003342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:02.033703Z","title":"The free-energy principle: a unified brain the- ory?Nature reviews neuroscience, 11(2):127–138, 2010","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:02.033703Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:3ece94ac41af0c4ce48e486f8215b8c581960e2354fd4e491dc78179c4a6fe4c","observation_id":"6163625b-6a14-42e8-8f7b-afdba3cc4faf","resolution":{"observed_at":"2026-08-03T20:23:02.033703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:02.091017Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:02.091017Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:7a4642f438e318ee661b98a724b49eaefac71e5bacb7c9909fa450ddc574f512","observation_id":"9948e519-a3c9-4ab7-a4cc-a60d18381849","resolution":{"observed_at":"2026-08-03T20:23:02.091017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:02.138277Z","title":"Blink: Multimodal large language models can see but not perceive","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:02.138277Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:2beac662149d7ef6b327f8edb7866304bf236d257e46533e2d8001f7615d3425","observation_id":"2f5062b3-88b0-4b28-bca1-026698eb8739","resolution":{"observed_at":"2026-08-03T20:23:02.138277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05656","last_updated":"2023-09-11T17:50:03Z","snapshot_observed_at":"2026-07-06T16:17:04.004519Z","submitted_at":"2023-09-11T17:50:03Z","title":"Atomistic Control in Molecular Beam Epitaxy Growth of Intrinsic Magnetic Topological Insulator MnBi2Te4","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05656","snapshot_observed_at":"2026-08-03T20:23:02.182852Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models.arXiv preprint arXiv:2309.05656, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:02.182852Z"},"links":{"cited_paper":"/paper/2309.05656","citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:70cf55ab105321ec79422ab1a8710a4cad2e8ddff6e29a6d4abae3d790929bdf","observation_id":"a30fc0d5-5e85-45b8-9ccc-84d95dcfeaf0","resolution":{"observed_at":"2026-08-03T20:23:02.182852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:02.249905Z","title":"Houghton Mifflin, 1979","venue":null,"work_id":null,"year":1979},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:02.249905Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:773f926c502220dd0f066c9a55f06a553f840036279a97a076131ed0bfdae80a","observation_id":"b3b05772-dd96-409b-b6e7-3cbca0d93443","resolution":{"observed_at":"2026-08-03T20:23:02.249905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:02.321899Z","title":"The” something something” video database for learning and evaluating visual common sense","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:02.321899Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:8041c552230a745de1c42b08fd60265fb77a0b64df9876eb093260060b9099f0","observation_id":"37ef0134-653e-4edd-bef5-ff46717a1752","resolution":{"observed_at":"2026-08-03T20:23:02.321899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-03T20:23:02.394429Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:02.394429Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:85239bc26744f0d6db38fc592e4d7139a4ccf50b41fa2fb57640c49a14939257","observation_id":"f3e67a5c-82eb-49a4-b17f-4932b2dacfb9","resolution":{"observed_at":"2026-08-03T20:23:02.394429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:02.480865Z","title":"Hallusionbench: an advanced diagnostic suite for entangled language halluci- nation and visual illusion in large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:02.480865Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:3616734bf6a5fb98ced78b375d22c38e65fb4e1bb3d83fcf7ba10cbf242f9667","observation_id":"0cba16a0-eb5e-4666-88cf-e2a04c2e0cf4","resolution":{"observed_at":"2026-08-03T20:23:02.480865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-03T20:23:02.549143Z","title":"Deepseek-r1: Incentivizing reason- ing capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:02.549143Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:b9e1866bb0df94fe11473a63424918316e561cb9265267564959688d18bb316b","observation_id":"6411cd8f-eded-43a2-b78b-3cae95e7e5d4","resolution":{"observed_at":"2026-08-03T20:23:02.549143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:02.624952Z","title":"Doubleday, 1966","venue":null,"work_id":null,"year":1966},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:02.624952Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:dea90a75d15c7805b396ac07c3e6cf0d653fe6ff264bcb63a2f101fa9041f079","observation_id":"dc1af7d2-65d2-48c4-8ed2-51d6db7532a2","resolution":{"observed_at":"2026-08-03T20:23:02.624952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:02.726794Z","title":"Glm-4.1 v-thinking: Towards versatile multimodal reasoning with scalable reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:02.726794Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:e45425ceb5cec00af2bc77c760c5da0465668a5bb0bf1d034b7821873d68e5bb","observation_id":"10724494-018f-430d-935e-7415a1293efd","resolution":{"observed_at":"2026-08-03T20:23:02.726794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-07-06T20:49:27.466064Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-03T20:23:02.778666Z","title":"Vision-r1: Incentivizing reasoning capability in multimodal large language models.arXiv preprint arXiv:2503.06749,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:02.778666Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:6575a0ff9ff8efa9a83c3e0e64b8ea5606ec559475ad9b2dfe074ee7731151c2","observation_id":"f56e9cb6-14ad-429a-82cd-1483b68685bf","resolution":{"observed_at":"2026-08-03T20:23:02.778666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-03T20:23:02.877204Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:02.877204Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:75aa85a4e085f26da0c90cf7a2d541d190b3223d8f5c26d4d49a039d8ee997df","observation_id":"5f8a72b2-eb6f-47ee-9d55-dd7ae9dce488","resolution":{"observed_at":"2026-08-03T20:23:02.877204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:03.044818Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:03.044818Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:252ab99771298aed57954856a4761e58ae9b52c7bfa76a4120359260c41c2098","observation_id":"678d0199-f37c-47c2-98c6-88ad754fba18","resolution":{"observed_at":"2026-08-03T20:23:03.044818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08825","last_updated":"2024-03-08T02:49:12Z","snapshot_observed_at":"2026-08-06T19:26:27.412366Z","submitted_at":"2023-10-13T02:41:55Z","title":"From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08825","snapshot_observed_at":"2026-08-03T20:23:03.179935Z","title":"From clip to dino: Visual encoders shout in multi-modal large language models.arXiv preprint arXiv:2310.08825, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:03.179935Z"},"links":{"cited_paper":"/paper/2310.08825","citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:a3a98c58248b29e9a8df26cc9c3f982a43aa8fb4aef9c721d78cfad7a5f5a720","observation_id":"da0fb4f2-cd52-41d2-a5f9-f584920f3438","resolution":{"observed_at":"2026-08-03T20:23:03.179935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15316","last_updated":"2024-09-30T19:22:33Z","snapshot_observed_at":"2026-07-06T19:20:37.430389Z","submitted_at":"2024-09-05T16:49:31Z","title":"Towards Social AI: A Survey on Understanding Social Interactions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15316","snapshot_observed_at":"2026-08-03T20:23:03.378338Z","title":"Towards social ai: A survey on understand- ing social interactions.arXiv preprint arXiv:2409.15316,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:03.378338Z"},"links":{"cited_paper":"/paper/2409.15316","citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:8ea55caa671692f249782321d6a03f108237e30604f52fab26cc238d03c7b60d","observation_id":"f9851049-ad81-41e2-94d3-c00edd3d4bf3","resolution":{"observed_at":"2026-08-03T20:23:03.378338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.07999","last_updated":"2020-10-15T19:56:47Z","snapshot_observed_at":"2026-08-06T22:24:57.346555Z","submitted_at":"2020-10-15T19:56:47Z","title":"What is More Likely to Happen Next? Video-and-Language Future Event Prediction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.07999","snapshot_observed_at":"2026-08-03T20:23:03.468092Z","title":"What is more likely to happen next? video-and-language future event prediction.arXiv preprint arXiv:2010.07999,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:03.468092Z"},"links":{"cited_paper":"/paper/2010.07999","citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:90693e978f9a5cf9f69fe74400feacf85050dc51d538febd9d33e4d3da9ebba2","observation_id":"d511dc7e-7895-4907-9c2b-c3b73d49c0dd","resolution":{"observed_at":"2026-08-03T20:23:03.468092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:03.619120Z","title":"Detecting mo- ments and highlights in videos via natural language queries","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:03.619120Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:ec59d0de1d705d8d7e5b76cba3ea8c2ee42743455481bf1c39e787252ea5041d","observation_id":"6f908d3f-9d90-465a-9c6f-a5905c14acff","resolution":{"observed_at":"2026-08-03T20:23:03.619120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15536","last_updated":"2024-01-28T01:26:09Z","snapshot_observed_at":"2026-08-04T19:23:29.916099Z","submitted_at":"2024-01-28T01:26:09Z","title":"Anisotropic flow, flow fluctuation and flow decorrelation in relativistic heavy-ion collisions: the roles of sub-nucleon structure and shear viscosity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15536","snapshot_observed_at":"2026-08-03T20:23:03.810455Z","title":"Seed-bench: Evaluating multimodal llms with generative and discriminative tasks.arXiv preprint arXiv:2401.15536, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:03.810455Z"},"links":{"cited_paper":"/paper/2401.15536","citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:c1933f3d5181ac0c8afe17781d74c7a0568808be6900604a909ec3d46cca6cdd","observation_id":"224dc2ff-e5db-4249-bfec-2fe6ff741b00","resolution":{"observed_at":"2026-08-03T20:23:03.810455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-03T20:23:04.031544Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:04.031544Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:af091631bfa28156ec333417d67f7cbbc699521540d45e0672002f9ff2cccf55","observation_id":"fd73e304-7c6a-4557-b36c-1e76ed112956","resolution":{"observed_at":"2026-08-03T20:23:04.031544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:04.223426Z","title":"From represen- tation to reasoning: Towards both evidence and common- sense reasoning for video question-answering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:04.223426Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:d4fb3849a83397769d6d8890be538d4886e39c0a882d0af9e62be8feb4961080","observation_id":"cf5d0930-c3d0-443f-a63d-92be2ecef23d","resolution":{"observed_at":"2026-08-03T20:23:04.223426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:04.327558Z","title":"Mvbench: A comprehensive multi-modal video under- standing benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:04.327558Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:083331d2ee58cd260ced3f770926d110faab43e82217f2f92ff101cd4bcca0be","observation_id":"f72b758d-fcdf-49d2-b4ba-33bbc058f01c","resolution":{"observed_at":"2026-08-03T20:23:04.327558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:04.422362Z","title":"Pope: A simple method to hallucination eval- uation in visual question answering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:04.422362Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:02a7fd48c65bdddf341c17c9906f7453517b94b32eb762c9d5b1b3c5ce1656e6","observation_id":"4fc421a3-3b21-4ed9-bdc0-1e7dec310b92","resolution":{"observed_at":"2026-08-03T20:23:04.422362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-03T20:23:04.532245Z","title":"Videochat-r1: Enhancing spatio-temporal perception via reinforcement fine-tuning.arXiv preprint arXiv:2504.06958, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:04.532245Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:d57a6ac5458dbb38fccecc0bc41e076c657056038e1c0cffaf410becaea1cd0c","observation_id":"278caf4c-6ebd-4563-beb2-ea12b21b56cc","resolution":{"observed_at":"2026-08-03T20:23:04.532245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10855","last_updated":"2025-06-19T03:48:50Z","snapshot_observed_at":"2026-08-04T20:21:35.651005Z","submitted_at":"2024-10-06T20:13:11Z","title":"Core Knowledge Deficits in Multi-Modal Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10855","snapshot_observed_at":"2026-08-03T20:23:04.626496Z","title":"Core knowledge deficits in multi-modal language models.arXiv preprint arXiv:2410.10855, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:04.626496Z"},"links":{"cited_paper":"/paper/2410.10855","citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:71ca82c168b5f5c586f997f0c902cc3ea19580e154dbe8e9a3a0fc890ac48868","observation_id":"f1a887c0-7353-4b9f-bf56-c24768bc63e2","resolution":{"observed_at":"2026-08-03T20:23:04.626496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.19652","snapshot_observed_at":"2026-08-03T20:23:04.725008Z","title":"Self-rewarding vision- language model via reasoning decomposition.arXiv preprint arXiv:2508.19652, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:04.725008Z"},"links":{"cited_paper":"/paper/2508.19652","citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:279da520074439caf6637b65dce71d46b460ba2b207153a168763296a4bd5c7f","observation_id":"9ea4dfa3-11d9-4158-9b50-b17e8074ccdc","resolution":{"observed_at":"2026-08-03T20:23:04.725008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15401","last_updated":"2024-05-23T11:42:08Z","snapshot_observed_at":"2026-07-06T15:47:15.230195Z","submitted_at":"2023-06-27T11:54:57Z","title":"Explainable Multimodal Emotion Recognition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15401","snapshot_observed_at":"2026-08-03T20:23:04.826214Z","title":"Explainable multimodal emotion recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:04.826214Z"},"links":{"cited_paper":"/paper/2306.15401","citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:e5cb33a97bdb8b0861286ba382f321877d8b2058e0870628420e082cb81e1dc9","observation_id":"a7619fe7-b755-48d1-89b7-3d73dba6fe7b","resolution":{"observed_at":"2026-08-03T20:23:04.826214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.00883","last_updated":"2025-04-14T20:12:57Z","snapshot_observed_at":"2026-07-06T21:02:28.100677Z","submitted_at":"2025-04-01T15:11:11Z","title":"Improved Visual-Spatial Reasoning via R1-Zero-Like Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.00883","snapshot_observed_at":"2026-08-03T20:23:04.926420Z","title":"Improved visual-spatial reasoning via r1-zero-like training.arXiv preprint arXiv:2504.00883, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:04.926420Z"},"links":{"cited_paper":"/paper/2504.00883","citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:85f07ad35da93a6f1085f750f73dc5600695fbd18a1e23ee1c981b46471ecc1e","observation_id":"b4d6e639-687f-48bd-b459-b9d41f707997","resolution":{"observed_at":"2026-08-03T20:23:04.926420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:05.034079Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:05.034079Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:e9c7eadeeac7bdb6e7510c9d8817821064e83c3c2f80f3475c265c367b3a059d","observation_id":"f150adbc-f5dc-46ac-81f6-0a1fa312d5fb","resolution":{"observed_at":"2026-08-03T20:23:05.034079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05935","last_updated":"2025-03-21T10:19:01Z","snapshot_observed_at":"2026-08-06T11:32:00.537531Z","submitted_at":"2024-02-08T18:59:48Z","title":"SPHINX-X: Scaling Data and Parameters for a Family of Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05935","snapshot_observed_at":"2026-08-03T20:23:05.200466Z","title":"Sphinx-x: Scaling data and parameters for a family of multi-modal large language models.arXiv preprint arXiv:2402.05935, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:05.200466Z"},"links":{"cited_paper":"/paper/2402.05935","citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:1766ed487bb03149842a5bfaaf477373998d2d6d27f4a8d35a6450a3cdbbf4b0","observation_id":"9038ad2b-7b01-4e72-b0ee-82aab3cd54fa","resolution":{"observed_at":"2026-08-03T20:23:05.200466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10928","last_updated":"2025-04-19T14:52:08Z","snapshot_observed_at":"2026-07-06T20:22:59.218985Z","submitted_at":"2025-01-19T03:19:47Z","title":"Generative Physical AI in Vision: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10928","snapshot_observed_at":"2026-08-03T20:23:05.304254Z","title":"Generative physical ai in vision: A survey.arXiv preprint arXiv:2501.10928, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:05.304254Z"},"links":{"cited_paper":"/paper/2501.10928","citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:7bf9a5ad5bf5554a6f68bee2002cf0adff8a64d2a4da8d4a69747c1352f8443b","observation_id":"c6d62e94-c635-4f87-a6b4-aa202eed3c8b","resolution":{"observed_at":"2026-08-03T20:23:05.304254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:05.407372Z","title":"Visual instruction tuning.Advances in neural infor- mation processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:05.407372Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:576bcea0aca7288e41e7fa73f60ef77c638561d0040fac521fc5410a9051e702","observation_id":"4725a73b-cd00-4335-bd38-b554a4a47c85","resolution":{"observed_at":"2026-08-03T20:23:05.407372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:05.487338Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:05.487338Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:da3d1d40dc018735ce7d4f938ad17e31ea6bb1c276558b8a53f3d4cc06a767f8","observation_id":"e9aebeb5-ba66-4fb6-b7fc-a4e731d52021","resolution":{"observed_at":"2026-08-03T20:23:05.487338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:05.553933Z","title":"Mafw: A large-scale, multi-modal, compound affective database for dynamic facial expression recognition in the wild","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:05.553933Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:d385c43d9a93567bedd969c442f13501b43e08ffb0c0fd1caf2c8f8df18f3e61","observation_id":"4b6cbdf4-27dd-42ad-b025-e4b7e614b806","resolution":{"observed_at":"2026-08-03T20:23:05.553933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:05.605866Z","title":"Mmbench: Is your multi- modal model an all-around player? InEuropean conference on computer vision, pages 216–233","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:05.605866Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:92b409c11498a38b9c0cf89c12a7569b5c3d76c050409e5aaaac184f430db26a","observation_id":"2c559219-0d9f-435a-a826-b1d462cbcf51","resolution":{"observed_at":"2026-08-03T20:23:05.605866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00476","last_updated":"2024-06-03T04:13:39Z","snapshot_observed_at":"2026-08-04T21:17:37.211833Z","submitted_at":"2024-03-01T12:02:19Z","title":"TempCompass: Do Video LLMs Really Understand Videos?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00476","snapshot_observed_at":"2026-08-03T20:23:05.644159Z","title":"Temp- compass: Do video llms really understand videos?arXiv preprint arXiv:2403.00476, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:05.644159Z"},"links":{"cited_paper":"/paper/2403.00476","citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:418a1079dc7aa83e89256084a256e187e21ff3d7e3c439fbf19ebb7d6553b82e","observation_id":"75e2c42f-5191-4b9b-bbce-3ebab6794364","resolution":{"observed_at":"2026-08-03T20:23:05.644159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:05.701446Z","title":"Videoreasonbench: Can mllms perform vision-centric complex video reasoning?arXiv preprint arXiv:2505.23359, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:05.701446Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:1b9b437ae9cf3eb101d52c01712037f56a390c5bce4aea3d85ef588916d247f8","observation_id":"0eb26b62-1cfd-4c03-b18b-baa9752989bb","resolution":{"observed_at":"2026-08-03T20:23:05.701446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:05.749238Z","title":"When thinking drifts: Evidential grounding for robust video reasoning.arXiv preprint arXiv:2510.06077, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:05.749238Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:1420207a222bef4855c1a9880d3af0ae1e426ae14921a9604bcb8bb7c049b7e1","observation_id":"98b90b1a-9759-4ffa-bb92-81e248525fb2","resolution":{"observed_at":"2026-08-03T20:23:05.749238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:05.792172Z","title":"MIT press, 2010","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:05.792172Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:523dfa66df8117637ab8635eaf23f63e2fb9f1a6531d90cbfad229b58ae07a42","observation_id":"cf187c95-adac-4098-b1bc-88bddfc558b9","resolution":{"observed_at":"2026-08-03T20:23:05.792172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:05.833758Z","title":"Ba- sic books, 1988","venue":null,"work_id":null,"year":1988},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:05.833758Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:7ec9a32bc436719d15b453e98e594a4bed1d7156c73f2e038ef52bf516558754","observation_id":"a349a015-7c69-4313-89ee-8323b3926575","resolution":{"observed_at":"2026-08-03T20:23:05.833758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:05.895137Z","title":"Clarendon Press, 1978","venue":null,"work_id":null,"year":1978},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:05.895137Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:50b555a97664eafff691ae5e24042b10c05fdd4ea086c791e828eedeb0b7833d","observation_id":"e1d5a2e2-5c32-4bba-a7c1-b626cb290a91","resolution":{"observed_at":"2026-08-03T20:23:05.895137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:05.945973Z","title":"On visual knowledge.Frontiers of Information Technology & Electronic Engineering, 20(8):1021–1025,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:05.945973Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:0bb57ed6e09a9bf80f43a7a57e452da38e4f9e870c307fe64dd636a458ba3cf3","observation_id":"2e884371-8bcb-4f6f-b24f-2d478ec58b54","resolution":{"observed_at":"2026-08-03T20:23:05.945973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:05.986585Z","title":"Basic Books, 1954","venue":null,"work_id":null,"year":1954},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:05.986585Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:5ecf2b793a57ad4792454d3de4ab9c336872ae86afa56a32b4d9ba62e86b72d4","observation_id":"8baf9970-6bcf-4ac3-a585-5cac0dc0bd69","resolution":{"observed_at":"2026-08-03T20:23:05.986585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:06.041280Z","title":"Free Press,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:06.041280Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:9e8fa63829081ced1dddf9431143f7abf541f048c8da291f11ed7b91bf85a518","observation_id":"814d2dfb-5841-4200-b9ad-4dbed6af28e2","resolution":{"observed_at":"2026-08-03T20:23:06.041280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:06.169383Z","title":"Does the chimpanzee have a theory of mind?Behavioral and brain sciences, 1 (4):515–526, 1978","venue":null,"work_id":null,"year":1978},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:06.169383Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:0362106f97a723197db8acb3f69281a5106bf549ddbcc37d3b5536559e31b971","observation_id":"383f3a06-06dc-41c2-888f-4915c0f5158e","resolution":{"observed_at":"2026-08-03T20:23:06.169383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:06.206756Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:06.206756Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:93a89b9e144dabde045d63447fbcde59d21e4e8fb350c28c828a14e385f0a64b","observation_id":"8085e3b1-b330-4261-bfe7-ff04d5b2faa8","resolution":{"observed_at":"2026-08-03T20:23:06.206756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:06.241697Z","title":"Robust speech recognition via large-scale weak supervision, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:06.241697Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:e52b2efe7f293d4761dd83f7c2d44c971beee3a1e06affe9d8b1fe33fec8eb8e","observation_id":"76b23818-ceb9-458e-a77e-a1b1a0fec841","resolution":{"observed_at":"2026-08-03T20:23:06.241697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:06.292109Z","title":"Reka flash 3, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:06.292109Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:b09a0c0e62598a8632775f6b20606be86ee58c0bdf960af48534e6d21cb70b0b","observation_id":"8e03999a-7e75-490b-8664-0a14bed4c345","resolution":{"observed_at":"2026-08-03T20:23:06.292109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.07616","last_updated":"2020-02-11T10:05:20Z","snapshot_observed_at":"2026-08-01T11:20:53.002295Z","submitted_at":"2018-03-20T19:29:46Z","title":"IntPhys: A Framework and Benchmark for Visual Intuitive Physics Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.07616","snapshot_observed_at":"2026-08-03T20:23:06.339842Z","title":"Intphys: A framework and benchmark for visual intuitive physics reasoning.arXiv preprint arXiv:1803.07616, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:06.339842Z"},"links":{"cited_paper":"/paper/1803.07616","citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:7ef327a29c3991b43bec0e91f5a85f10506481c351af2b7bbbdb87ddb787f2e6","observation_id":"37092672-20ea-423e-a20d-b2de8430b06b","resolution":{"observed_at":"2026-08-03T20:23:06.339842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:06.400203Z","title":"Wellness Insti- tute, Inc., 2001","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:06.400203Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:47e1851d7cacab778bb3cd5f7843f21f6be2281b93985821c167f1aa19ba681e","observation_id":"0835e414-529d-4a0f-bb76-38dd27af434c","resolution":{"observed_at":"2026-08-03T20:23:06.400203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:06.439459Z","title":"Lawrence Erlbaum Associates, 1977","venue":null,"work_id":null,"year":1977},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:06.439459Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:3157b387f620cfda5eea3101b7a065f6a74cd00bed4c14cffb709e2086823be9","observation_id":"f2da25a9-8ede-48f8-89bd-94ad7b8478ef","resolution":{"observed_at":"2026-08-03T20:23:06.439459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:06.482435Z","title":"Core dimensions of human material perception.Proceedings of the National Academy of Sci- ences, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:06.482435Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:dfa470deba00d6e77b4a9e2b2f7d02447870216b66f88077323c6f925c1f1edd","observation_id":"655df557-4eac-465e-882e-bdf5827dc90f","resolution":{"observed_at":"2026-08-03T20:23:06.482435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-03T20:23:06.535503Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:06.535503Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:6ba3b2575894aa58cbe70552ac94657ca71509679a58e7c17e69621419fbc500","observation_id":"85483ddc-b72c-445c-a6be-a44e7720ef2f","resolution":{"observed_at":"2026-08-03T20:23:06.535503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:06.578820Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:06.578820Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:3363f08fcea49a788bd1ba2626d1f6271e14bdf4a38a599d4d164cfc95269d8d","observation_id":"dd66fe63-c1d4-4f88-802a-62595ad9b606","resolution":{"observed_at":"2026-08-03T20:23:06.578820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18409","last_updated":"2025-02-13T02:37:06Z","snapshot_observed_at":"2026-08-04T15:11:55.782077Z","submitted_at":"2024-02-28T15:28:36Z","title":"A Cognitive Evaluation Benchmark of Image Reasoning and Description for Large Vision-Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18409","snapshot_observed_at":"2026-08-03T20:23:06.635646Z","title":"A cognitive evaluation benchmark of image reasoning and description for large vision-language models.arXiv preprint arXiv:2402.18409, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:06.635646Z"},"links":{"cited_paper":"/paper/2402.18409","citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:6e412e406781abfc6d4c803c83c373ab539dce84d41aa17255058f8267e3e809","observation_id":"4babefde-5f86-4720-bc87-6e121df70ef2","resolution":{"observed_at":"2026-08-03T20:23:06.635646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:06.685266Z","title":"Origins of knowledge.Psychologi- cal review, 99(4):605, 1992","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:06.685266Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:0ed0492b127141015e403607444c54f6800adc5ab683d765cfffbd197123667a","observation_id":"bd8084a8-b7ec-405c-a36d-98be1261629c","resolution":{"observed_at":"2026-08-03T20:23:06.685266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:06.722348Z","title":"Mimo-vl technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:06.722348Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:9fe31fb65db57927e8514f423e9575155874dcef833a2824aa2f0507dc427823","observation_id":"c5496cb1-740a-4094-994e-73864e367016","resolution":{"observed_at":"2026-08-03T20:23:06.722348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-03T20:23:06.763176Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of con- text.arXiv preprint arXiv:2403.05530, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:06.763176Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:ede5f743e2a2bfd8a503cb0cfac0d2b4765e5f450f9add28fa6369149e58960b","observation_id":"595fa52c-9b86-407c-876f-a754121fa28b","resolution":{"observed_at":"2026-08-03T20:23:06.763176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:06.811188Z","title":"Qwen2.5: A party of foundation models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:06.811188Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:c4015e14e79e3f4dc1f4a4136e5456cb42d9a876aa22d126823fe460fb613d32","observation_id":"19aaa2ea-9a29-43ce-92bb-673ffdf86ce9","resolution":{"observed_at":"2026-08-03T20:23:06.811188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:06.869311Z","title":"Trl: Trans- former reinforcement learning.https : / / github","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:06.869311Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:9b979f9035f028158965130f8ff66bfa96bd81a30a21618b2e56aeb3676cf343","observation_id":"300bd0a9-c482-4590-9ca2-ee6940c64633","resolution":{"observed_at":"2026-08-03T20:23:06.869311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14237","last_updated":"2025-03-18T13:15:58Z","snapshot_observed_at":"2026-07-06T20:54:41.254707Z","submitted_at":"2025-03-18T13:15:58Z","title":"Make Your Training Flexible: Towards Deployment-Efficient Video Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14237","snapshot_observed_at":"2026-08-03T20:23:06.938062Z","title":"Make your training flex- ible: Towards deployment-efficient video models.arXiv preprint arXiv:2503.14237, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:06.938062Z"},"links":{"cited_paper":"/paper/2503.14237","citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:a1f9d5aac8e21bb54ff384cfff694c8be64911f2bb24ff4c6492012a5c1bf57a","observation_id":"a632ed77-af1f-40e5-b70b-9ade9057808b","resolution":{"observed_at":"2026-08-03T20:23:06.938062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00741","last_updated":"2024-10-04T16:10:38Z","snapshot_observed_at":"2026-07-06T19:25:19.661028Z","submitted_at":"2024-10-01T14:33:22Z","title":"VideoCLIP-XL: Advancing Long Description Understanding for Video CLIP Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00741","snapshot_observed_at":"2026-08-03T20:23:06.982542Z","title":"Videoclip-xl: Advancing long descrip- tion understanding for video clip models.arXiv preprint arXiv:2410.00741, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:06.982542Z"},"links":{"cited_paper":"/paper/2410.00741","citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:65f19a4b1ee9faa658614ab128ba865e53acebfcdb258429bd6d7ae96ec849a4","observation_id":"7e6f7a3f-13d5-4433-b15e-9a32d1ba58a9","resolution":{"observed_at":"2026-08-03T20:23:06.982542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:07.036858Z","title":"Videorft: Incentivizing video reasoning capabil- ity in mllms via reinforced fine-tuning.arXiv preprint arXiv:2505.12434, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:07.036858Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:08a469636ba47c0ddbb5bcc783e0618687023569f3c3b93d2b033824bde65594","observation_id":"04382e29-c0ac-4578-8504-e3b22ab54b6d","resolution":{"observed_at":"2026-08-03T20:23:07.036858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-03T20:23:07.078012Z","title":"Internvl3","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:07.078012Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:f422d87509adcf0466598b2bf82fd878c6b35e5a68dc89123abfdc2af2a6a538","observation_id":"7976c6c5-d3fa-427d-883a-80ef94acb2d8","resolution":{"observed_at":"2026-08-03T20:23:07.078012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:07.123948Z","title":"Visual knowl- edge in the big model era: Retrospect and prospect.Fron- tiers of Information Technology & Electronic Engineering, 26(1):1–19, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:07.123948Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:498faa9420f1474213bf19f9c960495e194b0538b4d2326bb0633940701714ce","observation_id":"5e3a3b12-e1d4-4821-9fa0-158de14183ab","resolution":{"observed_at":"2026-08-03T20:23:07.123948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:07.176103Z","title":"Internvideo2: Scaling foundation models for multimodal video understanding, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:07.176103Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:204549dd2acc0ce989e348bfd6a6fc1a14d76d4d09bb805d363adc56b04b6f9c","observation_id":"446e61eb-466a-431c-b28f-f2d23c2e59e7","resolution":{"observed_at":"2026-08-03T20:23:07.176103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:07.201464Z","title":"Social-iq 2.0 challenge: Benchmarking multimodal social understanding.https : / / github","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:07.201464Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:56d1846ca967d5c80809e32074ea5ee736394f38f983b5c864cde0cee71618a0","observation_id":"cf47c66d-3022-43d2-8fab-2778e12eba31","resolution":{"observed_at":"2026-08-03T20:23:07.201464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:07.239523Z","title":"Beliefs about beliefs: Representation and constraining function of wrong beliefs in young children’s understanding of deception.Cognition, 13(1):103–128, 1983","venue":null,"work_id":null,"year":1983},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:07.239523Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:88bbe8df1ada518f605578ee8677e41b9e436e8524b668194e4e7453a8b77098","observation_id":"4b7087a9-7e98-47b4-92b3-56b13ebd9674","resolution":{"observed_at":"2026-08-03T20:23:07.239523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-03T10:25:11.936842Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-03T20:23:07.271934Z","title":"Star: A benchmark for situated reason- ing in real-world videos.arXiv preprint arXiv:2405.09711,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:07.271934Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:43e9e7a52e5f33fdb3d76bbcfefa85bbecf87fb953456d3cb63c166ffd0a0535","observation_id":"905837be-2b9a-4bfc-bfc4-713a1d332ae9","resolution":{"observed_at":"2026-08-03T20:23:07.271934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:07.319389Z","title":"Visionary-r1: Mitigating shortcuts in vi- sual reasoning with reinforcement learning.arXiv preprint arXiv:2505.14677, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:07.319389Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:a07727097475b9124e59b96c07584de8e2fa08f61c712db6bf5639204a8132a1","observation_id":"7cceb949-8946-4862-ab0c-74e261ec11a1","resolution":{"observed_at":"2026-08-03T20:23:07.319389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:07.349331Z","title":"Next-qa: Next phase of question-answering to explaining temporal actions","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:07.349331Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:87736501a7c4bde1cfa9b1fbb543cf0ccc9f24265ae7899b6967c2885c0566c3","observation_id":"42a0454b-2425-4809-989e-d2fa46412140","resolution":{"observed_at":"2026-08-03T20:23:07.349331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:07.392482Z","title":"Advancing multi- modal reasoning capabilities of multimodal large language models via visual perception reward.arXiv preprint arXiv:2506.07218, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:07.392482Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:03f4179e72b3296719bac2b2994b59563c783d73c9be35c8a6d8ac97cee87ce5","observation_id":"7330fcfe-4bed-43db-9130-ee96a05e3ba3","resolution":{"observed_at":"2026-08-03T20:23:07.392482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:07.464600Z","title":"Expvid: A benchmark for experi- ment video understanding & reasoning.arXiv preprint arXiv:2510.11606, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:07.464600Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:6ee9930c3fc5474523c0a5dbcaf48956f4cbebabcb9d481163e7c85d9d38c6da","observation_id":"36820249-8bf6-4b53-b020-81b06c3cd21c","resolution":{"observed_at":"2026-08-03T20:23:07.464600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-03T20:23:07.540368Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:07.540368Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:58dea80856ea5a5903385fa2e0f31a19a4c108caf806477b8faa0ac4b786baf6","observation_id":"c280d29b-db4e-4c29-98d3-f92a41a34247","resolution":{"observed_at":"2026-08-03T20:23:07.540368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:23:07.705686Z","title":"Gupta, Rilyn Han, Li Fei-Fei, and Saining Xie","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:07.705686Z"},"links":{"citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:31a024371b2fa8633b830432a9d08e7a1ec1e78a9fb34a718bff7c5574005748","observation_id":"a88715d9-15f4-484d-b8e2-edd3ccdb777f","resolution":{"observed_at":"2026-08-03T20:23:07.705686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":127},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 100 of 127 outbound references and 3 inbound Pith citation observations for arXiv:2511.20272."}