{"as_of":"2026-08-12T18:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:470424150f198a9572fc436377c871f278092c70c8cfa8521e91de1ddea2fe9b","coverage":[{"denominator":94,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":94,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-16T20:10:27.633010Z","state":"measured"},{"denominator":194,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":194,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":102,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T18:48:16.344206Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-08T05:34:32.402425Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":"2408.16500","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-07-08T05:34:32.402425Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","venue":"cs.CV","work_id":"4cd1db02-57ee-4017-9bf2-b9df24e0f9a9","year":2024},"citing_paper":{"arxiv_id":"2406.08035","last_updated":"2025-08-09T10:54:59Z","snapshot_observed_at":"2026-08-08T19:38:26.415599Z","submitted_at":"2024-06-12T09:36:52Z","title":"LVBench: An Extreme Long Video Understanding Benchmark","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-19T11:55:30.048525Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2406.08035"},"observation_digest":"sha256:81921b9cc2d05b6eb8ce71c168664b9b7608754925b55cfec13eade86ae1fbf0","observation_id":"ae03e68c-0b35-47c4-8a43-06f9a44a98fb","resolution":{"observed_at":"2026-05-19T11:55:30.175570Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":"2408.16500","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-07-08T05:34:32.402425Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","venue":"cs.CV","work_id":"4cd1db02-57ee-4017-9bf2-b9df24e0f9a9","year":2024},"citing_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-05-10T18:26:22.224924Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2408.06072"},"observation_digest":"sha256:e96825d4b52007cf47bdaa4982dd8416dbdbc8b957d61dea689a29d04340ddaf","observation_id":"bfb2e576-3c5b-4b29-9add-7a0e9196be4d","resolution":{"observed_at":"2026-05-16T20:10:28.051835Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":"2408.16500","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-07-08T05:34:32.402425Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","venue":"cs.CV","work_id":"4cd1db02-57ee-4017-9bf2-b9df24e0f9a9","year":2024},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:b72a4265ee5c998ccb40092259fa99c5843ff16d95fe116644dd855d9ca24d76","observation_id":"3ed25625-ffcc-4338-b771-77e891f93c84","resolution":{"observed_at":"2026-05-16T20:10:28.051835Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":"2408.16500","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-07-08T05:34:32.402425Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","venue":"cs.CV","work_id":"4cd1db02-57ee-4017-9bf2-b9df24e0f9a9","year":2024},"citing_paper":{"arxiv_id":"2410.05970","last_updated":"2026-04-27T13:16:40Z","snapshot_observed_at":"2026-08-09T08:12:02.284497Z","submitted_at":"2024-10-08T12:17:42Z","title":"PDF-WuKong: A Large Multimodal Model for Efficient Long PDF Reading with End-to-End Sparse Sampling","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-23T19:39:35.147671Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2410.05970"},"observation_digest":"sha256:1bafd34e31907f24a177a2dbad8fb7004328d2f8fef0781cff70d304f7e671cc","observation_id":"eb35f914-a198-4dbf-9193-7bd2b7f97aef","resolution":{"observed_at":"2026-05-23T19:43:23.734159Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":"2408.16500","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-07-08T05:34:32.402425Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","venue":"cs.CV","work_id":"4cd1db02-57ee-4017-9bf2-b9df24e0f9a9","year":2024},"citing_paper":{"arxiv_id":"2410.13891","last_updated":"2026-04-03T02:48:34Z","snapshot_observed_at":"2026-07-06T19:35:35.229351Z","submitted_at":"2024-10-13T11:39:13Z","title":"S$^4$ST: A Strong, Self-transferable, faSt, and Simple Scale Transformation for Transferable Targeted Attack","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-23T19:22:48.087574Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2410.13891"},"observation_digest":"sha256:4939e545fb45ea75fca01c605f09fb038f3b821bd35368e29c2589991ec76c65","observation_id":"80bab832-fcb6-443e-9f08-8096876b0a1b","resolution":{"observed_at":"2026-05-23T19:23:21.732594Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-12T18:31:01.990635Z","title":"Wenbo Hu, Yifan Xu, Yi Li, Weiyue Li, Zeyuan Chen, and Zhuowen Tu","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11479","last_updated":"2025-06-03T01:05:41Z","snapshot_observed_at":"2026-08-12T18:25:50.813903Z","submitted_at":"2024-11-18T11:31:10Z","title":"Value-Spectrum: Quantifying Preferences of Vision-Language Models via Value Decomposition in Social Media Contexts","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-12T18:31:01.990635Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2411.11479"},"observation_digest":"sha256:21774bec5c7d12eb124d516d203ab77c80e21be16b7e35ff88338aa819df912a","observation_id":"861cfd05-a8d1-45ac-8b04-fac18e201ff1","resolution":{"observed_at":"2026-08-12T18:31:01.990635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-12T18:48:16.344206Z","title":"Cogvlm2: Visual language mod- els for image and video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11916","last_updated":"2024-11-18T02:58:37Z","snapshot_observed_at":"2026-08-12T18:42:40.412317Z","submitted_at":"2024-11-18T02:58:37Z","title":"From Words to Structured Visuals: A Benchmark and Framework for Text-to-Diagram Generation and Editing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T18:48:16.344206Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2411.11916"},"observation_digest":"sha256:e222469c8315b4401a8b9f69316dee4f999c24df709fdfe40cad1c4b135a0907","observation_id":"10b97a24-666c-4350-bb70-09030d617967","resolution":{"observed_at":"2026-08-12T18:48:16.344206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-12T14:51:13.200029Z","title":"Cogvlm2: Visual language mod- els for image and video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15268","last_updated":"2024-11-22T12:22:21Z","snapshot_observed_at":"2026-08-12T14:42:59.095462Z","submitted_at":"2024-11-22T12:22:21Z","title":"ICT: Image-Object Cross-Level Trusted Intervention for Mitigating Object Hallucination in Large Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:13.200029Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2411.15268"},"observation_digest":"sha256:8d126862119ff4a7d0d4ec6f93086fcb381f4b83083724bb93efebe82224a447","observation_id":"4cb90199-14d9-4d0b-b297-647d44f44a60","resolution":{"observed_at":"2026-08-12T14:51:13.200029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-12T10:57:49.249681Z","title":"Cogvlm2: Visual language models for image and video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18810","last_updated":"2025-03-19T22:39:25Z","snapshot_observed_at":"2026-08-12T10:49:39.056998Z","submitted_at":"2024-11-27T23:32:54Z","title":"All Seeds Are Not Equal: Enhancing Compositional Text-to-Image Generation with Reliable Random Seeds","version":5},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-12T10:57:49.249681Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2411.18810"},"observation_digest":"sha256:744bde016eff6814c9fdef1ad90513a0f0ce009ee03d0c535c9ddce8a76c16c9","observation_id":"b7e92756-c100-41ac-9710-cc5b51013b8f","resolution":{"observed_at":"2026-08-12T10:57:49.249681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-12T10:44:52.508007Z","title":"Cogvlm2: Visual language mod- els for image and video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00115","last_updated":"2025-01-04T06:16:56Z","snapshot_observed_at":"2026-08-12T10:39:42.542300Z","submitted_at":"2024-11-28T07:01:06Z","title":"OpenHumanVid: A Large-Scale High-Quality Dataset for Enhancing Human-Centric Video Generation","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T10:44:52.508007Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2412.00115"},"observation_digest":"sha256:ee2175289c06ef5fa05d2c4e58432e1e3491f0e804ac04a8fc73875558862544","observation_id":"542f5c65-6096-4cf0-8097-4748a8434ca1","resolution":{"observed_at":"2026-08-12T10:44:52.508007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-11T22:51:11.697842Z","title":"Cogvlm2: Visual language mod- els for image and video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-12T14:10:33.803043Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.697842Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:b53cf3bbb89ced28de6afc05d8da43d9a4c9383580d26297ec1a2531b58d0bf8","observation_id":"a21b01a0-49ff-4cb7-b178-40b54e03990d","resolution":{"observed_at":"2026-08-11T22:51:11.697842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-11T21:29:49.610925Z","title":"Cogvlm2: Visual language mod- els for image and video understanding.arXiv preprint arXiv:2408.16500, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04383","last_updated":"2025-05-29T14:14:03Z","snapshot_observed_at":"2026-08-11T21:21:53.225570Z","submitted_at":"2024-12-05T17:58:43Z","title":"SeeGround: See and Ground for Zero-Shot Open-Vocabulary 3D Visual Grounding","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:49.610925Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2412.04383"},"observation_digest":"sha256:b0f7c9baeddb1ee76334ce04ac2b8f8bc68d8ff1a3c269ee60dbdc92f595d8b3","observation_id":"8bcb7c49-8e65-4f33-9d51-52465e746d80","resolution":{"observed_at":"2026-08-11T21:29:49.610925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-11T21:31:44.375733Z","title":"Cogvlm2: Visual language mod- els for image and video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04449","last_updated":"2025-08-06T16:57:39Z","snapshot_observed_at":"2026-08-11T21:21:37.177352Z","submitted_at":"2024-12-05T18:58:03Z","title":"p-MoD: Building Mixture-of-Depths MLLMs via Progressive Ratio Decay","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T21:31:44.375733Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2412.04449"},"observation_digest":"sha256:756ddb0ffcef1a768d6414cd5c7a0568c3c347951ead4374a6c1cc0922b29a4f","observation_id":"18c8ea42-2691-4d54-9308-bda11e8539d9","resolution":{"observed_at":"2026-08-11T21:31:44.375733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":"2408.16500","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-07-08T05:34:32.402425Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","venue":"cs.CV","work_id":"4cd1db02-57ee-4017-9bf2-b9df24e0f9a9","year":2024},"citing_paper":{"arxiv_id":"2412.06224","last_updated":"2025-02-06T10:14:36Z","snapshot_observed_at":"2026-08-06T17:32:08.916929Z","submitted_at":"2024-12-09T05:55:55Z","title":"Uni-NaVid: A Video-based Vision-Language-Action Model for Unifying Embodied Navigation Tasks","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-16T19:51:36.137985Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2412.06224"},"observation_digest":"sha256:99c57646f19304583052a26309bc723e2090d0fd41df87aa99121e9099612a06","observation_id":"13143aad-217b-4e29-aa85-c10d28e9c651","resolution":{"observed_at":"2026-05-16T20:10:28.051835Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-11T19:09:36.930018Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.07147","last_updated":"2024-12-16T09:28:53Z","snapshot_observed_at":"2026-08-11T19:02:12.714149Z","submitted_at":"2024-12-10T03:12:35Z","title":"MIT-10M: A Large Scale Parallel Corpus of Multilingual Image Translation","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:36.930018Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2412.07147"},"observation_digest":"sha256:04b865d7902d3584d7e7d25da0346b2b64c6d38243b367981465a5d3540d6bc9","observation_id":"1b5bf52b-6207-44ad-b136-1fa758a80eb3","resolution":{"observed_at":"2026-08-11T19:09:36.930018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-11T16:10:28.947119Z","title":"Cogvlm2: Visual language mod- els for image and video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-12T00:02:16.364157Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:28.947119Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:656fa0d643974b6f583af8608a1da254550ec7113e2f19edd62bea601db1c0ad","observation_id":"22c75973-7a83-4169-89d2-a9460907a033","resolution":{"observed_at":"2026-08-11T16:10:28.947119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-11T18:07:09.698224Z","title":"Cogvlm2: Visual language mod- els for image and video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10439","last_updated":"2025-08-28T04:36:42Z","snapshot_observed_at":"2026-08-11T18:00:15.920941Z","submitted_at":"2024-12-11T09:50:35Z","title":"CogNav: Cognitive Process Modeling for Object Goal Navigation with LLMs","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T18:07:09.698224Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2412.10439"},"observation_digest":"sha256:d2be430134ec256087b888202503f31540c68b2110c24ed67ebf19a58e38934e","observation_id":"dd200a4d-45e3-466b-8dc2-98ea4bf95dbf","resolution":{"observed_at":"2026-08-11T18:07:09.698224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-11T16:51:15.146078Z","title":"Cogvlm2: Visual language mod- els for image and video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10471","last_updated":"2025-03-10T03:35:16Z","snapshot_observed_at":"2026-08-12T03:32:43.793989Z","submitted_at":"2024-12-12T23:39:54Z","title":"VCA: Video Curious Agent for Long Video Understanding","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T16:51:15.146078Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2412.10471"},"observation_digest":"sha256:e89200f8fdc4e3934793aa7379d27a02f40922158cdc69a41a92b6396001f593","observation_id":"e8fa3bc7-3dbc-485e-8264-4a12f7377600","resolution":{"observed_at":"2026-08-11T16:51:15.146078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-11T14:32:24.061627Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-11T14:25:38.533595Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:24.061627Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:e086725a2fdf399cb97cdd384ba5050b024517672f5e3132d989c00eca8ef8ca","observation_id":"3853f0ae-45c3-44b3-a537-60687707fd4d","resolution":{"observed_at":"2026-08-11T14:32:24.061627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":"2408.16500","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-07-08T05:34:32.402425Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","venue":"cs.CV","work_id":"4cd1db02-57ee-4017-9bf2-b9df24e0f9a9","year":2024},"citing_paper":{"arxiv_id":"2412.17574","last_updated":"2026-04-13T15:05:36Z","snapshot_observed_at":"2026-07-06T20:12:09.120832Z","submitted_at":"2024-12-23T13:45:56Z","title":"HumanVBench: Probing Human-Centric Video Understanding in MLLMs with Automatically Synthesized Benchmarks","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-23T07:05:08.716223Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2412.17574"},"observation_digest":"sha256:05d1917e28a73a1e0f8d8cc04bcbccec417f14cd8da2aa6baed0709b352c552d","observation_id":"7b3b0cee-ec53-4083-ba9e-33e21ce4bb7f","resolution":{"observed_at":"2026-05-23T07:05:29.249376Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":"2408.16500","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-07-08T05:34:32.402425Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","venue":"cs.CV","work_id":"4cd1db02-57ee-4017-9bf2-b9df24e0f9a9","year":2024},"citing_paper":{"arxiv_id":"2412.21059","last_updated":"2026-01-05T02:39:01Z","snapshot_observed_at":"2026-08-12T07:31:23.124121Z","submitted_at":"2024-12-30T16:24:09Z","title":"VisionReward: Fine-Grained Multi-Dimensional Human Preference Learning for Image and Video Generation","version":4},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-16T11:49:14.698249Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2412.21059"},"observation_digest":"sha256:83b326717d0fa5e39bbfa29daaa9f9f895bd54b199c2d9cdb08c5f189d84f005","observation_id":"28fe57f7-70d8-45a3-a09d-57d8f79cf6d7","resolution":{"observed_at":"2026-05-16T20:10:28.051835Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-10T22:38:08.640912Z","title":"Cogvlm2: Vi- sual language models for image and video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-12T08:44:42.512113Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.640912Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:839d303eacecb98ad08cae1d482315f36bbf8dbaf76e9a1d7d9b453eb62ae321","observation_id":"e17633e3-7103-4a5c-b930-5c03bcfedcc7","resolution":{"observed_at":"2026-08-10T22:38:08.640912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":"2408.16500","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-07-08T05:34:32.402425Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","venue":"cs.CV","work_id":"4cd1db02-57ee-4017-9bf2-b9df24e0f9a9","year":2024},"citing_paper":{"arxiv_id":"2501.01957","last_updated":"2025-10-24T02:32:10Z","snapshot_observed_at":"2026-08-06T10:28:03.148202Z","submitted_at":"2025-01-03T18:59:52Z","title":"VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction","version":4},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-17T21:08:19.570050Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2501.01957"},"observation_digest":"sha256:6bf41d505f19c442c9b644af802c2d93493c62b39fc45d58da4cee1f7fcc101c","observation_id":"d343bc22-7f2c-4a94-b0f6-9c11bb61ee7d","resolution":{"observed_at":"2026-05-17T21:08:19.716043Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":"2408.16500","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-07-08T05:34:32.402425Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","venue":"cs.CV","work_id":"4cd1db02-57ee-4017-9bf2-b9df24e0f9a9","year":2024},"citing_paper":{"arxiv_id":"2501.02955","last_updated":"2026-05-12T15:02:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-06T11:57:38Z","title":"MotionBench: Benchmarking and Improving Fine-grained Video Motion Understanding for Vision Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-23T05:44:31.546843Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2501.02955"},"observation_digest":"sha256:3cf917c9f7e92c457ef2d3465c77effebcfab96e064e682940ec5adf828fb29a","observation_id":"c33e27e4-ab57-4af2-a9f3-b12bea3ee231","resolution":{"observed_at":"2026-05-23T05:45:28.289290Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-10T21:57:14.197014Z","title":"Cogvlm2: Visual language mod- els for image and video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03225","last_updated":"2025-04-09T17:25:07Z","snapshot_observed_at":"2026-08-12T11:36:04.839544Z","submitted_at":"2025-01-06T18:57:31Z","title":"Automated Generation of Challenging Multiple-Choice Questions for Vision Language Model Evaluation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:14.197014Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2501.03225"},"observation_digest":"sha256:784fe4859c822ef246667a552e9191b98e1c472705c61030bf451b5989576825","observation_id":"aa05e9a9-14ce-4327-bdfd-caa8d1658aa0","resolution":{"observed_at":"2026-08-10T21:57:14.197014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-10T17:30:47.844735Z","title":"Cogvlm2: Visual language mod- els for image and video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-11T17:54:08.311392Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.844735Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:96f82dc320faeda7ed09393c3643f56a6677c369c6087ed69832040ce073fe1d","observation_id":"e0be945d-b4ad-488d-954a-f4da9bd4ba9b","resolution":{"observed_at":"2026-08-10T17:30:47.844735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":"2408.16500","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-07-08T05:34:32.402425Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","venue":"cs.CV","work_id":"4cd1db02-57ee-4017-9bf2-b9df24e0f9a9","year":2024},"citing_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"reference_index":153,"source":"pdf_text","source_observed_at":"2026-05-11T01:19:59.603343Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2501.13106"},"observation_digest":"sha256:98c16f95c62da33c5c2c8e24222deea658120a93c3869ad8ef144cfa9c706d67","observation_id":"2d921696-ed34-4e29-871d-1a83a63f7f06","resolution":{"observed_at":"2026-05-16T20:10:28.051835Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-10T15:38:02.989993Z","title":"Cogvlm2: Visual language models for image and video under- standing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13787","last_updated":"2025-01-23T16:04:23Z","snapshot_observed_at":"2026-08-10T19:15:37.342583Z","submitted_at":"2025-01-23T16:04:23Z","title":"Parameter-Efficient Fine-Tuning for Foundation Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T15:38:02.989993Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2501.13787"},"observation_digest":"sha256:c33f65bc6b41b06f6c7d53f23c28a0d7c822c6539c6932b6dcbd3673682a2639","observation_id":"24c36bcd-dbb8-49ab-a937-3ac590d86abb","resolution":{"observed_at":"2026-08-10T15:38:02.989993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":"2408.16500","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-07-08T05:34:32.402425Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","venue":"cs.CV","work_id":"4cd1db02-57ee-4017-9bf2-b9df24e0f9a9","year":2024},"citing_paper":{"arxiv_id":"2501.13918","last_updated":"2025-10-27T08:22:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-23T18:55:41Z","title":"Improving Video Generation with Human Feedback","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-13T15:30:02.578430Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2501.13918"},"observation_digest":"sha256:c78e219665f1b3a690855dd0e9a55ba355340b3fc4a3a5232cc10a7b3c979825","observation_id":"a421bbdd-b9fd-433a-bc95-a95243aa9862","resolution":{"observed_at":"2026-05-16T20:10:28.051835Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-10T15:35:30.140139Z","title":"Cogvlm2: Visual language models for image and video understanding.arXiv preprint arXiv:2408.16500, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-11T01:32:58.320917Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.140139Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:af44c017906d149c70ab329ccbb1d918442b4812c04d17b0432e83eb61b16468","observation_id":"5f20bb0b-ca90-4602-96a2-3f33908ac49d","resolution":{"observed_at":"2026-08-10T15:35:30.140139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-10T13:38:18.716137Z","title":"Cogvlm2: Visual language mod- els for image and video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-12T11:25:29.449646Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.716137Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:f9ba2ee4362ae49853a5c325ca6a5fb586d31136c83c9819e87e93be559574be","observation_id":"ac01ab06-dbdb-4897-a3e3-12b933609d0d","resolution":{"observed_at":"2026-08-10T13:38:18.716137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-09T21:39:21.697649Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-10T12:01:17.734125Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.697649Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:d83b3cb2d549a2e90c0bdf200409f58afde7ca19cbd0d2a93146c66a312d4b7f","observation_id":"41854b49-82df-4c20-af01-61df17409811","resolution":{"observed_at":"2026-08-09T21:39:21.697649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-09T19:12:56.065018Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00425","last_updated":"2025-08-10T04:13:03Z","snapshot_observed_at":"2026-08-11T03:00:26.939226Z","submitted_at":"2025-02-01T13:08:02Z","title":"MQuant: Unleashing the Inference Potential of Multimodal Large Language Models via Full Static Quantization","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-09T19:12:56.065018Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2502.00425"},"observation_digest":"sha256:df3989eda51e38a8d3db470368cceb0eb03414affa75b3bdb61e56bf4805d897","observation_id":"d5152635-448a-4b1e-884c-1d77e25ade10","resolution":{"observed_at":"2026-08-09T19:12:56.065018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-08T14:34:02.009863Z","title":"Cogvlm2: Vi- sual language models for image and video understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06734","last_updated":"2025-03-12T07:47:48Z","snapshot_observed_at":"2026-08-09T23:56:56.358848Z","submitted_at":"2025-02-10T17:58:22Z","title":"Se\\~norita-2M: A High-Quality Instruction-based Dataset for General Video Editing by Video Specialists","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-08T14:34:02.009863Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2502.06734"},"observation_digest":"sha256:3f5c451ed8acb0791ee305a8b6003aa6b7db8a6da01b643361c2ec910a68630f","observation_id":"ccf3b396-b07e-4a72-b983-5689db8bcda2","resolution":{"observed_at":"2026-08-08T14:34:02.009863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-08T12:54:56.189601Z","title":"Cogvlm2: Visual language mod- els for image and video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-10T04:36:21.525026Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.189601Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:f966bcdd46ac9e024ba7f78c784c1f7bd290e31bc42280d05e69cd8f642f0626","observation_id":"b749407b-50fe-48b0-a978-ce8c3d8f9694","resolution":{"observed_at":"2026-08-08T12:54:56.189601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":"2408.16500","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-07-08T05:34:32.402425Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","venue":"cs.CV","work_id":"4cd1db02-57ee-4017-9bf2-b9df24e0f9a9","year":2024},"citing_paper":{"arxiv_id":"2503.23137","last_updated":"2026-04-15T02:38:45Z","snapshot_observed_at":"2026-08-12T16:01:25.076287Z","submitted_at":"2025-03-29T16:08:51Z","title":"When 'YES' Meets 'BUT': Can Large Models Comprehend Contradictory Humor Through Comparative Reasoning?","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-22T22:38:35.969273Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2503.23137"},"observation_digest":"sha256:5a7a3bf9d643f177a92dbb9f8d534c03a34de422f46ee1e542da845e7698f46e","observation_id":"d396599b-5e37-499d-a6da-3a60182807c4","resolution":{"observed_at":"2026-05-22T22:42:13.561704Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":"2408.16500","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-07-08T05:34:32.402425Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","venue":"cs.CV","work_id":"4cd1db02-57ee-4017-9bf2-b9df24e0f9a9","year":2024},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:446202e5f0598a98f6b63330a1b5e36b8cc65602cbf3d63ee2eee1a16c113741","observation_id":"41cec851-faf3-49cf-b7bf-c6f8af1032d0","resolution":{"observed_at":"2026-05-22T22:47:13.016745Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-07T15:41:22.143040Z","title":"Cogvlm2: Visual language models for image and video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14289","last_updated":"2026-06-05T10:24:33Z","snapshot_observed_at":"2026-08-07T15:34:54.479489Z","submitted_at":"2025-05-20T12:41:05Z","title":"EVA: Evolving Semantic Adversaries for Red-Teaming GUI Agents Against Environmental Injection Attacks","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:41:22.143040Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2505.14289"},"observation_digest":"sha256:5b4f6191808d4fb6da22ff346e89c1255c3a592a9972083ef23c95b331c1b2db","observation_id":"e153ab84-b985-404f-b405-86e22a50c706","resolution":{"observed_at":"2026-08-07T15:41:22.143040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-07T15:21:04.051014Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-12T00:33:16.331090Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:04.051014Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:b1a5f7d3cae4f65f02956bcb116c7abeed494d91bf0088c96b752228f301693d","observation_id":"6425c5f5-2628-4408-8271-946a7a686471","resolution":{"observed_at":"2026-08-07T15:21:04.051014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-07T15:06:33.405736Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17144","last_updated":"2025-05-22T07:30:01Z","snapshot_observed_at":"2026-08-10T16:23:31.450026Z","submitted_at":"2025-05-22T07:30:01Z","title":"MDIT-Bench: Evaluating the Dual-Implicit Toxicity in Large Multimodal Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T15:06:33.405736Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2505.17144"},"observation_digest":"sha256:eeb33bef6f5fb74c734c851f25ef5fd2707ea84c99d187bb3264538923e2dae0","observation_id":"572b17a5-5d92-4dd8-82a7-d80b6564bfda","resolution":{"observed_at":"2026-08-07T15:06:33.405736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":"2408.16500","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-07-08T05:34:32.402425Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","venue":"cs.CV","work_id":"4cd1db02-57ee-4017-9bf2-b9df24e0f9a9","year":2024},"citing_paper":{"arxiv_id":"2505.21282","last_updated":"2026-04-19T13:43:39Z","snapshot_observed_at":"2026-08-05T20:01:00.305386Z","submitted_at":"2025-05-27T14:51:34Z","title":"EgoWalk: A Multimodal Dataset for Robot Navigation in the Wild","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-19T12:56:30.634284Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2505.21282"},"observation_digest":"sha256:a5b2a60e5d4d9795c9bb5c5ce75b1ea53ca52b5f6941a16f6ec58bdb7bbdb6d1","observation_id":"429f532a-e99e-4441-b5b6-32b649924ea2","resolution":{"observed_at":"2026-05-19T12:57:17.687038Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":"2408.16500","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-07-08T05:34:32.402425Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","venue":"cs.CV","work_id":"4cd1db02-57ee-4017-9bf2-b9df24e0f9a9","year":2024},"citing_paper":{"arxiv_id":"2505.21374","last_updated":"2025-05-27T16:05:01Z","snapshot_observed_at":"2026-08-06T04:32:21.352745Z","submitted_at":"2025-05-27T16:05:01Z","title":"Video-Holmes: Can MLLM Think Like Holmes for Complex Video Reasoning?","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-17T05:40:55.944288Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2505.21374"},"observation_digest":"sha256:f818577debeca257449febc14bba0ccc3e8694f8159382805515c5a111e503de","observation_id":"537f7211-5ccc-4a13-9826-b8b7293b8a29","resolution":{"observed_at":"2026-05-17T05:40:56.007393Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-07T13:12:16.099070Z","title":"Cogvlm2: Visual language mod- els for image and video understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:16.099070Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:f4b808cca6e417ce8fa0ac9b175885451257824079944cb18f311fed31c0fd04","observation_id":"5426ae40-e7e6-4ba6-bb60-6b115f0d2f4a","resolution":{"observed_at":"2026-08-07T13:12:16.099070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-07T13:08:03.626178Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:03.626178Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:99fd831168d6bb18312f4bd775202d0f6d1ec38e51729d5fbb5b7420810a434a","observation_id":"a683d7db-d212-4e2f-92ee-460c5bb7e6bc","resolution":{"observed_at":"2026-08-07T13:08:03.626178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-07T12:48:02.656403Z","title":"Cogvlm2: Visual language models for image and video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23484","last_updated":"2025-05-29T14:34:25Z","snapshot_observed_at":"2026-08-09T05:32:01.732887Z","submitted_at":"2025-05-29T14:34:25Z","title":"VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:02.656403Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2505.23484"},"observation_digest":"sha256:2dc145b375d7fb78a6a3b63b6175e06d0755db8ded6e2693d76e8ef76fd47072","observation_id":"91c67106-19dc-4238-9ca3-0e6c841ed35d","resolution":{"observed_at":"2026-08-07T12:48:02.656403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-07T12:21:38.829107Z","title":"Cogvlm2: Visual language models for image and video understanding.arXiv preprint arXiv:2408.16500, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24873","last_updated":"2025-05-30T17:59:45Z","snapshot_observed_at":"2026-08-12T07:26:46.273952Z","submitted_at":"2025-05-30T17:59:45Z","title":"MiniMax-Remover: Taming Bad Noise Helps Video Object Removal","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:38.829107Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2505.24873"},"observation_digest":"sha256:6faad7f83f52545677459efa1948aa01c0daae9cc328ea0f1d64c95a631debe1","observation_id":"f617f3a5-e179-45cd-86e8-ac1931bcd33a","resolution":{"observed_at":"2026-08-07T12:21:38.829107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-07T11:55:23.590215Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00991","last_updated":"2025-08-05T09:17:28Z","snapshot_observed_at":"2026-08-07T22:16:51.729179Z","submitted_at":"2025-06-01T12:46:14Z","title":"GOBench: Benchmarking Geometric Optics Generation and Understanding of MLLMs","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:23.590215Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2506.00991"},"observation_digest":"sha256:44b0b8410ca71309ebb8bc2453835173f6a54af8438ca62eebf113a4dc7d5286","observation_id":"8d794475-5b78-48a6-9ad6-cbca8d7d57bb","resolution":{"observed_at":"2026-08-07T11:55:23.590215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-07T11:39:52.921977Z","title":"Cogvlm2: Visual language models for image and video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-12T13:30:50.947331Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:39:52.921977Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:3a9f9c5e557e5d0645be370c903f33307cc645c95af18dd1e9be8f092782bbf6","observation_id":"33795074-5261-4f2d-a544-74a39440397d","resolution":{"observed_at":"2026-08-07T11:39:52.921977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-07T11:14:44.036808Z","title":"CogVLM2: Visual language models for image and video understanding.arXiv:2408.16500, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03150","last_updated":"2025-06-03T17:59:52Z","snapshot_observed_at":"2026-08-09T04:47:45.249838Z","submitted_at":"2025-06-03T17:59:52Z","title":"IllumiCraft: Unified Geometry and Illumination Diffusion for Controllable Video Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:44.036808Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2506.03150"},"observation_digest":"sha256:bd4fe638623d87fe817f2b419eeb732a903027512f4fad53b24cdd5b3d161470","observation_id":"3c67805f-ff99-426e-8c56-684306e97bc9","resolution":{"observed_at":"2026-08-07T11:14:44.036808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-07T10:52:35.680171Z","title":"Cogvlm2: Visual language models for image and video understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.680171Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:98cb7555e0d66e32c795ee33b7c21291bbc18ee45cd6f327c203b2cd439b69e7","observation_id":"54be0b75-8e85-4d36-95de-86a8a0f15c25","resolution":{"observed_at":"2026-08-07T10:52:35.680171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-07T10:50:50.116063Z","title":"Edward J Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04228","last_updated":"2025-06-04T17:59:58Z","snapshot_observed_at":"2026-08-12T17:13:18.985268Z","submitted_at":"2025-06-04T17:59:58Z","title":"LayerFlow: A Unified Model for Layer-aware Video Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:50.116063Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2506.04228"},"observation_digest":"sha256:f15e3fe7164f7bc8ff91453a913cafc6d43c1bd96869addb3a08640e5e6b2b4d","observation_id":"4fbc802f-525f-457b-a1cc-6b238be05542","resolution":{"observed_at":"2026-08-07T10:50:50.116063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-07T10:27:05.505880Z","title":"Cogvlm2: Visual language models for image and video understanding.arXiv preprint arXiv:2408.16500, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.505880Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:8a44c0e58b30d8d2c3d1008d6e94721dc09de6aaf2a0e34aefe98076b6784d92","observation_id":"46c9b6b1-1bdf-47dc-9e13-ea4ac9dc1f34","resolution":{"observed_at":"2026-08-07T10:27:05.505880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-07T04:58:55.911607Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-09T21:59:37.409544Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:55.911607Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:96bf08814fe550b367a42921477d6dda5c58382d354e54c51ef65600a2f94444","observation_id":"f76c8697-c3b6-44c8-8c19-bafeb7f3a54f","resolution":{"observed_at":"2026-08-07T04:58:55.911607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-07T04:48:24.087480Z","title":"arXiv preprint arXiv:2408.16500 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09665","last_updated":"2025-06-16T12:02:05Z","snapshot_observed_at":"2026-08-09T18:42:47.872177Z","submitted_at":"2025-06-11T12:36:49Z","title":"VideoMat: Extracting PBR Materials from Video Diffusion Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T04:48:24.087480Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2506.09665"},"observation_digest":"sha256:1353fa16a8ca713e4ccfc739403c32a0c9f7e194c94d4c8493995ccda3cdf45a","observation_id":"75504491-fbe0-40f5-9b1f-cbf7465bca9c","resolution":{"observed_at":"2026-08-07T04:48:24.087480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-07T11:12:03.375223Z","title":"CogVLM2: Visual language mod- els for image and video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14808","last_updated":"2025-06-03T19:42:32Z","snapshot_observed_at":"2026-08-10T10:07:25.321698Z","submitted_at":"2025-06-03T19:42:32Z","title":"PARC: A Quantitative Framework Uncovering the Symmetries within Vision Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:03.375223Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2506.14808"},"observation_digest":"sha256:4e5358f9e4e70e41321a0d736220cfc996af40e3c301d40d87a84be34c68bca0","observation_id":"19ba0531-62db-4840-8e20-4266b6af1531","resolution":{"observed_at":"2026-08-07T11:12:03.375223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-06T23:57:22.901966Z","title":"arXiv preprint arXiv:2408.16500 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15681","last_updated":"2026-06-25T14:33:27Z","snapshot_observed_at":"2026-08-08T08:54:57.204006Z","submitted_at":"2025-06-18T17:59:49Z","title":"GenRecal: Generation after Recalibration from Large to Small Vision-Language Models","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:22.901966Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2506.15681"},"observation_digest":"sha256:b04b2bb5cc506233b00fdabd8e1b862ba1f65ad41cf4add0dfedc27761764693","observation_id":"fdf1a535-d8e8-4c25-858e-fde0cda07149","resolution":{"observed_at":"2026-08-06T23:57:22.901966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-06T22:18:39.318280Z","title":"arXiv:2408.16500 [cs.CV]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21962","last_updated":"2025-06-27T07:09:46Z","snapshot_observed_at":"2026-08-09T05:08:46.218478Z","submitted_at":"2025-06-27T07:09:46Z","title":"AnyAni: An Interactive System with Generative AI for Animation Effect Creation and Code Understanding in Web Development","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T22:18:39.318280Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2506.21962"},"observation_digest":"sha256:c57005207856f25804b0853d252f5a885274e7f58fc6e2e9b209522c34c0a8e3","observation_id":"ae57d9f2-bfa5-4289-ad01-016bac8bedbb","resolution":{"observed_at":"2026-08-06T22:18:39.318280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-06T21:44:56.136017Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23590","last_updated":"2025-06-30T07:52:36Z","snapshot_observed_at":"2026-08-10T16:12:19.318933Z","submitted_at":"2025-06-30T07:52:36Z","title":"CAI: Caption-Sensitive Attention Intervention for Mitigating Object Hallucination in Large Vision-Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T21:44:56.136017Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2506.23590"},"observation_digest":"sha256:433b670b59bc2e08cd1781b33989dd7a4c33d051fefc118ae1df8008b74af3e1","observation_id":"8cb5907f-1712-434a-b50f-90b64a967961","resolution":{"observed_at":"2026-08-06T21:44:56.136017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":"2408.16500","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-07-08T05:34:32.402425Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","venue":"cs.CV","work_id":"4cd1db02-57ee-4017-9bf2-b9df24e0f9a9","year":2024},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-08-03T18:50:30.558321Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:b0cbdf55969d705d35954393ea46a6a8afe559ed9859ae0ef97c2a30a98fec76","observation_id":"c18bd244-ec45-4b50-8fdd-e5e641b6b1d3","resolution":{"observed_at":"2026-05-16T20:10:28.051835Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-06T20:44:00.477581Z","title":"Cogvlm2: Visual language mod- els for image and video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-09T14:38:44.861382Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:00.477581Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:6ccea59730223a90167417c3596e208cbe3bb7f811ba029dac42656a9d5aafb8","observation_id":"cf4e2d1c-22da-461c-97af-ba5d821a63f1","resolution":{"observed_at":"2026-08-06T20:44:00.477581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-06T21:22:27.120045Z","title":"Cogvlm2: Visual language models for image and video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-08T00:06:19.287707Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.120045Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:ece3667a3a1672018bd94cb3e4b593db4cc81ddaead89d11693232959319e277","observation_id":"ee2df0b5-ed51-4e1a-8ae4-659f11bf2e08","resolution":{"observed_at":"2026-08-06T21:22:27.120045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-06T21:19:34.077710Z","title":"arXiv preprint arXiv:2408.16500 (2024) 14","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02984","last_updated":"2025-07-28T05:53:50Z","snapshot_observed_at":"2026-08-07T08:32:24.456726Z","submitted_at":"2025-07-01T08:24:51Z","title":"From Answers to Rationales: Self-Aligning Multimodal Reasoning with Answer-Oriented Chain-of-Thought","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:34.077710Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2507.02984"},"observation_digest":"sha256:f4a55bf9d034d9f70c4814376edf96ac6c0037eabd69a1eeda52c809fbb487f8","observation_id":"fe18d58a-759a-4aeb-a4ab-e676cca4ece0","resolution":{"observed_at":"2026-08-06T21:19:34.077710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-06T17:55:45.294752Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09693","last_updated":"2025-07-13T16:09:58Z","snapshot_observed_at":"2026-08-10T16:27:53.336213Z","submitted_at":"2025-07-13T16:09:58Z","title":"ExpStar: Towards Automatic Commentary Generation for Multi-discipline Scientific Experiments","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T17:55:45.294752Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2507.09693"},"observation_digest":"sha256:469f1446cd4110763b97e8ed6d2792b442d1ce42623642377d66191ff4bb89fb","observation_id":"af92a477-8330-412a-944c-438aea6291d5","resolution":{"observed_at":"2026-08-06T17:55:45.294752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-06T17:43:53.061653Z","title":"Cogvlm2: Visual language models for image and video understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10087","last_updated":"2025-07-14T09:13:07Z","snapshot_observed_at":"2026-08-12T18:23:14.296455Z","submitted_at":"2025-07-14T09:13:07Z","title":"Foundation Model Driven Robotics: A Comprehensive Review","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T17:43:53.061653Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2507.10087"},"observation_digest":"sha256:8205431deb054fe09c1e1b3e7b34ca466eb91de42ee0385e005b6bc10c7082ae","observation_id":"e1c538fe-0dbf-4454-9c19-4e70034d0425","resolution":{"observed_at":"2026-08-06T17:43:53.061653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-06T16:39:34.667066Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12956","last_updated":"2025-07-17T09:50:43Z","snapshot_observed_at":"2026-08-10T05:19:16.514953Z","submitted_at":"2025-07-17T09:50:43Z","title":"FantasyPortrait: Enhancing Multi-Character Portrait Animation with Expression-Augmented Diffusion Transformers","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T16:39:34.667066Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2507.12956"},"observation_digest":"sha256:58047783f0ae78c10e42877385705f23f9ec32543b270f1c451d8d69cb26fa96","observation_id":"4b0f739b-1099-42e8-ad53-78744aec49e6","resolution":{"observed_at":"2026-08-06T16:39:34.667066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-06T11:34:26.624192Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22617","last_updated":"2025-07-30T12:37:29Z","snapshot_observed_at":"2026-08-06T22:42:04.029387Z","submitted_at":"2025-07-30T12:37:29Z","title":"Hate in Plain Sight: On the Risks of Moderating AI-Generated Hateful Illusions","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:26.624192Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2507.22617"},"observation_digest":"sha256:eb1c15c0738cebadf9b9dc88adac2955fd477118363fe73f84bd30a43e4c8729","observation_id":"f560e7b0-eef2-4c07-84fb-f2935996c012","resolution":{"observed_at":"2026-08-06T11:34:26.624192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-06T10:10:57.591421Z","title":"Cogvlm2: Visual language models for image and video understanding.arXiv preprint arXiv:2408.16500, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.00447","last_updated":"2025-08-01T09:08:10Z","snapshot_observed_at":"2026-08-10T03:49:48.779541Z","submitted_at":"2025-08-01T09:08:10Z","title":"CLIPTime: Time-Aware Multimodal Representation Learning from Images and Text","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T10:10:57.591421Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2508.00447"},"observation_digest":"sha256:457aa978149c627f5c08d6cc17a1f99fae951d734e5d8ea51c473354d1cfdcd6","observation_id":"88a1cdb1-3f66-4c60-9aaf-442fd10cca4d","resolution":{"observed_at":"2026-08-06T10:10:57.591421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-06T05:46:59.364916Z","title":"Cogvlm2: Vi- sual language models for image and video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01233","last_updated":"2025-08-02T07:09:17Z","snapshot_observed_at":"2026-08-07T01:10:11.222770Z","submitted_at":"2025-08-02T07:09:17Z","title":"Detailed radial scale height profile of dust grains as probed by dust self-scattering in HL Tau","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T05:46:59.364916Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2508.01233"},"observation_digest":"sha256:b109fce56f06f91ec2fc09ec83a15f30701965d1d2a55f9375e118cc0dfe7703","observation_id":"b2590721-641b-4a1e-a652-db841f948b71","resolution":{"observed_at":"2026-08-06T05:46:59.364916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-06T05:48:15.980138Z","title":"Cogvlm2: Vi- sual language models for image and video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01237","last_updated":"2025-08-02T07:22:51Z","snapshot_observed_at":"2026-08-12T10:13:05.349042Z","submitted_at":"2025-08-02T07:22:51Z","title":"SketchAgent: Generating Structured Diagrams from Hand-Drawn Sketches","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T05:48:15.980138Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2508.01237"},"observation_digest":"sha256:506f0b26e48bc547be8c1a58801dac8dcc73fd8b2a8856c9ffb061575e39e56b","observation_id":"eb9829c8-d950-44cf-a218-957407b31b1f","resolution":{"observed_at":"2026-08-06T05:48:15.980138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-05T18:40:33.705789Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.14405","last_updated":"2025-08-20T04:03:54Z","snapshot_observed_at":"2026-08-12T12:52:56.251618Z","submitted_at":"2025-08-20T04:03:54Z","title":"CTA-Flux: Integrating Chinese Cultural Semantics into High-Quality English Text-to-Image Communities","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T18:40:33.705789Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2508.14405"},"observation_digest":"sha256:fdcfbc07f1eb532621098423121d2184cab319bf276915bc1b35b31e89562c86","observation_id":"cf623911-4578-4e0b-aae1-804bbb548cce","resolution":{"observed_at":"2026-08-05T18:40:33.705789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-05T12:27:27.345868Z","title":"Cogvlm2: Visual language models for image and video understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-08T14:14:58.948394Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.345868Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:ab15f003714acdb8b1200c9ef4cff1b3d67ea6783bc96c2bda5c555f7d36a23e","observation_id":"e7d8a105-9d58-482a-a151-9c16b8c07adb","resolution":{"observed_at":"2026-08-05T12:27:27.345868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-05T10:58:16.100830Z","title":"Cogvlm2: Visual language mod- els for image and video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03501","last_updated":"2025-09-03T17:33:20Z","snapshot_observed_at":"2026-08-07T14:11:47.550063Z","submitted_at":"2025-09-03T17:33:20Z","title":"Strefer: Empowering Video LLMs with Space-Time Referring and Reasoning via Synthetic Instruction Data","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T10:58:16.100830Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2509.03501"},"observation_digest":"sha256:12656c348a2e94ed1758e4b252ee9924021854f15feb3f9373ff55d7f66b38ee","observation_id":"6b30dc52-6e55-4609-94cd-8a3165b86594","resolution":{"observed_at":"2026-08-05T10:58:16.100830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":"2408.16500","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-07-08T05:34:32.402425Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","venue":"cs.CV","work_id":"4cd1db02-57ee-4017-9bf2-b9df24e0f9a9","year":2024},"citing_paper":{"arxiv_id":"2509.14977","last_updated":"2026-07-27T09:29:16Z","snapshot_observed_at":"2026-08-04T16:15:47.555876Z","submitted_at":"2025-09-18T14:07:53Z","title":"EchoVLM: Dynamic Mixture-of-Experts Vision-Language Model for Universal Ultrasound Intelligence","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-18T16:04:11.834915Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2509.14977"},"observation_digest":"sha256:3bb5765b1476cfc52ecf2ccd3c3c55c15eff623094ccccacdc797339475f017d","observation_id":"f19733e0-5fd9-486a-93cb-e830037cad92","resolution":{"observed_at":"2026-05-18T16:06:35.099190Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-04T16:15:50.676012Z","title":"arXiv:2408.16500","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.14977","last_updated":"2026-07-27T09:29:16Z","snapshot_observed_at":"2026-08-04T16:15:47.555876Z","submitted_at":"2025-09-18T14:07:53Z","title":"EchoVLM: Dynamic Mixture-of-Experts Vision-Language Model for Universal Ultrasound Intelligence","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T16:15:50.676012Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2509.14977"},"observation_digest":"sha256:b9fc7ace398f61092c428558855e096a4356b188e8281331e6f063a4acec9838","observation_id":"a0652a44-4016-42ae-a5d1-601fca47aee9","resolution":{"observed_at":"2026-08-04T16:15:50.676012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-04T10:18:42.991905Z","title":"Cogvlm2: Visual language models for image and video understanding.arXiv preprint arXiv:2408.16500,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.10921","last_updated":"2026-05-25T02:35:42Z","snapshot_observed_at":"2026-08-04T10:18:40.408381Z","submitted_at":"2025-10-13T02:32:07Z","title":"FG-CLIP 2: A Bilingual Fine-grained Vision-Language Alignment Model","version":3},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-04T10:18:42.991905Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2510.10921"},"observation_digest":"sha256:c45663eaa503d4b5a925165142de50df0f4ab158d3c5882ac2e34abfc08bfbb3","observation_id":"3215cbe9-0022-45f5-ba4b-b5c0262f5d43","resolution":{"observed_at":"2026-08-04T10:18:42.991905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-03T18:30:03.280897Z","title":"Cogvlm2: Visual language mod- els for image and video understanding.arXiv preprint arXiv:2408.16500, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.05044","last_updated":"2026-07-08T17:50:45Z","snapshot_observed_at":"2026-08-12T07:48:24.595379Z","submitted_at":"2025-12-04T17:59:10Z","title":"Geometry-Aware Single-Image 4D Synthesis via Dense Trajectory Generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T18:30:03.280897Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2512.05044"},"observation_digest":"sha256:444777f552f284b52acbe0cbac94333e0bb3e7ddc4cc744ec3e25c919fe26f5b","observation_id":"65acc6f3-cd13-4534-b900-bac1388877c0","resolution":{"observed_at":"2026-08-03T18:30:03.280897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":"2408.16500","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-07-08T05:34:32.402425Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","venue":"cs.CV","work_id":"4cd1db02-57ee-4017-9bf2-b9df24e0f9a9","year":2024},"citing_paper":{"arxiv_id":"2512.21815","last_updated":"2026-06-29T08:03:34Z","snapshot_observed_at":"2026-08-11T15:48:09.383072Z","submitted_at":"2025-12-26T01:01:25Z","title":"High-Entropy Tokens as Multimodal Failure Points in Vision-Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T19:29:43.382392Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2512.21815"},"observation_digest":"sha256:37d91cea62912136646c26d68d2a185cb77c8beb29f812b70bb7423f475fcc89","observation_id":"cc137128-489f-4e02-a161-27f53335a197","resolution":{"observed_at":"2026-05-16T20:10:28.051835Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-03T14:05:23.078713Z","title":"Cogvlm2: Visual language models for image and video understanding.CoRR, abs/2408.16500,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.21815","last_updated":"2026-06-29T08:03:34Z","snapshot_observed_at":"2026-08-11T15:48:09.383072Z","submitted_at":"2025-12-26T01:01:25Z","title":"High-Entropy Tokens as Multimodal Failure Points in Vision-Language Models","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T14:05:23.078713Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2512.21815"},"observation_digest":"sha256:b61e3256be4f9fce07d351b0d3631e4386cac5e6161d501448bcf892004bc38e","observation_id":"671de08b-2c86-4874-98ed-33ccf864a62e","resolution":{"observed_at":"2026-08-03T14:05:23.078713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-03T13:15:30.305563Z","title":"Cogvlm2: Visual language models for image and video understanding.arXiv preprint arXiv:2408.16500,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24946","last_updated":"2026-06-24T14:47:42Z","snapshot_observed_at":"2026-08-11T00:16:46.348893Z","submitted_at":"2025-12-31T16:18:07Z","title":"HaineiFRDM: Structure-Preserving Diffusion for Film Restoration under Fast Motion and Diverse Defects","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T13:15:30.305563Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2512.24946"},"observation_digest":"sha256:8b53306ffa1fdd4cb563875984c75e070da5d39abc873784d009ce92b3db1045","observation_id":"08af0cf1-b685-4976-8e52-8b998fb76eea","resolution":{"observed_at":"2026-08-03T13:15:30.305563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":"2408.16500","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-07-08T05:34:32.402425Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","venue":"cs.CV","work_id":"4cd1db02-57ee-4017-9bf2-b9df24e0f9a9","year":2024},"citing_paper":{"arxiv_id":"2601.23286","last_updated":"2026-06-07T21:12:04Z","snapshot_observed_at":"2026-08-09T01:16:31.080512Z","submitted_at":"2026-01-30T18:59:57Z","title":"VideoGPA: Distilling Geometry Priors for 3D-Consistent Video Generation","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-16T09:16:57.528410Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2601.23286"},"observation_digest":"sha256:fbf0fc0642d25b2704c18dd5a10a9886adc3ab2ce90cb701584ba2f224ddf385","observation_id":"e4af9e13-2c93-44b5-aa23-edd890386e92","resolution":{"observed_at":"2026-05-16T20:10:28.051835Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-03T06:13:19.065521Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.23286","last_updated":"2026-06-07T21:12:04Z","snapshot_observed_at":"2026-08-09T01:16:31.080512Z","submitted_at":"2026-01-30T18:59:57Z","title":"VideoGPA: Distilling Geometry Priors for 3D-Consistent Video Generation","version":4},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T06:13:19.065521Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2601.23286"},"observation_digest":"sha256:4c5138893a283c727be4b13f034a750940279c84f475b6a81fb8e9d1ff60dd10","observation_id":"8ff2be2d-ac4b-4450-ba60-3fa3a91e10ae","resolution":{"observed_at":"2026-08-03T06:13:19.065521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-04T05:50:27.185756Z","title":"arXiv preprint arXiv:2408.16500 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.12147","last_updated":"2026-08-03T09:43:55Z","snapshot_observed_at":"2026-08-08T20:08:07.326425Z","submitted_at":"2026-03-12T16:46:01Z","title":"EgoIntent: A Pre-Outcome Micro-Step Benchmark for Understanding What, Why, and Next","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T05:50:27.185756Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2603.12147"},"observation_digest":"sha256:f3cc058916120823efe893186a6dae73cd24b3b36c9e0619fd0e06b7b072a711","observation_id":"bdf92923-e799-48b2-b36a-69a32bcd5fdb","resolution":{"observed_at":"2026-08-04T05:50:27.185756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":"2408.16500","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-07-08T05:34:32.402425Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","venue":"cs.CV","work_id":"4cd1db02-57ee-4017-9bf2-b9df24e0f9a9","year":2024},"citing_paper":{"arxiv_id":"2604.05180","last_updated":"2026-04-06T21:20:00Z","snapshot_observed_at":"2026-08-11T11:38:40.115599Z","submitted_at":"2026-04-06T21:20:00Z","title":"MIRAGE: Benchmarking and Aligning Multi-Instance Image Editing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T19:38:45.361389Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2604.05180"},"observation_digest":"sha256:5d1379827133cd8844d7a8c1da0c70f88ce8b8afa21de036304aa09a7ad32d3b","observation_id":"d5153d1e-8319-4c13-a2fa-345e69018981","resolution":{"observed_at":"2026-05-16T20:10:28.051835Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":"2408.16500","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-07-08T05:34:32.402425Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","venue":"cs.CV","work_id":"4cd1db02-57ee-4017-9bf2-b9df24e0f9a9","year":2024},"citing_paper":{"arxiv_id":"2604.07210","last_updated":"2026-04-08T15:31:30Z","snapshot_observed_at":"2026-08-11T13:38:56.262613Z","submitted_at":"2026-04-08T15:31:30Z","title":"VersaVogue: Visual Expert Orchestration and Preference Alignment for Unified Fashion Synthesis","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T19:00:29.650500Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2604.07210"},"observation_digest":"sha256:67388d078cd4df67505b2955d455802f2fe25beffdfd2cc76604afbc0dcce9eb","observation_id":"69ea4b6d-93e6-4b83-9c97-c02f0adac2ca","resolution":{"observed_at":"2026-05-16T20:10:28.051835Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":"2408.16500","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-07-08T05:34:32.402425Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","venue":"cs.CV","work_id":"4cd1db02-57ee-4017-9bf2-b9df24e0f9a9","year":2024},"citing_paper":{"arxiv_id":"2604.07634","last_updated":"2026-05-05T18:37:14Z","snapshot_observed_at":"2026-08-11T08:05:23.175406Z","submitted_at":"2026-04-08T22:31:20Z","title":"VSAS-Bench: Real-Time Evaluation of Visual Streaming Assistant Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T17:39:30.731688Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2604.07634"},"observation_digest":"sha256:320b4bcc070c03bb3b9109c96dfdc96453fa9415e9efa82bf147b6d253b1cb89","observation_id":"92d96f62-5ef7-4f2a-96fa-6b2728cd23c4","resolution":{"observed_at":"2026-05-16T20:10:28.051835Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":"2408.16500","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-07-08T05:34:32.402425Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","venue":"cs.CV","work_id":"4cd1db02-57ee-4017-9bf2-b9df24e0f9a9","year":2024},"citing_paper":{"arxiv_id":"2604.14069","last_updated":"2026-04-15T16:39:28Z","snapshot_observed_at":"2026-08-03T00:53:45.864670Z","submitted_at":"2026-04-15T16:39:28Z","title":"Towards Unconstrained Human-Object Interaction","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T14:17:06.952676Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2604.14069"},"observation_digest":"sha256:b6cbeb7013927ec23abc8fed64053929d9911247d84bce40d16e3a7146b0f603","observation_id":"143042a3-3692-488a-9295-822a4320a670","resolution":{"observed_at":"2026-05-16T20:10:28.051835Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":"2408.16500","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-07-08T05:34:32.402425Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","venue":"cs.CV","work_id":"4cd1db02-57ee-4017-9bf2-b9df24e0f9a9","year":2024},"citing_paper":{"arxiv_id":"2604.18091","last_updated":"2026-04-20T11:08:33Z","snapshot_observed_at":"2026-08-12T16:30:36.370390Z","submitted_at":"2026-04-20T11:08:33Z","title":"Culture-Aware Humorous Captioning: Multimodal Humor Generation across Cultural Contexts","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-10T05:33:20.557526Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2604.18091"},"observation_digest":"sha256:4c6af9d82929c7773fa4fdedbe0b51735557d9acfb9a4f7b33b6577c53cdf868","observation_id":"04e81a59-7c10-4f66-9e06-c8539e73423a","resolution":{"observed_at":"2026-05-16T20:10:28.051835Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":"2408.16500","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-07-08T05:34:32.402425Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","venue":"cs.CV","work_id":"4cd1db02-57ee-4017-9bf2-b9df24e0f9a9","year":2024},"citing_paper":{"arxiv_id":"2604.21232","last_updated":"2026-05-11T13:21:53Z","snapshot_observed_at":"2026-08-10T22:46:17.479174Z","submitted_at":"2026-04-23T02:57:50Z","title":"ReCAPA: Hierarchical Predictive Correction to Mitigate Cascading Failures","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-09T22:21:54.577215Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2604.21232"},"observation_digest":"sha256:9d65d0fafa7d1fc8c9f9631f45013f9cb243656475eab03588562c0a0bbca06b","observation_id":"3dfaeb8b-e91b-4920-a9e8-266660ee8bef","resolution":{"observed_at":"2026-05-16T20:10:28.051835Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":"2408.16500","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-07-08T05:34:32.402425Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","venue":"cs.CV","work_id":"4cd1db02-57ee-4017-9bf2-b9df24e0f9a9","year":2024},"citing_paper":{"arxiv_id":"2604.21232","last_updated":"2026-05-11T13:21:53Z","snapshot_observed_at":"2026-08-10T22:46:17.479174Z","submitted_at":"2026-04-23T02:57:50Z","title":"ReCAPA: Hierarchical Predictive Correction to Mitigate Cascading Failures","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-12T03:08:25.891080Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2604.21232"},"observation_digest":"sha256:83b025525c78c45251d11cf2ccbd34d7118159e9affcc7887abe6753d2404346","observation_id":"097dc07a-3f65-4eec-91b7-e0e9f11de37a","resolution":{"observed_at":"2026-05-16T20:10:28.051835Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":"2408.16500","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-07-08T05:34:32.402425Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","venue":"cs.CV","work_id":"4cd1db02-57ee-4017-9bf2-b9df24e0f9a9","year":2024},"citing_paper":{"arxiv_id":"2604.21362","last_updated":"2026-04-23T07:24:15Z","snapshot_observed_at":"2026-07-06T23:07:56.487654Z","submitted_at":"2026-04-23T07:24:15Z","title":"KD-CVG: A Knowledge-Driven Approach for Creative Video Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-09T22:51:13.632121Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2604.21362"},"observation_digest":"sha256:9dfa7e3ece464cde2d27f85f15d687b6ed028feaa34e86116a5028dd695c5da2","observation_id":"74f388d3-9f17-4a53-9523-351980ccc556","resolution":{"observed_at":"2026-05-16T20:10:28.051835Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":"2408.16500","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-07-08T05:34:32.402425Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","venue":"cs.CV","work_id":"4cd1db02-57ee-4017-9bf2-b9df24e0f9a9","year":2024},"citing_paper":{"arxiv_id":"2605.04641","last_updated":"2026-07-29T07:14:27Z","snapshot_observed_at":"2026-08-11T12:03:57.511892Z","submitted_at":"2026-05-06T08:32:30Z","title":"CAST: Mitigating Object Hallucination in Large Vision-Language Models via Caption-Guided Visual Attention Steering","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-08T18:05:38.705480Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2605.04641"},"observation_digest":"sha256:95b7dc74412887b448bdd4eacf665cb5e6766f64e195135fb53160547d2f33a3","observation_id":"790d6ea8-0e57-4dcc-8f9d-3598530e9826","resolution":{"observed_at":"2026-05-16T20:10:28.051835Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":"2408.16500","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-07-08T05:34:32.402425Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","venue":"cs.CV","work_id":"4cd1db02-57ee-4017-9bf2-b9df24e0f9a9","year":2024},"citing_paper":{"arxiv_id":"2605.08841","last_updated":"2026-05-09T09:52:23Z","snapshot_observed_at":"2026-08-11T16:49:03.037748Z","submitted_at":"2026-05-09T09:52:23Z","title":"Illusion-Aware Visual Preprocessing and Anti-Illusion Prompting for Classic Illusion Understanding in Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-12T01:39:17.468076Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2605.08841"},"observation_digest":"sha256:188f66c9c1e08e7ff4608fa29aa84d569cec0b060132d8608c08ebd459dc820f","observation_id":"5dd0961d-d8c1-434c-860c-4f5709476b7a","resolution":{"observed_at":"2026-05-16T20:10:28.051835Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":"2408.16500","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-07-08T05:34:32.402425Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","venue":"cs.CV","work_id":"4cd1db02-57ee-4017-9bf2-b9df24e0f9a9","year":2024},"citing_paper":{"arxiv_id":"2605.17360","last_updated":"2026-07-02T12:39:55Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T09:57:01Z","title":"Omni-DuplexEval: Evaluating Real-time Duplex Omni-modal Interaction","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-20T13:36:44.071188Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2605.17360"},"observation_digest":"sha256:8391bdf570bc7da7cbf361edbbd654eaf6e8fd275208185e265b21d29e105474","observation_id":"31174350-03f7-4a3a-9e1c-b691b3e181df","resolution":{"observed_at":"2026-05-20T13:38:19.184600Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":"2408.16500","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-07-08T05:34:32.402425Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","venue":"cs.CV","work_id":"4cd1db02-57ee-4017-9bf2-b9df24e0f9a9","year":2024},"citing_paper":{"arxiv_id":"2605.17360","last_updated":"2026-07-02T12:39:55Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T09:57:01Z","title":"Omni-DuplexEval: Evaluating Real-time Duplex Omni-modal Interaction","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-04T01:11:42.073993Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2605.17360"},"observation_digest":"sha256:6ad7d01071cff9c7036e035e3a9b5accb97bf6f7bb2e831d155da4e6a26e1b34","observation_id":"0e39044d-1a37-4bc6-8de4-60c62b310850","resolution":{"observed_at":"2026-07-04T01:19:20.300620Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":"2408.16500","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-07-08T05:34:32.402425Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","venue":"cs.CV","work_id":"4cd1db02-57ee-4017-9bf2-b9df24e0f9a9","year":2024},"citing_paper":{"arxiv_id":"2605.20177","last_updated":"2026-05-19T17:58:40Z","snapshot_observed_at":"2026-08-02T05:10:06.894644Z","submitted_at":"2026-05-19T17:58:40Z","title":"From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2605.20177"},"observation_digest":"sha256:e7de15b48eb17e69a32714699bdc7cbd81b8984a1d50e447e6467ce73732c0fb","observation_id":"e07336f4-347c-40a0-9901-4679646b9a37","resolution":{"observed_at":"2026-05-20T05:13:21.481162Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":"2408.16500","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-07-08T05:34:32.402425Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","venue":"cs.CV","work_id":"4cd1db02-57ee-4017-9bf2-b9df24e0f9a9","year":2024},"citing_paper":{"arxiv_id":"2605.21272","last_updated":"2026-05-20T15:04:56Z","snapshot_observed_at":"2026-08-02T13:53:05.548583Z","submitted_at":"2026-05-20T15:04:56Z","title":"MONET: A Massive, Open, Non-redundant and Enriched Text-to-image dataset","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-21T05:21:18.369534Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2605.21272"},"observation_digest":"sha256:086b68ec87920fd92b0c4387bb8f50c286e1cec225dd2391749337bc0886e848","observation_id":"b15ad2f6-0690-4fd5-a6e4-d3236130f31c","resolution":{"observed_at":"2026-05-21T05:23:58.461915Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":"2408.16500","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-07-08T05:34:32.402425Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","venue":"cs.CV","work_id":"4cd1db02-57ee-4017-9bf2-b9df24e0f9a9","year":2024},"citing_paper":{"arxiv_id":"2605.26576","last_updated":"2026-05-26T05:49:12Z","snapshot_observed_at":"2026-07-06T23:36:25.432687Z","submitted_at":"2026-05-26T05:49:12Z","title":"TrackRef3D: Multi-View Consistent Track-then-Label for Open-World Referring Segmentation in 3D Gaussian Splatting","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T18:39:28.055568Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2605.26576"},"observation_digest":"sha256:e5c7391c9aa41ba05e8ed69af870e2d148874275464d39225539d0ba9d4e7697","observation_id":"a43ce7f1-9338-48fa-9550-81cc9503f3ef","resolution":{"observed_at":"2026-06-29T18:43:50.597565Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":"2408.16500","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-07-08T05:34:32.402425Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","venue":"cs.CV","work_id":"4cd1db02-57ee-4017-9bf2-b9df24e0f9a9","year":2024},"citing_paper":{"arxiv_id":"2606.06853","last_updated":"2026-06-05T02:56:48Z","snapshot_observed_at":"2026-08-06T01:06:20.170619Z","submitted_at":"2026-06-05T02:56:48Z","title":"MotionEnhancer: Leveraging Video Diffusion for Motion-Enhanced Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T22:49:18.420491Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2606.06853"},"observation_digest":"sha256:44f35bc86d23a461a6f7b6aa1fa668114fbfa9fa625d5e35e1a2af308ca463ff","observation_id":"9d37e3c6-e5de-43f0-82cb-9982e653f131","resolution":{"observed_at":"2026-07-02T16:17:09.558511Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":"2408.16500","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-07-08T05:34:32.402425Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","venue":"cs.CV","work_id":"4cd1db02-57ee-4017-9bf2-b9df24e0f9a9","year":2024},"citing_paper":{"arxiv_id":"2607.00115","last_updated":"2026-06-30T19:51:54Z","snapshot_observed_at":"2026-08-12T18:27:50.447234Z","submitted_at":"2026-06-30T19:51:54Z","title":"PixelEyes: Decoupling Perception and Reasoning for Pinpoint Visual Evidence Seeking","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-02T19:52:39.269265Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2607.00115"},"observation_digest":"sha256:94f235a7d40bc6255732ce2b24f8cb7843edf9bb065f10d70daa771b17efb6bd","observation_id":"eb8cf754-4144-46a4-82f6-cfbed09c3279","resolution":{"observed_at":"2026-07-02T19:57:19.117966Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":"2408.16500","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-07-08T05:34:32.402425Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","venue":"cs.CV","work_id":"4cd1db02-57ee-4017-9bf2-b9df24e0f9a9","year":2024},"citing_paper":{"arxiv_id":"2607.06468","last_updated":"2026-07-07T16:28:10Z","snapshot_observed_at":"2026-08-06T08:39:40.495369Z","submitted_at":"2026-07-07T16:28:10Z","title":"EgoPolice: A Benchmark for Egocentric Video Understanding in High-Stakes Police Body-Worn Camera Footage","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-08T05:25:07.553526Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2607.06468"},"observation_digest":"sha256:c1b5cd5715a44ab4aa6eb38f0c55fabd42f51688bf12b8af298a2976b6e51a06","observation_id":"6de49193-a046-4c4f-b4b4-63212490ad9d","resolution":{"observed_at":"2026-07-08T05:34:32.403838Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2408.16500/citation-record","integrity":"/paper/2408.16500/integrity","json":"/paper/2408.16500/citation-record.json","paper":"/paper/2408.16500"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Acharya, K","venue":null,"work_id":"1d36bd2e-b486-49fb-912a-ad929c7f9d24","year":2019},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:2ed6ea477087fe42e1448a0f926cc28ffb5b8a3cc0f6d7526132fe39567130be","observation_id":"9a54e822-4ab9-45b7-a39e-79850111f800","resolution":{"observed_at":"2026-05-16T20:10:27.960763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:c70855c41d547c9dff6f47d343d14cb103091b93d8f73f710841f0e6e17b0b9a","observation_id":"f519b59e-a69c-4472-b0bb-d9b17202b92b","resolution":{"observed_at":"2026-05-16T20:10:27.836941Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":"2010.11929","doi":"10.1175/jcli-d-22-0357.1","metadata_source":"pith","pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","venue":"cs.CV","work_id":"e96730e3-129b-4db6-b981-15ab7932e297","year":2020},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:094b9254d6270e1614df5e9253a20d8c9b3b4e7311351dccdf719e24c1a28d4b","observation_id":"12e69b45-834a-484c-aabc-ec199a801209","resolution":{"observed_at":"2026-05-16T20:10:27.784533Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Antol, A","venue":null,"work_id":"4b105d61-5d3e-438b-83f4-246542fc3464","year":2015},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:72017c03c90ee048b479ee4618448cd0d47dbe5d6ea015edc6b57981203a8e62","observation_id":"fac6f531-5b74-4cec-bd42-bba3ee2772cb","resolution":{"observed_at":"2026-05-16T20:10:27.966570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":"2308.12966","doi":"10.48550/arxiv.2308.12966","metadata_source":"pith","pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","venue":"cs.CV","work_id":"cbc2bb21-b6bb-46c0-80bf-107e195ffe10","year":2023},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:ddea808275af20134905c95ea66d263a5fef56cba3bd3f102d3b6033418a40c0","observation_id":"f42fe827-7dae-465d-b5df-dddf0df14e2f","resolution":{"observed_at":"2026-05-16T20:10:27.696978Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"095cb13c-d956-4679-95e1-144f5cf0c634","year":2019},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:c950183414f66adcff2fa2cbe7c029cb62e93d1a059d3e4ff862feccbb4375f9","observation_id":"db0ce25f-ab37-496b-971a-64edebd88ffb","resolution":{"observed_at":"2026-05-16T20:10:27.969757Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13418","last_updated":"2023-08-25T15:03:36Z","snapshot_observed_at":"2026-08-12T03:48:04.422679Z","submitted_at":"2023-08-25T15:03:36Z","title":"Nougat: Neural Optical Understanding for Academic Documents","version":1},"cited_work":{"arxiv_id":"2308.13418","doi":"10.48550/arxiv.2308.13418","metadata_source":"pith","pith_arxiv_id":"2308.13418","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nougat: Neural Optical Understanding for Academic Documents","venue":"cs.LG","work_id":"26c3b627-7e97-40d7-bab3-020936b8196b","year":2023},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"cited_paper":"/paper/2308.13418","citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:a637365bf95e4001382f143662a5fda42e431f37cd3f8009fa179d6cd7e691bd","observation_id":"399385a3-d04a-451c-a72f-118c1319ef66","resolution":{"observed_at":"2026-05-16T20:10:27.832094Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Byeon, B","venue":null,"work_id":"55514b41-a546-4793-ba84-8852a06e2741","year":2022},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:12715496200971c2197d9322cc2c06176ad98743449d8345560817545d8c18c3","observation_id":"46bc0e43-3c59-4e0a-b2be-c0b73962a863","resolution":{"observed_at":"2026-05-16T20:10:27.972978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6807d692-fc13-4ebc-827a-dd04ab68e603","year":2022},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:2d6dea5a680d2db186efed204fae0cfb6cd640b50a19a85f8779c4e215f8999b","observation_id":"b7f05ec2-497f-48cd-866b-68e5f0bb5ddc","resolution":{"observed_at":"2026-05-16T20:10:27.975701Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":"2403.20330","doi":"10.48550/arxiv.2403.20330","metadata_source":"pith","pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","venue":"cs.CV","work_id":"0d0b977c-a42e-49b1-869e-b7360dca5282","year":2024},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:ca4e6b5d1aca4b51bc53af1c935abd1f83e74429552dee782460ab0b2c011e29","observation_id":"be43286c-aaa6-4f05-ac68-2b86a40dd27a","resolution":{"observed_at":"2026-05-16T20:10:27.718078Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:20.921853+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:20.921853+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-07-06T18:26:42.010940Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":"2406.04325","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-07-04T06:39:37.677235Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":"22138421-9fc7-4d3e-8a5b-90fd9a0a6c97","year":2024},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:d224e4f629e76b1826d9b2f7960e074f8726fe52ea317a3ce3bc3b4c7d3f3d8a","observation_id":"adafa0e3-6f81-4449-ad51-6dc21c67c500","resolution":{"observed_at":"2026-05-16T20:10:27.726864Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.06794","last_updated":"2023-06-05T17:55:12Z","snapshot_observed_at":"2026-08-10T09:03:43.940864Z","submitted_at":"2022-09-14T17:24:07Z","title":"PaLI: A Jointly-Scaled Multilingual Language-Image Model","version":4},"cited_work":{"arxiv_id":"2209.06794","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.06794","snapshot_observed_at":"2026-07-04T19:30:07.491958Z","title":"PaLI: A Jointly-Scaled Multilingual Language-Image Model","venue":"cs.CV","work_id":"29921cff-29c1-4aad-a27d-adac346027ec","year":2022},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"cited_paper":"/paper/2209.06794","citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:66bcacbbebc3708e961c42185b392cc2ba22f7f24b48ae5854075a9428aa893a","observation_id":"62580b45-2181-4231-958f-393f3d04b395","resolution":{"observed_at":"2026-05-16T20:10:27.740978Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":"2312.14238","doi":"10.48550/arxiv.2312.14238","metadata_source":"pith","pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","venue":"cs.CV","work_id":"d9e035c7-9e23-4cc2-ad3e-be080fbbf2d9","year":2023},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:9b5c04c3ed7dd1087f8ebef9af34feb222b87b151428593519664c363455c2d8","observation_id":"51873788-83fa-429c-b8c5-18d16cb5aa6c","resolution":{"observed_at":"2026-05-16T20:10:27.762682Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"aea71555-108d-4af0-8d00-64c120ff5ede","year":2024},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:205df7255b5233237cf1dc4466ef7e48a9687712595b1d0833adb9edcc027cbf","observation_id":"8a0fe6c1-7d03-4073-8176-4821a424e7e4","resolution":{"observed_at":"2026-05-16T20:10:27.978720Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11370","last_updated":"2025-08-20T15:45:11Z","snapshot_observed_at":"2026-08-02T03:18:39.824103Z","submitted_at":"2023-12-18T17:36:20Z","title":"G-LLaVA: Solving Geometric Problem with Multi-Modal Large Language Model","version":2},"cited_work":{"arxiv_id":"2312.11370","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.11370","snapshot_observed_at":"2026-07-10T01:46:40.938849Z","title":"G-LLaVA: Solving Geometric Problem with Multi- Modal Large Language Model","venue":"cs.CL","work_id":"3a63b857-2284-4d2e-93fe-e112cfbc77ea","year":2023},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"cited_paper":"/paper/2312.11370","citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:aa868a2df894c45d8d794778dc1aa57be78092bf71c8379e197a3006affdeb7a","observation_id":"4949e172-7d11-4456-b104-8a87ba7f15eb","resolution":{"observed_at":"2026-05-16T20:10:27.800589Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12793","last_updated":"2024-07-30T03:58:11Z","snapshot_observed_at":"2026-08-07T13:56:34.167869Z","submitted_at":"2024-06-18T16:58:21Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","version":2},"cited_work":{"arxiv_id":"2406.12793","doi":"10.48550/arxiv.2406.12793","metadata_source":"pith","pith_arxiv_id":"2406.12793","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","venue":"cs.CL","work_id":"de9ce5af-0d8d-4b94-9793-64968d9bc06d","year":2024},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"cited_paper":"/paper/2406.12793","citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:a260befefc3809dc6eb3bc39c41d7313791fa1a73c8657a811177723400836ad","observation_id":"d2271787-305b-4483-ac57-d267a4f73ea6","resolution":{"observed_at":"2026-05-16T20:10:27.806236Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"something something","venue":null,"work_id":"b3f4176f-e761-46d0-b023-9da0a7aea17c","year":2017},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:63b61a51a11ff95a3f87c763464b2dcead1c2c00d08e418e9bd67ac8ca2a227e","observation_id":"37a4fbc5-5967-4bd6-9e07-fbfb8378c8bf","resolution":{"observed_at":"2026-05-16T20:10:27.981730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grauman, A","venue":null,"work_id":"7925e78c-f81b-4855-bfb8-394a70a24ee8","year":2022},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:ce992aced17576196ce4081d3f1ba3672799c8035146e7f3561c3bf146e1c894","observation_id":"1b6a4e1b-ab6b-4c72-866b-0d04e57b18b4","resolution":{"observed_at":"2026-05-16T20:10:27.984758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"670c4853-5d46-468f-960b-69fd093c5fd0","year":2024},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:ad82ceec249c2a307b6429b7a91079e96d78127d3c81b869f91c6fa5afc6d851","observation_id":"0a3bfad9-14b4-4706-9b86-3de7b1caf828","resolution":{"observed_at":"2026-05-16T20:10:27.987696Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"83b397b8-63a1-4e8c-aecf-d2ee7a9ae026","year":2017},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:5c3bf4df15d0ddf9a774c0209a3a6fd4925c8a5ceb622d2418751f63782855a3","observation_id":"11bb57e1-7c3f-4c79-845c-c6eff8d4c976","resolution":{"observed_at":"2026-05-16T20:10:27.991068Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kafle, S","venue":null,"work_id":"b61c96a9-f042-4b33-9a56-48f0942985ea","year":2018},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:d5cb7143a70d982b521e2d971bc3f351fdde607f54b7e3827ae28d8611606ae4","observation_id":"48d09d39-17d0-4168-9d62-508ad1e94839","resolution":{"observed_at":"2026-05-16T20:10:27.994523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kafle and C","venue":null,"work_id":"a4cbb9d7-9319-4462-8ddc-033bda416a52","year":1965},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:df645b29259434775326855d7ff1911a16c8d845045d61f9e04ba6f81d54034c","observation_id":"0bd75f35-dd08-4032-b41e-c260c900e94f","resolution":{"observed_at":"2026-05-16T20:10:27.997490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2bda248d-c3d7-43a9-ac70-e3d9946d44cb","year":2018},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:29eb9e21ab7fb5384074144ade133e24a009b7b2be6a7f88c52177439d8feaac","observation_id":"afefd87b-f583-4aab-9f92-0a9981b0e610","resolution":{"observed_at":"2026-05-16T20:10:28.000979Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12241","last_updated":"2023-12-19T15:25:39Z","snapshot_observed_at":"2026-08-07T13:16:45.623593Z","submitted_at":"2023-12-19T15:25:39Z","title":"GeomVerse: A Systematic Evaluation of Large Models for Geometric Reasoning","version":1},"cited_work":{"arxiv_id":"2312.12241","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.12241","snapshot_observed_at":"2026-07-03T20:48:56.071888Z","title":"Kazemi, H","venue":null,"work_id":"a6a0af2b-e0d6-4234-9409-9f4eecda7ca5","year":2023},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"cited_paper":"/paper/2312.12241","citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:b1567938a8d2752504ecf6e3a7029dcdf3aba7465322f689e316a40267786073","observation_id":"5d35e18a-09b7-4db3-bfd2-bc7f5ee8c95b","resolution":{"observed_at":"2026-05-16T20:10:27.768097Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kembhavi, M","venue":null,"work_id":"65893766-8423-4f51-b4ac-b05ee1cffcd7","year":2016},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:8119c37c10e656376064ff4657ba58df55aa852aa7753e1006f5b3ff404eadcd","observation_id":"e1baaf04-8de4-4025-a39c-71e9b8e2ab62","resolution":{"observed_at":"2026-05-16T20:10:28.004022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kembhavi, M","venue":null,"work_id":"f3233768-2c29-4617-9560-a6ceacd06c7d","year":2016},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:dba98da914c9e80eb2b1fe06223101eb6df677c5980c04f1e0a8cbc641852306","observation_id":"e26de3c2-270c-4c6a-86b2-75d766afb424","resolution":{"observed_at":"2026-05-16T20:10:28.007065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kembhavi, M","venue":null,"work_id":"bca6a4ae-66c5-45f1-a110-fdc4fe9beb46","year":2017},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:31512fb754dcecc1a7a3ea88c29335fbcdc82cfc26f7b21e7238ec9adb27e372","observation_id":"da9fac4f-310f-4c21-8981-f7ab8b46e639","resolution":{"observed_at":"2026-05-16T20:10:28.009882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d4998200-9972-4f33-bab3-de74832799d1","year":2024},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:683238dcff67a399a2d27f9aacd745690562cc2c5990a2073f17e67852a60c92","observation_id":"89f11a57-515c-414d-9240-cf1375e20207","resolution":{"observed_at":"2026-05-16T20:10:28.012864Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Krishna, Y","venue":null,"work_id":"d3829e9e-504c-4c55-9a3d-fa8a19d260b5","year":2017},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:bee1fe9dcb8982ab3a0ed07c0ac2e2ac859f73fcb4af61a422982af302181a0b","observation_id":"a7a21ed4-e12f-4fc1-965f-0791d835de4e","resolution":{"observed_at":"2026-05-16T20:10:28.015504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6772ae66-048a-4009-ae45-99eb6a2fa056","year":2018},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:aff416ea38a04f9b8bf5d15d05afa702c900e0733f6d1d022def7c9b4b75995f","observation_id":"9885d6ee-3a90-4f91-a337-566fd07ff03e","resolution":{"observed_at":"2026-05-16T20:10:28.018224Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.03001","last_updated":"2022-06-14T12:00:10Z","snapshot_observed_at":"2026-07-06T13:18:06.376608Z","submitted_at":"2022-06-07T04:33:50Z","title":"PP-OCRv3: More Attempts for the Improvement of Ultra Lightweight OCR System","version":2},"cited_work":{"arxiv_id":"2206.03001","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.03001","snapshot_observed_at":"2026-07-03T13:48:21.604443Z","title":"PP-OCRv3: More attempts for the improvement of ultra lightweight OCR system","venue":null,"work_id":"92ed45ef-6f7c-415f-bf2e-2be01e2ed6c4","year":2022},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"cited_paper":"/paper/2206.03001","citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:9643928316965659d79c86c48159ce5975508d4feda24cfa017e6a05efa02b12","observation_id":"4607e1dd-2765-48e0-a96f-340c3d8c9cf5","resolution":{"observed_at":"2026-05-16T20:10:27.712122Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5d0025d8-575d-41e2-9c8c-d85828052e31","year":2023},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:12d28465b696b31c144a1547b20c1b0d8539cf4e3ce1ba5c023a1e26da589602","observation_id":"e0d47ba8-940f-4113-95a6-4d73cdb8ecbc","resolution":{"observed_at":"2026-05-16T20:10:28.020838Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":"2305.06355","doi":"10.48550/arxiv.2305.06355","metadata_source":"pith","pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VideoChat: Chat-Centric Video Understanding","venue":"cs.CV","work_id":"07461eec-156c-4054-a28e-b84bc53bf6e1","year":2023},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:231e8f82e6b4b200bb04de4490fa2cac99bd1e4a912c7f0459b943c39401938a","observation_id":"0652cd27-6b42-445f-8066-cb5879896a28","resolution":{"observed_at":"2026-05-16T20:10:27.722354Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"37e3bcc1-5b43-425f-a880-c2fac355ec99","year":2023},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:8c9832c82e2d20a357fc27903d13975359d0a09bf0c357bc4d73a32223cf9c41","observation_id":"08d38f54-f572-4214-ba13-000243b31a84","resolution":{"observed_at":"2026-05-16T20:10:28.023954Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09552","last_updated":"2022-11-17T14:17:40Z","snapshot_observed_at":"2026-08-07T04:39:25.258902Z","submitted_at":"2022-11-17T14:17:40Z","title":"UniFormerV2: Spatiotemporal Learning by Arming Image ViTs with Video UniFormer","version":1},"cited_work":{"arxiv_id":"2211.09552","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2211.09552","snapshot_observed_at":"2026-07-03T19:08:49.809225Z","title":"Uniformerv2: Spatiotemporal learning by arming image vits with video uniformer","venue":null,"work_id":"cb4c2612-0c2a-4ab9-9dde-7031260274d1","year":2022},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"cited_paper":"/paper/2211.09552","citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:8d63e8b41ccffb5ed879f6613908fbf3a64569656703f19fe251980a72b897d0","observation_id":"215434de-9888-454e-8479-a6ce6fd57807","resolution":{"observed_at":"2026-05-16T20:10:27.735657Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0b10ba7f-0216-4bce-93fa-7bc3d8b4ce21","year":2024},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:3fdf155ec3076d00dd57085c40effa39993e33ef11514af3d9b0eadd7a86befe","observation_id":"4752dbaa-481f-4104-8ffd-fc14d2ab159a","resolution":{"observed_at":"2026-05-16T20:10:28.026867Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":"2403.18814","doi":"10.48550/arxiv.2403.18814","metadata_source":"pith","pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","venue":"cs.CV","work_id":"70d699a8-f265-4862-b60f-3b62ca85f6d8","year":2024},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:e494324cdb570c43dab53f89157a047bb29e5035c090de0e9534c66686713cd9","observation_id":"b6a8c910-c016-4550-a1a3-c16656d56357","resolution":{"observed_at":"2026-05-17T07:44:47.683285Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:07.759194+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:07.759194+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c1a711d0-ecc5-49ae-977e-c8b88213cd26","year":2023},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:9efcdf74263ee412a3ab4b13cea1549f228354bece983eee77f723ce85e3aad1","observation_id":"b56541ca-3f59-498b-8d37-80c9589f0766","resolution":{"observed_at":"2026-05-16T20:10:28.029941Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"79c78dfc-e958-4fb3-9a97-74785f8fe9a1","year":2023},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:88ea0f7f4ba3a080bfd3976687768e676f9e397877875bc63689be40de83aa23","observation_id":"933aeecf-ff3e-412e-a5d0-0bcdedb3c0d7","resolution":{"observed_at":"2026-05-16T20:10:28.033478Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:04:28.725644Z","title":null,"venue":null,"work_id":"5845b6e3-4ba1-49ea-849c-501e97bde202","year":2024},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:7dc804a3d6c90cf9a4b61cdcd7a3d35b2da4d2558bf96fe3207b2de380a7d662","observation_id":"9628919e-6ccf-4368-99b2-e7c76070419a","resolution":{"observed_at":"2026-05-16T20:10:28.037335Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"091ccac0-6a2e-4cd8-a93b-b8d4a090f9dc","year":2024},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:ce039f2dbc30871fe6840ddf4506fa3608a0180480418c68fe4b3c4a92ef3127","observation_id":"006b469e-8057-48f0-993d-12705df4fd29","resolution":{"observed_at":"2026-05-16T20:10:28.041078Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c9e67ce4-795b-499d-a039-942dc9173185","year":2024},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:78557f24ec5cb70d6df769b1bb04ae644ff6335052a7cf2c1ec5c3d287c9a017","observation_id":"fba93d6d-aade-463d-ac2e-5d114150ca90","resolution":{"observed_at":"2026-05-16T20:10:28.044513Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00308","last_updated":"2024-03-30T10:11:26Z","snapshot_observed_at":"2026-08-12T14:30:48.915309Z","submitted_at":"2024-03-30T10:11:26Z","title":"ST-LLM: Large Language Models Are Effective Temporal Learners","version":1},"cited_work":{"arxiv_id":"2404.00308","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.00308","snapshot_observed_at":"2026-07-04T03:29:31.158429Z","title":"St-llm: Large language models are effective tem- poral learners","venue":null,"work_id":"f3061161-8e9c-4661-b0e5-c9fb55fddf74","year":2024},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"cited_paper":"/paper/2404.00308","citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:bd8f8e82b7208afbc0a487864bcc5f78363aaa23ef913ee3495e8ac3d3514a20","observation_id":"ed258d1e-0ec7-43b8-9f8e-ec97490736e6","resolution":{"observed_at":"2026-05-16T20:10:27.812133Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":"2307.06281","doi":"10.48550/arxiv.2307.06281","metadata_source":"pith","pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","venue":"cs.CV","work_id":"3b44943d-0f15-4228-9ac3-0e376f4f9ada","year":2023},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:36bf67f9b86c4b598f5445cdef0298d1d2bf38c6cb73ea34bf003989f63f9234","observation_id":"d22a74fe-19eb-4142-9be5-aade3379bff5","resolution":{"observed_at":"2026-05-16T20:10:27.822433Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"564792d0-7bdf-43f8-b205-83e335c85862","year":2024},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:8d079446b273bde13693a55892f8f282261fcc04734bb1d6f94f9f4a315a2e2a","observation_id":"dda4b2f0-c538-47a5-bac8-b6bf4feddb93","resolution":{"observed_at":"2026-05-16T20:10:28.047689Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6125c1d3-67ce-44ec-ac2c-e7da83e898f0","year":2021},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:3645564e0e0031a21029ab618c5cebf766b0d8f22280179fc736efc9f2d53544","observation_id":"3fadd1fa-3df3-4adc-a7d5-5021ba705c83","resolution":{"observed_at":"2026-05-16T20:10:28.050733Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5a0d9667-26c7-42ad-983a-772b34eaaee6","year":2022},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:7183e4f1bfeb900fb42946278c3cce9b613212c60833f81257975717d9bbb3c6","observation_id":"8378d1cc-3b1a-4cea-825a-131a12ef1827","resolution":{"observed_at":"2026-05-16T20:10:27.845245Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b2a18327-fb73-4f15-aef2-1151443b2406","year":2023},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:3662023eec0a8404ba358b4ee831de2dc299a6a9478dc6922bdaff0e7a1052fd","observation_id":"8c5f4bca-301a-409b-b94e-fbcf5869b7da","resolution":{"observed_at":"2026-05-16T20:10:27.848655Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7afb6a6d-93f8-4a99-b288-8174b948754f","year":2021},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:84cc0786fa33a82bd0eeb87ba1050043dd649c36a81181b23b6cb6c6d1a1a448","observation_id":"2e7da8ad-e0e9-4990-b680-b7a544d73a61","resolution":{"observed_at":"2026-05-16T20:10:27.852603Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"11a11574-fa4c-4aa2-9098-c8168a865d88","year":2023},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:38e865be2fcb7a899e8952332173ea0a0e1b17a8e7e8902ec72ad77dbf75d527","observation_id":"bc8c901a-6038-4a53-bf88-5c8e21cfa6ee","resolution":{"observed_at":"2026-05-16T20:10:27.856463Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d5d9cfdd-2772-4359-89c2-4a37a7c340c8","year":2024},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:fcdd24bad1ea5407e507ff58dfc774b12e6ed6c9394f42a3e866110d316f1b22","observation_id":"67d4e8bc-6a3f-4ec2-976b-43b6e236dfc6","resolution":{"observed_at":"2026-05-16T20:10:27.860240Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"cc9e1934-257b-4fdf-b330-0166428c80f2","year":2024},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:2b06e7c738ec59b07a8a3a7e096a2a717d1e743b1807e49c0e01129ccf465119","observation_id":"83c4514c-9187-4a43-8e84-18741ebd59e5","resolution":{"observed_at":"2026-05-16T20:10:27.863551Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"03f0dfac-f108-452b-883c-80f143ed67a1","year":2024},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:d793dd02ef23134326b069c27fa1c8ac96575e25a62aa8d03c36ea1a7f6b5c62","observation_id":"e8f9307d-1efa-4220-8899-e3a489d2c08b","resolution":{"observed_at":"2026-05-16T20:10:27.867046Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Marino, M","venue":null,"work_id":"13d7376e-84cf-4384-b3c8-043469a4ea9e","year":2019},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:07e1a0a6a18b6086aa792a4c91530bea9d2b3712a89cc88548ba69985668e5a3","observation_id":"49ecbadf-39ca-4f01-ae6c-126297641938","resolution":{"observed_at":"2026-05-16T20:10:27.870344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Marti and H","venue":null,"work_id":"d20871e1-3c5c-4474-b9f0-e034f752d216","year":2002},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:c26271b57e1425e44f521af3eee5945d9dd6bbcd8a659d4770d7ef8f5b7fcd24","observation_id":"ab2f312b-a3dd-4ac5-8edb-6a4dcf3ce4a3","resolution":{"observed_at":"2026-05-16T20:10:27.873786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Masry, D","venue":null,"work_id":"5f501445-44ec-4627-b62b-88a6752574c0","year":2022},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:7942f63ed78f71cd80d26fe9d6d7bdb3bcb5384d3e162734cc2fd5c6eeb05833","observation_id":"d620c82a-f797-4f38-99b7-ea1df47a204a","resolution":{"observed_at":"2026-05-16T20:10:27.877201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-08-11T03:45:43.920485Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":"2203.10244","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-07-04T16:39:57.602645Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","venue":"cs.CL","work_id":"8b49b78c-7e1d-4f57-af10-7c11cd63ff7c","year":2022},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:d0cb84b697095eb7534fde16760d7c039b5f555e422eef1742de3b3c873c2d69","observation_id":"c0ac1a4a-60ca-4b97-b35b-6498f7642f97","resolution":{"observed_at":"2026-05-16T20:10:27.773421Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Masry, D","venue":null,"work_id":"11ec7ab0-77df-4500-ba5d-7b6dd67b4b71","year":2022},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:adc36e6a91673cc9a09a493671fe6fdf79b813d2c48a4b5f7e5cc863c539a591","observation_id":"2be31272-5224-4446-b428-9ab5ec0606c1","resolution":{"observed_at":"2026-05-16T20:10:27.880648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mathew, V","venue":null,"work_id":"f5cf0a9b-991e-485e-9bc8-ccd45041e2c5","year":2022},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:cf36b11cf987e0f5a39755ffb590c594955ebf40544760608b7ba4273fbc4847","observation_id":"c93e4f5f-46a4-48ae-a803-e880fa3cccdf","resolution":{"observed_at":"2026-05-16T20:10:27.884006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mathew, D","venue":null,"work_id":"7dc1de1a-f033-4e7d-a9ed-d70039f7f4aa","year":2021},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:c2eaadc522701d18998b62a1e5390fe5cc1b27506455446bef8ca225bbc81e1b","observation_id":"5eb98273-7f29-4c13-902c-a3e918dcdebc","resolution":{"observed_at":"2026-05-16T20:10:27.887727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mathew, D","venue":null,"work_id":"4d461194-3e55-417e-a1aa-1635f5ce1f13","year":2021},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:5fa43d108613dbe9a890cb5d179032f16d0b7d4fc3ec49559b5f20dcae579739","observation_id":"60611023-95f5-44f8-a7f2-64c1d6a7e560","resolution":{"observed_at":"2026-05-16T20:10:27.890525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mathew, D","venue":null,"work_id":"27aa2dcd-1934-410b-bf9a-7a1ae42c42ce","year":2021},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:8601430b00195d8e6f53ca1cc62151502e5b540ad093ebc0722af5ec43f0fe96","observation_id":"4bc8b320-4139-4516-970f-837028af3720","resolution":{"observed_at":"2026-05-16T20:10:27.893362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mishra, S","venue":null,"work_id":"7ac593a3-00d8-41cb-818e-53967efb7f2c","year":2019},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:56ff4399c892f0b3002500a3ba3994f5895fde6a178a1859ac59f21a825cee47","observation_id":"105879cc-09d2-4e7c-8ba8-8b74d15ede99","resolution":{"observed_at":"2026-05-16T20:10:27.896528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d87f6907-cfb4-4bc4-a51e-ec07fd3703f1","year":2024},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:fb55dc3beda387e7c2edecde1042884aa0dd45db1a9a607749e5c96d91feaf57","observation_id":"1da3e238-20a2-4283-8d52-77202e7b22ee","resolution":{"observed_at":"2026-05-16T20:10:27.899897Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":"2403.05530","doi":"10.48550/arxiv.2403.05530","metadata_source":"pith","pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":"cs.CL","work_id":"80e3e977-f1bb-4c83-8d0c-1ab0a0c5c3f1","year":2024},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:a40dc3f27c1d8b2116d495ce33d4a1f3735e8a0c53d5de41d2c0c939d73dd1c2","observation_id":"67e47033-07ba-4894-852d-4d263c54316e","resolution":{"observed_at":"2026-05-16T20:10:27.841615Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02051","last_updated":"2024-03-28T12:41:14Z","snapshot_observed_at":"2026-08-10T13:36:40.776714Z","submitted_at":"2023-12-04T17:09:52Z","title":"TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding","version":2},"cited_work":{"arxiv_id":"2312.02051","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.02051","snapshot_observed_at":"2026-07-04T06:39:37.643725Z","title":"Timechat: A time-sensitive multimodal large lan- guage model for long video understanding","venue":null,"work_id":"85fc1396-2fab-4238-9120-5878dc1705b6","year":2023},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"cited_paper":"/paper/2312.02051","citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:d5f44bcfc53bb72eeb48d1404c3bd1c9b3067ab4fb096594827e789a36194de1","observation_id":"ca324a57-d643-4590-a8bb-7f477c6345fe","resolution":{"observed_at":"2026-05-16T20:10:27.687282Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Schuhmann, R","venue":null,"work_id":"3d9b77f3-1fc1-4438-aab8-c2f59fbb3388","year":2022},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:9366c210320f4e14d223b1527253de7e33e627156cf38ec95db948c091765f70","observation_id":"4ee1ecd9-8719-4618-9e4e-fa49f8b6f344","resolution":{"observed_at":"2026-05-16T20:10:27.903327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":"2111.02114","doi":"10.48550/arxiv.2111.02114","metadata_source":"pith","pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","venue":"cs.CV","work_id":"fbf16034-512e-4dd9-a0bd-7ddd23f532a6","year":2021},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:84b20947f40c70af9ef96c09ef509e56d538fa7c2271f9e122015b11e24539ad","observation_id":"431a3330-2eca-4b36-a522-366b88b7377b","resolution":{"observed_at":"2026-05-16T20:10:27.705585Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:40.426779+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:40.426779+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Schwenk, A","venue":null,"work_id":"ab97f20f-cd2a-4020-a6d6-aa20380436e7","year":2022},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:0c8a682d1a2006fc54f5e8382bd4b1d8d534a8e6b951e73ed1cce9601e2b4119","observation_id":"010ea674-078b-429a-8d10-5aa2a183eb75","resolution":{"observed_at":"2026-05-16T20:10:27.906584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0335a6ba-34fa-4891-9a9a-414fb2afb854","year":2020},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:d4e5e17027702342fb196c618c088fab98acdcb7b6296509914994bbb4a5d0a7","observation_id":"6b4bff8d-8b16-4a8c-a3a9-be4adb8b7413","resolution":{"observed_at":"2026-05-16T20:10:27.909919Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Singh, V","venue":null,"work_id":"2e4619a4-d2c6-4884-b43b-5cdff916e525","year":2019},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:d3e7c4bb448743cd0f06912b4957bcb6e001b36e0d17f3fb0a956f277a0223c6","observation_id":"de1d903c-78f6-49bc-a3f4-57328560d13a","resolution":{"observed_at":"2026-05-16T20:10:27.913661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Singh, V","venue":null,"work_id":"3406dcb4-be61-45ee-8cec-518d60039993","year":2019},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:0c2af019cb1cc983aa0821e70636046df8d0bda78661596c4c1f3e7dd606724a","observation_id":"d58a588d-378d-4b28-b029-c1e75ef45aa2","resolution":{"observed_at":"2026-05-16T20:10:27.917169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:e558e291112e182530fcec558cbdceed249b16a9b886d06a67e378e5432d6f0f","observation_id":"a75f5f2b-8ca2-4d28-8161-68348ad4b46a","resolution":{"observed_at":"2026-05-16T20:10:27.731179Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"dc17822e-05c4-40ad-9396-43e673138a7a","year":2023},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:5682bdfccfabf9478e9fbafc5ad886c983b65355468473bde9f1faeff92a71a7","observation_id":"aa30b319-8c08-4bd8-b180-873ab01e7054","resolution":{"observed_at":"2026-05-16T20:10:27.920352Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ba034911-508a-4ee3-a614-7e19966d0b35","year":2024},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:6f50e7522eff450f8837b7f806c305e3c5e79fbdf2d5b1a037dcf1af6187705e","observation_id":"8acc3d6d-4f6e-4ccb-88be-df59bc93c15b","resolution":{"observed_at":"2026-05-16T20:10:27.923301Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08035","last_updated":"2025-08-09T10:54:59Z","snapshot_observed_at":"2026-08-08T19:38:26.415599Z","submitted_at":"2024-06-12T09:36:52Z","title":"LVBench: An Extreme Long Video Understanding Benchmark","version":3},"cited_work":{"arxiv_id":"2406.08035","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.08035","snapshot_observed_at":"2026-07-04T16:09:57.146670Z","title":"LVBench: An Extreme Long Video Understanding Benchmark","venue":"cs.CV","work_id":"e9bfdf40-cd28-4d57-98b8-31b7e97f9f2f","year":2024},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"cited_paper":"/paper/2406.08035","citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:7dbe202b1a2a7a5832aebb5175945d8dd39f093de57a897f51bab7323a0bc06c","observation_id":"a09a5b4c-0772-46d4-9811-b8b2837694c9","resolution":{"observed_at":"2026-05-19T11:55:30.239348Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":"2311.03079","doi":"10.48550/arxiv.2311.03079","metadata_source":"pith","pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVLM: Visual Expert for Pretrained Language Models","venue":"cs.CV","work_id":"0d81fb99-dae6-46d2-8bed-c01dcbd7d7cf","year":2023},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:dfe00063975f0aad7624a744cc4217d181600c54d98df354257b9b3019c08689","observation_id":"defb3e9e-c668-49ce-91df-cbdba7e44a1d","resolution":{"observed_at":"2026-05-16T20:10:27.751296Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b8105f74-9cb5-438a-92fb-f60276e2787f","year":2022},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:0809445c5e0563a7fe257456c0db1c32e7fbbe430f25ca6f06f0d7168a4f8dc8","observation_id":"8c54c02a-278b-4aa7-a14d-fae33148d94d","resolution":{"observed_at":"2026-05-16T20:10:27.926322Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d0d2ad9f-349c-46aa-abac-960d5560180b","year":2021},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:171ebfdd3f3952b1d1a00a2739688367c7e5cc95ef8dbab201a4537b390333f0","observation_id":"38dd3c32-185c-47ea-9826-8967c0e5108a","resolution":{"observed_at":"2026-05-16T20:10:27.929608Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"480440d2-5e95-405b-8957-036f4f8ea9f6","year":2024},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:96967eeca7f2e3c42fa9e472f728e3cfff8b64683196853f2bc7d85d8768ad5c","observation_id":"d2d8a7ec-ac15-4a91-8c1d-9bbc1e9bd6b4","resolution":{"observed_at":"2026-05-16T20:10:27.932605Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"85ac95f0-548c-4973-b82b-aafdbe66739e","year":2021},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:d60173d023cf595540159bf2fac2e24f991ceb1515d6b52cdeca25919ddf02e6","observation_id":"5e0aa4f6-4677-4cb0-bb0a-a5f35afd971d","resolution":{"observed_at":"2026-05-16T20:10:27.936695Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":"2408.01800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-07-10T11:37:03.161139Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","venue":"cs.CV","work_id":"0f06e436-0c76-4e3c-be5e-6168f6bc4336","year":2024},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:d58eb08b7b27af9fd36786b0912ef0b2efe1100ad79d26e1354314cb1871f056","observation_id":"cf4a475c-3692-42f6-8ae1-c03796870c41","resolution":{"observed_at":"2026-05-16T20:10:27.778951Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"288070aa-f6a0-4d9a-9abc-e88e9527e1b8","year":2020},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:99d931ea754ed43057d9e44f91d063d7494bb04935f30d798ec259a1ef58b7d1","observation_id":"7bfaa28d-75c4-4274-8a50-bab90447ddc4","resolution":{"observed_at":"2026-05-16T20:10:27.939735Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":"2306.13549","doi":"10.48550/arxiv.2306.13549","metadata_source":"pith","pith_arxiv_id":"2306.13549","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey on Multimodal Large Language Models","venue":"cs.CV","work_id":"29d41a4d-d51b-4020-8947-991367e75c2c","year":2023},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"cited_paper":"/paper/2306.13549","citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:7ab037c720a58c456750aa3ef96c59fab0f64b596c5a0c7ffc0eb999c2a8a280","observation_id":"e8073d0e-b871-4d18-8e33-d78f836ab8aa","resolution":{"observed_at":"2026-05-16T20:10:27.789856Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-08T03:31:37.699253Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":"2308.02490","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-07-10T09:37:00.827227Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","venue":"cs.AI","work_id":"7f3bac41-a0a5-4a7a-bfd2-526b616db745","year":2023},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:e102661f194ed2cff28f93bb7edca0fa491d298ec15922fbb877ba009bf9c15b","observation_id":"6e246c8e-b37c-4fd6-b63b-d90deedb94c1","resolution":{"observed_at":"2026-05-16T20:10:27.795148Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0b52dffb-0e1b-491b-9e63-eafafa867ad0","year":2024},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:2a3b6373bc958d8bd47b89c4cbe0703321603e6420ce421ca7393809a2d3e2bb","observation_id":"5f9bf804-442e-4c99-b2d8-6d45bb7631a1","resolution":{"observed_at":"2026-05-16T20:10:27.942389Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ce33d978-188e-4640-8324-2f15b231379e","year":2024},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:e58daf441b6a89dc828bdb279ce59668607899a6cf20a87770f5f7117f1ce56d","observation_id":"d2753ffe-2fff-48c6-ad30-819a8c2e8589","resolution":{"observed_at":"2026-05-16T20:10:27.945129Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zhang, F","venue":null,"work_id":"90ebd621-079e-46bc-85c1-412f1e2790f9","year":2019},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:ae101d2ea22d6adfde92f06bc4c466a6a45b2bacb0e49604a30901eeaac8fe50","observation_id":"1e3d03fb-344b-4f66-8db2-158f0e57127a","resolution":{"observed_at":"2026-05-16T20:10:27.947867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":"2306.02858","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-07-04T16:29:57.761121Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","venue":"cs.CL","work_id":"555cf04a-49a7-44b8-9019-a83ce85ace95","year":2023},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:64ca5925f22e8b80743ed7fbdca64e566e2741552135f0ca2272b80dd9b5e999","observation_id":"2027a0c2-8aa6-414c-8543-c10731b1bfbc","resolution":{"observed_at":"2026-05-16T20:10:27.817218Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zhang, P","venue":null,"work_id":"420925e6-15c6-4a62-8a35-b3d0d63af358","year":2022},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:2ed8e07183bd158fb3662fd6cf33e380fad75d5f2b20ca89ce046d0077930541","observation_id":"4eef3165-d815-461c-9d58-baed95544be4","resolution":{"observed_at":"2026-05-16T20:10:27.950812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06462","last_updated":"2025-04-18T16:42:48Z","snapshot_observed_at":"2026-08-09T14:45:06.557931Z","submitted_at":"2024-06-10T16:58:48Z","title":"VCR: A Task for Pixel-Level Complex Reasoning in Vision Language Models via Restoring Occluded Text","version":4},"cited_work":{"arxiv_id":"2406.06462","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.06462","snapshot_observed_at":"2026-07-03T17:18:43.988790Z","title":"Vcr: Visual caption restoration","venue":null,"work_id":"7012a43a-6e09-4f9f-b77e-9b4483e38072","year":2024},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"cited_paper":"/paper/2406.06462","citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:d6c0d1107990e4aee821edeb4669c484e2c86f6952be09734eea35dffa6e7018","observation_id":"7a856c60-8a1e-498a-be79-9ab924c70cf5","resolution":{"observed_at":"2026-05-16T20:10:27.827632Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"It features a blue and white circular design with a black border","venue":null,"work_id":"3421d622-2054-49bb-9a17-b7b4e67b562b","year":null},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:1872313b22d68071846aa1d9a758ad13ac246040010f10132abb187ce6fd9a1e","observation_id":"426d7758-4284-4e31-a0cb-05e65d850e1f","resolution":{"observed_at":"2026-05-16T20:10:27.953910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"It consists of a stylized letter \"Q\" enclosed within a circular shape","venue":null,"work_id":"864b7823-8c68-4583-b08e-3fa2deb3cfc1","year":null},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:16d3182daacb71d93bbbcea789daaf7eae50747750b4fc3a77c67bd62203dcb0","observation_id":"e51ea41b-eae4-428d-8390-f18a89c42103","resolution":{"observed_at":"2026-05-16T20:10:27.957571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"N/A\" instead).{","venue":null,"work_id":"9a20feb1-7d33-45cd-99f2-0520875195e8","year":1988},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:4f38ec8ea60c02718db2bfa96ff2bbddc49dc8bd4ae1a1d2beab97a06e48e6a0","observation_id":"36b71b83-e388-4da3-884a-785ad178df4d","resolution":{"observed_at":"2026-05-16T20:10:27.963491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding"},"reference_resolution":{"displayed":94,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":1,"unresolved":35,"verified_exact":28,"verified_fuzzy":29},"total_outbound_references":94},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 94 of 94 outbound references and 100 inbound Pith citation observations for arXiv:2408.16500."}