{"as_of":"2026-08-12T20:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1c7f5d338cebac513de944b312f62f1454ebcaabf9ef16c3596ac76443ab0b44","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-15T15:46:06.334088Z","state":"measured"},{"denominator":133,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":133,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":169,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T19:55:47.889395Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":77,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":"2311.03079","doi":"10.48550/arxiv.2311.03079","metadata_source":"pith","pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVLM: Visual Expert for Pretrained Language Models","venue":"cs.CV","work_id":"0d81fb99-dae6-46d2-8bed-c01dcbd7d7cf","year":2023},"citing_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-16T02:56:41.658658Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2306.13549"},"observation_digest":"sha256:13df58ae2bfc93ac987e8425463b1ba3f3464c6db509200112a2d90a7f49afa5","observation_id":"bb0b95b1-382f-4360-be3b-63d8e10b47e8","resolution":{"observed_at":"2026-05-16T02:56:42.577157Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":"2311.03079","doi":"10.48550/arxiv.2311.03079","metadata_source":"pith","pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVLM: Visual Expert for Pretrained Language Models","venue":"cs.CV","work_id":"0d81fb99-dae6-46d2-8bed-c01dcbd7d7cf","year":2023},"citing_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-12T17:20:53.687692Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2307.06281"},"observation_digest":"sha256:cc09b8a08d4faa8c32e3bbde06601bb12da27b1ae85bf6d7f968044366effae6","observation_id":"f01eb9ad-d63b-4779-aacf-59f9eded3c5a","resolution":{"observed_at":"2026-05-15T15:46:06.589810Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":"2311.03079","doi":"10.48550/arxiv.2311.03079","metadata_source":"pith","pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVLM: Visual Expert for Pretrained Language Models","venue":"cs.CV","work_id":"0d81fb99-dae6-46d2-8bed-c01dcbd7d7cf","year":2023},"citing_paper":{"arxiv_id":"2311.16502","last_updated":"2024-06-13T15:02:39Z","snapshot_observed_at":"2026-08-12T16:58:06.280003Z","submitted_at":"2023-11-27T17:33:21Z","title":"MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI","version":4},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-15T05:37:41.401736Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2311.16502"},"observation_digest":"sha256:4c1174f1ee5debb4882aa62b2e3c9d1d3daf972337023e95e7cbae492ea721c3","observation_id":"cd2b4c3f-a9fb-4032-8ada-7fea5f961cd6","resolution":{"observed_at":"2026-05-15T15:46:06.589810Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":"2311.03079","doi":"10.48550/arxiv.2311.03079","metadata_source":"pith","pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVLM: Visual Expert for Pretrained Language Models","venue":"cs.CV","work_id":"0d81fb99-dae6-46d2-8bed-c01dcbd7d7cf","year":2023},"citing_paper":{"arxiv_id":"2401.10935","last_updated":"2024-02-23T04:36:51Z","snapshot_observed_at":"2026-08-11T07:36:02.871665Z","submitted_at":"2024-01-17T08:10:35Z","title":"SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-17T10:09:46.447508Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2401.10935"},"observation_digest":"sha256:2c237efc3965cf4798cf151549fac9c98dc7150d0708894256853c9525083800","observation_id":"c3857ff0-9581-4aae-be51-8c33e9374e42","resolution":{"observed_at":"2026-05-17T10:09:46.664149Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":"2311.03079","doi":"10.48550/arxiv.2311.03079","metadata_source":"pith","pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVLM: Visual Expert for Pretrained Language Models","venue":"cs.CV","work_id":"0d81fb99-dae6-46d2-8bed-c01dcbd7d7cf","year":2023},"citing_paper":{"arxiv_id":"2402.12289","last_updated":"2024-06-25T17:55:35Z","snapshot_observed_at":"2026-08-10T03:38:23.239399Z","submitted_at":"2024-02-19T17:04:04Z","title":"DriveVLM: The Convergence of Autonomous Driving and Large Vision-Language Models","version":5},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-12T19:22:35.305220Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2402.12289"},"observation_digest":"sha256:3b2ff1a35af98a411abf328c3ca8e58f1d090a62dd231d95a05af468971f49f0","observation_id":"563dea3e-45a6-4451-a552-83786cce7ae1","resolution":{"observed_at":"2026-05-15T15:46:06.589810Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":"2311.03079","doi":"10.48550/arxiv.2311.03079","metadata_source":"pith","pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVLM: Visual Expert for Pretrained Language Models","venue":"cs.CV","work_id":"0d81fb99-dae6-46d2-8bed-c01dcbd7d7cf","year":2023},"citing_paper":{"arxiv_id":"2403.03206","last_updated":"2024-03-05T18:45:39Z","snapshot_observed_at":"2026-07-06T17:40:01.975792Z","submitted_at":"2024-03-05T18:45:39Z","title":"Scaling Rectified Flow Transformers for High-Resolution Image Synthesis","version":1},"reference_index":192,"source":"arxiv_source","source_observed_at":"2026-05-12T08:27:53.446686Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2403.03206"},"observation_digest":"sha256:eac3f96ae3ca3aa93445d5e7c7478d34e9b333d402d37cbe2a06e34d629f9b5b","observation_id":"74c5dc15-11c8-4ce0-aa77-d1029d41eb18","resolution":{"observed_at":"2026-05-15T15:46:06.589810Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":"2311.03079","doi":"10.48550/arxiv.2311.03079","metadata_source":"pith","pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVLM: Visual Expert for Pretrained Language Models","venue":"cs.CV","work_id":"0d81fb99-dae6-46d2-8bed-c01dcbd7d7cf","year":2023},"citing_paper":{"arxiv_id":"2403.09611","last_updated":"2024-04-18T18:51:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-14T17:51:32Z","title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","version":4},"reference_index":114,"source":"pdf_text","source_observed_at":"2026-05-16T04:09:36.019146Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2403.09611"},"observation_digest":"sha256:ddaf1135b5efd9c71cd807b20b468ba5c717bd6f837f49238049294c9942ed2f","observation_id":"c60aef8f-086a-4728-90b2-499a09754b02","resolution":{"observed_at":"2026-05-16T04:09:36.305301Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":"2311.03079","doi":"10.48550/arxiv.2311.03079","metadata_source":"pith","pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVLM: Visual Expert for Pretrained Language Models","venue":"cs.CV","work_id":"0d81fb99-dae6-46d2-8bed-c01dcbd7d7cf","year":2023},"citing_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-17T07:44:47.355960Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2403.18814"},"observation_digest":"sha256:7e5b2416f24836b67132b0abdd0e09bbc92a65c817d44b3d5ef4ba02c784e38a","observation_id":"cde6715c-4def-4681-9d01-777b8d6b1e43","resolution":{"observed_at":"2026-05-17T07:44:47.542649Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":"2311.03079","doi":"10.48550/arxiv.2311.03079","metadata_source":"pith","pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVLM: Visual Expert for Pretrained Language Models","venue":"cs.CV","work_id":"0d81fb99-dae6-46d2-8bed-c01dcbd7d7cf","year":2023},"citing_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-12T19:41:44.263663Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2403.20330"},"observation_digest":"sha256:59fc354d50bb0ba25f42aa0caf193dcdf926979de9726ee8fdfefd9ba7a471c1","observation_id":"91d94187-9a12-40b2-9836-1c4a7b0ea5a5","resolution":{"observed_at":"2026-05-15T15:46:06.589810Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":"2311.03079","doi":"10.48550/arxiv.2311.03079","metadata_source":"pith","pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVLM: Visual Expert for Pretrained Language Models","venue":"cs.CV","work_id":"0d81fb99-dae6-46d2-8bed-c01dcbd7d7cf","year":2023},"citing_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"reference_index":117,"source":"pdf_text","source_observed_at":"2026-05-12T20:58:58.849040Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2404.16821"},"observation_digest":"sha256:23e8270e9eb296ba789edfb8bb3845dc34e609a0065f46aaa5676f1040a9db33","observation_id":"ed3cac7c-96ca-47b9-8f86-8590ce4ce26e","resolution":{"observed_at":"2026-05-15T15:46:06.589810Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":"2311.03079","doi":"10.48550/arxiv.2311.03079","metadata_source":"pith","pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVLM: Visual Expert for Pretrained Language Models","venue":"cs.CV","work_id":"0d81fb99-dae6-46d2-8bed-c01dcbd7d7cf","year":2023},"citing_paper":{"arxiv_id":"2404.18930","last_updated":"2025-04-01T18:36:08Z","snapshot_observed_at":"2026-08-06T19:08:14.800394Z","submitted_at":"2024-04-29T17:59:41Z","title":"Hallucination of Multimodal Large Language Models: A Survey","version":2},"reference_index":169,"source":"pdf_text","source_observed_at":"2026-05-11T12:33:32.631346Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2404.18930"},"observation_digest":"sha256:e4b349d0a9290d8623fb733173cab7a26c7f5d6615f23082a95a2a3144a7a00b","observation_id":"2728c380-e409-4570-ba97-9d949b7b1da1","resolution":{"observed_at":"2026-05-15T15:46:06.589810Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":"2311.03079","doi":"10.48550/arxiv.2311.03079","metadata_source":"pith","pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVLM: Visual Expert for Pretrained Language Models","venue":"cs.CV","work_id":"0d81fb99-dae6-46d2-8bed-c01dcbd7d7cf","year":2023},"citing_paper":{"arxiv_id":"2405.19088","last_updated":"2026-04-15T02:26:56Z","snapshot_observed_at":"2026-07-06T18:21:57.091728Z","submitted_at":"2024-05-29T13:51:43Z","title":"Cracking the Code of Juxtaposition: Can AI Models Understand the Humorous Contradictions","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-24T00:52:52.056076Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2405.19088"},"observation_digest":"sha256:07301ce030578de6e82591c95451bb7b488f475c519105be7e8ac0e77af02466","observation_id":"c02d76f9-d739-43c7-88aa-ba2ab3e72a24","resolution":{"observed_at":"2026-05-24T00:53:40.687462Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":"2311.03079","doi":"10.48550/arxiv.2311.03079","metadata_source":"pith","pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVLM: Visual Expert for Pretrained Language Models","venue":"cs.CV","work_id":"0d81fb99-dae6-46d2-8bed-c01dcbd7d7cf","year":2023},"citing_paper":{"arxiv_id":"2406.08035","last_updated":"2025-08-09T10:54:59Z","snapshot_observed_at":"2026-08-08T19:38:26.415599Z","submitted_at":"2024-06-12T09:36:52Z","title":"LVBench: An Extreme Long Video Understanding Benchmark","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-19T11:55:30.048525Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2406.08035"},"observation_digest":"sha256:91d61fa3f549d3a5e4d86a85f74cdc208fda3acba25c422029522932fdb9d6e0","observation_id":"37fccd2a-a5a8-4c60-a750-8f363b616856","resolution":{"observed_at":"2026-05-19T11:55:30.076307Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":"2311.03079","doi":"10.48550/arxiv.2311.03079","metadata_source":"pith","pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVLM: Visual Expert for Pretrained Language Models","venue":"cs.CV","work_id":"0d81fb99-dae6-46d2-8bed-c01dcbd7d7cf","year":2023},"citing_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"reference_index":143,"source":"pdf_text","source_observed_at":"2026-05-11T13:10:19.972353Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2407.07726"},"observation_digest":"sha256:13b4616c886ac9c1055b85b19d07b9df97840bf7250dbfc6177fa566d845d804","observation_id":"91b19249-652c-4607-900e-656d843fa259","resolution":{"observed_at":"2026-05-15T15:46:06.589810Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":"2311.03079","doi":"10.48550/arxiv.2311.03079","metadata_source":"pith","pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVLM: Visual Expert for Pretrained Language Models","venue":"cs.CV","work_id":"0d81fb99-dae6-46d2-8bed-c01dcbd7d7cf","year":2023},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:4a25d634dc8091125c94f2cfc37c1827e8fa32df9eca0fe1ccd0f55ad1f3e7be","observation_id":"8388e13e-22c3-4078-8a3b-d33e97485d23","resolution":{"observed_at":"2026-05-15T15:46:06.589810Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":"2311.03079","doi":"10.48550/arxiv.2311.03079","metadata_source":"pith","pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVLM: Visual Expert for Pretrained Language Models","venue":"cs.CV","work_id":"0d81fb99-dae6-46d2-8bed-c01dcbd7d7cf","year":2023},"citing_paper":{"arxiv_id":"2408.04840","last_updated":"2024-08-13T08:10:32Z","snapshot_observed_at":"2026-07-06T18:58:39.334273Z","submitted_at":"2024-08-09T03:25:42Z","title":"mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models","version":2},"reference_index":250,"source":"arxiv_source","source_observed_at":"2026-05-20T06:20:36.235304Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2408.04840"},"observation_digest":"sha256:8a5b27462f5feb7c4fb376ed0b7dca8c69571f782d1e3618084356acc55ec5b9","observation_id":"7f99b24f-61a3-40f1-b2db-3c1b961f7800","resolution":{"observed_at":"2026-05-20T06:20:36.522342Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":"2311.03079","doi":"10.48550/arxiv.2311.03079","metadata_source":"pith","pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVLM: Visual Expert for Pretrained Language Models","venue":"cs.CV","work_id":"0d81fb99-dae6-46d2-8bed-c01dcbd7d7cf","year":2023},"citing_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"reference_index":103,"source":"arxiv_source","source_observed_at":"2026-05-10T18:26:22.224924Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2408.06072"},"observation_digest":"sha256:4eb95925bdfee137b82ebc9f789a8e7dcd58ce3c191ef2ebdbf083e753c4168a","observation_id":"d94def45-28f3-4cc1-9511-1acdca22261a","resolution":{"observed_at":"2026-05-15T15:46:06.589810Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":"2311.03079","doi":"10.48550/arxiv.2311.03079","metadata_source":"pith","pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVLM: Visual Expert for Pretrained Language Models","venue":"cs.CV","work_id":"0d81fb99-dae6-46d2-8bed-c01dcbd7d7cf","year":2023},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:dfe00063975f0aad7624a744cc4217d181600c54d98df354257b9b3019c08689","observation_id":"defb3e9e-c668-49ce-91df-cbdba7e44a1d","resolution":{"observed_at":"2026-05-16T20:10:27.751296Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":"2311.03079","doi":"10.48550/arxiv.2311.03079","metadata_source":"pith","pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVLM: Visual Expert for Pretrained Language Models","venue":"cs.CV","work_id":"0d81fb99-dae6-46d2-8bed-c01dcbd7d7cf","year":2023},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:65373fddfec8a0f7516e1cabb18f2798b897509d0cd97226dcd1dd5a478174d0","observation_id":"724ddaa9-7e39-4b2a-adf6-984c04aa1b4f","resolution":{"observed_at":"2026-05-15T15:46:06.589810Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":"2311.03079","doi":"10.48550/arxiv.2311.03079","metadata_source":"pith","pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVLM: Visual Expert for Pretrained Language Models","venue":"cs.CV","work_id":"0d81fb99-dae6-46d2-8bed-c01dcbd7d7cf","year":2023},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:c87772906344a956ad3e4589cf4018ed784a4848530916facfa386bb44f1f968","observation_id":"dedad807-91d7-4d41-ad1f-0185068474a2","resolution":{"observed_at":"2026-05-23T20:13:24.656773Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":"2311.03079","doi":"10.48550/arxiv.2311.03079","metadata_source":"pith","pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVLM: Visual Expert for Pretrained Language Models","venue":"cs.CV","work_id":"0d81fb99-dae6-46d2-8bed-c01dcbd7d7cf","year":2023},"citing_paper":{"arxiv_id":"2410.10594","last_updated":"2025-03-02T01:19:51Z","snapshot_observed_at":"2026-08-12T04:43:44.229948Z","submitted_at":"2024-10-14T15:04:18Z","title":"VisRAG: Vision-based Retrieval-augmented Generation on Multi-modality Documents","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-16T15:37:25.781240Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2410.10594"},"observation_digest":"sha256:fdb660ca69fe8ea87f6cdc829f778d6301035d0a443f1e0d7e5a5ee646b2ac4f","observation_id":"74d654de-be48-4838-aaa6-d1f869bc91ca","resolution":{"observed_at":"2026-05-16T15:37:25.839749Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":"2311.03079","doi":"10.48550/arxiv.2311.03079","metadata_source":"pith","pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVLM: Visual Expert for Pretrained Language Models","venue":"cs.CV","work_id":"0d81fb99-dae6-46d2-8bed-c01dcbd7d7cf","year":2023},"citing_paper":{"arxiv_id":"2410.17434","last_updated":"2024-10-22T21:21:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-22T21:21:37Z","title":"LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-16T13:53:33.585035Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2410.17434"},"observation_digest":"sha256:77a8c001ea5b1a5f96b4e78974daf9f5f05b75f741c32f98bb50035888a2ddec","observation_id":"ab197ee2-0f26-4732-8964-92cdb419fb80","resolution":{"observed_at":"2026-05-16T13:53:33.703016Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":"2311.03079","doi":"10.48550/arxiv.2311.03079","metadata_source":"pith","pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVLM: Visual Expert for Pretrained Language Models","venue":"cs.CV","work_id":"0d81fb99-dae6-46d2-8bed-c01dcbd7d7cf","year":2023},"citing_paper":{"arxiv_id":"2410.22313","last_updated":"2024-10-29T17:53:56Z","snapshot_observed_at":"2026-07-31T01:16:26.372370Z","submitted_at":"2024-10-29T17:53:56Z","title":"Senna: Bridging Large Vision-Language Models and End-to-End Autonomous Driving","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T15:24:23.756052Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2410.22313"},"observation_digest":"sha256:de644ae286be747f2ecda18b97993c8f4d00b7817228fcc7e08030b703ba8142","observation_id":"61c960ff-14dc-47dc-a679-324aae4881cc","resolution":{"observed_at":"2026-05-15T15:46:06.589810Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":"2311.03079","doi":"10.48550/arxiv.2311.03079","metadata_source":"pith","pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVLM: Visual Expert for Pretrained Language Models","venue":"cs.CV","work_id":"0d81fb99-dae6-46d2-8bed-c01dcbd7d7cf","year":2023},"citing_paper":{"arxiv_id":"2411.04996","last_updated":"2025-05-08T01:53:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T18:59:06Z","title":"Mixture-of-Transformers: A Sparse and Scalable Architecture for Multi-Modal Foundation Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2411.04996"},"observation_digest":"sha256:3f127007d5eab23f26b2becdc39462ab19ea1335dc285982c88290472cb39370","observation_id":"9622adbb-a55c-4c06-a685-10946707da83","resolution":{"observed_at":"2026-05-18T02:48:44.950606Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-12T19:55:47.889395Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10187","last_updated":"2024-11-15T13:35:58Z","snapshot_observed_at":"2026-08-12T19:50:18.993773Z","submitted_at":"2024-11-15T13:35:58Z","title":"Try-On-Adapter: A Simple and Flexible Try-On Paradigm","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-12T19:55:47.889395Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2411.10187"},"observation_digest":"sha256:af105d1c886be1af8d28662be36ca006d47877a2dbcc6d57d52ce52dc38c2778","observation_id":"d93950ff-ac62-43d6-88d1-679916c8f526","resolution":{"observed_at":"2026-08-12T19:55:47.889395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":"2311.03079","doi":"10.48550/arxiv.2311.03079","metadata_source":"pith","pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVLM: Visual Expert for Pretrained Language Models","venue":"cs.CV","work_id":"0d81fb99-dae6-46d2-8bed-c01dcbd7d7cf","year":2023},"citing_paper":{"arxiv_id":"2411.10442","last_updated":"2025-04-07T09:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-15T18:59:27Z","title":"Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-16T09:16:17.150383Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2411.10442"},"observation_digest":"sha256:23bd6421ac44f98778874ac78520d2f375e3271ffecd2423a9cf8ddfb2d67ea1","observation_id":"a7edf753-b562-4d43-b73e-52dc00117bd9","resolution":{"observed_at":"2026-05-16T09:16:17.496406Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-12T19:33:01.007756Z","title":"CogVLM: Visual expert for pretrained language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10640","last_updated":"2024-11-16T00:14:51Z","snapshot_observed_at":"2026-08-12T19:26:13.887553Z","submitted_at":"2024-11-16T00:14:51Z","title":"BlueLM-V-3B: Algorithm and System Co-Design for Multimodal Large Language Models on Mobile Devices","version":1},"reference_index":126,"source":"pdf_text","source_observed_at":"2026-08-12T19:33:01.007756Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2411.10640"},"observation_digest":"sha256:c38459494bb477492e22392f2002408303391181d59fee03e047125e753e8bcc","observation_id":"d54a8d6f-325b-4336-8f18-01145263bd6f","resolution":{"observed_at":"2026-08-12T19:33:01.007756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-12T19:21:14.725897Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-12T19:14:46.493618Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T19:21:14.725897Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2411.10803"},"observation_digest":"sha256:91af549f0daf076def9754cc5a16c4ebd7499b9a853880990a35079640868085","observation_id":"0b8f65aa-c970-41fe-a198-dcaa65a8dfb4","resolution":{"observed_at":"2026-08-12T19:21:14.725897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-12T18:49:29.228243Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11235","last_updated":"2024-11-18T02:09:48Z","snapshot_observed_at":"2026-08-12T18:43:48.846339Z","submitted_at":"2024-11-18T02:09:48Z","title":"MEMO-Bench: A Multiple Benchmark for Text-to-Image and Multimodal Large Language Models on Human Emotion Analysis","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T18:49:29.228243Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2411.11235"},"observation_digest":"sha256:81322dc9b037e3848873a079fce1de0ec70703ae92bbcaf568abf490616853cb","observation_id":"5c882845-fc80-4653-a25d-4f62f7535e03","resolution":{"observed_at":"2026-08-12T18:49:29.228243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-12T16:27:47.920413Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-12T16:21:20.114613Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.920413Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:544e8a4e851acd20f35b5fe6826d75642d751b9747f70c809a53ebc275742f8c","observation_id":"1767b3c0-e5e6-4c2c-bfd6-305adca70dc8","resolution":{"observed_at":"2026-08-12T16:27:47.920413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-12T15:31:59.606386Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14164","last_updated":"2024-11-21T14:22:38Z","snapshot_observed_at":"2026-08-12T15:25:25.131146Z","submitted_at":"2024-11-21T14:22:38Z","title":"FoPru: Focal Pruning for Efficient Large Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T15:31:59.606386Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2411.14164"},"observation_digest":"sha256:707fa7535b9ade2644b1379e6936e56e61bfb6e27b473248425a15c6aa798a77","observation_id":"5ff5cd4d-0220-46b9-8588-730cdad390dd","resolution":{"observed_at":"2026-08-12T15:31:59.606386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-12T14:58:10.044146Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14795","last_updated":"2024-11-22T08:35:35Z","snapshot_observed_at":"2026-08-12T14:50:49.672929Z","submitted_at":"2024-11-22T08:35:35Z","title":"De-biased Multimodal Electrocardiogram Analysis","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-12T14:58:10.044146Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2411.14795"},"observation_digest":"sha256:6e48b33989d60a88ed3a3013dad55103ae776b1b856021c14474d0fa30c2cb09","observation_id":"21a86877-63f8-4aef-98fe-69ff3cccdbea","resolution":{"observed_at":"2026-08-12T14:58:10.044146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-12T14:58:43.106019Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-12T14:50:27.319819Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:43.106019Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:6bba03d675a65dc399f77c960f10b14d12ce220ceee0bf5ffa6ebb7a3146515c","observation_id":"a0a32663-3ec7-471b-90af-7515e6269bf9","resolution":{"observed_at":"2026-08-12T14:58:43.106019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-12T14:31:37.456232Z","title":"Cogvlm: Visual expert for pretrained language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15296","last_updated":"2024-12-08T04:24:31Z","snapshot_observed_at":"2026-08-12T14:24:51.823396Z","submitted_at":"2024-11-22T18:59:54Z","title":"MME-Survey: A Comprehensive Survey on Evaluation of Multimodal LLMs","version":2},"reference_index":184,"source":"pdf_text","source_observed_at":"2026-08-12T14:31:37.456232Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2411.15296"},"observation_digest":"sha256:d08c9e9128f9ad8fc6e75c05a0a7ca79ca6c05675b78e34ca3c298a984296ad5","observation_id":"64d55457-6c01-4971-a84b-5ff9ad6c3059","resolution":{"observed_at":"2026-08-12T14:31:37.456232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-12T13:03:42.587146Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16819","last_updated":"2025-03-20T07:02:30Z","snapshot_observed_at":"2026-08-12T12:56:40.981727Z","submitted_at":"2024-11-25T16:41:45Z","title":"Pathways on the Image Manifold: Image Editing via Video Generation","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T13:03:42.587146Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2411.16819"},"observation_digest":"sha256:a6b173d48932ec604a19b9317748fb81ff015aee426c379472469034da74dd4a","observation_id":"c9b05143-1491-4162-b3e6-62c7a56d6240","resolution":{"observed_at":"2026-08-12T13:03:42.587146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-12T12:42:49.268335Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17760","last_updated":"2024-11-26T00:44:37Z","snapshot_observed_at":"2026-08-12T14:21:15.437536Z","submitted_at":"2024-11-26T00:44:37Z","title":"Efficient Self-Improvement in Multimodal Large Language Models: A Model-Level Judge-Free Approach","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T12:42:49.268335Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2411.17760"},"observation_digest":"sha256:b2df440bd403af91f326c459155fc04f4cf0f5d375967e0bec10100cbb94ef78","observation_id":"edea6d44-21f1-4b73-93e6-bf0f9cdef135","resolution":{"observed_at":"2026-08-12T12:42:49.268335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-12T11:19:33.850035Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-12T11:14:28.515103Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.850035Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:26a4c63cbef7c5286ff5b5b3d0ec9504e7b32d300879c6128224dc92038faa4b","observation_id":"585288b8-058f-4bc6-a95a-b5a3a7a589b7","resolution":{"observed_at":"2026-08-12T11:19:33.850035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-12T13:46:28.198600Z","title":"Cogvlm: Visual expert for pretrained language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00056","last_updated":"2024-11-24T17:49:48Z","snapshot_observed_at":"2026-08-12T13:41:06.623009Z","submitted_at":"2024-11-24T17:49:48Z","title":"Improving Medical Diagnostics with Vision-Language Models: Convex Hull-Based Uncertainty Analysis","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T13:46:28.198600Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2412.00056"},"observation_digest":"sha256:0d119a26d1db24484989ad26f1719caec66708bfbbef72db026b6375f59e3f5f","observation_id":"dfa154cd-9702-4351-b68a-78497c026d30","resolution":{"observed_at":"2026-08-12T13:46:28.198600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":"2311.03079","doi":"10.48550/arxiv.2311.03079","metadata_source":"pith","pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVLM: Visual Expert for Pretrained Language Models","venue":"cs.CV","work_id":"0d81fb99-dae6-46d2-8bed-c01dcbd7d7cf","year":2023},"citing_paper":{"arxiv_id":"2412.00727","last_updated":"2026-04-07T12:10:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-01T08:39:12Z","title":"Perturb and Recover: Fine-tuning for Effective Backdoor Removal from CLIP","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-23T08:16:53.133986Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2412.00727"},"observation_digest":"sha256:f674cd5beabae4f520966e4130655ff2db620815f9a13cc69e90e10b2dd68d7f","observation_id":"8332cbc5-faa8-4c16-95d2-3ed4313155c7","resolution":{"observed_at":"2026-05-23T08:17:43.774916Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-12T05:06:45.305321Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00756","last_updated":"2024-12-08T05:04:49Z","snapshot_observed_at":"2026-08-12T04:59:53.231047Z","submitted_at":"2024-12-01T10:29:36Z","title":"Multi-View Incongruity Learning for Multimodal Sarcasm Detection","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-12T05:06:45.305321Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2412.00756"},"observation_digest":"sha256:b7b68541e2bf7cfd9f1ffc27da664da2023161a34718363d7108ec7ab0aced0b","observation_id":"6342a59d-883b-4146-85e9-a195894c8a59","resolution":{"observed_at":"2026-08-12T05:06:45.305321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-12T04:57:58.648038Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00878","last_updated":"2024-12-06T17:14:05Z","snapshot_observed_at":"2026-08-12T15:50:41.589910Z","submitted_at":"2024-12-01T16:36:22Z","title":"Beyond Pixels: Text Enhances Generalization in Real-World Image Restoration","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T04:57:58.648038Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2412.00878"},"observation_digest":"sha256:0f26c9368ac637b7f5250135d4d2e6e601318a35b23a49b78198267aeddc0de4","observation_id":"52e08cb8-b7fd-4948-8414-c6623e9a8449","resolution":{"observed_at":"2026-08-12T04:57:58.648038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-11T23:56:46.488520Z","title":"arXiv preprint arXiv:2311.03079 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02025","last_updated":"2024-12-02T23:08:38Z","snapshot_observed_at":"2026-08-12T15:15:27.016425Z","submitted_at":"2024-12-02T23:08:38Z","title":"PKRD-CoT: A Unified Chain-of-thought Prompting for Multi-Modal Large Language Models in Autonomous Driving","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T23:56:46.488520Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2412.02025"},"observation_digest":"sha256:8a0a2780fbed351c8498f7063e5f970799d8dd1912442f4a2c651458003e6aa5","observation_id":"49e0f7b4-3685-4d8d-8ba2-841c10fe3838","resolution":{"observed_at":"2026-08-11T23:56:46.488520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-11T23:50:37.093016Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02158","last_updated":"2024-12-04T08:34:49Z","snapshot_observed_at":"2026-08-12T14:25:50.767875Z","submitted_at":"2024-12-03T04:34:23Z","title":"Agri-LLaVA: Knowledge-Infused Large Multimodal Assistant on Agricultural Pests and Diseases","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:37.093016Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2412.02158"},"observation_digest":"sha256:bbf97e7a918a6d6ceb0b49886f7138992e0d42e07b42901092b0f59bdf6bcb7b","observation_id":"e2caa988-2a4a-4ab2-8623-9eebfe452aa3","resolution":{"observed_at":"2026-08-11T23:50:37.093016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-11T23:19:11.668665Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02611","last_updated":"2024-12-03T17:41:23Z","snapshot_observed_at":"2026-08-12T12:13:39.433245Z","submitted_at":"2024-12-03T17:41:23Z","title":"AV-Odyssey Bench: Can Your Multimodal LLMs Really Understand Audio-Visual Information?","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T23:19:11.668665Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2412.02611"},"observation_digest":"sha256:2a1248f40cefbad9b73a9c1a90c621b2d6b88c88f7e30fa7110430d111b3486d","observation_id":"d4ba772b-d8ff-4974-9980-796228dceb1a","resolution":{"observed_at":"2026-08-11T23:19:11.668665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-11T22:56:44.666623Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03002","last_updated":"2025-03-09T13:26:29Z","snapshot_observed_at":"2026-08-12T17:27:32.038344Z","submitted_at":"2024-12-04T03:42:39Z","title":"AdvDreamer Unveils: Are Vision-Language Models Truly Ready for Real-World 3D Variations?","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T22:56:44.666623Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2412.03002"},"observation_digest":"sha256:c5e11a91311e42b615e51f87dec97f13af73be551b3b01186bc0c640206d694c","observation_id":"96a96334-1a74-4b8c-946b-61c0d9d3a5e4","resolution":{"observed_at":"2026-08-11T22:56:44.666623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-11T22:16:58.741333Z","title":"arXiv preprint arXiv:2311.03079 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-11T22:11:08.091648Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.741333Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:9e8e80dff256bc91886c8a170096df66c625c306bab05f32fa45296b45fed823","observation_id":"6146e7bc-49c0-40c8-8f60-38f6987a6fd9","resolution":{"observed_at":"2026-08-11T22:16:58.741333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-11T22:18:01.649362Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03704","last_updated":"2025-06-30T20:29:34Z","snapshot_observed_at":"2026-08-11T22:08:17.756402Z","submitted_at":"2024-12-04T20:35:07Z","title":"Scaling Inference-Time Search with Vision Value Model for Improved Visual Comprehension","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T22:18:01.649362Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2412.03704"},"observation_digest":"sha256:a8478a8de482bf3437a6730d2bd6361cf43f1038a39a257863ae2d2956390824","observation_id":"39a38205-86a0-41d5-8e18-fbdee6d4621a","resolution":{"observed_at":"2026-08-11T22:18:01.649362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-11T21:45:35.942543Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04146","last_updated":"2025-01-06T06:56:03Z","snapshot_observed_at":"2026-08-12T17:46:15.123780Z","submitted_at":"2024-12-05T13:16:47Z","title":"AnyDressing: Customizable Multi-Garment Virtual Dressing via Latent Diffusion Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T21:45:35.942543Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2412.04146"},"observation_digest":"sha256:ace0ea710d02b12d422f890ed5e7d731e1c4b80cc191306dffab9ba85c05d9b3","observation_id":"9a50e6e9-38ca-415a-a5a2-167b8703414a","resolution":{"observed_at":"2026-08-11T21:45:35.942543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-11T21:29:26.508759Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04378","last_updated":"2025-05-08T19:16:29Z","snapshot_observed_at":"2026-08-11T22:16:48.221162Z","submitted_at":"2024-12-05T17:54:27Z","title":"VladVA: Discriminative Fine-tuning of LVLMs","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:26.508759Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2412.04378"},"observation_digest":"sha256:dd71befa167bf7e9178f4849cb26223a3a8c7461f2c3dd3864aa9245b5176bff","observation_id":"630d2cc9-02a1-4e40-8ccb-e6e1e968d272","resolution":{"observed_at":"2026-08-11T21:29:26.508759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":"2311.03079","doi":"10.48550/arxiv.2311.03079","metadata_source":"pith","pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVLM: Visual Expert for Pretrained Language Models","venue":"cs.CV","work_id":"0d81fb99-dae6-46d2-8bed-c01dcbd7d7cf","year":2023},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":249,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:1c93dce9e6535cafb4645850b8711c89a0ff823144411ecbc3eb36c71f6dfbc2","observation_id":"927b86c0-83fc-4ee1-8fa7-88eb074a9566","resolution":{"observed_at":"2026-05-15T15:46:06.589810Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-11T20:32:31.756956Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.05679","last_updated":"2024-12-10T02:23:30Z","snapshot_observed_at":"2026-08-12T05:19:12.753205Z","submitted_at":"2024-12-07T15:11:21Z","title":"RSUniVLM: A Unified Vision Language Model for Remote Sensing via Granularity-oriented Mixture of Experts","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T20:32:31.756956Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2412.05679"},"observation_digest":"sha256:518686eca2593b5eec55d1162ad869d5299b509e553bd2ed9eb179fcc571843b","observation_id":"5c68940f-5fda-4306-97e0-a664b6ef4eea","resolution":{"observed_at":"2026-08-11T20:32:31.756956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-11T20:23:18.691345Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.05819","last_updated":"2024-12-08T05:29:39Z","snapshot_observed_at":"2026-08-12T04:14:49.076577Z","submitted_at":"2024-12-08T05:29:39Z","title":"[CLS] Token Tells Everything Needed for Training-free Efficient MLLMs","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T20:23:18.691345Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2412.05819"},"observation_digest":"sha256:e6a10c4a0578a09a3d6d71f6567f0113730dba95dd6d6a78643048965bb81f27","observation_id":"b17676b0-df9e-4568-9076-ca336662f59a","resolution":{"observed_at":"2026-08-11T20:23:18.691345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-11T17:00:09.024739Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09604","last_updated":"2024-12-12T18:59:26Z","snapshot_observed_at":"2026-08-11T20:41:55.840334Z","submitted_at":"2024-12-12T18:59:26Z","title":"SynerGen-VL: Towards Synergistic Image Understanding and Generation with Vision Experts and Token Folding","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-11T17:00:09.024739Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2412.09604"},"observation_digest":"sha256:61788e555ba0ae9a36c0272f6fd95776254507752f4bc98c7b95ce9fd73bdb9e","observation_id":"d0eaa8d3-4c83-47aa-8133-c6cca7ca74b2","resolution":{"observed_at":"2026-08-11T17:00:09.024739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-11T16:45:44.816068Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-12T04:14:50.154967Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.816068Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:2a634175d843f46dd49b3e2c3d798db089318919325ff80349a4eba4c64de8e5","observation_id":"e68e8702-e122-46c0-9500-451de0b6bcb1","resolution":{"observed_at":"2026-08-11T16:45:44.816068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-11T16:35:39.968009Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09946","last_updated":"2024-12-13T08:10:56Z","snapshot_observed_at":"2026-08-11T16:30:11.565721Z","submitted_at":"2024-12-13T08:10:56Z","title":"Enhancing Nursing and Elderly Care with Large Language Models: An AI-Driven Framework","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T16:35:39.968009Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2412.09946"},"observation_digest":"sha256:8b652deabbf946bd25b56c9ee4dc102dca7b3a2ab05990d52401a34dd44d2a10","observation_id":"4ea7d8b6-87ae-4ddc-ab77-d7f697758fd0","resolution":{"observed_at":"2026-08-11T16:35:39.968009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-11T15:38:09.327899Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10840","last_updated":"2024-12-14T14:30:05Z","snapshot_observed_at":"2026-08-12T10:19:11.167586Z","submitted_at":"2024-12-14T14:30:05Z","title":"Attention-driven GUI Grounding: Leveraging Pretrained Multimodal Large Language Models without Fine-Tuning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T15:38:09.327899Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2412.10840"},"observation_digest":"sha256:ed604e097a06a6f0172ce99b0c473745913aef0ab81d2da39f319d32f1852ce1","observation_id":"877ec80c-6122-4bc2-ac7d-1dc5a236e381","resolution":{"observed_at":"2026-08-11T15:38:09.327899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-11T14:34:00.743480Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11892","last_updated":"2024-12-17T04:38:28Z","snapshot_observed_at":"2026-08-11T14:26:29.103281Z","submitted_at":"2024-12-16T15:41:14Z","title":"From 2D CAD Drawings to 3D Parametric Models: A Vision-Language Approach","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T14:34:00.743480Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2412.11892"},"observation_digest":"sha256:2e92177fe605b69656813ba23aa6f4bee41c88a3570f1a679c1a13e1befb9c20","observation_id":"2749b36c-99e9-4b98-b6ed-a938fe68861a","resolution":{"observed_at":"2026-08-11T14:34:00.743480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-11T14:32:24.249886Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-11T14:25:38.533595Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:24.249886Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:e0a44f6aaf0ae26c013e0341c7125972c1431d305c3ca292d47f6c9f719cba6b","observation_id":"ecb7134a-b6a2-4d1b-af30-570c73754c14","resolution":{"observed_at":"2026-08-11T14:32:24.249886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-11T14:29:04.408030Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11952","last_updated":"2024-12-16T16:35:35Z","snapshot_observed_at":"2026-08-12T02:33:32.842324Z","submitted_at":"2024-12-16T16:35:35Z","title":"Advancing Comprehensive Aesthetic Insight with Multi-Scale Text-Guided Self-Supervised Learning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T14:29:04.408030Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2412.11952"},"observation_digest":"sha256:a7e4a4d7f8997e91cf1dd65c9c2b5725e21b0cac6bf872ad607c9b50b4507d65","observation_id":"f706b0dc-398a-4973-92fb-f12b81ed17fb","resolution":{"observed_at":"2026-08-11T14:29:04.408030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-11T18:19:03.957978Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12150","last_updated":"2024-12-11T05:29:54Z","snapshot_observed_at":"2026-08-12T00:20:51.372366Z","submitted_at":"2024-12-11T05:29:54Z","title":"Rethinking Comprehensive Benchmark for Chart Understanding: A Perspective from Scientific Literature","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T18:19:03.957978Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2412.12150"},"observation_digest":"sha256:8ca7ed2ce870db67d84438d79c5556805ef177a2611ce4b68be864f656126eb1","observation_id":"4ca56343-1589-4d85-a10a-5f224ddf4070","resolution":{"observed_at":"2026-08-11T18:19:03.957978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-11T13:58:43.716199Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12606","last_updated":"2024-12-17T07:06:10Z","snapshot_observed_at":"2026-08-11T20:30:36.661178Z","submitted_at":"2024-12-17T07:06:10Z","title":"Multi-Dimensional Insights: Benchmarking Real-World Personalization in Large Multimodal Models","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-11T13:58:43.716199Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2412.12606"},"observation_digest":"sha256:594672187c53edf904b41dda2f388e057a2f1f1d69db12c24cba242dd352588d","observation_id":"dadbc503-a094-43af-b542-441b1a132c0b","resolution":{"observed_at":"2026-08-11T13:58:43.716199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-11T13:09:46.253907Z","title":"Cogvlm: Visual expert for pretrained language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13437","last_updated":"2024-12-18T02:15:31Z","snapshot_observed_at":"2026-08-11T16:12:55.845810Z","submitted_at":"2024-12-18T02:15:31Z","title":"Deploying Foundation Model Powered Agent Services: A Survey","version":1},"reference_index":157,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:46.253907Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2412.13437"},"observation_digest":"sha256:64cd576e96938bb6f5c6bcf89beafcfc1479e0540cc0626c6300da9e4e4c7e32","observation_id":"86015391-7127-4d78-811c-616777739bfe","resolution":{"observed_at":"2026-08-11T13:09:46.253907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-11T13:03:42.330170Z","title":"CogVLM: Visual expert for pretrained language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13599","last_updated":"2024-12-18T08:31:26Z","snapshot_observed_at":"2026-08-12T00:07:04.086581Z","submitted_at":"2024-12-18T08:31:26Z","title":"Unlocking the Potential of Weakly Labeled Data: A Co-Evolutionary Learning Framework for Abnormality Detection and Report Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T13:03:42.330170Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2412.13599"},"observation_digest":"sha256:29d3275880eb9f967c4cebf07072ebd3d1b960ba56bf488c098ed2d26227cb58","observation_id":"bfe81834-379f-4856-a0b2-c8471692022d","resolution":{"observed_at":"2026-08-11T13:03:42.330170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-11T13:02:11.018923Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13636","last_updated":"2024-12-18T09:09:41Z","snapshot_observed_at":"2026-08-11T12:54:12.968958Z","submitted_at":"2024-12-18T09:09:41Z","title":"Consistency of Compositional Generalization across Multiple Levels","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T13:02:11.018923Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2412.13636"},"observation_digest":"sha256:f2a65d5b9c4c28a5edb08d1d14e68b3cb4ceb55f471cc628efa9a30ca2d27855","observation_id":"b4dce76a-0d41-4b56-a2ee-5d023895c247","resolution":{"observed_at":"2026-08-11T13:02:11.018923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":"2311.03079","doi":"10.48550/arxiv.2311.03079","metadata_source":"pith","pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVLM: Visual Expert for Pretrained Language Models","venue":"cs.CV","work_id":"0d81fb99-dae6-46d2-8bed-c01dcbd7d7cf","year":2023},"citing_paper":{"arxiv_id":"2412.17574","last_updated":"2026-04-13T15:05:36Z","snapshot_observed_at":"2026-07-06T20:12:09.120832Z","submitted_at":"2024-12-23T13:45:56Z","title":"HumanVBench: Probing Human-Centric Video Understanding in MLLMs with Automatically Synthesized Benchmarks","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-23T07:05:08.716223Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2412.17574"},"observation_digest":"sha256:0c87312cb52a32a6cd7b122457419ee7796fb0118b4bf13076d17fef2a5b7750","observation_id":"0dfd2b33-9f51-48f3-9f88-6e7ca5665c2e","resolution":{"observed_at":"2026-05-23T07:05:29.263612Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-11T05:23:02.126767Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17644","last_updated":"2025-01-18T11:08:25Z","snapshot_observed_at":"2026-08-11T22:36:55.601386Z","submitted_at":"2024-12-23T15:21:28Z","title":"DreamFit: Garment-Centric Human Generation via a Lightweight Anything-Dressing Encoder","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T05:23:02.126767Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2412.17644"},"observation_digest":"sha256:dcc96d50d8ac863dc97dd9f28cb905eff42ca2b4fdb16246062b649b8732573d","observation_id":"5aed9335-5f5f-4087-81fb-1af4fb7cf83a","resolution":{"observed_at":"2026-08-11T05:23:02.126767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-11T05:08:18.392280Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-12T10:23:27.666120Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:18.392280Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:04ce195bc676af9a9f49867134c3ef001da76187c7e3f44f3c266b36ca08307d","observation_id":"252471fb-a11c-4262-80f7-2a748906c09d","resolution":{"observed_at":"2026-08-11T05:08:18.392280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-11T05:01:12.255236Z","title":"arXiv preprint arXiv:2311.03079","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18216","last_updated":"2025-01-20T06:04:13Z","snapshot_observed_at":"2026-08-11T04:53:20.454902Z","submitted_at":"2024-12-24T06:45:36Z","title":"ICM-Assistant: Instruction-tuning Multimodal Large Language Models for Rule-based Explainable Image Content Moderation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T05:01:12.255236Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2412.18216"},"observation_digest":"sha256:1eb8b5b954004f292f63841b8d3f54a88c04a0b46a382c0669fff2a9b08e9dde","observation_id":"fdc05b06-be11-43dd-bac4-348323dcb897","resolution":{"observed_at":"2026-08-11T05:01:12.255236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-11T04:29:04.330178Z","title":"CogVLM: Visual expert for pretrained language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18826","last_updated":"2024-12-25T08:31:53Z","snapshot_observed_at":"2026-08-11T16:24:19.048579Z","submitted_at":"2024-12-25T08:31:53Z","title":"RapGuard: Safeguarding Multimodal Large Language Models via Rationale-aware Defensive Prompting","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T04:29:04.330178Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2412.18826"},"observation_digest":"sha256:3f4e0de857db658ae23c8500c0982e1fa67a744acb98d08294bb9dcfdf7daf0f","observation_id":"36c3196c-d36c-4d9c-9ba2-9839c7216a56","resolution":{"observed_at":"2026-08-11T04:29:04.330178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-11T00:47:52.509718Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-11T01:45:20.152144Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.509718Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:a760f19b98ec5396244222ceb391397eb6420827631efec7aec25ec210ca92e0","observation_id":"e4514247-2ebd-4ed2-bc74-e7053b154cfd","resolution":{"observed_at":"2026-08-11T00:47:52.509718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-11T00:45:19.903369Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-11T01:06:54.161560Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.903369Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:be230bacacf0037d0dd200252e8746b39f3eec687ce6a6da9641c893887d161b","observation_id":"1b1ceba9-f1e3-476b-9189-44c649c5b49d","resolution":{"observed_at":"2026-08-11T00:45:19.903369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-11T00:18:36.839423Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19531","last_updated":"2024-12-27T08:53:37Z","snapshot_observed_at":"2026-08-11T01:08:20.491698Z","submitted_at":"2024-12-27T08:53:37Z","title":"Is Your Text-to-Image Model Robust to Caption Noise?","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T00:18:36.839423Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2412.19531"},"observation_digest":"sha256:55f239a0117632f479594649f77d22c0dc963656ae514a9bc50522ea2884cf56","observation_id":"497cdf64-dd86-408d-a9bf-31c6b0a0e194","resolution":{"observed_at":"2026-08-11T00:18:36.839423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-10T23:39:18.175993Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.20105","last_updated":"2024-12-28T10:17:29Z","snapshot_observed_at":"2026-08-10T23:30:14.051344Z","submitted_at":"2024-12-28T10:17:29Z","title":"ST$^3$: Accelerating Multimodal Large Language Model by Spatial-Temporal Visual Token Trimming","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-10T23:39:18.175993Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2412.20105"},"observation_digest":"sha256:7982323c1ce64f89baa0f65b8a05128531fc09235400a5ed977b5acac94ae1a9","observation_id":"30bed91f-ec62-4b7e-8fde-d8312b5b6016","resolution":{"observed_at":"2026-08-10T23:39:18.175993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":"2311.03079","doi":"10.48550/arxiv.2311.03079","metadata_source":"pith","pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVLM: Visual Expert for Pretrained Language Models","venue":"cs.CV","work_id":"0d81fb99-dae6-46d2-8bed-c01dcbd7d7cf","year":2023},"citing_paper":{"arxiv_id":"2412.20718","last_updated":"2026-04-08T17:39:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-30T05:18:55Z","title":"MM-MoralBench: A MultiModal Moral Evaluation Benchmark for Large Vision-Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-23T07:14:27.786918Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2412.20718"},"observation_digest":"sha256:3e450081031a22631c2409e2b3f9a9757c6b41f6758a162e49cf2e73c526431a","observation_id":"33b1bf55-a471-450e-9439-51434881b217","resolution":{"observed_at":"2026-05-23T07:15:28.516075Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":"2311.03079","doi":"10.48550/arxiv.2311.03079","metadata_source":"pith","pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVLM: Visual Expert for Pretrained Language Models","venue":"cs.CV","work_id":"0d81fb99-dae6-46d2-8bed-c01dcbd7d7cf","year":2023},"citing_paper":{"arxiv_id":"2412.21059","last_updated":"2026-01-05T02:39:01Z","snapshot_observed_at":"2026-08-12T07:31:23.124121Z","submitted_at":"2024-12-30T16:24:09Z","title":"VisionReward: Fine-Grained Multi-Dimensional Human Preference Learning for Image and Video Generation","version":4},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-16T11:49:14.698249Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2412.21059"},"observation_digest":"sha256:5e891ca3862f1778c7bf06f94993605579d11561071361adfc8b3f325f2eefca","observation_id":"bc2621c8-ed9f-4f68-b995-4d1f4e3459b5","resolution":{"observed_at":"2026-05-16T11:49:14.800686Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":"2311.03079","doi":"10.48550/arxiv.2311.03079","metadata_source":"pith","pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVLM: Visual Expert for Pretrained Language Models","venue":"cs.CV","work_id":"0d81fb99-dae6-46d2-8bed-c01dcbd7d7cf","year":2023},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-12T17:21:52.298102Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":144,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:1a42bea36362de6239640abac5b5050b2972b5351da6aa1f849ec91f522c6c24","observation_id":"9bcf1ecd-5a72-4ea7-95d3-87d3b26dae30","resolution":{"observed_at":"2026-05-17T20:33:26.906583Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-10T22:46:41.994091Z","title":"Cogvlm: Visual expert for pretrained language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00848","last_updated":"2025-06-19T13:53:18Z","snapshot_observed_at":"2026-08-12T08:44:06.186700Z","submitted_at":"2025-01-01T14:10:25Z","title":"IllusionBench+: A Large-scale and Comprehensive Benchmark for Visual Illusion Understanding in Vision-Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:41.994091Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2501.00848"},"observation_digest":"sha256:3af6a9cac33b90cf975ff81b4c31eacd4358b093bab03653959dea5bbe28f85f","observation_id":"6673995a-2184-4aa0-92c2-0e47c10a8f6f","resolution":{"observed_at":"2026-08-10T22:46:41.994091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-10T22:32:55.600402Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01428","last_updated":"2025-03-11T07:54:04Z","snapshot_observed_at":"2026-08-10T22:25:36.091919Z","submitted_at":"2025-01-02T18:59:59Z","title":"GPT4Scene: Understand 3D Scenes from Videos with Vision-Language Models","version":4},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:55.600402Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2501.01428"},"observation_digest":"sha256:bde72161853faa210b171b2c8e7cce82527cbc674fd623187af02f23e42f5509","observation_id":"f57e492e-a729-44b6-ab68-593985511094","resolution":{"observed_at":"2026-08-10T22:32:55.600402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-10T22:23:27.822294Z","title":"Cross-modal prototype driven network for radiology report generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01834","last_updated":"2025-01-27T16:34:59Z","snapshot_observed_at":"2026-08-10T23:50:09.976570Z","submitted_at":"2025-01-03T14:38:01Z","title":"MoColl: Agent-Based Specific and General Model Collaboration for Image Captioning","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T22:23:27.822294Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2501.01834"},"observation_digest":"sha256:e892703ec75fe5ddee0873ab50abc768c3cbd212252718fc15a58c211891fc8a","observation_id":"926dd163-b180-4a9b-8484-4d248918d0a2","resolution":{"observed_at":"2026-08-10T22:23:27.822294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-10T22:08:09.260850Z","title":"Cogvlm: Visual expert for pretrained language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.260850Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:943cd725d00a0b84c2db056f728e4961209b717f40b808119daaeeab5f505a63","observation_id":"dc59dfea-9a5f-4d55-acb7-7be0fffb2415","resolution":{"observed_at":"2026-08-10T22:08:09.260850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-10T22:06:04.907190Z","title":"arXiv preprint arXiv:2311.03079 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02842","last_updated":"2025-01-06T08:38:29Z","snapshot_observed_at":"2026-08-12T14:33:26.268036Z","submitted_at":"2025-01-06T08:38:29Z","title":"Foundations of GenIR","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T22:06:04.907190Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2501.02842"},"observation_digest":"sha256:9087c349033ad4de3f25bb5bcd83150118f04ba1da64f59b2f222a8c25d10a17","observation_id":"dcb7a881-5241-43e7-84da-9e2fcf6fb8b1","resolution":{"observed_at":"2026-08-10T22:06:04.907190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":"2311.03079","doi":"10.48550/arxiv.2311.03079","metadata_source":"pith","pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVLM: Visual Expert for Pretrained Language Models","venue":"cs.CV","work_id":"0d81fb99-dae6-46d2-8bed-c01dcbd7d7cf","year":2023},"citing_paper":{"arxiv_id":"2501.02955","last_updated":"2026-05-12T15:02:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-06T11:57:38Z","title":"MotionBench: Benchmarking and Improving Fine-grained Video Motion Understanding for Vision Language Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-23T05:44:31.546843Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2501.02955"},"observation_digest":"sha256:a174b2932b849e3f9edf437c3e3e099a4565fa4b54a4cddcc493cbf2c28fbd3c","observation_id":"c20b871e-8556-44df-8fee-58b08fa38ff4","resolution":{"observed_at":"2026-05-23T05:45:28.373708Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-10T21:33:21.243962Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04575","last_updated":"2025-01-08T15:45:21Z","snapshot_observed_at":"2026-08-12T10:18:51.022688Z","submitted_at":"2025-01-08T15:45:21Z","title":"InfiGUIAgent: A Multimodal Generalist GUI Agent with Native Reasoning and Reflection","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-10T21:33:21.243962Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2501.04575"},"observation_digest":"sha256:13fce0748f3e326cd1cc1356f4432e4c39a4e5839fd36259fade0a2d1d278665","observation_id":"1dff1d06-f1c9-4ff2-9dd9-654a89816006","resolution":{"observed_at":"2026-08-10T21:33:21.243962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-10T20:53:48.427182Z","title":"Cogvlm: Visual expert for pretrained language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-10T21:53:16.968026Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.427182Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:bd70e685b0119e939a5d399525e49d3903ebc91aa7e7024868c7e75601b09dfe","observation_id":"2ad8e6e5-a33a-4a77-a1b2-694f80493fcc","resolution":{"observed_at":"2026-08-10T20:53:48.427182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-10T20:46:17.674626Z","title":"Cogvlm: Visual expert for pretrained language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-11T20:40:09.124138Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.674626Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:e34b3cea8bd45f7a654c325b1b69543391efdcc88ed9ec180c2dbf90135896a7","observation_id":"0c7a0eb7-ceb2-47c2-a88a-fabe790fdcc5","resolution":{"observed_at":"2026-08-10T20:46:17.674626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-10T20:34:11.747261Z","title":"Cogvlm: Visual expert for pretrained language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.08168","last_updated":"2025-01-14T14:49:45Z","snapshot_observed_at":"2026-08-12T16:38:02.794417Z","submitted_at":"2025-01-14T14:49:45Z","title":"LeapVAD: A Leap in Autonomous Driving via Cognitive Perception and Dual-Process Thinking","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T20:34:11.747261Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2501.08168"},"observation_digest":"sha256:d4c2665bf2a3747e5efeb28881b2bdaca548b68f8cb6738538856b8df0a5b458","observation_id":"08684fc7-abda-46a9-b442-365b65683e12","resolution":{"observed_at":"2026-08-10T20:34:11.747261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-10T15:38:03.671026Z","title":"Cogvlm: Visual expert for pretrained language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13787","last_updated":"2025-01-23T16:04:23Z","snapshot_observed_at":"2026-08-10T19:15:37.342583Z","submitted_at":"2025-01-23T16:04:23Z","title":"Parameter-Efficient Fine-Tuning for Foundation Models","version":1},"reference_index":264,"source":"pdf_text","source_observed_at":"2026-08-10T15:38:03.671026Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2501.13787"},"observation_digest":"sha256:e8487668360b4c3b21fde46527011bec2b040ecfd5f25d78216d788e250f2f6f","observation_id":"d873e978-b25b-4177-9e5f-b885631f7cf5","resolution":{"observed_at":"2026-08-10T15:38:03.671026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-10T18:04:34.830855Z","title":"CogVLM: Visual expert for pretrained language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.14818","last_updated":"2025-01-20T18:40:47Z","snapshot_observed_at":"2026-08-11T01:59:38.596539Z","submitted_at":"2025-01-20T18:40:47Z","title":"Eagle 2: Building Post-Training Data Strategies from Scratch for Frontier Vision-Language Models","version":1},"reference_index":191,"source":"pdf_text","source_observed_at":"2026-08-10T18:04:34.830855Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2501.14818"},"observation_digest":"sha256:4946d99f9fc758faa389819d53358e06ad562fbeb760ee8fb362382c8259e6d1","observation_id":"3c94e11a-902c-4632-b71e-6a9746b15428","resolution":{"observed_at":"2026-08-10T18:04:34.830855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-10T14:38:24.799578Z","title":"Cogvlm: Visual expert for pretrained language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15147","last_updated":"2025-02-23T08:09:48Z","snapshot_observed_at":"2026-08-12T02:17:29.724595Z","submitted_at":"2025-01-25T09:11:15Z","title":"A Causality-aware Paradigm for Evaluating Creativity of Multimodal Large Language Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T14:38:24.799578Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2501.15147"},"observation_digest":"sha256:3c9da66b987889ebd1d73145baf372c54155ec18c33a4b69ba862c730d551313","observation_id":"fdede704-6ae9-4a90-97d6-a00146a2845a","resolution":{"observed_at":"2026-08-10T14:38:24.799578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-10T11:26:29.215489Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16688","last_updated":"2025-01-28T03:56:17Z","snapshot_observed_at":"2026-08-10T13:25:41.324961Z","submitted_at":"2025-01-28T03:56:17Z","title":"MME-Industry: A Cross-Industry Multimodal Evaluation Benchmark","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T11:26:29.215489Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2501.16688"},"observation_digest":"sha256:acc506802ea50226e43f28653f240daf63027df573fbb542a20b27add87cae22","observation_id":"50448d07-38c6-45dc-997b-dde94c40c5b2","resolution":{"observed_at":"2026-08-10T11:26:29.215489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-10T14:01:11.094765Z","title":"Cogvlm: Visual expert for pretrained lan- guage models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18624","last_updated":"2025-02-07T05:11:54Z","snapshot_observed_at":"2026-08-12T08:20:53.652418Z","submitted_at":"2025-01-27T05:44:58Z","title":"Membership Inference Attacks Against Vision-Language Models","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-10T14:01:11.094765Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2501.18624"},"observation_digest":"sha256:6d4092f2e75c0f1a616edd62d972a2c787e84a6d785ee1daac881242e1704661","observation_id":"552eab35-d5bf-4d44-9fa3-3c97d50748a0","resolution":{"observed_at":"2026-08-10T14:01:11.094765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-09T21:39:21.810068Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-10T12:01:17.734125Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.810068Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:87284f91b9e5b7f4378b5b082569f0aa1e8c3979139f117ad3a776bb7227718d","observation_id":"ae49b89e-fb72-4cfa-9e34-b119b4cf6da8","resolution":{"observed_at":"2026-08-09T21:39:21.810068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-09T19:12:56.249039Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00425","last_updated":"2025-08-10T04:13:03Z","snapshot_observed_at":"2026-08-11T03:00:26.939226Z","submitted_at":"2025-02-01T13:08:02Z","title":"MQuant: Unleashing the Inference Potential of Multimodal Large Language Models via Full Static Quantization","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-09T19:12:56.249039Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2502.00425"},"observation_digest":"sha256:280753b39b7b87e9597577eda2da7bdd07d9f31a9582f3917a1c529130a9a82c","observation_id":"255b3b4f-9f35-4f6c-8fc1-341bcef9839a","resolution":{"observed_at":"2026-08-09T19:12:56.249039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-09T15:04:39.937725Z","title":"CogVLM: Visual expert for pretrained language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-11T11:46:05.304510Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:39.937725Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:cf0e5b03dd9b29dc20a626b372d2a01d22089279bff3a5eb0ccc959f1a982e6a","observation_id":"7f630ceb-7b5a-4204-923b-fb43ffb6d6e5","resolution":{"observed_at":"2026-08-09T15:04:39.937725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-09T04:44:58.880265Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.880265Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:6fa8b58543b7d9d9b2e6d86a2ce1cb670378a977ebd793e116d54aa88fbf40a2","observation_id":"9f8917dd-0a2a-4a17-889c-e93499148733","resolution":{"observed_at":"2026-08-09T04:44:58.880265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-08T20:05:16.194518Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05165","last_updated":"2025-02-07T18:48:54Z","snapshot_observed_at":"2026-08-09T08:34:13.595948Z","submitted_at":"2025-02-07T18:48:54Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T20:05:16.194518Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2502.05165"},"observation_digest":"sha256:b894c4523a1b514e884ea35fbd346d60140d32dcc4c8313a7fa0a8c40feb05fa","observation_id":"762dcc6a-bb1d-4db7-9f9b-e93c91d3ba83","resolution":{"observed_at":"2026-08-08T20:05:16.194518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-08T16:38:09.840436Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06145","last_updated":"2025-02-10T04:20:11Z","snapshot_observed_at":"2026-08-12T07:46:13.550482Z","submitted_at":"2025-02-10T04:20:11Z","title":"Animate Anyone 2: High-Fidelity Character Image Animation with Environment Affordance","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T16:38:09.840436Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2502.06145"},"observation_digest":"sha256:8f3739f6a6d5a2775abd239bd765db4e2e5cfbd51136aac6da412b1febad76f3","observation_id":"bb2464dd-4628-4751-a494-465575e88afc","resolution":{"observed_at":"2026-08-08T16:38:09.840436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-08T12:54:56.325636Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-10T04:36:21.525026Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.325636Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:c5311ab4b0d8d42eeb3b384c002360414fe104516898ce84d2f394007f576a61","observation_id":"e0dce2cd-fd45-4e5c-8037-27e7602e7d54","resolution":{"observed_at":"2026-08-08T12:54:56.325636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":"2311.03079","doi":"10.48550/arxiv.2311.03079","metadata_source":"pith","pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVLM: Visual Expert for Pretrained Language Models","venue":"cs.CV","work_id":"0d81fb99-dae6-46d2-8bed-c01dcbd7d7cf","year":2023},"citing_paper":{"arxiv_id":"2503.23137","last_updated":"2026-04-15T02:38:45Z","snapshot_observed_at":"2026-08-12T16:01:25.076287Z","submitted_at":"2025-03-29T16:08:51Z","title":"When 'YES' Meets 'BUT': Can Large Models Comprehend Contradictory Humor Through Comparative Reasoning?","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-22T22:38:35.969273Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2503.23137"},"observation_digest":"sha256:fc0e21d5d4e9edf6e4555d7cf60faf7b1f3685d51972a6ab470f1bac28354233","observation_id":"3e12ed85-88bc-4133-92d1-5561f8b37bc8","resolution":{"observed_at":"2026-05-22T22:42:13.544301Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":"2311.03079","doi":"10.48550/arxiv.2311.03079","metadata_source":"pith","pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVLM: Visual Expert for Pretrained Language Models","venue":"cs.CV","work_id":"0d81fb99-dae6-46d2-8bed-c01dcbd7d7cf","year":2023},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:f7ed8ff73aa56622767aab8459dc19329485cd8345d233eab9cfe12cdd63b62b","observation_id":"c078eb9a-f62e-4e13-9c20-2097f5044aab","resolution":{"observed_at":"2026-05-22T22:47:13.045306Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2311.03079/citation-record","integrity":"/paper/2311.03079/integrity","json":"/paper/2311.03079/citation-record.json","paper":"/paper/2311.03079"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2308.01390","doi":"10.48550/arxiv.2308.01390","metadata_source":"pith","pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","venue":"cs.CV","work_id":"87bfa84a-e663-4165-806f-93ef439d88d0","year":2023},"citing_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-15T15:46:06.334088Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2311.03079"},"observation_digest":"sha256:74763f3b034766ce4f6f0c1d4399e4d674c2cfc5d3b336f96b9b9d0c3532997f","observation_id":"4b86f9a7-ec6b-47c0-9a91-4452105c5311","resolution":{"observed_at":"2026-05-15T15:46:06.464567Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":"2308.12966","doi":"10.48550/arxiv.2308.12966","metadata_source":"pith","pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","venue":"cs.CV","work_id":"cbc2bb21-b6bb-46c0-80bf-107e195ffe10","year":2023},"citing_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T15:46:06.334088Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2311.03079"},"observation_digest":"sha256:9988d1536dfa928de5a3b858cf39f56e32a9dc643f5575c84ed67923381a8498","observation_id":"625d3bbf-dadb-4393-9b83-582458ed4974","resolution":{"observed_at":"2026-05-15T15:46:06.438703Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Murel: Multimodal relational reasoning for visual ques- tion answering","venue":null,"work_id":"49d68897-f597-43d7-b9ab-c6810ce5a8f3","year":1989},"citing_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T15:46:06.334088Z"},"links":{"citing_paper":"/paper/2311.03079"},"observation_digest":"sha256:2e4a25b1307c3a08a5034ed8ca3d0170a494b6f785dc62e5a51aa207b071d94b","observation_id":"3f6d95b5-5760-4aa0-9141-bd09618eae37","resolution":{"observed_at":"2026-05-15T15:46:06.547274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-07-06T15:47:07.545213Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":"2306.15195","doi":"10.48550/arxiv.2306.15195","metadata_source":"pith","pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","venue":"cs.CV","work_id":"44525076-312a-4259-b79c-134cd7eeb297","year":2023},"citing_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-15T15:46:06.334088Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2311.03079"},"observation_digest":"sha256:aaa45d695b6e5e48b3e356d6059bf1e4e0ea959593aad1aa15e0bee2f66c14cc","observation_id":"9da9aa74-5e99-41d6-a622-b84d30f38b24","resolution":{"observed_at":"2026-05-15T15:46:06.457279Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.12727","last_updated":"2023-11-30T11:47:36Z","snapshot_observed_at":"2026-08-04T15:32:23.202100Z","submitted_at":"2021-11-24T19:00:05Z","title":"Generating More Pertinent Captions by Leveraging Semantics and Style on Multi-Source Datasets","version":3},"cited_work":{"arxiv_id":"2111.12727","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.12727","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Universal captioner: Long-tail vision-and-language model training through content-style separation.arXiv preprint arXiv:2111.12727","venue":null,"work_id":"8147134b-8245-480c-a294-d5382f4aa9aa","year":null},"citing_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T15:46:06.334088Z"},"links":{"cited_paper":"/paper/2111.12727","citing_paper":"/paper/2311.03079"},"observation_digest":"sha256:4e16a862d8024f517037969d998a1338c1a08628b27471ba632cb3fe0ddd1a60","observation_id":"09cd8215-1680-48de-993a-e4103b1646ff","resolution":{"observed_at":"2026-05-15T15:46:06.472683Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11499","last_updated":"2024-03-15T19:19:28Z","snapshot_observed_at":"2026-08-07T22:11:51.327954Z","submitted_at":"2023-09-20T17:58:05Z","title":"DreamLLM: Synergistic Multimodal Comprehension and Creation","version":2},"cited_work":{"arxiv_id":"2309.11499","doi":"10.48550/arxiv.2309.11499","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.11499","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dreamllm: Synergistic multimodal comprehension and creation","venue":"arXiv (Cornell University)","work_id":"43128e8d-8204-43b8-9bfc-f0da0b15ed39","year":2023},"citing_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-15T15:46:06.334088Z"},"links":{"cited_paper":"/paper/2309.11499","citing_paper":"/paper/2311.03079"},"observation_digest":"sha256:a9b0ee1d4f7ea72f2c3ae6e6ba7587889ad8cd95fbaf2583334d5ac783d7e2fa","observation_id":"2dc7da0d-0149-4e62-8740-615d6cc017fc","resolution":{"observed_at":"2026-05-15T15:46:06.504847Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-08-08T22:04:13.117781Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-15T15:46:06.334088Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2311.03079"},"observation_digest":"sha256:9b3821705ce99c26ed9743586186ff1618f70e9e5d4fecc48e1e66bca0731c80","observation_id":"adf8a310-159f-45f3-8dcb-db23fc9b56e4","resolution":{"observed_at":"2026-05-15T15:46:06.522386Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-10T12:35:09.020030Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":"2009.03300","doi":"10.48550/arxiv.2009.03300","metadata_source":"pith","pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Massive Multitask Language Understanding","venue":"cs.CY","work_id":"e87ec49a-544b-4ec8-8991-75298c64ff5e","year":2020},"citing_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T15:46:06.334088Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2311.03079"},"observation_digest":"sha256:132cdf5d39d61962acf6fb7b8e5a034c8e72d4ade0d9559a8b5c3819ad5be9fb","observation_id":"bb095439-4e28-4314-ac2f-8f2a54d0f649","resolution":{"observed_at":"2026-05-15T15:46:06.405707Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"and Johnson, M","venue":null,"work_id":"a828ab83-b261-4d15-8613-20f456994e51","year":2015},"citing_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T15:46:06.334088Z"},"links":{"citing_paper":"/paper/2311.03079"},"observation_digest":"sha256:bc6e398e89e6470df2c1deb8d1950d37a1b5f09f9e8885fa511efeb74b95dcf9","observation_id":"62779542-b21e-4d98-b8bd-ba319fb66631","resolution":{"observed_at":"2026-05-15T15:46:06.551835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":"2106.09685","doi":"10.4088/pcc.v03n0609","metadata_source":"pith","pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","venue":"cs.CL","work_id":"0426219a-789e-4964-adc8-a04538510818","year":2021},"citing_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-15T15:46:06.334088Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2311.03079"},"observation_digest":"sha256:42b5084f32e234de55e40e509e2dcd6686cbb2d51c7bf01d04d18520c99f1945","observation_id":"9f85b72b-94a1-453a-ab5e-017259b938ef","resolution":{"observed_at":"2026-05-15T15:46:06.447809Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"and Kanan, C","venue":null,"work_id":"a39cbc75-6d75-4a37-9b79-73855151b2bc","year":1965},"citing_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-15T15:46:06.334088Z"},"links":{"citing_paper":"/paper/2311.03079"},"observation_digest":"sha256:c56debe84463eb6f440afe4dc2a3847d5ce9536595eb260ba1e47554cd9a601e","observation_id":"f71bd79c-755e-439f-a1b6-e5e671d9ada2","resolution":{"observed_at":"2026-05-15T15:46:06.556366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Referitgame: Referring to objects in photographs of natu- ral scenes","venue":null,"work_id":"988f7ead-fdcb-4a0d-a92f-7715cd595961","year":2014},"citing_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-15T15:46:06.334088Z"},"links":{"citing_paper":"/paper/2311.03079"},"observation_digest":"sha256:bd9f5a0ff6db4f69fe3e60673ed9ba62bd8dfe8ffe3a0affbc5dbf9ec17e6bb8","observation_id":"f20819c4-a886-473b-a30d-2a371eeec989","resolution":{"observed_at":"2026-05-15T15:46:06.560300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":"2307.16125","doi":"10.48550/arxiv.2307.16125","metadata_source":"pith","pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","venue":"cs.CL","work_id":"23881ff0-b851-474c-8712-90744cc07a3a","year":2023},"citing_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-15T15:46:06.334088Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2311.03079"},"observation_digest":"sha256:2344ca67d387d8ba74b3159b880908b5df4a00b35e9385d23d8415206c5bed7f","observation_id":"2fa0e400-3725-4159-9c6c-bf2f7eee87b1","resolution":{"observed_at":"2026-05-15T15:46:06.480520Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07575","last_updated":"2023-11-13T18:59:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-13T18:59:47Z","title":"SPHINX: The Joint Mixing of Weights, Tasks, and Visual Embeddings for Multi-modal Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.07575","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.07575","snapshot_observed_at":"2026-07-04T06:39:37.554183Z","title":"SPHINX: The Joint Mixing of Weights, Tasks, and Visual Embeddings for Multi-modal Large Language Models","venue":"cs.CV","work_id":"38f258e4-8974-4ea0-98a8-a336838dcfaa","year":2023},"citing_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T15:46:06.334088Z"},"links":{"cited_paper":"/paper/2311.07575","citing_paper":"/paper/2311.03079"},"observation_digest":"sha256:984a92e0acac513edeb97e96156b87daa1c2eda932153bacec44b1be0df8d5a2","observation_id":"1dcdb279-1b6e-4ad5-bd79-483278e7dfd3","resolution":{"observed_at":"2026-05-17T03:03:27.047113Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.02506","last_updated":"2024-01-18T22:09:40Z","snapshot_observed_at":"2026-08-10T21:35:37.739460Z","submitted_at":"2023-03-04T21:22:47Z","title":"Prismer: A Vision-Language Model with Multi-Task Experts","version":3},"cited_work":{"arxiv_id":"2303.02506","doi":"10.48550/arxiv.2303.02506","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.02506","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Prismer","venue":"arXiv (Cornell University)","work_id":"a0a19543-5a5e-4225-9583-688bcb817143","year":2023},"citing_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T15:46:06.334088Z"},"links":{"cited_paper":"/paper/2303.02506","citing_paper":"/paper/2311.03079"},"observation_digest":"sha256:1da7b12548fd73052ffbfb21b4d9046125d65767ececb2db68a2de37347b2558","observation_id":"da9ffbd5-379e-4e7d-bd97-b5a39e506ed9","resolution":{"observed_at":"2026-05-15T15:46:06.492169Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":"2310.02255","doi":"10.1109/cvpr52734.2025.01245","metadata_source":"pith","pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","venue":"cs.CV","work_id":"e22c3789-9e71-4242-b6ea-3e60e06e2b66","year":2023},"citing_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-15T15:46:06.334088Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2311.03079"},"observation_digest":"sha256:46b7607962bc3e46b80553833d3978769d9a475751c9f9a54aaf6c664f3d261e","observation_id":"663d4eb7-e7ee-4c9c-8322-5813b578a765","resolution":{"observed_at":"2026-05-15T15:46:06.498574Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"K., and Chakraborty, A","venue":null,"work_id":"851dbb40-2b23-4f3e-973b-b4259a07d03c","year":2019},"citing_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T15:46:06.334088Z"},"links":{"citing_paper":"/paper/2311.03079"},"observation_digest":"sha256:8f5ebaf976b8ee407631b89df9bbd48943d26868a4643abbee3168bd56909927","observation_id":"c1af65c4-c446-46a8-82b2-cccc93584cb9","resolution":{"observed_at":"2026-05-15T15:46:06.565138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-08-12T12:24:23.815073Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":"2306.14824","doi":"10.48550/arxiv.2306.14824","metadata_source":"pith","pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","venue":"cs.CL","work_id":"46e7f9e9-24c6-49af-b7d5-96159fa6f443","year":2023},"citing_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-15T15:46:06.334088Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2311.03079"},"observation_digest":"sha256:6b7d0e915f84b6df8f607555a3ef9c157a62b1e33a2789d644ff6b107461b0e7","observation_id":"9c2b806b-a009-4a4a-9b98-df6822e90a3c","resolution":{"observed_at":"2026-05-15T15:46:06.510686Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-08-11T06:21:56.129166Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":"2002.05202","doi":"10.48550/arxiv.2002.05202","metadata_source":"pith","pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GLU Variants Improve Transformer","venue":"cs.LG","work_id":"17d0763c-1016-41ab-a478-478e890765eb","year":2020},"citing_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-15T15:46:06.334088Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2311.03079"},"observation_digest":"sha256:f2bde5449b61e2683a1dbe7565b365420956dc4968ca6def9b88e2267a2c02d1","observation_id":"8a0c2fc0-effc-4960-b243-1333364587e4","resolution":{"observed_at":"2026-05-15T15:46:06.516264Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:07.002485+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:07.002485+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Textcaps: a dataset for image captioning with reading comprehen- sion","venue":null,"work_id":"fc1b2fa8-15b6-427c-8aaa-0e4910e21be3","year":2020},"citing_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-15T15:46:06.334088Z"},"links":{"citing_paper":"/paper/2311.03079"},"observation_digest":"sha256:5bf4e56b5260c184783cbff84b8766ae6dfe52e6e51ff9051a7cfe1ce603af31","observation_id":"6c139398-96d6-49f9-83b4-9413b0aeb3e2","resolution":{"observed_at":"2026-05-15T15:46:06.570077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13286","last_updated":"2024-05-08T03:09:22Z","snapshot_observed_at":"2026-08-10T12:19:42.891683Z","submitted_at":"2023-12-20T18:59:58Z","title":"Generative Multimodal Models are In-Context Learners","version":2},"cited_work":{"arxiv_id":"2312.13286","doi":"10.48550/arxiv.2312.13286","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.13286","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Generative multimodal models are in-context learners","venue":"arXiv (Cornell University)","work_id":"a80a95eb-a4c1-4074-b835-c862cc4bd0ce","year":2023},"citing_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-15T15:46:06.334088Z"},"links":{"cited_paper":"/paper/2312.13286","citing_paper":"/paper/2311.03079"},"observation_digest":"sha256:e37abf87374da74e662fcfa11c5bd4c8fd8aa4124b8ffd008cbe9233d7e10e15","observation_id":"ae3d4092-7407-449d-8aa4-9e8916771767","resolution":{"observed_at":"2026-05-15T15:46:06.530109Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14100","last_updated":"2022-12-15T19:21:35Z","snapshot_observed_at":"2026-08-04T09:31:34.784365Z","submitted_at":"2022-05-27T17:03:38Z","title":"GIT: A Generative Image-to-text Transformer for Vision and Language","version":5},"cited_work":{"arxiv_id":"2205.14100","doi":"10.48550/arxiv.2205.14100","metadata_source":"pith","pith_arxiv_id":"2205.14100","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GIT: A Generative Image-to-text Transformer for Vision and Language","venue":"cs.CV","work_id":"45b0563f-7563-4f00-8da5-8be70ff803fb","year":2022},"citing_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-15T15:46:06.334088Z"},"links":{"cited_paper":"/paper/2205.14100","citing_paper":"/paper/2311.03079"},"observation_digest":"sha256:ec3a0399761d0d20ef6d88af5ee323e1c861222ce44e606db88d8e003f672b7b","observation_id":"19a88fac-d386-40a9-b7cd-50e9e5f1e1df","resolution":{"observed_at":"2026-05-16T20:54:07.740206Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-25T07:53:51.898843+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T07:53:51.898843+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-08-06T04:08:15.266897Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"cited_work":{"arxiv_id":"2311.04257","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.04257","snapshot_observed_at":"2026-07-04T06:39:37.569021Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","venue":"cs.CL","work_id":"9200bc1e-ad8a-49b6-8f93-1bdac4689a9f","year":2023},"citing_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-15T15:46:06.334088Z"},"links":{"cited_paper":"/paper/2311.04257","citing_paper":"/paper/2311.03079"},"observation_digest":"sha256:42000a0458566dde195d413f4d0bc61dad9a28c4a1458380428fb562637811d0","observation_id":"176fbb6b-ee30-4a1c-80a2-e6bf6a6721d7","resolution":{"observed_at":"2026-05-18T03:18:51.946750Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07704","last_updated":"2023-10-11T17:55:15Z","snapshot_observed_at":"2026-08-12T17:07:18.793418Z","submitted_at":"2023-10-11T17:55:15Z","title":"Ferret: Refer and Ground Anything Anywhere at Any Granularity","version":1},"cited_work":{"arxiv_id":"2310.07704","doi":"10.48550/arxiv.2310.07704","metadata_source":"pith","pith_arxiv_id":"2310.07704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ferret: Refer and Ground Anything Anywhere at Any Granularity","venue":"cs.CV","work_id":"0db2bf55-f649-4428-bcc9-688724b38e57","year":2023},"citing_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-15T15:46:06.334088Z"},"links":{"cited_paper":"/paper/2310.07704","citing_paper":"/paper/2311.03079"},"observation_digest":"sha256:e53fd39f7b87c5ba2fe6c0c61228cbcea71f0a2fdd3ef51022f2081fad19a0da","observation_id":"5afb32c7-08f4-4794-a333-92b4451453ff","resolution":{"observed_at":"2026-05-15T15:46:06.379349Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-08-10T15:05:25.558818Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"cited_work":{"arxiv_id":"2205.01917","doi":"10.48550/arxiv.2205.01917","metadata_source":"pith","pith_arxiv_id":"2205.01917","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","venue":"cs.CV","work_id":"5dd5bf10-d548-40ff-9b6c-6735129b27ee","year":2022},"citing_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-15T15:46:06.334088Z"},"links":{"cited_paper":"/paper/2205.01917","citing_paper":"/paper/2311.03079"},"observation_digest":"sha256:3b48e565c507ee063ae4f6b3318292cf88b9a2ec7c2332504684bc791da9d8f8","observation_id":"195d2684-3568-427c-b238-e9559c78c3cc","resolution":{"observed_at":"2026-05-15T15:46:06.394093Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-22T13:22:43.398968+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T13:22:43.398968+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"C., and Berg, T","venue":null,"work_id":"901fcd07-4bd4-4c9e-8cb5-819656fccb2a","year":2016},"citing_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-15T15:46:06.334088Z"},"links":{"citing_paper":"/paper/2311.03079"},"observation_digest":"sha256:2362b8fdfe155ab613cd4e7ef28fcf9bb065161e5826e7f7b8f7d5064f3080d9","observation_id":"ebbba877-31a4-46ba-b8a4-fbe87650d643","resolution":{"observed_at":"2026-05-15T15:46:06.574371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-08T03:31:37.699253Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":"2308.02490","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-07-10T09:37:00.827227Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","venue":"cs.AI","work_id":"7f3bac41-a0a5-4a7a-bfd2-526b616db745","year":2023},"citing_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-15T15:46:06.334088Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2311.03079"},"observation_digest":"sha256:c319e3daa14f5edad64ffde84ad55b96dca253b1ba5541498a637cb982ccb68c","observation_id":"2f5fda1f-dd3d-477c-8ba8-0b0bc7c61300","resolution":{"observed_at":"2026-05-15T15:46:06.413968Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16502","last_updated":"2024-06-13T15:02:39Z","snapshot_observed_at":"2026-08-12T16:58:06.280003Z","submitted_at":"2023-11-27T17:33:21Z","title":"MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI","version":4},"cited_work":{"arxiv_id":"2311.16502","doi":"10.48550/arxiv.2311.16502","metadata_source":"pith","pith_arxiv_id":"2311.16502","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI","venue":"cs.CL","work_id":"da087b16-ea05-4064-980e-ce1d6e281d49","year":2023},"citing_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-15T15:46:06.334088Z"},"links":{"cited_paper":"/paper/2311.16502","citing_paper":"/paper/2311.03079"},"observation_digest":"sha256:0eea104b2f735af9a94f712d7fcc3d6d753bf098e4b72ac4623800fa55ffc79b","observation_id":"a4051937-4f6c-4242-acda-184b081f658c","resolution":{"observed_at":"2026-05-15T15:46:06.421184Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-10T17:38:12.261029+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T17:38:12.261029+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":"2304.10592","doi":"10.18653/v1/2024.findings-emnlp.692","metadata_source":"pith","pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","venue":"cs.CV","work_id":"a7e3a737-e007-42bc-be89-c4d34c5ee071","year":2023},"citing_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-15T15:46:06.334088Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2311.03079"},"observation_digest":"sha256:0274f4c3c5aa12c62f9033713699df4f740d27088422fc7958a57c4b7af8e511","observation_id":"c4541158-a550-4c90-addd-f9b7f61169f1","resolution":{"observed_at":"2026-05-15T15:46:06.430717Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-23T17:23:55.433296+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T17:23:55.433296+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"58298b82-e473-45ab-9559-1ccd58207959","year":2019},"citing_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-15T15:46:06.334088Z"},"links":{"citing_paper":"/paper/2311.03079"},"observation_digest":"sha256:b6a1301b4a04ca57673d7205fc04b6c7968898d4e2bbbccdc8f4605d61707aac","observation_id":"8a8cde92-4dde-4d6d-860a-4c83055990f1","resolution":{"observed_at":"2026-05-15T15:46:06.579214Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"in”, “near","venue":null,"work_id":"65192093-5ecd-4323-8810-46ad3789ba5e","year":2015},"citing_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-15T15:46:06.334088Z"},"links":{"citing_paper":"/paper/2311.03079"},"observation_digest":"sha256:819fd0d7e5fb0ce963a6c9eb9b101e26597b5886a4da8f30cc12484bef479e56","observation_id":"57e1ef59-ae86-4564-ad34-1cd7213156dd","resolution":{"observed_at":"2026-05-15T15:46:06.583337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"which”-type 15 CogVLM: Visual Expert for Pretrained Language Models question, such as “Which is the small computer in the corner?","venue":null,"work_id":"8518c6db-f09e-45e5-bef2-d435ae5fea81","year":2016},"citing_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-15T15:46:06.334088Z"},"links":{"citing_paper":"/paper/2311.03079"},"observation_digest":"sha256:7e80e5a02015ffe7962e8b2f58214d716a3a5df27d572878e58782bb9ce3497e","observation_id":"76fe0e15-6009-4abf-9cb9-e4dbc990f6c5","resolution":{"observed_at":"2026-05-15T15:46:06.588349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4c725619-ebfc-4d67-9bc3-8af4603daaa7","year":2017},"citing_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-15T15:46:06.334088Z"},"links":{"citing_paper":"/paper/2311.03079"},"observation_digest":"sha256:3b9c567cc8dd9472e5fb7874285e967987aff0cb5976642e62073e094fe86194","observation_id":"7bffdc91-e0ab-4720-91dc-f2bd7d3198ee","resolution":{"observed_at":"2026-05-15T15:46:06.542791Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":2,"verified_exact":18,"verified_fuzzy":9},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 100 inbound Pith citation observations for arXiv:2311.03079."}