{"as_of":"2026-08-13T11:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ec11dd0a98dc3e715c49159c14193e8478ce3b816bf91346cc746601b631f5b8","coverage":[{"denominator":96,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":96,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T15:51:51.871655Z","state":"measured"},{"denominator":96,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":96,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.13909/citation-record","integrity":"/paper/2411.13909/integrity","json":"/paper/2411.13909/citation-record.json","paper":"/paper/2411.13909"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:51:51.115101Z","title":"Fuyu-8b: A multimodal architecture for ai agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.115101Z"},"links":{"citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:1f7e0e97376d286f526e3b14a53b2db5fb22141de2123674e911eb3fa2d6efc1","observation_id":"25e15dd4-fb5e-48d0-a5ec-8b91e0174180","resolution":{"observed_at":"2026-08-12T15:51:51.115101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-12T15:51:51.125826Z","title":"Flamingo: a vi- sual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.125826Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:8de0e4e1012234b6c7be8b2e77a55d203f3ee00b15ffcd83958cb3c1c93070e2","observation_id":"2dfca88f-5ed2-48a6-909d-ccbd65904bf5","resolution":{"observed_at":"2026-08-12T15:51:51.125826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-12T15:51:51.133619Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.133619Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:748ee5744beefd4e44dce2440eed67a01bbd82a743e135dab8647f08fff2e872","observation_id":"8be1ce38-cf7a-4685-921f-6b439e7b402a","resolution":{"observed_at":"2026-08-12T15:51:51.133619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09461","last_updated":"2023-03-01T19:45:11Z","snapshot_observed_at":"2026-08-13T04:00:22.647615Z","submitted_at":"2022-10-17T22:23:40Z","title":"Token Merging: Your ViT But Faster","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09461","snapshot_observed_at":"2026-08-12T15:51:51.149219Z","title":"To- ken merging: Your vit but faster","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.149219Z"},"links":{"cited_paper":"/paper/2210.09461","citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:197c9893c59e463a6c478b36702f1fe732d6a8d0e9665d1bdc523314b8299da8","observation_id":"16ea1d5e-ef55-4af3-ae88-158a8d85d017","resolution":{"observed_at":"2026-08-12T15:51:51.149219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-12T15:51:51.162624Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.162624Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:79f44c49de60e111c6c34c3527fac8f81b1bef20e4aaa26cabfbc5623b07eb90","observation_id":"01be99ee-480d-4502-abda-68e0d3eed005","resolution":{"observed_at":"2026-08-12T15:51:51.162624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:51:51.175846Z","title":"Meyer, Yuning Chai, Dennis Park, and Yong Jae Lee","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.175846Z"},"links":{"citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:d63480c86c20f347b3d88dc11e18edcb4dcd36f65acc50db109b16d49f5b9bea","observation_id":"d86304a0-35c0-4903-8796-e548f8ea350e","resolution":{"observed_at":"2026-08-12T15:51:51.175846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03051","last_updated":"2025-04-09T06:24:14Z","snapshot_observed_at":"2026-08-12T22:31:09.310411Z","submitted_at":"2024-10-04T00:13:54Z","title":"AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03051","snapshot_observed_at":"2026-08-12T15:51:51.189481Z","title":"Auroracap: Efficient, performant video detailed captioning and a new benchmark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.189481Z"},"links":{"cited_paper":"/paper/2410.03051","citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:f498bd763843cfdf2c45772692faa5ebaab95e9eb7795d75d5b840c792aff7ea","observation_id":"7ea5e044-5a17-44a0-8c83-4e88c9eb8af6","resolution":{"observed_at":"2026-08-12T15:51:51.189481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:51:51.196581Z","title":"Towards unifying medical vision-and-language pre-training via soft prompts, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.196581Z"},"links":{"citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:c84ded551e56b14c395df171a60485d9632d04806873bdfa2d198a75dcf3d346","observation_id":"1d9af478-0dec-4101-8916-7bb93b3584eb","resolution":{"observed_at":"2026-08-12T15:51:51.196581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:51:51.203642Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.203642Z"},"links":{"citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:41cf9f1cf1c6bbb0c062180b2a0f13a038fbb3aa4f04f203833c5c8fd89ce343","observation_id":"6cd7bae4-de4b-450e-9772-b8ebfb2a07c5","resolution":{"observed_at":"2026-08-12T15:51:51.203642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-12T15:51:51.208742Z","title":"Instructblip: Towards general- purpose vision-language models with instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.208742Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:6c8fce6afcdc8093c11eacb43f5baa968e81f676876cd60913003a8447a6a5c5","observation_id":"96b12ac5-9880-4e23-a978-7e31e4b2bda4","resolution":{"observed_at":"2026-08-12T15:51:51.208742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-12T15:51:51.214972Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.214972Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:b6a07318a497ad5885f66f962723287dce90cbdc2e9aa9c18c328ebe432fa6e3","observation_id":"d27889d3-50b6-45b6-ac7f-944f46061dd6","resolution":{"observed_at":"2026-08-12T15:51:51.214972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06512","last_updated":"2024-04-09T17:59:32Z","snapshot_observed_at":"2026-08-13T00:33:57.647386Z","submitted_at":"2024-04-09T17:59:32Z","title":"InternLM-XComposer2-4KHD: A Pioneering Large Vision-Language Model Handling Resolutions from 336 Pixels to 4K HD","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06512","snapshot_observed_at":"2026-08-12T15:51:51.221314Z","title":"Internlm-xcomposer2- 4khd: A pioneering large vision-language model handling resolutions from 336 pixels to 4k hd","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.221314Z"},"links":{"cited_paper":"/paper/2404.06512","citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:0607816a576c235fa4d9bcace8f890f7dac31c8b02caabdf81bf2a6d2d45c5af","observation_id":"a0482907-b9f7-4175-9def-39199e954b99","resolution":{"observed_at":"2026-08-12T15:51:51.221314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:51:51.226824Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.226824Z"},"links":{"citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:c06bc73db4e88a4df45c5fde0d734fcc1cb973b6e610acf42535aa0fbc992b4b","observation_id":"52e81a30-a017-4365-be17-ac2af99121f1","resolution":{"observed_at":"2026-08-12T15:51:51.226824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:51:51.233360Z","title":"The llama 3 herd of models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.233360Z"},"links":{"citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:4d04f0c44886d27de982771125e2723c9c563fa5cefc2cbb689d117dc3b4b909","observation_id":"aed7bdbc-02b3-4e40-9283-6eee2677b121","resolution":{"observed_at":"2026-08-12T15:51:51.233360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-12T15:51:51.240282Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.240282Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:b74d0e712fe22485702fd4929c7b99580f6c57942f014b14f301cac5478c94f3","observation_id":"56ba8c92-f660-4a0f-89ee-b9ceb40c2164","resolution":{"observed_at":"2026-08-12T15:51:51.240282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:51:51.251837Z","title":"Domain adaptation via prompt learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.251837Z"},"links":{"citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:f372cbd29cfc09ca0351c9af30368406f6e30eb9c6b36c2a97fa177c22e1d9e9","observation_id":"ebf3e11b-eea7-4ca5-af0e-8dc4246c0da3","resolution":{"observed_at":"2026-08-12T15:51:51.251837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-08-12T19:12:43.246639Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-08-12T15:51:51.260941Z","title":"Seed-x: Mul- timodal models with unified multi-granularity comprehen- sion and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.260941Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:5c6b96fabf81b1186a73baeb828fa93c823d2c0bd68eca1fad2b1eb6214b0062","observation_id":"78bc37ef-d666-4c01-a95c-01f59493b87b","resolution":{"observed_at":"2026-08-12T15:51:51.260941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:51:51.267323Z","title":"Openllama: An open reproduc- tion of llama, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.267323Z"},"links":{"citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:88b6e4590c4a66a51fe2d6f0c06873b2e7f83287d0054ca27de5806401392989","observation_id":"a876b31c-c966-47f7-84f4-ebae66d9cb7e","resolution":{"observed_at":"2026-08-12T15:51:51.267323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:51:51.273091Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answer- ing","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.273091Z"},"links":{"citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:e259db7bf9bf9fc7ba35cb707c3eee134af671d5122cacc72abfa51f030b0884","observation_id":"21eaa993-e0b6-4e4f-9de9-885d1ab33ca1","resolution":{"observed_at":"2026-08-12T15:51:51.273091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:51:51.285067Z","title":"Vizwiz grand challenge: Answering visual questions from blind people","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.285067Z"},"links":{"citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:66cc0e02c8c78e66f31ad57599a59aaf175c279693acc5ca9e7d5d65e54e9f38","observation_id":"132734f6-3fda-4f3f-a0d1-198453b5212a","resolution":{"observed_at":"2026-08-12T15:51:51.285067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:51:51.290677Z","title":"Ma-lmm: Memory-augmented large multimodal model for long-term video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.290677Z"},"links":{"citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:697d2ccbf49e9b97952010b11b24db00109887562b53516290bb9122a0f28ca4","observation_id":"02b4bf6f-2fbb-47a7-97bd-7807a5d0dc9c","resolution":{"observed_at":"2026-08-12T15:51:51.290677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:51:51.297822Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.297822Z"},"links":{"citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:3731bb0077832c954860d0857299f81863f632fe7c5413bdba24f79b172d8dca","observation_id":"ec195a06-b6df-4ebe-8992-51b49c28db46","resolution":{"observed_at":"2026-08-12T15:51:51.297822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:51:51.309409Z","title":"Vi- sual prompt tuning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.309409Z"},"links":{"citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:87b5966e13c517693537ab4a786510a46ce43e9641c1cb4d0472df76ca28853a","observation_id":"7ebef389-4205-4652-b6ca-8ca8bf1ca476","resolution":{"observed_at":"2026-08-12T15:51:51.309409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:51:51.314393Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.314393Z"},"links":{"citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:09fa60f6926ae89d2f21547917e48fb5fe5e84935374f6583d5e17b2b95ff28a","observation_id":"81822f56-44ba-49f5-ab02-8fd91dfd962a","resolution":{"observed_at":"2026-08-12T15:51:51.314393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17981","last_updated":"2024-12-19T11:25:34Z","snapshot_observed_at":"2026-08-13T04:29:56.769216Z","submitted_at":"2024-01-31T16:38:32Z","title":"From Training-Free to Adaptive: Empirical Insights into MLLMs' Understanding of Detection Information","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.17981","snapshot_observed_at":"2026-08-12T15:51:51.320880Z","title":"Enhancing multimodal large language models with vision detection models: An empirical study","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.320880Z"},"links":{"cited_paper":"/paper/2401.17981","citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:d9532caa82d87bcd204d7ab8f88a885ed7e7d33ecb47b9b884fe3de0a4657974","observation_id":"7e954659-da04-4796-a11b-f9b7f15e460b","resolution":{"observed_at":"2026-08-12T15:51:51.320880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:51:51.331412Z","title":"Maple: Multi-modal prompt learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.331412Z"},"links":{"citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:bf13745af5d0dc7178f41fe79e6d22fd21963b379c3c4721822b7d3859a5776c","observation_id":"3a9dfaba-2753-403c-9d9d-6fe224fdb951","resolution":{"observed_at":"2026-08-12T15:51:51.331412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-08-08T05:14:59.435033Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-12T15:51:51.340574Z","title":"Segment any- thing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.340574Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:d5aed3faa1549fb84857843bae28cb38f261eaee62f3783788e31d182ddedb99","observation_id":"45f50271-4c28-4ee0-9f1d-159ba8212e0e","resolution":{"observed_at":"2026-08-12T15:51:51.340574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:51:51.346933Z","title":"Spvit: Enabling faster vision transformers via soft token pruning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.346933Z"},"links":{"citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:dbdc1d4ca580c0d35216766fb303ade0dacd2e0953105e39a1eb94d034ca5e24","observation_id":"fff57757-6d4d-4a60-864b-924505ee6c53","resolution":{"observed_at":"2026-08-12T15:51:51.346933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:51:51.353239Z","title":"The power of scale for parameter-efficient prompt tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.353239Z"},"links":{"citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:3b1869dd3c12fffa78febd59123c56cef225194b21445e2afff45ba1f9e62956","observation_id":"6d29c858-c89c-41a0-a18d-8d6ab9b73095","resolution":{"observed_at":"2026-08-12T15:51:51.353239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-12T15:51:51.360879Z","title":"Seed-bench: Benchmarking mul- timodal llms with generative comprehension","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.360879Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:cc3c4fa461d8d7639d73ce5f60f7a9464441c1d9526829901a23679aeae65738","observation_id":"e683a8cf-a4cf-4f82-b70a-9b1446688624","resolution":{"observed_at":"2026-08-12T15:51:51.360879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:51:54.046870Z","title":"Task-specific fine-tuning via variational information bottle- neck for weakly-supervised pathology whole slide image classification","venue":null,"work_id":"58698b4a-b90a-432e-8eac-000fb44415b8","year":2023},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.368671Z"},"links":{"citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:50ce809d198082fcd385a774b89ad9c37477c99161e7e9d35844151fcc292854","observation_id":"f3e2f510-242d-4244-ac39-afc68dc33698","resolution":{"observed_at":"2026-08-12T15:51:54.055635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:51:54.020812Z","title":"Rethinking transformer for long contextual histopathology whole slide image analysis, 2024","venue":null,"work_id":"7aa8026b-c703-4058-89cb-1fa88f597b0f","year":2024},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.378182Z"},"links":{"citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:db972636e098b259bf86109e5ebaf0c229daf9d6252ef0ba624b195635a9f3c0","observation_id":"db50e5e4-7f4e-4c1e-ba3d-543fec037ddb","resolution":{"observed_at":"2026-08-12T15:51:54.027824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-08-12T12:01:54.105712Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-12T15:51:51.388053Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.388053Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:dc35fc9d77ae023c31ad1d88aee349c752e793d2005697875c960433936934c3","observation_id":"896436c2-0078-4fcb-943f-bde17fb8f031","resolution":{"observed_at":"2026-08-12T15:51:51.388053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:51:53.990746Z","title":"Tokenpacker: Efficient visual projector for multimodal llm, 2024","venue":null,"work_id":"71ec74ea-96c7-4d15-a40d-f8cc66f4a3ee","year":2024},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.394057Z"},"links":{"citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:da3097dbb89cb8eff4d41240ac60e4bf7058b005e15051ed84bb151b9beca585","observation_id":"b0e6e73a-87ec-464d-81cf-0d72812d3c92","resolution":{"observed_at":"2026-08-12T15:51:54.000809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:51:53.961253Z","title":"Prefix-tuning: Optimizing continuous prompts for generation","venue":null,"work_id":"af8d2760-7e3b-4a7d-a7c2-105855833096","year":null},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.399734Z"},"links":{"citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:b0583b836186e6040ead06ee7fc628e4de78601d710bacc6f33f0e02b01efb6a","observation_id":"30fb327a-11ae-4523-ba7a-daa3d2ab37fa","resolution":{"observed_at":"2026-08-12T15:51:53.967541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-08-12T18:48:30.326248Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-12T15:51:51.405396Z","title":"Evaluating object hallucina- tion in large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.405396Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:79356496e77bb70eeeed8c79b0aa90b67f834b393bc6599623ca7af9bc6857ba","observation_id":"e4302872-b085-425b-a8ed-fa7e91fb5fa5","resolution":{"observed_at":"2026-08-12T15:51:51.405396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:51:53.929947Z","title":"Mon- key: Image resolution and text label are important things for large multi-modal models","venue":null,"work_id":"e9cb5200-a7f9-4105-8e66-182f55970e10","year":2024},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.411371Z"},"links":{"citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:c3bf3d37890b8cf0ab9031ca23f729a12697e9f96a7370e43175618dee3b8578","observation_id":"46b672a0-b583-4600-941d-361400c3489b","resolution":{"observed_at":"2026-08-12T15:51:53.938850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:51:53.904259Z","title":"Not all patches are what you need: Expediting vision transformers via token reorganiza- tions","venue":null,"work_id":"4576f1dd-ce63-4d92-89bb-2008f4308eb9","year":2022},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.416544Z"},"links":{"citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:c80b58d82df45ef0052e9d858a1cd36fca678fd866a171a89669c1e9391e85c8","observation_id":"9545a833-4f95-49d7-8cb3-26e0a38b59da","resolution":{"observed_at":"2026-08-12T15:51:53.910850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-12T15:51:51.423238Z","title":"Video-llava: Learning united visual represen- tation by alignment before projection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.423238Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:bec771b6c52330ef45f76fa466a9709542fc2df6be934c2eebc7e67c2c8504fc","observation_id":"7abf953f-ea58-4078-a81d-cbbf4112e3e7","resolution":{"observed_at":"2026-08-12T15:51:51.423238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:51:51.429088Z","title":"Vila: On pre-training for visual language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.429088Z"},"links":{"citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:272979d04b3be6273b927f44efecad17cf7b1361c910896a15b2b911b7dac384","observation_id":"a7db231a-cc16-43ef-94bf-19048719c464","resolution":{"observed_at":"2026-08-12T15:51:51.429088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:51:51.439359Z","title":"Draw-and-understand: Leveraging visual prompts to enable mllms to comprehend what you want,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.439359Z"},"links":{"citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:97fcbdea1bbb02e4d775a413eb7837d0e7193643315f0f3557bce8d646895d96","observation_id":"b76987c9-cda7-40b8-b57e-4ff84bd9cc45","resolution":{"observed_at":"2026-08-12T15:51:51.439359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04681","last_updated":"2024-07-05T17:43:30Z","snapshot_observed_at":"2026-08-12T23:28:00.598656Z","submitted_at":"2024-07-05T17:43:30Z","title":"Rethinking Visual Prompting for Multimodal Large Language Models with External Knowledge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04681","snapshot_observed_at":"2026-08-12T15:51:51.447029Z","title":"Rethinking visual prompting for multimodal large language models with exter- nal knowledge","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.447029Z"},"links":{"cited_paper":"/paper/2407.04681","citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:7f139b5ccfffb695528a9ea0488663c7c280382458abc0fd012560378c7d2eed","observation_id":"8acde3fc-cc86-4f71-9ed9-cb1763dcb9a5","resolution":{"observed_at":"2026-08-12T15:51:51.447029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:51:53.847756Z","title":"Sphinx: The joint mixing of weights, tasks, and visual embeddings for multi-modal large language models, 2023","venue":null,"work_id":"b3337383-be65-4a25-92fe-97792acf31db","year":2023},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.455813Z"},"links":{"citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:7f3b06a189046d45a5cbebfdbc169b28f266cd760ca7c65043b21b5d9a5d89df","observation_id":"8971a870-89dd-42c6-acc1-8a9dc523125d","resolution":{"observed_at":"2026-08-12T15:51:53.855150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:51:53.824858Z","title":"Visual instruction tuning","venue":null,"work_id":"ff3e2c17-9b94-4e03-81d0-ff9be1d5c376","year":2023},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.471072Z"},"links":{"citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:0be44f2c5708c301efcb68f569d1779e039a9d149c09ae1f151ea2806b95787f","observation_id":"3c85cca2-2749-4b40-b36d-b4b1dc9ffcf6","resolution":{"observed_at":"2026-08-12T15:51:53.832375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:51:53.801094Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"223c211f-7e48-479a-8f0e-79a2ff4eab14","year":2024},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.481122Z"},"links":{"citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:f9b0091a9ea763cc89ad1a153a6885c176b41bbbebedcbdc41311ac335d25897","observation_id":"8347f6f0-5b3f-425a-97d5-d273a265eeff","resolution":{"observed_at":"2026-08-12T15:51:53.808615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:51:53.776154Z","title":"Llava-1.6: Improved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":"375ec6a8-2727-4745-8311-3f5c9256675f","year":2024},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.489726Z"},"links":{"citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:166949d6182cfd98da2142278006e155bd014d9debf26de7fde8daa6d5779f1b","observation_id":"9f64413e-8685-476a-be50-3f3720fad9d9","resolution":{"observed_at":"2026-08-12T15:51:53.785240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:51:53.755525Z","title":"World model on million-length video and language with blockwise ringattention, 2024","venue":null,"work_id":"3cc6dd58-61e8-4d49-b264-97ad421ae4d8","year":2024},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.495850Z"},"links":{"citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:e87104d283a03eda6085c8e40407f1252df49567ff0d573b0abfadf9a90e6153","observation_id":"5bf72967-eb8f-42c2-9f6b-337257311c0f","resolution":{"observed_at":"2026-08-12T15:51:53.762595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:51:53.723918Z","title":"P-tuning: Prompt tuning can be comparable to fine-tuning across scales and tasks","venue":null,"work_id":"4f06c45d-9b18-457a-bd7d-c2ce0e2f8286","year":2022},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.502656Z"},"links":{"citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:ab72ed46189b6342564c8711510f619af073446e8b152468a36ea035b8ef1eef","observation_id":"2199b5a4-c859-45be-a4b7-7428330582c9","resolution":{"observed_at":"2026-08-12T15:51:53.735115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-12T15:51:51.512227Z","title":"Mmbench: Is your multi-modal model an all-around player? arXiv preprint arXiv:2307.06281, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.512227Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:307a9b5e248488143bc6392e7c2a0852524e8d7b94b28e0661a8de40205a0df3","observation_id":"218681ba-83d3-4018-8ed1-ace6947eee90","resolution":{"observed_at":"2026-08-12T15:51:51.512227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-11T01:38:59.827005Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-12T15:51:51.522927Z","title":"Deepseek-vl: towards real-world vision- language understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.522927Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:b4fa06ab88ede52186ce9927f76a9ed707a689215cba76f1421dd74dc298078f","observation_id":"a383fb7a-48a7-4f7e-bde7-ae9d8ba8a5b4","resolution":{"observed_at":"2026-08-12T15:51:51.522927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:51:53.703312Z","title":"Learn to explain: Multimodal reasoning via 10 thought chains for science question answering","venue":null,"work_id":"00ded1a0-d9cc-425e-851a-cc915596fd60","year":2022},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.529520Z"},"links":{"citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:fba9ad4384421a99f8622b6a222004115bee61e7cbb7138a96eecb876a45dbbd","observation_id":"aaf713b1-1088-4f31-a13a-5970acd6111f","resolution":{"observed_at":"2026-08-12T15:51:53.710147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.09958","last_updated":"2023-09-18T17:30:46Z","snapshot_observed_at":"2026-08-13T10:10:39.691607Z","submitted_at":"2023-09-18T17:30:46Z","title":"An Empirical Study of Scaling Instruct-Tuned Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.09958","snapshot_observed_at":"2026-08-12T15:51:51.535228Z","title":"An empirical study of scal- ing instruct-tuned large multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.535228Z"},"links":{"cited_paper":"/paper/2309.09958","citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:fbd143c2bc52031548cf3a6447d68261ea9153d5c8cdc0c03360816d8b396602","observation_id":"036e0362-408a-4ef8-b126-f2fd49856bf5","resolution":{"observed_at":"2026-08-12T15:51:51.535228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20339","last_updated":"2024-05-30T17:59:47Z","snapshot_observed_at":"2026-08-12T23:53:52.440959Z","submitted_at":"2024-05-30T17:59:47Z","title":"Visual Perception by Large Language Model's Weights","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20339","snapshot_observed_at":"2026-08-12T15:51:51.542580Z","title":"Visual percep- tion by large language model’s weights","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.542580Z"},"links":{"cited_paper":"/paper/2405.20339","citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:60041dfb4a76dcc5b647525e6ec4ff6d22095bf90aa1d23d941b6e4ec8e325e7","observation_id":"193a2832-4434-437b-a8e7-a55696fca248","resolution":{"observed_at":"2026-08-12T15:51:51.542580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.03860","last_updated":"2021-10-11T15:17:21Z","snapshot_observed_at":"2026-08-09T19:17:33.883490Z","submitted_at":"2021-10-08T02:22:50Z","title":"Token Pooling in Vision Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.03860","snapshot_observed_at":"2026-08-12T15:51:51.549984Z","title":"Token pooling in vision transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.549984Z"},"links":{"cited_paper":"/paper/2110.03860","citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:9e76d7bb7c3d403b42b85635b6ba1ec064de6fc2f01e81c5e790c23de74603c2","observation_id":"ad8e103d-077e-43ea-8636-f5f7d1e8be23","resolution":{"observed_at":"2026-08-12T15:51:51.549984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:51:53.679174Z","title":"Chatgpt plugins","venue":null,"work_id":"14d392eb-fdb8-46d4-9fb9-2966257f6fd8","year":2023},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.558033Z"},"links":{"citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:38a0b9ef8a6ae3bc100ee106b59c2e643c38f9def1ed26c1e3b3635c6e8d5dfa","observation_id":"c1f9c4be-1a33-4d87-b263-3526922d29ac","resolution":{"observed_at":"2026-08-12T15:51:53.685716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:51:51.563801Z","title":"Gpt-4v(ision) system card","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.563801Z"},"links":{"citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:7979f1575b057ecbb2cc83d522964083a33abd4a00ed7b939c30fecf05e9df8f","observation_id":"cd97e14f-003f-499e-94f0-530cd68d45ea","resolution":{"observed_at":"2026-08-12T15:51:51.563801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:51:53.637595Z","title":"V o, Marc Szafraniec, Vasil Khalidov, Pierre Fernandez, Daniel Haziza, Francisco Massa, Alaaeldin El-Nouby, Rus- sell Howes, Po-Yao Huang, et al","venue":null,"work_id":"9076700f-1bdd-43fc-bd0a-c8eed669ad83","year":2023},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.570694Z"},"links":{"citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:9e7e3167534ea3595b10c0345313a488346162b34d4c22f19755898f9b96bb61","observation_id":"0a80067d-ff0b-4ec4-8da6-c99c998ff3d5","resolution":{"observed_at":"2026-08-12T15:51:53.644321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:51:53.616876Z","title":"Less is more: Pay less attention in vision transform- ers","venue":null,"work_id":"f4552c82-8bc1-468b-ba98-7245d00e7069","year":2022},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.577940Z"},"links":{"citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:6d10d5b6206469f7eeda76fceac7adc6a937dc95fb2621b62585d0b5061506b5","observation_id":"6c73149d-2832-4f2b-a5ad-93c1871b829f","resolution":{"observed_at":"2026-08-12T15:51:53.623986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:51:51.585147Z","title":"Language models are unsu- pervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.585147Z"},"links":{"citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:02ff1cd3988c7576d15d66913efad33b447d461fb1f57449a746e3ea9cacb73d","observation_id":"2280410b-3b1a-440a-8582-8be45c8eb50e","resolution":{"observed_at":"2026-08-12T15:51:51.585147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:51:53.577577Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"71fbef9f-85a5-42b8-8315-7e9e8196dc99","year":2021},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.591793Z"},"links":{"citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:3ab91b84a9908752eb6f5698eb8d00dd6fc475a4bd3977a788a6bf4825c26d4e","observation_id":"043f2b9f-c29b-47ec-8e0b-c33c51fd2147","resolution":{"observed_at":"2026-08-12T15:51:53.587710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-12T15:51:51.598489Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.598489Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:d947fd2aaf4248766266a3507888b3c0ec6c93e95e4be18917541d230b76a5ea","observation_id":"9ff59451-3750-4069-8ec2-b5bac5422d24","resolution":{"observed_at":"2026-08-12T15:51:51.598489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:51:53.550983Z","title":"Tokenlearner: Adaptive space-time tokenization for videos","venue":null,"work_id":"2485397e-43b1-44e2-972a-6c4524539126","year":2021},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.606248Z"},"links":{"citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:0036586c98b099bedb20babdcda2e22aa525a7deb6521fc315dd9a200d22868d","observation_id":"1ae589ff-0e04-4017-91d4-2feb561732c9","resolution":{"observed_at":"2026-08-12T15:51:53.557328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.15980","last_updated":"2020-11-07T05:33:35Z","snapshot_observed_at":"2026-08-05T14:17:34.026911Z","submitted_at":"2020-10-29T22:54:00Z","title":"AutoPrompt: Eliciting Knowledge from Language Models with Automatically Generated Prompts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.15980","snapshot_observed_at":"2026-08-12T15:51:51.615817Z","title":"Autoprompt: Eliciting knowl- edge from language models with automatically generated prompts","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.615817Z"},"links":{"cited_paper":"/paper/2010.15980","citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:0a1ece201f6b608ca670444e983c820ed46fd62efa23d000c19d1f3b5da28026","observation_id":"cfa4e5d7-c75a-4d76-a02d-0658841969f1","resolution":{"observed_at":"2026-08-12T15:51:51.615817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06712","last_updated":"2023-08-18T05:49:47Z","snapshot_observed_at":"2026-08-12T15:16:57.633602Z","submitted_at":"2023-04-13T17:58:08Z","title":"What does CLIP know about a red circle? Visual prompt engineering for VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06712","snapshot_observed_at":"2026-08-12T15:51:51.622598Z","title":"What does clip know about a red cir- cle? visual prompt engineering for vlms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.622598Z"},"links":{"cited_paper":"/paper/2304.06712","citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:42ebb12ec40946286ac4f0aa0b82867b884c77ce2e303464580d2ff0b6a3f732","observation_id":"4af9e36e-5d89-4cab-8991-79139306fd1e","resolution":{"observed_at":"2026-08-12T15:51:51.622598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:51:53.525737Z","title":"Unleashing the power of prompt-driven nu- cleus instance segmentation, 2024","venue":null,"work_id":"63c8758a-aaf1-4d1b-adef-f899fcd0b796","year":2024},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.629753Z"},"links":{"citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:23bf7ba312787beee2544ac8bc95c6fba13ab83c1f5b309d8ed990a58f7baa22","observation_id":"9943d15d-6ed2-4702-8a41-1d39e9e9997d","resolution":{"observed_at":"2026-08-12T15:51:53.535200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:51:51.634993Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.634993Z"},"links":{"citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:95c4ef197f92d842c3db1b62d9f4449983bd74e7b49bcc5178bfd584ca53a704","observation_id":"30569455-0054-4bd0-80d9-6eabf4ce7fa0","resolution":{"observed_at":"2026-08-12T15:51:51.634993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-12T15:51:51.642361Z","title":"Chameleon: Mixed-modal early-fusion foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.642361Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:d9e87a66df05df15ec91c1a027857cfa14f6ee25b2d58781cad03cfc1be34bc8","observation_id":"de667c41-506a-4b77-9f2a-55f0efb3212c","resolution":{"observed_at":"2026-08-12T15:51:51.642361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:51:51.649110Z","title":"Gemini 1.5: Unlocking multimodal under- standing across millions of tokens of context, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.649110Z"},"links":{"citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:3804c36a333c690852507752b21540cb05548b6df0bfb3597738c3fce8b192a5","observation_id":"b3406eeb-679a-4d6b-abfa-75d4aadba639","resolution":{"observed_at":"2026-08-12T15:51:51.649110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-12T15:51:51.656061Z","title":"Cambrian- 1: A fully open, vision-centric exploration of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.656061Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:051d156657ea6c19ec61d4898d9395de6cca86bda53b01c759d51a61dfb90206","observation_id":"0c2dc4cc-e423-4ec9-91f3-2fad006c364d","resolution":{"observed_at":"2026-08-12T15:51:51.656061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:51:53.463023Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms","venue":null,"work_id":"a1488079-60c4-4b08-91ef-23f210e88f6d","year":2024},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.665815Z"},"links":{"citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:53836afd2dfe9ce7626fb6eceb05a3e114fe69b97624aadac20cfb4594b75794","observation_id":"64db2029-d43b-4f97-bded-009ff49a11c7","resolution":{"observed_at":"2026-08-12T15:51:53.469088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-12T15:51:51.671252Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.671252Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:488a934491e93061d0c4e492a011eb42b05cfe977430760ae7e38dca992075e9","observation_id":"1c36a860-840d-4904-a7a0-6f49d18cb409","resolution":{"observed_at":"2026-08-12T15:51:51.671252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:51:51.678359Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.678359Z"},"links":{"citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:4d8bf6fd6906979a74e3aff9d21977ea9245ee6c2d50378f671e33ec46b2c875","observation_id":"2036c52d-8c0d-4cda-8d27-2748e21d8784","resolution":{"observed_at":"2026-08-12T15:51:51.678359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.12223","last_updated":"2023-05-23T10:35:35Z","snapshot_observed_at":"2026-08-13T11:38:11.144651Z","submitted_at":"2023-05-20T16:11:26Z","title":"What Makes for Good Visual Tokenizers for Large Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.12223","snapshot_observed_at":"2026-08-12T15:51:51.685067Z","title":"What makes for good visual to- kenizers for large language models? arXiv preprint arXiv:2305.12223, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.685067Z"},"links":{"cited_paper":"/paper/2305.12223","citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:e605906809d189c59caa212262b0b86da7addb1606743a7d317ba4ba11a9f668","observation_id":"e202018b-0e6c-4e9d-ae3a-b16738d7d2ee","resolution":{"observed_at":"2026-08-12T15:51:51.685067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:51:53.422422Z","title":"Tarsier: Recipes for training and evaluating large video description models, 2024","venue":null,"work_id":"b3fb0e0b-ed20-4253-8882-5d35f08c058a","year":2024},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.697846Z"},"links":{"citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:fe4f512f97882b1b25f9ee1e524c6544d6c0186a2cddd4f2ea6de60ba025702c","observation_id":"a26334f5-8b8e-46e4-94c5-d7e68ed9429f","resolution":{"observed_at":"2026-08-12T15:51:53.428397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:51:53.393543Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution, 2024","venue":null,"work_id":"948b49b4-93b0-4b88-985f-f48e651ba3d0","year":2024},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.704154Z"},"links":{"citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:92496e30fdf64430a3a01ef5d0dd5a2a841eabcaf15d0df2ccaa7d077223b6a2","observation_id":"db3febaa-6b80-4aa2-a1d9-92daa63ae9f0","resolution":{"observed_at":"2026-08-12T15:51:53.402379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:51:51.711559Z","title":"Learning to prompt for con- tinual learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.711559Z"},"links":{"citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:bf5398c3a845fbfb29b81ced3f5a6883e28dfd2c23e2ddaa8a756a4deca6d136","observation_id":"06bd867a-6b0b-4965-8d69-050956f876dd","resolution":{"observed_at":"2026-08-12T15:51:51.711559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:51:53.353564Z","title":"Mio: A foun- dation model on multimodal tokens, 2024","venue":null,"work_id":"82a14d71-cb7d-4ec1-b006-f0e807715e90","year":2024},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.718058Z"},"links":{"citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:817ca2680373012cee02d29f4aae155edc53bd83e20b642e4655a1120341c93e","observation_id":"96fc4e0b-9ae3-4075-8cde-94c63626d417","resolution":{"observed_at":"2026-08-12T15:51:53.360335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04429","last_updated":"2025-03-04T16:31:57Z","snapshot_observed_at":"2026-08-01T23:38:04.510222Z","submitted_at":"2024-09-06T17:49:56Z","title":"VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04429","snapshot_observed_at":"2026-08-12T15:51:51.723519Z","title":"Vila-u: a unified foundation model inte- grating visual understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.723519Z"},"links":{"cited_paper":"/paper/2409.04429","citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:56fdc260ea52eb2227b6b19f7981388d5a2388338cebf81060c3d44a789243b0","observation_id":"2d01d96d-148d-4bb8-85e8-565a1e4faf39","resolution":{"observed_at":"2026-08-12T15:51:51.723519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:51:53.329911Z","title":"Grok-1.5 vision preview","venue":null,"work_id":"d39efaac-1e31-4b43-8261-20c4cab89a55","year":2024},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.740454Z"},"links":{"citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:6a9940396c9e386341bb419a538dfdb29b55c1fa9a69df4e9f19bef4ec82a7d9","observation_id":"59ad4f3e-7d88-4f55-8152-b890cac004d4","resolution":{"observed_at":"2026-08-12T15:51:53.335965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:51:53.300377Z","title":"C-pack: Packaged resources to advance general chi- nese embedding, 2023","venue":null,"work_id":"2b28f121-69d6-4a19-8259-2f334600b5df","year":2023},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.750696Z"},"links":{"citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:2d93cd87da7c6302a6ca7c7154a620fa6c7adf7c916106714f525bed90ad092d","observation_id":"a05d27ac-d832-4f2d-8a5b-40941e86c5f4","resolution":{"observed_at":"2026-08-12T15:51:53.306509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-12T15:51:51.761561Z","title":"Show-o: One single transformer to unify multimodal understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.761561Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:e186a4ac08597529f947eb625d57bf5c3c3bcfba388c8c21f90565296316ccfb","observation_id":"88b0479f-34c2-4ba1-82ff-1d90556f228c","resolution":{"observed_at":"2026-08-12T15:51:51.761561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-08-12T15:51:51.768960Z","title":"Pllava: Parameter-free llava extension from images to videos for video dense captioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.768960Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:0d610073e1ef436a371d40a0dab19928f619a625dfcb0af2a6ae9cf553447743","observation_id":"e7e61a9a-3b27-427e-909c-34c217e0147b","resolution":{"observed_at":"2026-08-12T15:51:51.768960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:51:53.270514Z","title":"Libra: Building decoupled vision system on large lan- guage models","venue":null,"work_id":"a92c71f0-e101-4299-a4b6-071c1dd737dc","year":2024},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.777203Z"},"links":{"citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:13413d6eb7168c2c1820887153ecffe9b4bf41a09b072f21a01b5dcdcd69add0","observation_id":"120c3296-73f3-4f4e-b0da-6bc8c5b4acfe","resolution":{"observed_at":"2026-08-12T15:51:53.279187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:51:53.241478Z","title":"Efficient model personalization in federated learning via client-specific prompt generation","venue":null,"work_id":"a9d2d7ff-1fa4-4428-a1b3-210848cb1835","year":2023},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.788220Z"},"links":{"citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:a3da855bd0f6b589a61803c8d966009c3e125b29eaf4f0d64b7f5fb764626080","observation_id":"defe557f-ac3b-41f1-b193-4d7cc03f4cc3","resolution":{"observed_at":"2026-08-12T15:51:53.248758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:51:53.216497Z","title":"Minicpm-v: A gpt-4v level mllm on your phone, 2024","venue":null,"work_id":"bea23c0e-f514-4b16-916d-725e5e685d2f","year":2024},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.794324Z"},"links":{"citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:34ca64a5ec1f7b56e7282a0251caef000b6e114460abcc645d17298b96a592e2","observation_id":"06b0a2f4-7a05-4924-86f1-0dfd06cf2d91","resolution":{"observed_at":"2026-08-12T15:51:53.224539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:51:53.183973Z","title":"mplug-owl2: Revolutionizing multi-modal large language model with modality collaboration","venue":null,"work_id":"4036a5c4-e53f-496b-bc7a-44b69380956a","year":2024},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.801180Z"},"links":{"citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:a1f8e34b687958030126e67d53aa2eb51f14457d33bd03493b876de0f38213a0","observation_id":"9e1d771a-9a3f-48da-8d43-eb11fc489dc7","resolution":{"observed_at":"2026-08-12T15:51:53.191202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-08T03:31:37.699253Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-12T15:51:51.809046Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.809046Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:967d774209693adeb49ff82ee015ef8c41135ab32195656d390f8ca0c8b9ad10","observation_id":"4f6201c2-9065-4d2e-b0a6-958acf1c5ee5","resolution":{"observed_at":"2026-08-12T15:51:51.809046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:51:53.150002Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"509bf6c4-f9ab-4bbf-8994-4715ae759df7","year":2023},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.814869Z"},"links":{"citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:150b4f241a7a38dff6ab4a0881064bbaa8eaf342d04523239165e630dd2a43a6","observation_id":"9583c768-028d-405c-bb2c-4c0df17add0e","resolution":{"observed_at":"2026-08-12T15:51:53.159672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12226","last_updated":"2025-09-08T07:04:17Z","snapshot_observed_at":"2026-08-13T04:15:20.480186Z","submitted_at":"2024-02-19T15:33:10Z","title":"AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12226","snapshot_observed_at":"2026-08-12T15:51:51.820564Z","title":"Anygpt: Unified multimodal llm with dis- crete sequence modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.820564Z"},"links":{"cited_paper":"/paper/2402.12226","citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:6f22fc2972c8d8b698183ed06183d43ca143e57507deadf1a07d00b02bcd206c","observation_id":"874eb5fc-de1b-4c35-9243-076f57beb7f7","resolution":{"observed_at":"2026-08-12T15:51:51.820564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-12T15:51:51.827282Z","title":"Video-llama: An instruction-tuned audio-visual language model for video un- derstanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.827282Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:d205b253717215b6ba05eb4773b3e9b9c33c33890a0708454f763f950b538f2b","observation_id":"035551e1-a0dc-4aa6-ad14-198223eb7ef5","resolution":{"observed_at":"2026-08-12T15:51:51.827282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:51:53.119137Z","title":"Long context transfer from language to vision, 2024","venue":null,"work_id":"d7d07e1d-c2b9-4cb5-9a45-dc977ff75685","year":2024},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.833316Z"},"links":{"citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:3c97b1914365e2352a2275d76676e238c7cc10f69186bdbc5e6f48864f19ab3c","observation_id":"28f86b27-a50d-4d0d-87ce-21343dcc636a","resolution":{"observed_at":"2026-08-12T15:51:53.128400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06169","last_updated":"2024-11-30T05:32:51Z","snapshot_observed_at":"2026-08-12T22:28:01.700115Z","submitted_at":"2024-10-08T16:13:24Z","title":"Treat Visual Tokens as Text? But Your MLLM Only Needs Fewer Efforts to See","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06169","snapshot_observed_at":"2026-08-12T15:51:51.844982Z","title":"Treat visual tokens as text? but your mllm only needs fewer efforts to see","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.844982Z"},"links":{"cited_paper":"/paper/2410.06169","citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:93d17b5bb1a2d373f157654f189cbe943e3221511ba6cf11e2cd91697e12f1d7","observation_id":"9fe4f246-6e6f-4a33-a99c-7c132b2b21eb","resolution":{"observed_at":"2026-08-12T15:51:51.844982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:51:51.853839Z","title":"Learning to prompt for vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.853839Z"},"links":{"citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:fa77619f702cf80696ef7c9200b9b4bd0c7c73c4244aef6b0d7e4bcf5fe091a8","observation_id":"9f9955f7-6598-40b6-8644-766d416fc479","resolution":{"observed_at":"2026-08-12T15:51:51.853839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-12T15:51:51.860532Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.860532Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:f9cb483f26c9b7c703711e7f07be21caf08033b04aa75a58d9d94f9e4208961f","observation_id":"f5f7f052-85c0-40d6-b03b-efe3baba85c9","resolution":{"observed_at":"2026-08-12T15:51:51.860532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:51:53.079037Z","title":null,"venue":null,"work_id":"d34099f8-1162-442c-ad64-517a1e8ba54a","year":null},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.866589Z"},"links":{"citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:467507d1f1c5a4b13192fa915f7d2551443a3ca81600894fed77e6193791a1b7","observation_id":"316b5729-ad1f-47b6-9691-0148398ce56c","resolution":{"observed_at":"2026-08-12T15:51:53.086621Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:51:53.055262Z","title":null,"venue":null,"work_id":"8229eece-2b61-4f2c-a3a1-497c47e73413","year":null},"citing_paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-12T15:51:51.871655Z"},"links":{"citing_paper":"/paper/2411.13909"},"observation_digest":"sha256:0ad55024cb256f5c73e9245dd7569bba0269496d2bf415e6c5e0ef34d90bd80b","observation_id":"cf9350ed-e91c-4afd-8cb4-03f0d90f6945","resolution":{"observed_at":"2026-08-12T15:51:53.062413Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.13909","last_updated":"2024-11-22T07:03:11Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T15:42:41.107155Z","submitted_at":"2024-11-21T07:47:27Z","title":"Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts"},"reference_resolution":{"displayed":96,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":65,"verified_exact":0,"verified_fuzzy":31},"total_outbound_references":96},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 96 of 96 outbound references and 0 inbound Pith citation observations for arXiv:2411.13909."}