{"as_of":"2026-08-14T08:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8d5e259adce2141ebbc3e11e19111d99435072cfea455435ff4651814e7509c9","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T04:35:52.480788Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T22:40:00.510742Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T16:27:09.401525Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-13T20:41:02.597193Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"cited_work":{"arxiv_id":"2412.01289","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.01289","snapshot_observed_at":"2026-07-02T16:27:09.401525Z","title":"Enhancing perception capabilities of multimodal llms with training-free fusion","venue":null,"work_id":"5b6a06bb-7868-4d9c-ac4b-9e51accef9d4","year":2024},"citing_paper":{"arxiv_id":"2604.22823","last_updated":"2026-07-13T15:11:18Z","snapshot_observed_at":"2026-08-13T18:01:04.268818Z","submitted_at":"2026-04-18T09:38:03Z","title":"PivotMerge: Bridging Heterogeneous Multimodal Pre-training via Post-Alignment Model Merging","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T07:04:54.909073Z"},"links":{"cited_paper":"/paper/2412.01289","citing_paper":"/paper/2604.22823"},"observation_digest":"sha256:c2f3fb0b48db0d5ccdee0879324364abc403aa213c10dd3b7338531f8ad82993","observation_id":"81cc936d-1ccb-4918-be52-a8ad35fac335","resolution":{"observed_at":"2026-05-10T07:06:52.904006Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-13T20:41:02.597193Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"cited_work":{"arxiv_id":"2412.01289","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.01289","snapshot_observed_at":"2026-07-02T16:27:09.401525Z","title":"Enhancing perception capabilities of multimodal llms with training-free fusion","venue":null,"work_id":"5b6a06bb-7868-4d9c-ac4b-9e51accef9d4","year":2024},"citing_paper":{"arxiv_id":"2606.07289","last_updated":"2026-06-05T14:00:47Z","snapshot_observed_at":"2026-08-01T07:32:32.007503Z","submitted_at":"2026-06-05T14:00:47Z","title":"Closed-Form Spectral Regularization for Multi-Task Model Merging","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T22:40:00.510742Z"},"links":{"cited_paper":"/paper/2412.01289","citing_paper":"/paper/2606.07289"},"observation_digest":"sha256:4351288f781294224a8ab149ad2ba96c85793c54e9f5cfc05a3b16fced9329bf","observation_id":"d395fd3b-2d8b-4ac5-9735-002f65d9c99b","resolution":{"observed_at":"2026-07-02T16:27:09.403073Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.01289/citation-record","integrity":"/paper/2412.01289/integrity","json":"/paper/2412.01289/citation-record.json","paper":"/paper/2412.01289"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:53.917640Z","title":"Llama 3 model card","venue":null,"work_id":"25e47b2b-73ac-4088-ad7c-2cc888df0754","year":2024},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-13T20:41:02.597193Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.161969Z"},"links":{"citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:c679bf4f2e93557643c22ee75f2859df03ea408aff121bd6b563dac5503f98f9","observation_id":"e5020a5b-2820-412e-922d-8a01dcd07960","resolution":{"observed_at":"2026-08-12T04:35:53.926092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:52.169246Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-13T20:41:02.597193Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.169246Z"},"links":{"citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:028d965456a9a888319cd1d6dc2450d58d8a61208772ebca74b06db9f2361d6c","observation_id":"579021a5-be40-4b14-b897-eb5b2b030ef5","resolution":{"observed_at":"2026-08-12T04:35:52.169246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-12T04:35:52.174871Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-13T20:41:02.597193Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.174871Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:57dca38b2d59a74f0f50bbb59d59c1b8d46e949f053ee9d4b3cb078e6b85b589","observation_id":"93f85b83-c205-419c-af0b-3cd0ddf64249","resolution":{"observed_at":"2026-08-12T04:35:52.174871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09461","last_updated":"2023-03-01T19:45:11Z","snapshot_observed_at":"2026-08-13T04:00:22.647615Z","submitted_at":"2022-10-17T22:23:40Z","title":"Token Merging: Your ViT But Faster","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09461","snapshot_observed_at":"2026-08-12T04:35:52.180236Z","title":"To- ken merging: Your vit but faster","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-13T20:41:02.597193Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.180236Z"},"links":{"cited_paper":"/paper/2210.09461","citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:88652ab9ad34eecc55c7897ee1951eada7a1031a7f00a1931de4b1d7943b9f61","observation_id":"c84bf1a3-e5d7-4fe6-a94e-c2360674bb86","resolution":{"observed_at":"2026-08-12T04:35:52.180236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:53.885422Z","title":"Honeybee: Locality-enhanced projector for multimodal llm","venue":null,"work_id":"23347b5a-23e0-4395-8b53-14160ab6a12b","year":2024},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-13T20:41:02.597193Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.185358Z"},"links":{"citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:1ea3c810b4c13d72a24bbd5fd50aee12a9a6d66f7fda257a353c9c5fe5342cd2","observation_id":"ffb5b431-b27b-4176-90e4-5d67fb9a08d4","resolution":{"observed_at":"2026-08-12T04:35:53.891160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-08-13T14:42:26.982679Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-12T04:35:52.190470Z","title":"Shikra: Unleashing multi- modal llm’s referential dialogue magic","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-13T20:41:02.597193Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.190470Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:25a500edd70ca640c41de0f306cb6557a248a39913e901e38f32416193625905","observation_id":"578e2d59-2d4a-4796-888a-adb393df60e7","resolution":{"observed_at":"2026-08-12T04:35:52.190470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:53.866830Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models, 2024","venue":null,"work_id":"ec4964f8-ace2-4773-b73d-e8816fe61707","year":2024},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-13T20:41:02.597193Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.196430Z"},"links":{"citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:b6e7361d8e321412da080b1bac043226e063323b9d23cad3c6d9f436e5ac304c","observation_id":"89f70929-9fb2-4836-8a7c-a31a4843be58","resolution":{"observed_at":"2026-08-12T04:35:53.873075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:52.201755Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality, march","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-13T20:41:02.597193Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.201755Z"},"links":{"citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:878c1dbe0c55337a7ac38a45f87e35ad690de8f2016a9b2c46f02cba874b7b8f","observation_id":"3fd7e438-4b00-4406-ab26-73712da16cb6","resolution":{"observed_at":"2026-08-12T04:35:52.201755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.03044","last_updated":"2022-04-06T18:54:48Z","snapshot_observed_at":"2026-08-13T16:07:23.235097Z","submitted_at":"2022-04-06T18:54:48Z","title":"Fusing finetuned models for better pretraining","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.03044","snapshot_observed_at":"2026-08-12T04:35:52.206726Z","title":"Fusing finetuned models for better pretraining","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-13T20:41:02.597193Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.206726Z"},"links":{"cited_paper":"/paper/2204.03044","citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:65e8de4a3d63bc3ec925fd7b5960ae241aad791d1640bec9198b9613d77df658","observation_id":"55d157bb-c303-4343-a09c-d07f1ad997d5","resolution":{"observed_at":"2026-08-12T04:35:52.206726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-12T04:35:52.211989Z","title":"Mobilevlm: A fast, reproducible and strong vision language assistant for mobile devices","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-13T20:41:02.597193Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.211989Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:93d87f644be4420166359a5519bf7b5728dee183b7adc28abad0054f55673079","observation_id":"e3c46c07-88a7-4f99-a008-8230dc87b68f","resolution":{"observed_at":"2026-08-12T04:35:52.211989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:52.217289Z","title":"Instructblip: Towards general- purpose vision-language models with instruction tuning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-13T20:41:02.597193Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.217289Z"},"links":{"citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:7effade58ae3a8705f1f8941455f4115e10cbf31f9414cf76d35c3ad66628dd1","observation_id":"1961de4f-e606-4566-904a-1bb5a3654107","resolution":{"observed_at":"2026-08-12T04:35:52.217289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09860","last_updated":"2023-05-18T02:24:56Z","snapshot_observed_at":"2026-08-13T11:40:38.498943Z","submitted_at":"2023-05-17T00:11:38Z","title":"Epsilon Sampling Rocks: Investigating Sampling Strategies for Minimum Bayes Risk Decoding for Machine Translation","version":2},"cited_work":{"arxiv_id":"2305.09860","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.09860","snapshot_observed_at":"2026-08-12T04:35:53.102436Z","title":"Epsilon Sampling Rocks: Investigating Sampling Strategies for Minimum Bayes Risk Decoding for Machine Translation","venue":"cs.CL","work_id":"b874cfbc-e789-41c9-b9ca-78d355641101","year":2023},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-13T20:41:02.597193Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.222575Z"},"links":{"cited_paper":"/paper/2305.09860","citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:73fed3ca9468e2187d7cd5fe21dee7965ae0588f2d5d91919ff57e5835592f50","observation_id":"8dc888e9-7e0c-426d-ba46-4932d7dcc54f","resolution":{"observed_at":"2026-08-12T04:35:53.110880Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:53.815774Z","title":"Mme: A compre- hensive evaluation benchmark for multimodal large language models, 2024","venue":null,"work_id":"5648d79b-9200-4575-8f70-e660fd593fe5","year":2024},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-13T20:41:02.597193Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.229333Z"},"links":{"citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:a0b0618ab47085bd5c4317f4b851593e2326faf09655cfbcec33e56b605c95c9","observation_id":"3736654f-5dd5-4490-a3db-223588607acf","resolution":{"observed_at":"2026-08-12T04:35:53.823105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15738","last_updated":"2024-05-24T17:34:15Z","snapshot_observed_at":"2026-08-14T04:30:40.908915Z","submitted_at":"2024-05-24T17:34:15Z","title":"ConvLLaVA: Hierarchical Backbones as Visual Encoder for Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15738","snapshot_observed_at":"2026-08-12T04:35:52.235865Z","title":"Con- vllava: Hierarchical backbones as visual encoder for large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-13T20:41:02.597193Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.235865Z"},"links":{"cited_paper":"/paper/2405.15738","citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:5c01fba8b3defdbcd37061e2de416c1edbaed67c7849984852dc252e0385cbd9","observation_id":"432abb0b-d338-4279-8de6-313248a04d2b","resolution":{"observed_at":"2026-08-12T04:35:52.235865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:53.792898Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answer- ing","venue":null,"work_id":"c95055bc-0cb8-4b71-8d64-f7ca6e66a1ad","year":2017},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-13T20:41:02.597193Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.241613Z"},"links":{"citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:e7d78788b6746413b7142554fe547d53cac31d6b6627f0fa4df58b575b8de47a","observation_id":"932ccbd9-163f-4711-8a14-80f66a95fb4a","resolution":{"observed_at":"2026-08-12T04:35:53.800117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:53.767619Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answer- ing","venue":null,"work_id":"5a240e3c-90a0-4b66-89dc-82abf1490237","year":2017},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-13T20:41:02.597193Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.247353Z"},"links":{"citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:206f81e4bf83c249b19d3caee233e6a28eb24d619561c6da0346013e007e017b","observation_id":"0765a90e-1a92-4eb8-8f00-fd0f3af35a10","resolution":{"observed_at":"2026-08-12T04:35:53.774006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:53.747243Z","title":"Vizwiz grand challenge: Answering visual questions from blind people","venue":null,"work_id":"a291e513-35cc-491c-be96-2ebfb47f5dfa","year":2018},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-13T20:41:02.597193Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.252591Z"},"links":{"citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:17a46b3a9de08d986cfe512d5f5535dda575f7083376d75184f9003b389a3016","observation_id":"0014ba9e-0cad-4347-bf10-699e3e4c6b3c","resolution":{"observed_at":"2026-08-12T04:35:53.753151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:53.728817Z","title":"Onellm: One framework to align all modalities with language","venue":null,"work_id":"1eaace47-638c-4ed8-8a5e-1474f81f4b34","year":2024},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-13T20:41:02.597193Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.257413Z"},"links":{"citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:b74438ff45756fcebe5abeab7ff4cb94128ce976eea8c7f54616a5e6dfd45032","observation_id":"36af12b2-109f-46e6-84e8-0ac063c7138f","resolution":{"observed_at":"2026-08-12T04:35:53.734724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:53.708950Z","title":"Editing models with task arithmetic","venue":null,"work_id":"4ca141ac-647b-465d-9fc4-51ef7eb354ab","year":2022},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-13T20:41:02.597193Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.262529Z"},"links":{"citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:fad01b4c88a018c60520215543977ead297de7e7fd60af4dbe34bfa1a6705805","observation_id":"83921769-1cbc-4a52-a3ad-df5b70759392","resolution":{"observed_at":"2026-08-12T04:35:53.714807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:53.689662Z","title":"Editing models with task arithmetic","venue":null,"work_id":"55c282b5-a1ac-45d7-98a4-60fc0eaf1b3c","year":2023},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-13T20:41:02.597193Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.267261Z"},"links":{"citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:545e5b4c4efebdfb9acae45d36b125b7e62cb67c283e2bcbfad1b2a8666ce2a0","observation_id":"11de87cf-3771-4388-8e95-300b97321891","resolution":{"observed_at":"2026-08-12T04:35:53.695652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02561","last_updated":"2023-06-30T21:39:54Z","snapshot_observed_at":"2026-08-13T11:24:39.612149Z","submitted_at":"2023-06-05T03:32:26Z","title":"LLM-Blender: Ensembling Large Language Models with Pairwise Ranking and Generative Fusion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02561","snapshot_observed_at":"2026-08-12T04:35:52.272424Z","title":"Llm- blender: Ensembling large language models with pair- wise ranking and generative fusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-13T20:41:02.597193Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.272424Z"},"links":{"cited_paper":"/paper/2306.02561","citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:712706abb4ac586338e13f36efec9abfad7a716ca5aedd35f145351661057afe","observation_id":"9d214fd1-cbe8-4607-b7d8-87a6f45498ff","resolution":{"observed_at":"2026-08-12T04:35:52.272424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:53.669567Z","title":"Dataless knowledge fusion by merging weights of language models","venue":null,"work_id":"44f44b00-27a7-40ed-82ba-282f3a3ecc2a","year":2022},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-13T20:41:02.597193Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.277765Z"},"links":{"citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:812c3bd214b5188323a7760b40c2b5d52ce4fd021ba51ec289a6f7126f5b4824","observation_id":"802b26ba-707d-41ff-8c6b-aaeabe7dd343","resolution":{"observed_at":"2026-08-12T04:35:53.675911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:52.282873Z","title":"A diagram is worth a dozen images","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-13T20:41:02.597193Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.282873Z"},"links":{"citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:52a28ccd735cdd3cab6ca315d3aa49e548d85dd8af6f123f9f14727fe2aebe99","observation_id":"7cd60cc8-56bf-4ac8-a293-760a515e2c89","resolution":{"observed_at":"2026-08-12T04:35:52.282873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:53.640596Z","title":"In- troducing idefics: An open reproduction of state-of-the-art visual language model, 2023","venue":null,"work_id":"ef2329f8-0331-4c5c-b198-b5866e39cd4b","year":2023},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-13T20:41:02.597193Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.296757Z"},"links":{"citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:08b41e73485bccc85a213e502b6b70525e6de5cc43fe3359807dadfcc50cfa37","observation_id":"332759f4-3009-434c-955d-cdd30957e077","resolution":{"observed_at":"2026-08-12T04:35:53.646125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:52.302694Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-13T20:41:02.597193Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.302694Z"},"links":{"citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:edf65f50027c242eaeba0330594a5867194be6a22079ec04f38697d7720b72bf","observation_id":"e9980917-69d3-430b-9f95-603a1244ca12","resolution":{"observed_at":"2026-08-12T04:35:52.302694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-13T05:15:07.522678Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-08-12T04:35:52.307747Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-13T20:41:02.597193Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.307747Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:1416e824a858ef453ea1b4616e901c843acf5804833a06a0c26d283568334bb6","observation_id":"5e915f62-38f3-4445-8129-ccf5dee9a37b","resolution":{"observed_at":"2026-08-12T04:35:52.307747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-12T04:35:52.313670Z","title":"Mini-gemini: Mining the potential of multi-modality vision language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-13T20:41:02.597193Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.313670Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:cdb3cfe7a358372b7e09cf6c20b3d862cebfba12f7f096e33594c93133bd5267","observation_id":"3f797669-e749-44a5-bdc2-08af6022129b","resolution":{"observed_at":"2026-08-12T04:35:52.313670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-12T04:35:52.321158Z","title":"Video-llava: Learning united visual represen- tation by alignment before projection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-13T20:41:02.597193Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.321158Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:f8d86ed48ebe4099fad66496bad5e3b09400e865fe1dae3a4411b7998ca7b97e","observation_id":"2998fcce-700e-4121-b0b2-7cd9735a91ba","resolution":{"observed_at":"2026-08-12T04:35:52.321158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:53.604778Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":"44445f9e-1653-4e16-b5dd-67f3c1d7d9b3","year":2024},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-13T20:41:02.597193Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.326881Z"},"links":{"citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:747c14269c7955dee76a458e7d5e175865d9c602c5762f21516bd882bee65387","observation_id":"031776af-ef46-435a-b03c-2f7c4bfe9e85","resolution":{"observed_at":"2026-08-12T04:35:53.611660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:52.332753Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-13T20:41:02.597193Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.332753Z"},"links":{"citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:ee3f0c2c00b3ee66c90a67ff937b787b31fac77eaa46499f14bfc54731e250de","observation_id":"8bc5a57e-f4ea-4e02-8cd2-d4d1b5d11ab2","resolution":{"observed_at":"2026-08-12T04:35:52.332753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:53.572043Z","title":"Mitigating hallucination in large multi-modal models via robust instruction tuning","venue":null,"work_id":"f099f9b2-f31d-4f65-8b02-28bb2134b792","year":null},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-13T20:41:02.597193Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.339639Z"},"links":{"citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:29b58aa6025a696e13c39c3b2619b488f7596268e7e69167a03898705b7f1a0d","observation_id":"96d2cefd-2f49-4e5a-a952-a525211d076b","resolution":{"observed_at":"2026-08-12T04:35:53.577821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:53.553692Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"d7157eef-5a1b-4940-bc92-b98802fbab1a","year":2024},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-13T20:41:02.597193Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.346028Z"},"links":{"citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:028fa81057f499f7dd48ebab2416488d999ec4face83aba31e259a5c391faf9c","observation_id":"e449a05d-4bb9-40ba-b126-78193aa34fc0","resolution":{"observed_at":"2026-08-12T04:35:53.559725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:53.394482Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":"efb8bbca-8a56-432c-8525-71bf3e62e7a4","year":2024},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-13T20:41:02.597193Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.350752Z"},"links":{"citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:5a1c3974c747705367a4fd052874e7a011b8860e6140f1cdfd417095febfd81f","observation_id":"6d7f0d48-151c-4fb3-a4e6-ce8c87379131","resolution":{"observed_at":"2026-08-12T04:35:53.400194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:53.374076Z","title":"Visual instruction tuning","venue":null,"work_id":"c6e96d91-67c8-4137-8ab9-592d08c21f42","year":2024},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-13T20:41:02.597193Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.356248Z"},"links":{"citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:370ff7cee0b3142c87b023973e26ad028416436d5fbdf28628cad662802bf68d","observation_id":"0073817c-eee9-4e9e-bb05-9a1b029e7253","resolution":{"observed_at":"2026-08-12T04:35:53.380245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10193","last_updated":"2024-10-13T20:42:37Z","snapshot_observed_at":"2026-08-13T04:18:04.658813Z","submitted_at":"2024-02-15T18:50:06Z","title":"BitDelta: Your Fine-Tune May Only Be Worth One Bit","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10193","snapshot_observed_at":"2026-08-12T04:35:52.361915Z","title":"Bitdelta: Your fine-tune may only be worth one bit","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-13T20:41:02.597193Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.361915Z"},"links":{"cited_paper":"/paper/2402.10193","citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:6ce75ca7b9bd352a196cf8baa601976caf347e1928a1bdd4843f2101b5566d9d","observation_id":"300eb4da-51a2-4cc8-b6dd-493e0edca866","resolution":{"observed_at":"2026-08-12T04:35:52.361915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-12T04:35:52.368597Z","title":"Mmbench: Is your multi-modal model an all-around player? arXiv preprint arXiv:2307.06281, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-13T20:41:02.597193Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.368597Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:69747ac8960e4ff68e07c333819f01058b13422fa7c1821495d2dd147af308c9","observation_id":"99d3f12d-3706-4a72-8c75-50782528f299","resolution":{"observed_at":"2026-08-12T04:35:52.368597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07895","last_updated":"2024-08-26T02:37:14Z","snapshot_observed_at":"2026-08-13T22:21:37.032118Z","submitted_at":"2023-05-13T11:28:37Z","title":"OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07895","snapshot_observed_at":"2026-08-12T04:35:52.374335Z","title":"On the hidden mystery of ocr in large multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-13T20:41:02.597193Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.374335Z"},"links":{"cited_paper":"/paper/2305.07895","citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:c117a3e2147fe8b6515d6e0358a058a8e31f2281105587f2a9de2458b559432a","observation_id":"2df3300e-0170-4a34-a7f2-adac24513433","resolution":{"observed_at":"2026-08-12T04:35:52.374335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.09958","last_updated":"2023-09-18T17:30:46Z","snapshot_observed_at":"2026-08-13T10:10:39.691607Z","submitted_at":"2023-09-18T17:30:46Z","title":"An Empirical Study of Scaling Instruct-Tuned Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.09958","snapshot_observed_at":"2026-08-12T04:35:52.380002Z","title":"An empirical study of scal- ing instruct-tuned large multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-13T20:41:02.597193Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.380002Z"},"links":{"cited_paper":"/paper/2309.09958","citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:c4f46ef39d14dd82c8ef3c1d00cf4b4d13d251d3e9455d13eede432acb78df85","observation_id":"d97a5506-0c4f-4577-87f1-af88335367f4","resolution":{"observed_at":"2026-08-12T04:35:52.380002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:52.385690Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-13T20:41:02.597193Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.385690Z"},"links":{"citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:c248e571da9f29310246daf529f1afa3d1c00c2266f7972f7df9103f7352e7dc","observation_id":"d6c2f7b5-19f5-46c5-aa8e-c34aa7e9cb31","resolution":{"observed_at":"2026-08-12T04:35:52.385690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15998","last_updated":"2025-03-02T23:41:37Z","snapshot_observed_at":"2026-08-12T22:55:41.155703Z","submitted_at":"2024-08-28T17:59:31Z","title":"Eagle: Exploring The Design Space for Multimodal LLMs with Mixture of Encoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15998","snapshot_observed_at":"2026-08-12T04:35:52.390853Z","title":"Eagle: Exploring the design space for multimodal llms with mixture of encoders","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-13T20:41:02.597193Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.390853Z"},"links":{"cited_paper":"/paper/2408.15998","citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:feaff8a89a6eca862fa9d8cbb54d7a1f65ca920bb4c3135405f6baf391b55890","observation_id":"a6cc9117-80e7-49c2-b2af-c2da7fac13b2","resolution":{"observed_at":"2026-08-12T04:35:52.390853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:53.332293Z","title":"Animating rotation with quaternion curves","venue":null,"work_id":"6c1c8449-91f9-4a79-8f69-c33baf88ac31","year":1985},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-13T20:41:02.597193Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.396328Z"},"links":{"citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:be4b15cf9752e59da96f28e73e5b513fb2fc6e5ccd6117b708cde92a618329eb","observation_id":"b82fd9ad-d49f-40bb-b243-f5d0d3416c85","resolution":{"observed_at":"2026-08-12T04:35:53.340341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:53.305993Z","title":"Towards vqa models that can read","venue":null,"work_id":"332b24f6-f2f5-451f-8f95-ebf869ef2c1b","year":2019},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-13T20:41:02.597193Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.403028Z"},"links":{"citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:8a7d3d130b0aa71523a3aa77dc09815ea92bc3fb2f2c93dedd360e87ba3a77db","observation_id":"4d0d2f25-67e1-4bf3-bd8f-22e13d25057e","resolution":{"observed_at":"2026-08-12T04:35:53.312247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:53.286346Z","title":"Visualizing data using t-sne","venue":null,"work_id":"a3f62bd8-b057-416a-b37b-983be8fdeb46","year":2008},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-13T20:41:02.597193Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.408981Z"},"links":{"citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:f436c433e0260932d5f38c3fcf4984b7b3ea665b66f08bacfed315e63fed1211","observation_id":"b4bce915-5b0a-4100-9b43-9b89da4f8f55","resolution":{"observed_at":"2026-08-12T04:35:53.292775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10491","last_updated":"2024-01-22T17:16:37Z","snapshot_observed_at":"2026-08-14T02:25:46.836991Z","submitted_at":"2024-01-19T05:02:46Z","title":"Knowledge Fusion of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10491","snapshot_observed_at":"2026-08-12T04:35:52.415298Z","title":"Knowledge fusion of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-13T20:41:02.597193Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.415298Z"},"links":{"cited_paper":"/paper/2401.10491","citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:99f2354929443723496ea877c8f540facb92ab4f45b23990f50ad7f9db83a1ed","observation_id":"174fae8c-ad11-4a6c-895d-cc5a8550ca61","resolution":{"observed_at":"2026-08-12T04:35:52.415298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:53.262058Z","title":"Grok-1.5 Vision Preview, 2024","venue":null,"work_id":"5f01488f-60a6-45c4-b86a-b6085429e64f","year":2024},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-13T20:41:02.597193Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.421218Z"},"links":{"citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:b4fb07ce10d59eb066f8861835537facfa97b825fa14481651763ff1113e2beb","observation_id":"56d56766-116b-49ec-b54f-7c8135a8682b","resolution":{"observed_at":"2026-08-12T04:35:53.268461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-08-13T20:40:43.794560Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-08-12T04:35:52.426778Z","title":"Pllava: Parameter-free llava extension from images to videos for video dense captioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-13T20:41:02.597193Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.426778Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:6be32acf6b84e0ca7fcdc3835b872c7571651e13e5831b6cf1fb08ca2bbe80ef","observation_id":"d522b4b3-3f60-491e-a3bd-ff52039a38aa","resolution":{"observed_at":"2026-08-12T04:35:52.426778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01708","last_updated":"2023-10-27T01:09:31Z","snapshot_observed_at":"2026-08-13T15:23:54.677158Z","submitted_at":"2023-06-02T17:31:32Z","title":"TIES-Merging: Resolving Interference When Merging Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.01708","snapshot_observed_at":"2026-08-12T04:35:52.432601Z","title":"Resolving interference when merging models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-13T20:41:02.597193Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.432601Z"},"links":{"cited_paper":"/paper/2306.01708","citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:0b4c3fa3d1d321b1ce03789e729ece9f7ee5a16c72de70a2e3372811f7f5038b","observation_id":"6429dc0b-6a57-4882-b451-55182ee5fb1a","resolution":{"observed_at":"2026-08-12T04:35:52.432601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:52.438373Z","title":"Law of vision represen- tation in mllms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-13T20:41:02.597193Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.438373Z"},"links":{"citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:3194d7dbb64b9b5a2221885415308fc6ffa05f4cb27a9eeae4e39943eb5fb17b","observation_id":"d6bd0b00-1e4d-4529-9caf-f9b31182c94c","resolution":{"observed_at":"2026-08-12T04:35:52.438373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-08-13T08:24:19.015641Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-12T04:35:52.444166Z","title":"mplug-owl: Modularization empowers large language models with multimodality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-13T20:41:02.597193Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.444166Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:97b3df4a49dbff304b323f995a3a724343adb7525bf80d398f5669023aa9561c","observation_id":"b2605e8c-5450-46e0-a93d-1563c818a0da","resolution":{"observed_at":"2026-08-12T04:35:52.444166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13549","snapshot_observed_at":"2026-08-12T04:35:52.450553Z","title":"A survey on multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-13T20:41:02.597193Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.450553Z"},"links":{"cited_paper":"/paper/2306.13549","citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:69b8c306466732206fe9f5a0a75ada7fba94c2efd32bd2f81fc3d4757f2ca031","observation_id":"5a448751-c2b9-4eca-96e4-baba4f97c04c","resolution":{"observed_at":"2026-08-12T04:35:52.450553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:53.245234Z","title":"Language models are super mario: Absorbing abilities from homologous models as a free lunch","venue":null,"work_id":"b70c22e5-e35d-4489-ad82-710d8de797df","year":2024},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-13T20:41:02.597193Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.455827Z"},"links":{"citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:afa149d2b3e307211cdaddc32f3abf027a80ae1cf57d35a9e042e220c945898e","observation_id":"5486dcd6-2b10-486f-9432-c81a8ef32a2d","resolution":{"observed_at":"2026-08-12T04:35:53.250350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:53.225892Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for ex- pert agi","venue":null,"work_id":"77b85027-c8f7-47dd-b78b-0d266079f17c","year":2024},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-13T20:41:02.597193Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.460798Z"},"links":{"citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:0011d1b9c2ac96bdc5a14373646991cdb119ffb36a3164f4417ea257816d1eed","observation_id":"ba3966b2-3d3e-4c1e-922a-3b6331e1f0c1","resolution":{"observed_at":"2026-08-12T04:35:53.232358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-08-13T11:05:54.841341Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-08-12T04:35:52.465577Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-13T20:41:02.597193Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.465577Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:d70d88b9ec08d4ae7f745a83d27e067f107302ba2ed8c3b23cc201ecb2b1414b","observation_id":"558f1a50-6dac-4dea-b57e-712b593cedeb","resolution":{"observed_at":"2026-08-12T04:35:52.465577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08487","last_updated":"2024-06-14T00:52:35Z","snapshot_observed_at":"2026-08-12T23:44:15.418450Z","submitted_at":"2024-06-12T17:59:49Z","title":"Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08487","snapshot_observed_at":"2026-08-12T04:35:52.470510Z","title":"Beyond llava-hd: Diving into high-resolution large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-13T20:41:02.597193Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.470510Z"},"links":{"cited_paper":"/paper/2406.08487","citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:52cdccc977c5c0aaa87374bdb34a32ac959309bcc1a0e943d8d3d16699f3729c","observation_id":"2293816a-e9c4-45b7-9785-2041aec0a79d","resolution":{"observed_at":"2026-08-12T04:35:52.470510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04087","last_updated":"2023-12-28T16:01:36Z","snapshot_observed_at":"2026-08-13T10:59:39.237521Z","submitted_at":"2023-07-09T03:25:14Z","title":"SVIT: Scaling up Visual Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04087","snapshot_observed_at":"2026-08-12T04:35:52.475515Z","title":"Svit: Scaling up visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-13T20:41:02.597193Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.475515Z"},"links":{"cited_paper":"/paper/2307.04087","citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:ad3d83acd72241fcb4bc2ba4f538e8b4502dec049dbc65851afd9ce27bb8d4fa","observation_id":"af8029f1-3b68-4ea6-857e-e5fb67d7643a","resolution":{"observed_at":"2026-08-12T04:35:52.475515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-12T04:35:52.480788Z","title":"Sparsity","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-13T20:41:02.597193Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.480788Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:17661b085870db161733bf30f7d2e926a3807f52ac30479e03c01fc444514d5c","observation_id":"35fc70fc-8ca2-46a9-8ed4-77b774c000ba","resolution":{"observed_at":"2026-08-12T04:35:52.480788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T20:41:02.597193Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":1,"verified_fuzzy":23},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 2 inbound Pith citation observations for arXiv:2412.01289."}