{"as_of":"2026-08-09T06:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:321c58c2c1291b86442c92fb57ccab99cb857abc32c46a8fd5059e069cb2b842","coverage":[{"denominator":15,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T12:40:56.954792Z","state":"measured"},{"denominator":15,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":15,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.26596/citation-record","integrity":"/paper/2607.26596/integrity","json":"/paper/2607.26596/citation-record.json","paper":"/paper/2607.26596"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-01T12:40:56.926574Z","title":"Kaiming He, Xiangyu Zhang, Shaoqing Ren, and Jian Sun","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26596","last_updated":"2026-07-29T08:16:28Z","snapshot_observed_at":"2026-08-07T19:27:23.125369Z","submitted_at":"2026-07-29T08:16:28Z","title":"Decoupled Visual Processing: Efficient Multimodal Adaptation via Modality-Specific Transformer Substitution","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T12:40:56.926574Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2607.26596"},"observation_digest":"sha256:4be103c8a48a8492030e5964f176dec0d71f4f885839465928d94c498f9c56a8","observation_id":"1f88dbb6-2687-4aa1-9f9a-997a3ba183fc","resolution":{"observed_at":"2026-08-01T12:40:56.926574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:40:56.935423Z","title":"Junnan Li, Dongxu Li, Silvio Savarese, and Steven Hoi","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26596","last_updated":"2026-07-29T08:16:28Z","snapshot_observed_at":"2026-08-07T19:27:23.125369Z","submitted_at":"2026-07-29T08:16:28Z","title":"Decoupled Visual Processing: Efficient Multimodal Adaptation via Modality-Specific Transformer Substitution","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T12:40:56.935423Z"},"links":{"citing_paper":"/paper/2607.26596"},"observation_digest":"sha256:3ee57e7b4421829d5d14977abbefa349b20eda896ed0cc18c647ca35e9a12cc2","observation_id":"5d9c196b-f4a7-4bbd-9d2f-052b3c22c11b","resolution":{"observed_at":"2026-08-01T12:40:56.935423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07533","last_updated":"2024-05-16T21:21:30Z","snapshot_observed_at":"2026-07-06T17:00:37.507046Z","submitted_at":"2023-12-12T18:58:18Z","title":"VILA: On Pre-training for Visual Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07533","snapshot_observed_at":"2026-08-01T12:40:56.938008Z","title":"Haotian Liu, Chunyuan Li, Yuheng Li, and Yong Jae Lee","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26596","last_updated":"2026-07-29T08:16:28Z","snapshot_observed_at":"2026-08-07T19:27:23.125369Z","submitted_at":"2026-07-29T08:16:28Z","title":"Decoupled Visual Processing: Efficient Multimodal Adaptation via Modality-Specific Transformer Substitution","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T12:40:56.938008Z"},"links":{"cited_paper":"/paper/2312.07533","citing_paper":"/paper/2607.26596"},"observation_digest":"sha256:dea1b7109eb50c4f6be3b5f45c53d1ecdacb27ab15504571bee802915877db12","observation_id":"5a61cdb0-9ed5-417f-95a6-a18341fcdc43","resolution":{"observed_at":"2026-08-01T12:40:56.938008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-01T12:40:56.940805Z","title":"Ahmed Masry, Do Xuan Long, Jia Qing Tan, Shafiq Joty, and Enamul Hoque","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26596","last_updated":"2026-07-29T08:16:28Z","snapshot_observed_at":"2026-08-07T19:27:23.125369Z","submitted_at":"2026-07-29T08:16:28Z","title":"Decoupled Visual Processing: Efficient Multimodal Adaptation via Modality-Specific Transformer Substitution","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T12:40:56.940805Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2607.26596"},"observation_digest":"sha256:9fa0f43c2e9ff98598714d67ce3958b2af4e83421804583431d3ac5bbf9435c5","observation_id":"830ae66c-781d-41e5-9326-2c2e2ff03646","resolution":{"observed_at":"2026-08-01T12:40:56.940805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-01T12:40:56.943390Z","title":"Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sas- try, Amanda Askell, Pamela Mishkin, Jack Clark, and 1 others","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26596","last_updated":"2026-07-29T08:16:28Z","snapshot_observed_at":"2026-08-07T19:27:23.125369Z","submitted_at":"2026-07-29T08:16:28Z","title":"Decoupled Visual Processing: Efficient Multimodal Adaptation via Modality-Specific Transformer Substitution","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T12:40:56.943390Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2607.26596"},"observation_digest":"sha256:3722c23bbb745620de334880f538886408b29a37bada3938d450f8d8e2cfcc48","observation_id":"3100d93d-404d-4521-a8ec-ab1fecd3994b","resolution":{"observed_at":"2026-08-01T12:40:56.943390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-01T12:40:56.945948Z","title":"arXiv preprint arXiv:2406.16860","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26596","last_updated":"2026-07-29T08:16:28Z","snapshot_observed_at":"2026-08-07T19:27:23.125369Z","submitted_at":"2026-07-29T08:16:28Z","title":"Decoupled Visual Processing: Efficient Multimodal Adaptation via Modality-Specific Transformer Substitution","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T12:40:56.945948Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2607.26596"},"observation_digest":"sha256:be843ebb6a7c20b2650c7e25852ee234f1a06ebddaa0a7af6f60c6ff262c967f","observation_id":"790da517-9b0a-423b-a228-e98ba5390d4b","resolution":{"observed_at":"2026-08-01T12:40:56.945948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-01T12:40:56.949309Z","title":"Zheng Wang, Xiaoliang Fan, Zhaopeng Peng, Xueheng Li, Ziqi Yang, Mingkuan Feng, Zhicheng Yang, Xiao Liu, and Cheng Wang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26596","last_updated":"2026-07-29T08:16:28Z","snapshot_observed_at":"2026-08-07T19:27:23.125369Z","submitted_at":"2026-07-29T08:16:28Z","title":"Decoupled Visual Processing: Efficient Multimodal Adaptation via Modality-Specific Transformer Substitution","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T12:40:56.949309Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2607.26596"},"observation_digest":"sha256:aa9ef8d0f9f50151570b2388b40a89eb241397db29637846ea0ace7cad05dba9","observation_id":"25be7dd9-6dfe-479e-a1ac-7ed684938b88","resolution":{"observed_at":"2026-08-01T12:40:56.949309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12079","last_updated":"2023-06-21T07:55:29Z","snapshot_observed_at":"2026-08-05T22:37:45.586049Z","submitted_at":"2023-06-21T07:55:29Z","title":"FLGo: A Fully Customizable Federated Learning Platform","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12079","snapshot_observed_at":"2026-08-01T12:40:56.951963Z","title":"Jinyang Wu, Mingkuan Feng, Guocheng Zhai, Shuai Zhang, Zheng Lian, Fangrui Lv, Pengpeng Shao, Rui- han Jin, Zhengqi Wen, and Jianhua Tao","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26596","last_updated":"2026-07-29T08:16:28Z","snapshot_observed_at":"2026-08-07T19:27:23.125369Z","submitted_at":"2026-07-29T08:16:28Z","title":"Decoupled Visual Processing: Efficient Multimodal Adaptation via Modality-Specific Transformer Substitution","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T12:40:56.951963Z"},"links":{"cited_paper":"/paper/2306.12079","citing_paper":"/paper/2607.26596"},"observation_digest":"sha256:cee7722c6dcd9291f4ec05ce9109f47042bc314ea0133d3b45435ed3ca03809c","observation_id":"00355b0e-bfab-4df1-8d82-d3624c9629dc","resolution":{"observed_at":"2026-08-01T12:40:56.951963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-08-06T04:08:15.266897Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04257","snapshot_observed_at":"2026-08-01T12:40:56.954792Z","title":"arXiv preprint arXiv:2311.04257","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26596","last_updated":"2026-07-29T08:16:28Z","snapshot_observed_at":"2026-08-07T19:27:23.125369Z","submitted_at":"2026-07-29T08:16:28Z","title":"Decoupled Visual Processing: Efficient Multimodal Adaptation via Modality-Specific Transformer Substitution","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T12:40:56.954792Z"},"links":{"cited_paper":"/paper/2311.04257","citing_paper":"/paper/2607.26596"},"observation_digest":"sha256:e997591c863b498663cec0c541ff92073394a13eacbecca3f7658b2ad7769698","observation_id":"abbab7a4-eef6-4abe-8d74-a2efe25f6549","resolution":{"observed_at":"2026-08-01T12:40:56.954792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-01T12:40:56.887890Z","title":"Mingkuan Feng, Jinyang Wu, Hao Gu, Fangrui Lv, Ruihan Jin, Chuyuan Zhang, Zhengqi Wen, and Jianhua Tao","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26596","last_updated":"2026-07-29T08:16:28Z","snapshot_observed_at":"2026-08-07T19:27:23.125369Z","submitted_at":"2026-07-29T08:16:28Z","title":"Decoupled Visual Processing: Efficient Multimodal Adaptation via Modality-Specific Transformer Substitution","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-01T12:40:56.887890Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2607.26596"},"observation_digest":"sha256:53607f5721055ca8cf7c18e9e3dabe5d0dac456f3237a0e4fc264bc4e20ceeb9","observation_id":"a2d46f7d-6730-4e90-80dc-490bfbf64241","resolution":{"observed_at":"2026-08-01T12:40:56.887890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-01T12:40:56.929777Z","title":"Ruihan Jin, Pengpeng Shao, Zhengqi Wen, Jinyang Wu, Mingkuan Feng, Shuo Yang, Chu Yuan Zhang, and Jianhua Tao","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26596","last_updated":"2026-07-29T08:16:28Z","snapshot_observed_at":"2026-08-07T19:27:23.125369Z","submitted_at":"2026-07-29T08:16:28Z","title":"Decoupled Visual Processing: Efficient Multimodal Adaptation via Modality-Specific Transformer Substitution","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-01T12:40:56.929777Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2607.26596"},"observation_digest":"sha256:a24effde7aa369e0366ae6f66f4b239beeadcde3a1991b0093c22c37ae12c24e","observation_id":"6facfb72-b996-4426-bca3-9d5f5b3d3a2b","resolution":{"observed_at":"2026-08-01T12:40:56.929777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-01T12:40:56.858304Z","title":"Zhe Chen, Jiannan Wu, Wenhai Wang, Weijie Su, Guo Chen, Sen Xing, Muyan Zhong, Qinglong Zhang, Xizhou Zhu, Lewei Lu, and 1 others","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26596","last_updated":"2026-07-29T08:16:28Z","snapshot_observed_at":"2026-08-07T19:27:23.125369Z","submitted_at":"2026-07-29T08:16:28Z","title":"Decoupled Visual Processing: Efficient Multimodal Adaptation via Modality-Specific Transformer Substitution","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-01T12:40:56.858304Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2607.26596"},"observation_digest":"sha256:36622a58efc787e6ec71781348fbe85bbd8c808c148f2dfad819acf6d2ff2f58","observation_id":"4e6b62ce-890d-4902-a46d-f722d15d2379","resolution":{"observed_at":"2026-08-01T12:40:56.858304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-08-01T12:40:56.871061Z","title":"Wenliang Dai, Junnan Li, Dongxu Li, Anthony Meng Huat Tiong, Junqi Zhao, Weisheng Wang, Boyang Li, Pascale Fung, and Steven Hoi","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26596","last_updated":"2026-07-29T08:16:28Z","snapshot_observed_at":"2026-08-07T19:27:23.125369Z","submitted_at":"2026-07-29T08:16:28Z","title":"Decoupled Visual Processing: Efficient Multimodal Adaptation via Modality-Specific Transformer Substitution","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-01T12:40:56.871061Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2607.26596"},"observation_digest":"sha256:a39490c3220111db5c582589072f7b5de10d8444ad7bcb75c016e3cdd635f34c","observation_id":"7f387456-358b-4518-b435-c8a1f63056a1","resolution":{"observed_at":"2026-08-01T12:40:56.871061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17905","last_updated":"2025-06-29T03:25:00Z","snapshot_observed_at":"2026-08-03T00:47:40.430047Z","submitted_at":"2025-01-29T14:28:11Z","title":"DReSS: Data-driven Regularized Structured Streamlining for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17905","snapshot_observed_at":"2026-08-01T12:40:56.907968Z","title":"arXiv preprint arXiv:2501.17905","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26596","last_updated":"2026-07-29T08:16:28Z","snapshot_observed_at":"2026-08-07T19:27:23.125369Z","submitted_at":"2026-07-29T08:16:28Z","title":"Decoupled Visual Processing: Efficient Multimodal Adaptation via Modality-Specific Transformer Substitution","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-01T12:40:56.907968Z"},"links":{"cited_paper":"/paper/2501.17905","citing_paper":"/paper/2607.26596"},"observation_digest":"sha256:cd54cd285a2a3b1892e356cbfc732006b939f00d062dbcecc9e6560030a95fbe","observation_id":"2c30a087-2d53-4d67-ad03-b22958e7e088","resolution":{"observed_at":"2026-08-01T12:40:56.907968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.01064","last_updated":"2026-04-11T14:46:55Z","snapshot_observed_at":"2026-08-07T19:27:12.063810Z","submitted_at":"2026-02-01T07:19:57Z","title":"Exploring Knowledge Purification in Multi-Teacher Knowledge Distillation for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.01064","snapshot_observed_at":"2026-08-01T12:40:56.932940Z","title":"arXiv preprint arXiv:2602.01064","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26596","last_updated":"2026-07-29T08:16:28Z","snapshot_observed_at":"2026-08-07T19:27:23.125369Z","submitted_at":"2026-07-29T08:16:28Z","title":"Decoupled Visual Processing: Efficient Multimodal Adaptation via Modality-Specific Transformer Substitution","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-01T12:40:56.932940Z"},"links":{"cited_paper":"/paper/2602.01064","citing_paper":"/paper/2607.26596"},"observation_digest":"sha256:b939e567c392839f422f4741f73c6f002bf87695a93b774043cf1ac2ec0bcdc7","observation_id":"b1902258-08e3-4dc7-bbb3-d3a19e07e521","resolution":{"observed_at":"2026-08-01T12:40:56.932940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.26596","last_updated":"2026-07-29T08:16:28Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T19:27:23.125369Z","submitted_at":"2026-07-29T08:16:28Z","title":"Decoupled Visual Processing: Efficient Multimodal Adaptation via Modality-Specific Transformer Substitution"},"reference_resolution":{"displayed":15,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":15},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 15 of 15 outbound references and 0 inbound Pith citation observations for arXiv:2607.26596."}