{"as_of":"2026-08-09T23:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a04d626a186da90d6d9d20efe15116293da2ab6138323d0d36ba9ef63219d365","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:46:48.850831Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T01:52:44.785582Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T12:46:56.783735Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2506.09638","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09638","snapshot_observed_at":"2026-07-02T12:46:56.783735Z","title":"org/abs/2506.09638","venue":null,"work_id":"c6ae6167-ceb4-4fba-b89a-108993b54da8","year":2025},"citing_paper":{"arxiv_id":"2606.05736","last_updated":"2026-06-04T05:55:15Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T05:55:15Z","title":"VTI-CoT: Visual-Textual Interleaved Chain of Thought for Video Reasoning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-28T01:52:44.785582Z"},"links":{"cited_paper":"/paper/2506.09638","citing_paper":"/paper/2606.05736"},"observation_digest":"sha256:6a3444488b8fc087e7ba634778e82df26a818520d86d40df8df0574367eb2a3c","observation_id":"3c225ccd-48af-43ea-8c35-869ac0184beb","resolution":{"observed_at":"2026-07-02T12:46:56.785169Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.09638/citation-record","integrity":"/paper/2506.09638/integrity","json":"/paper/2506.09638/citation-record.json","paper":"/paper/2506.09638"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T04:46:48.684669Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.684669Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:1604365c5e8c89e84143749a5d34704072c3136fbb0f2622dbf049ef89ba200b","observation_id":"3687621b-3200-4b01-a764-79c25aeb6402","resolution":{"observed_at":"2026-08-07T04:46:48.684669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:49.411143Z","title":"FedMBridge: Bridgeable multimodal federated learning","venue":null,"work_id":"02a106e1-7d06-4784-bfe7-c426b2fef010","year":2024},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.689138Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:2e92a308d3331a92ffecc6f0e4dbcb42ba4581a214a402a3fb4a9eca295f2ca8","observation_id":"4286ba1d-0d28-4e5d-b288-a4e2601deb45","resolution":{"observed_at":"2026-08-07T04:46:49.415097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:48.693076Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.693076Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:ce1ffc4f8eb7e78fd6e1243ae4dff7666733a862d61f2978e4f9286ebd2fbb88","observation_id":"7276e55d-b06b-4886-bccd-984f9872456f","resolution":{"observed_at":"2026-08-07T04:46:48.693076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:49.391772Z","title":"Personalized federated learning with theoretical guarantees: A model-agnostic meta-learning approach","venue":null,"work_id":"5bbaf854-dd3c-4c3e-a820-1761af44f387","year":2020},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.697510Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:320824949f13b716dd69e7a3c81091f0939e8c5955869d2e5a3cc7d596941fff","observation_id":"daaea0cb-42f9-4519-86e3-fcb340cf2af3","resolution":{"observed_at":"2026-08-07T04:46:49.395750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.15010","last_updated":"2023-04-28T17:59:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-28T17:59:25Z","title":"LLaMA-Adapter V2: Parameter-Efficient Visual Instruction Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.15010","snapshot_observed_at":"2026-08-07T04:46:48.702039Z","title":"Llama-adapter v2: Parameter-efficient visual instruction model.arXiv preprint arXiv:2304.15010, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.702039Z"},"links":{"cited_paper":"/paper/2304.15010","citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:b5248d988bf9e16861b1bc844ffd343e23a5cf1615e0451849ce56df499c8511","observation_id":"558d49a0-913a-4979-ac04-943d7524c967","resolution":{"observed_at":"2026-08-07T04:46:48.702039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.11514","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:49.007821Z","title":"Exploring the vulnerabilities of federated learning: A deep dive into gradient inversion attacks.arXiv preprint arXiv:2503.11514, 2025","venue":null,"work_id":"1c39d18d-5e62-4e50-874a-7d0c8b4878a7","year":2025},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.706200Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:52d16b65a7e8f6f4bbfa75b72e4413af2b693a83e7a5c391b91733aa2cd49d58","observation_id":"05525e87-928d-4b40-92be-854987948b73","resolution":{"observed_at":"2026-08-07T04:46:49.015685Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:49.379774Z","title":"A new federated learning framework against gradient inversion attacks","venue":null,"work_id":"6c9db9e2-5783-47f5-b4ee-fc6643b5ca9f","year":2025},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.710442Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:bf7b24214f2fcff44c1d59a49445177d73a646c2cf2e02f30930df28c32e21eb","observation_id":"d94aa90f-a676-4eec-a61a-a57d319429b8","resolution":{"observed_at":"2026-08-07T04:46:49.383880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:49.367781Z","title":"Selective aggregation for low-rank adaptation in federated learning","venue":null,"work_id":"b4d47d67-1c7e-472f-8b37-db8b49288b6c","year":2025},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.714311Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:4e4bc7af92f24b9256064d959cc1ce5dd4c7b4b1773a7a5c92b31601fb7f8fe3","observation_id":"f88e9a82-ec7d-48d9-8f4b-8e7ce4bff44d","resolution":{"observed_at":"2026-08-07T04:46:49.371984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:49.355806Z","title":"Measuring the effects of non-identical data distribu- tion for federated visual classification, 2019","venue":null,"work_id":"d85a7dc9-f972-4703-af90-a5cf7bd89e38","year":2019},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.718522Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:3ef313d8c97c50c31773e7c065702db93b3d9414cea7a4aa6de6f1c24f9bfb32","observation_id":"d8e72b90-424c-4784-8947-f491ce13cc48","resolution":{"observed_at":"2026-08-07T04:46:49.359782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:48.722162Z","title":"Lora: Low-rank adaptation of large language models.ICLR, 1(2):3, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.722162Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:26c0f2db8691942ed581c2ebfd83ebe26be1804664f64326bde8906801f86714","observation_id":"14599aa7-b0d8-48e4-8a62-08b9b0d14aed","resolution":{"observed_at":"2026-08-07T04:46:48.722162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:49.336393Z","title":"Fedlps: Heterogeneous federated learning for multiple tasks with local parameter sharing, 2024","venue":null,"work_id":"4e823934-290d-4441-943a-856daaee061e","year":2024},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.726332Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:357f44e40c1278a821d7c03692d60071585d2269150440103a3805d3abce5f6c","observation_id":"1cbae2c3-cedd-4128-afa3-4f4bfcbe2b30","resolution":{"observed_at":"2026-08-07T04:46:49.340328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:49.324717Z","title":null,"venue":null,"work_id":"2af10347-639e-440f-bd3b-235b10d8a5f4","year":2019},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.730944Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:707a07d2f89231d2333b75a4736cf2f43314b0b1e7bc5a019c29c539ebcb5746","observation_id":"ff54f841-c76d-44c9-92e9-604b57fc5664","resolution":{"observed_at":"2026-08-07T04:46:49.328507Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:49.312474Z","title":"ReferItGame: Referring to objects in photographs of natural scenes","venue":null,"work_id":"9d97ef9d-5195-49ac-aeae-e0aed9ee24c4","year":2014},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.735198Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:75ebba991551a5875dfe159d22c4d965b009ab145ab6b45a857bdd0bd1a9d8ab","observation_id":"fc7cd118-c8a0-42c2-941a-9ff54a03501a","resolution":{"observed_at":"2026-08-07T04:46:49.316564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:49.300454Z","title":"Federatedscope-llm: A comprehensive package for fine-tuning large language models in federated learning","venue":null,"work_id":"b040a6d7-412d-4af7-8cf9-c51fc8eced10","year":2024},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.738823Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:7be44ce9633ef28e793f91c75655283a9c398a07683dc2a645694807e1eceddd","observation_id":"61969c35-083c-417d-a109-145ccb1ae660","resolution":{"observed_at":"2026-08-07T04:46:49.304569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:48.742288Z","title":"A dataset of clinically generated visual questions and answers about radiology images.Scientific data, 5(1):1–10, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.742288Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:e43b83978041f98393a37f8f1c786bc6d454ff6c76a168d88a98f007158b272b","observation_id":"0d7733ea-24b1-4bcf-9f02-f63c684f800c","resolution":{"observed_at":"2026-08-07T04:46:48.742288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:49.281093Z","title":"Federated optimization in heterogeneous networks, 2020","venue":null,"work_id":"ba60e5d9-2d84-4091-a17a-7c2cdfa16a71","year":2020},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.745943Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:b960b06c2805ea46a1849c56b4a8fc702f7eaea3ea7e845228bfe6b922739785","observation_id":"ed4a0e06-c688-453d-92da-1ed6e81bc56d","resolution":{"observed_at":"2026-08-07T04:46:49.285106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02503","last_updated":"2024-08-05T14:27:39Z","snapshot_observed_at":"2026-07-06T18:56:57.369673Z","submitted_at":"2024-08-05T14:27:39Z","title":"UnifiedMLLM: Enabling Unified Representation for Multi-modal Multi-tasks With Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02503","snapshot_observed_at":"2026-08-07T04:46:48.750294Z","title":"Unifiedmllm: Enabling unified representation for multi-modal multi-tasks with large language model.arXiv preprint arXiv:2408.02503, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.750294Z"},"links":{"cited_paper":"/paper/2408.02503","citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:c1b23a0dceffc1beb3f06db20d64578f0b80dbf43d5f5e51100d190fcc61762a","observation_id":"c80410a0-366b-4f71-990b-2e05fc27441e","resolution":{"observed_at":"2026-08-07T04:46:48.750294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:48.755470Z","title":"Lawrence Zitnick, and Piotr Dollár","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.755470Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:67b1da34b64fb32c3c6eb520ea5d4822f70566341cf063e6097817c5084519b4","observation_id":"6fcec27f-9c28-4ef9-95eb-ace020d99d1d","resolution":{"observed_at":"2026-08-07T04:46:48.755470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:49.261121Z","title":"Slake: A semantically-labeled knowledge-enhanced dataset for medical visual question answering, 2021","venue":null,"work_id":"1e59fd81-b47f-4f26-8354-0555c44a4b77","year":2021},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.759466Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:961bd13c9862da5cb5fe9dbc331da407d52ec0e9a8686776ab9eb7f6e0987a8e","observation_id":"17c332f1-4dad-48bd-8985-39e940a0f4fa","resolution":{"observed_at":"2026-08-07T04:46:49.265909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:49.249011Z","title":"Visual instruction tuning.NIPS, 36:34892– 34916, 2023","venue":null,"work_id":"2a1ffb9d-5171-4527-b903-15817b65bd01","year":2023},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.763946Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:fc0abd0648b2867da7eead282e9fc4bee6ee9a39fde4be6347480d89223430e5","observation_id":"8573775a-0fbf-48d7-a371-401010216341","resolution":{"observed_at":"2026-08-07T04:46:49.253255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:48.767754Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.767754Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:59a901531857b0acba0e676c363c58b3ad601d844f94f7e03f330600658e7a40","observation_id":"c7be9ac6-7605-470e-874b-3dbd90e7733d","resolution":{"observed_at":"2026-08-07T04:46:48.767754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:49.228537Z","title":"Fine-grained visual classification of aircraft, 2013","venue":null,"work_id":"e9390e61-9351-493b-8fb1-d920402923bc","year":2013},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.771667Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:2279ef2427dc9b3e1dab9b0990424b779baff7b4dc797c8f22fd4ac091a13ae9","observation_id":"9eed584a-cd20-4b2e-b846-be141e2870c4","resolution":{"observed_at":"2026-08-07T04:46:49.232649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:49.215731Z","title":"Brendan McMahan, Eider Moore, Daniel Ramage, Seth Hampson, and Blaise Agüera y Arcas","venue":null,"work_id":"917c6d81-e6f1-4a37-a4ac-c9af8f46d28a","year":2023},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.776135Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:cfbce0027b1c11fcf12cc50922db514fa14740b8b9cc785d9b3052e62a732b40","observation_id":"5d58df5e-ae06-44c5-a59a-cf82b6fd8b79","resolution":{"observed_at":"2026-08-07T04:46:49.220202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:49.203470Z","title":"Introducing meta llama 3: The most capable openly available llm to date.Meta AI, 2024","venue":null,"work_id":"d7fce23f-9586-47c0-a3e3-7bec221e59fc","year":2024},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.779836Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:de2f5028fa929d98e633f4240535da024e84874ac41a87c2d34bcc551d0e6927","observation_id":"421bfc29-05b1-4f7e-8f40-9dda2603b39b","resolution":{"observed_at":"2026-08-07T04:46:49.207534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:48.783497Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.783497Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:01c47bd7c1aec5096e1004f6126b31fbfca4c3a324b9b25657aeeab2fe94a3b2","observation_id":"5c311a02-a6b8-41c6-a168-db30a83f2495","resolution":{"observed_at":"2026-08-07T04:46:48.783497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:48.786814Z","title":"Learning transferable visual models from natural language supervision, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.786814Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:e758febec7daa573c6714a9c54bf0f99983a9ad8a4f8968e80046f190a6fae35","observation_id":"5e48f7c5-2761-48e0-83c0-9592e2ac0fd5","resolution":{"observed_at":"2026-08-07T04:46:48.786814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.00295","last_updated":"2021-09-08T23:37:17Z","snapshot_observed_at":"2026-07-06T09:01:12.515300Z","submitted_at":"2020-02-29T16:37:29Z","title":"Adaptive Federated Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.00295","snapshot_observed_at":"2026-08-07T04:46:48.790571Z","title":"Adaptive federated optimization.arXiv preprint arXiv:2003.00295, 2020","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.790571Z"},"links":{"cited_paper":"/paper/2003.00295","citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:2da96ccd2e808c72c699753c0a544d29a3a32fc5022334968b5b0fea133f6101","observation_id":"0e0f3a57-d0fa-4ca9-aa7f-93a902cdf445","resolution":{"observed_at":"2026-08-07T04:46:48.790571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:49.176980Z","title":"Brendan McMahan","venue":null,"work_id":"a712238a-cc0a-4b9a-92cf-7ed372149816","year":2021},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.794830Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:6e62b85f2ffd0d48b0a9a726474684caa1b5f45d245b28511c93df1531d8447b","observation_id":"9b994af4-a485-42c3-b943-df7836a4951a","resolution":{"observed_at":"2026-08-07T04:46:49.180748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:49.165116Z","title":"Exploring models and data for image question answering, 2015","venue":null,"work_id":"cb0fb57e-cd21-4851-b021-2894a6335fac","year":2015},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.798543Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:cb1471c0e50ab7fac69590ff27f682d08e714030ab90ae7715805b769db8063a","observation_id":"cc5a492a-fd7d-48c7-80f0-a155200d9c34","resolution":{"observed_at":"2026-08-07T04:46:49.169097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:48.802233Z","title":"Chameleon: Mixed-modal early-fusion foundation models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.802233Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:c32f5dbc43e23fb52900349f8b1c2d5ba10324703ecec8edf5e166849148d89a","observation_id":"14ed9eac-a4d4-4169-a983-148c59da03fe","resolution":{"observed_at":"2026-08-07T04:46:48.802233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T04:46:48.806923Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.806923Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:008ab86773cd361b8e122fe9fde26618128c123c79afc87d38cfddb8636e3177","observation_id":"d3bc5996-47ec-47d4-a1f5-772b0e7cd7bb","resolution":{"observed_at":"2026-08-07T04:46:48.806923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-07T04:46:48.811789Z","title":"Show-o: One single transformer to unify multimodal understanding and generation.arXiv preprint arXiv:2408.12528, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.811789Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:2a024c50b55eae353ad171b158f6fb0d93e443d81f45acf9d7166c6753e002a3","observation_id":"792201df-4f85-426e-9a7c-2f85b01f18a4","resolution":{"observed_at":"2026-08-07T04:46:48.811789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:49.145577Z","title":"Pilot: Building the federated multimodal instruction tuning framework, 2025","venue":null,"work_id":"4383799e-c50b-4cf2-96cf-16402ee58aac","year":2025},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.816565Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:9642d65c17225f35a29481d96f04e45fac248f817b2b346859cde9eb2b713d80","observation_id":"41629199-3860-4d2d-9823-a4069c3ca8fe","resolution":{"observed_at":"2026-08-07T04:46:49.149443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14717","last_updated":"2025-03-08T13:10:57Z","snapshot_observed_at":"2026-07-06T19:54:09.469212Z","submitted_at":"2024-11-22T04:09:23Z","title":"FedMLLM: Federated Fine-tuning MLLM on Multimodal Heterogeneity Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14717","snapshot_observed_at":"2026-08-07T04:46:48.820248Z","title":"Fedmllm: Federated fine-tuning mllm on multimodal heterogeneity data.arXiv preprint arXiv:2411.14717, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.820248Z"},"links":{"cited_paper":"/paper/2411.14717","citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:006173cdbe526f40fbc8d1d934166d3369afa53e22c1e07c461f7821f825f4f9","observation_id":"0a106ab8-970c-4955-9bf5-39ff41f19d14","resolution":{"observed_at":"2026-08-07T04:46:48.820248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:49.133815Z","title":"Fedmllm: Federated fine-tuning mllm on multimodal heterogeneity data, 2025","venue":null,"work_id":"a7991a94-3743-46b5-8dd1-15efcb7bb39c","year":2025},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.824111Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:2775ea0b6b46967c7200521617d1b0637dbdae241a96c13738f83ba6088575bd","observation_id":"d98c9006-6fc1-4a8b-bf91-728615edf7a6","resolution":{"observed_at":"2026-08-07T04:46:49.137896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:49.122118Z","title":"Fedllm- bench: Realistic benchmarks for federated learning of large language models.NIPS, 37:111106–111130, 2024","venue":null,"work_id":"c47e2d4d-db90-4dff-b527-b9e2a500e6f5","year":2024},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.827827Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:c5d1f4ffc644828d8de22465757ead6365442a0c039da1f06b568cfc5f8efb2d","observation_id":"a9ac6d2c-1951-4bd6-b05f-5f200bbddce6","resolution":{"observed_at":"2026-08-07T04:46:49.126081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:49.109289Z","title":"Openfedllm: Training large language models on decentralized private data via federated learning","venue":null,"work_id":"65353f97-3071-4cbf-bd42-2de8aeed12ba","year":2024},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.831723Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:f0c07ec662e1d12647da4dd6a49eb08b97c0527d9970c9cf0e4b676d0a0ed1e5","observation_id":"ebc7a116-8e1c-4e09-a4f3-768290500b7f","resolution":{"observed_at":"2026-08-07T04:46:49.113860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:49.096448Z","title":"Tackling data heterogeneity in federated learning via loss decomposition","venue":null,"work_id":"6c56842e-c191-4f7f-9e5c-7c6edcdeacb2","year":2024},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.835568Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:10ba2231aab79e654192592c0bb06a59221b7aaa62e009296d8bc109bb4850c9","observation_id":"749aa389-b6ff-402c-9da6-e0a7d5239e37","resolution":{"observed_at":"2026-08-07T04:46:49.100515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:49.084261Z","title":"Fedtgp: Trainable global prototypes with adaptive- margin-enhanced contrastive learning for data and model heterogeneity in federated learning, 2024","venue":null,"work_id":"c47776f1-01b7-401e-be46-f9d334c47c97","year":2024},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.839218Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:43ea3eed9feb9c7b4c3e15df95bb30929c85288c2ad0d9539c13ada35f8fd3c2","observation_id":"b18696cc-86a5-4604-a243-908a3b9b6f80","resolution":{"observed_at":"2026-08-07T04:46:49.088407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:49.072391Z","title":"Mllm- llava-fl: Multimodal large language model assisted federated learning","venue":null,"work_id":"68625701-1034-4919-b3d1-eb48a0db065e","year":2025},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.843309Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:2fe4425f7485ee5762aedc2713b0c3bd9b3ccab74d197249a370ccb02412f326","observation_id":"16c968b5-ec23-4c8c-b4b1-e3af78ab5aa6","resolution":{"observed_at":"2026-08-07T04:46:49.076280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:49.060264Z","title":"Flhetbench: Benchmarking device and state heterogeneity in federated learning","venue":null,"work_id":"eda3df8a-2a59-480b-96ff-3a0f24f5bf36","year":2024},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.847188Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:ce7660ac69270500235a1b86e22927b410d54088372d3f887be8b866f160b165","observation_id":"b009af85-f999-4183-9a24-7a0db4f64bf3","resolution":{"observed_at":"2026-08-07T04:46:49.064475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:49.048124Z","title":"Radgenome-chest ct: A grounded vision-language dataset for chest ct analysis, 2024","venue":null,"work_id":"52d2c94d-536d-48a9-9314-4716c58d75aa","year":2024},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.850831Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:d2657c0c142210e410c243d914f49714fae1c256d9ab4413dff7313c9b0e99df","observation_id":"c817fdf1-1cc3-47c7-80e7-c8b83804fafe","resolution":{"observed_at":"2026-08-07T04:46:49.052242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":1,"verified_fuzzy":25},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 1 inbound Pith citation observation for arXiv:2506.09638."}