{"as_of":"2026-08-07T20:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5c2038cdb7e529e6e14ba2b5f7ad5661691ba9011e9a2531b9dc3983defdac4f","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":28,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:37:46.509499Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T04:27:37.024796Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-07-06T17:39:53.791209Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2403.03003","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-07-03T04:27:37.024796Z","title":"Feast your eyes: Mixture-of- resolution adaptation for multimodal large language models","venue":null,"work_id":"f100b81f-dd1f-471e-819a-bd7b0c74c063","year":2025},"citing_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-12T20:58:58.849040Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2404.16821"},"observation_digest":"sha256:5aecb21138fa7792ea7220f6ed5e290d6b791c1829793e44a02936bcca2e5277","observation_id":"776bfcc4-13b6-44ce-8048-2b0e1629f187","resolution":{"observed_at":"2026-05-12T20:58:59.148522Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-07-06T17:39:53.791209Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-08-07T12:37:46.509499Z","title":"Feast your eyes: Mixture-of-resolution adaptation for multimodal large language models.arXiv preprint arXiv:2403.03003,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:46.509499Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:1311b59c028081ba9dbe8cd37402f0b65a0f14b81d8cb8242967e6d9cf471681","observation_id":"7d0232be-36ae-4f25-a436-a166fe6a183e","resolution":{"observed_at":"2026-08-07T12:37:46.509499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-07-06T17:39:53.791209Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-08-07T05:26:47.176832Z","title":"Feast your eyes: Mixture-of- resolution adaptation for multimodal large language models.arXiv preprint arXiv:2403.03003, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.176832Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:5aa80077ab4442a26483a2ad3cc2bb9e27aa0848ee01d7d91fc891e923a55bd8","observation_id":"8f9db7db-44f9-475e-9bfc-ce67c36f08ea","resolution":{"observed_at":"2026-08-07T05:26:47.176832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-07-06T17:39:53.791209Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-08-07T04:20:31.837013Z","title":"Feast your eyes: Mixture- of-resolution adaptation for multimodal large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-07T04:10:34.426874Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:31.837013Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2506.10967"},"observation_digest":"sha256:14402d21a7654f96b0c43dce9690dabed4e18d95b0dc25bba51c1f3fe086e3b6","observation_id":"f46ba898-242d-4dcc-a67e-660f1cd1d0a9","resolution":{"observed_at":"2026-08-07T04:20:31.837013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-07-06T17:39:53.791209Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-08-07T00:48:31.688789Z","title":"Feast your eyes: Mixture-of-resolution adaptation for multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:31.688789Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:02010a4dea94661def7dac757acf17317e72ca05a0f67d21bb37ba2bd3c44aa8","observation_id":"56555408-5b6c-498d-a63f-ba3f12f10b05","resolution":{"observed_at":"2026-08-07T00:48:31.688789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-07-06T17:39:53.791209Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-08-07T00:23:52.717672Z","title":"Feast your eyes: Mixture-of-resolution adaptation for multimodal large language models.arXiv preprint arXiv:2403.03003,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-07T09:15:22.290008Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:52.717672Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:f06b7402656b794c3681950c0c123231cc36edfab00e280917cc3865cc9096d5","observation_id":"4e6d7fd3-13bc-4b76-952b-ad5ea10882ba","resolution":{"observed_at":"2026-08-07T00:23:52.717672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-07-06T17:39:53.791209Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-08-07T04:57:50.441648Z","title":"Feast your eyes: Mixture-of-resolution adaptation for multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14821","last_updated":"2025-08-05T03:49:33Z","snapshot_observed_at":"2026-08-07T05:00:44.806379Z","submitted_at":"2025-06-10T20:11:44Z","title":"Reinforcing VLMs to Use Tools for Detailed Visual Reasoning Under Resource Constraints","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T04:57:50.441648Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2506.14821"},"observation_digest":"sha256:417984f699c2d2d4a67a050ffdab9b93a68d39f77e16b0d596030bc363f51496","observation_id":"5c50d509-3051-4a26-a553-5419dcc3eb98","resolution":{"observed_at":"2026-08-07T04:57:50.441648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-07-06T17:39:53.791209Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-08-06T21:27:40.606698Z","title":"Feast your eyes: Mixture-of- resolution adaptation for multimodal large language models.arXiv preprint arXiv:2403.03003, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-07T09:15:18.123904Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.606698Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:890b2d59ab692e18cf7379c4536df469d4ba49d3009a881942f1205920c5e8bd","observation_id":"771b976f-f12b-4fb9-b996-ba86b6d8470f","resolution":{"observed_at":"2026-08-06T21:27:40.606698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-07-06T17:39:53.791209Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-08-06T21:19:45.018551Z","title":"Feast your eyes: Mixture-of-resolution adaptation for multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-06T21:11:02.923227Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:45.018551Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:dc8a8fe7dfe6162602ecbd70d7e0462715819ad82d6842eba47c8b671960eb20","observation_id":"0870f533-a5ce-4bec-b390-43a3a9d4e9ab","resolution":{"observed_at":"2026-08-06T21:19:45.018551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-07-06T17:39:53.791209Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-08-06T20:53:07.312239Z","title":"Feast your eyes: Mixture-of-resolution adaptation for multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:07.312239Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:440bd495fb1f42535d52ceff005aeb4e26abe8bd0c36d7e938951294a751a71d","observation_id":"aea5201b-43bc-4e53-925d-97fcc6f8ebe8","resolution":{"observed_at":"2026-08-06T20:53:07.312239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-07-06T17:39:53.791209Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-08-06T20:45:08.557208Z","title":"Feast your eyes: Mixture-of-resolution adaptation for multimodal large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-06T20:37:19.866170Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:08.557208Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2507.01949"},"observation_digest":"sha256:ccb49b1bbdd1c97ddb5457319734a26993037a0e875b418eb2ac8caf4fad7553","observation_id":"3ff3c3d0-80d0-40bb-9d61-d79f4b14c792","resolution":{"observed_at":"2026-08-06T20:45:08.557208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-07-06T17:39:53.791209Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-08-06T19:25:02.794185Z","title":"Feast your eyes: Mixture-of- resolution adaptation for multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-07T12:25:32.445608Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.794185Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:309efdd9e4eb70be39da1795da8e25886beb05b6f518049d7aab5c6f0d6e837a","observation_id":"c64fb980-aa3b-45df-be78-a21e7f0a2fe3","resolution":{"observed_at":"2026-08-06T19:25:02.794185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-07-06T17:39:53.791209Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-08-06T18:21:47.820050Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:47.820050Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:278eaaa0cc97ba8fba41ab0d908b6b3e040bfeca8b30892f9e1fe6cfe8564495","observation_id":"382d78d9-c7aa-49df-baa3-9797b2cf1ffb","resolution":{"observed_at":"2026-08-06T18:21:47.820050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-07-06T17:39:53.791209Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-08-06T17:40:40.230169Z","title":"Feast your eyes: Mixture-of- resolution adaptation for multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10202","last_updated":"2025-07-14T12:14:53Z","snapshot_observed_at":"2026-08-06T17:34:42.369677Z","submitted_at":"2025-07-14T12:14:53Z","title":"A Training-Free, Task-Agnostic Framework for Enhancing MLLM Performance on High-Resolution Images","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T17:40:40.230169Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2507.10202"},"observation_digest":"sha256:35dd766879c48ff3208067e025fcafa2b61e0c802327532353b99b7d885df525","observation_id":"04f92453-e9e4-4bf9-8fd9-dafccf4c7bdc","resolution":{"observed_at":"2026-08-06T17:40:40.230169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-07-06T17:39:53.791209Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-08-06T16:49:57.463091Z","title":"Feast your eyes: Mixture-of-resolution adaptation for multimodal large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:57.463091Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:f0824d1c35c0ebe627b2882ca8753b8428c00bc465f26471eeca38253172214d","observation_id":"0f625dc8-cdfc-42c1-9448-9668a4a65cfd","resolution":{"observed_at":"2026-08-06T16:49:57.463091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-07-06T17:39:53.791209Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2403.03003","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-07-03T04:27:37.024796Z","title":"Feast your eyes: Mixture-of- resolution adaptation for multimodal large language models","venue":null,"work_id":"f100b81f-dd1f-471e-819a-bd7b0c74c063","year":2025},"citing_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-10T11:58:58.660564Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2508.18265"},"observation_digest":"sha256:3c138bb1b59a08b714d1f18a7979b43619efddd0a1cd2139b7e4f5d01dd77f7c","observation_id":"1a662a34-b84c-4208-82ba-1679f9af911a","resolution":{"observed_at":"2026-05-10T11:58:59.211532Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-07-06T17:39:53.791209Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-08-05T12:28:26.680272Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-07T09:15:48.717373Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:26.680272Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:e4cf5cca8eec573bcfc3179ba396697376ed6d4d481c03217f900bd2031a98a5","observation_id":"4a4d3bcf-c754-407e-90e5-db416ee141c3","resolution":{"observed_at":"2026-08-05T12:28:26.680272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-07-06T17:39:53.791209Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-08-04T10:37:24.213930Z","title":"Feast your eyes: Mixture-of-resolution adaptation for multimodal large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.10028","last_updated":"2026-06-07T08:26:55Z","snapshot_observed_at":"2026-08-06T20:27:36.559252Z","submitted_at":"2025-10-11T05:11:21Z","title":"Efficient Onboard Vision-Language Inference in UAV-Enabled Low-Altitude Economy Networks via LLM-Enhanced Optimization","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T10:37:24.213930Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2510.10028"},"observation_digest":"sha256:7de80855aa83d2b4ab29dfcbed184f9704af3c22ac6a524645d70265bc6eb417","observation_id":"2b9fae99-2fcc-43ea-90d7-e24bf41d54fc","resolution":{"observed_at":"2026-08-04T10:37:24.213930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-07-06T17:39:53.791209Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2403.03003","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-07-03T04:27:37.024796Z","title":"Feast your eyes: Mixture-of- resolution adaptation for multimodal large language models","venue":null,"work_id":"f100b81f-dd1f-471e-819a-bd7b0c74c063","year":2025},"citing_paper":{"arxiv_id":"2603.22911","last_updated":"2026-04-12T14:01:49Z","snapshot_observed_at":"2026-08-03T01:43:21.251112Z","submitted_at":"2026-03-24T08:01:16Z","title":"ForestPrune: High-ratio Visual Token Compression for Video Multimodal Large Language Models via Spatial-Temporal Forest Modeling","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-15T00:56:47.841355Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2603.22911"},"observation_digest":"sha256:05037fc67e59f122b4e5392782d0bb257ccd0845386951dcff7a6d7a6abd7bd4","observation_id":"5d4fa2c5-97c5-4a3a-ac41-3c84ed8ea622","resolution":{"observed_at":"2026-05-15T00:58:25.587093Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-07-06T17:39:53.791209Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2403.03003","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-07-03T04:27:37.024796Z","title":"Feast your eyes: Mixture-of- resolution adaptation for multimodal large language models","venue":null,"work_id":"f100b81f-dd1f-471e-819a-bd7b0c74c063","year":2025},"citing_paper":{"arxiv_id":"2604.06912","last_updated":"2026-04-08T10:12:30Z","snapshot_observed_at":"2026-08-04T18:58:19.981225Z","submitted_at":"2026-04-08T10:12:30Z","title":"Q-Zoom: Query-Aware Adaptive Perception for Efficient Multimodal Large Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T18:46:26.869644Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2604.06912"},"observation_digest":"sha256:36e7962a134cb68d5e0ec762cbe235e3bf004c04bcab339844d85ac5e2f306fc","observation_id":"31968c7c-57bc-4110-afea-fb5180460cad","resolution":{"observed_at":"2026-05-10T23:55:52.974101Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-07-06T17:39:53.791209Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2403.03003","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-07-03T04:27:37.024796Z","title":"Feast your eyes: Mixture-of- resolution adaptation for multimodal large language models","venue":null,"work_id":"f100b81f-dd1f-471e-819a-bd7b0c74c063","year":2025},"citing_paper":{"arxiv_id":"2604.12508","last_updated":"2026-04-14T09:32:13Z","snapshot_observed_at":"2026-07-30T19:37:58.552302Z","submitted_at":"2026-04-14T09:32:13Z","title":"From Attenuation to Attention: Variational Information Flow Manipulation for Fine-Grained Visual Perception","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T15:25:46.990772Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2604.12508"},"observation_digest":"sha256:8967e294db1665acc79077fbc7f954aa4115d3f9c797f7cdae2d614ff2d1e393","observation_id":"f5ab41ee-f22c-4eaf-a99c-796d81535f0d","resolution":{"observed_at":"2026-05-11T10:36:02.563120Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-07-06T17:39:53.791209Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2403.03003","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-07-03T04:27:37.024796Z","title":"Feast your eyes: Mixture-of- resolution adaptation for multimodal large language models","venue":null,"work_id":"f100b81f-dd1f-471e-819a-bd7b0c74c063","year":2025},"citing_paper":{"arxiv_id":"2604.13565","last_updated":"2026-04-15T07:21:37Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T07:21:37Z","title":"UHR-BAT: Budget-Aware Token Compression Vision-Language model for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T13:53:13.255412Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2604.13565"},"observation_digest":"sha256:7afa442994889fa1df135702af01c44e383f3166c39adaedf570c51c0f1d2a70","observation_id":"d7e78842-bf47-44bf-b04b-89513cee8a1e","resolution":{"observed_at":"2026-05-10T13:55:28.929452Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-07-06T17:39:53.791209Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2403.03003","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-07-03T04:27:37.024796Z","title":"Feast your eyes: Mixture-of- resolution adaptation for multimodal large language models","venue":null,"work_id":"f100b81f-dd1f-471e-819a-bd7b0c74c063","year":2025},"citing_paper":{"arxiv_id":"2604.15670","last_updated":"2026-07-24T04:48:23Z","snapshot_observed_at":"2026-08-02T16:09:56.976755Z","submitted_at":"2026-04-17T03:48:56Z","title":"PixDLM: A Dual-Path Multimodal Language Model for UAV Reasoning Segmentation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T09:20:54.635375Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2604.15670"},"observation_digest":"sha256:ad63676d24653206ae570101da309a896b7e344d423610220e330a2e938d1b2d","observation_id":"3a711b48-abd4-4610-b541-3cef14ebaf95","resolution":{"observed_at":"2026-05-10T09:23:37.116103Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-07-06T17:39:53.791209Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-08-02T16:10:02.004034Z","title":"Feast your eyes: Mixture-of- resolution adaptation for multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.15670","last_updated":"2026-07-24T04:48:23Z","snapshot_observed_at":"2026-08-02T16:09:56.976755Z","submitted_at":"2026-04-17T03:48:56Z","title":"PixDLM: A Dual-Path Multimodal Language Model for UAV Reasoning Segmentation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T16:10:02.004034Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2604.15670"},"observation_digest":"sha256:88de40e56b1ae0db4f15c8adc8d112ad0a1a77581f4211ac85cb9d8511526ae6","observation_id":"2189009a-8efa-45d0-a5fa-61956e228177","resolution":{"observed_at":"2026-08-02T16:10:02.004034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-07-06T17:39:53.791209Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2403.03003","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-07-03T04:27:37.024796Z","title":"Feast your eyes: Mixture-of- resolution adaptation for multimodal large language models","venue":null,"work_id":"f100b81f-dd1f-471e-819a-bd7b0c74c063","year":2025},"citing_paper":{"arxiv_id":"2605.24675","last_updated":"2026-05-23T17:25:45Z","snapshot_observed_at":"2026-07-06T23:34:43.210149Z","submitted_at":"2026-05-23T17:25:45Z","title":"VaaWIT: Visual-Aware Adaptation of Large Language Models for Multilingual Web Image Translation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-30T13:33:12.116833Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2605.24675"},"observation_digest":"sha256:b65b2b25f64579eda4e8e9037596004b9389a345654a85364195d5ce7ab811c7","observation_id":"6294fd61-bcca-4fd7-947e-787f214c9949","resolution":{"observed_at":"2026-06-30T13:34:40.279432Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-07-06T17:39:53.791209Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2403.03003","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-07-03T04:27:37.024796Z","title":"Feast your eyes: Mixture-of- resolution adaptation for multimodal large language models","venue":null,"work_id":"f100b81f-dd1f-471e-819a-bd7b0c74c063","year":2025},"citing_paper":{"arxiv_id":"2606.03879","last_updated":"2026-06-02T16:46:42Z","snapshot_observed_at":"2026-08-07T17:02:56.856514Z","submitted_at":"2026-06-02T16:46:42Z","title":"Beyond Encoder Accumulation: Measuring Encoder Roles in Multi-Encoder VLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T11:08:36.451147Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2606.03879"},"observation_digest":"sha256:d20461c7f2d2f618f791b4a4469b02bf54e91252417535905a994dd17e97c94f","observation_id":"8dba0300-11ef-4796-891a-62114535752d","resolution":{"observed_at":"2026-07-02T02:16:26.520798Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-07-06T17:39:53.791209Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2403.03003","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-07-03T04:27:37.024796Z","title":"Feast your eyes: Mixture-of- resolution adaptation for multimodal large language models","venue":null,"work_id":"f100b81f-dd1f-471e-819a-bd7b0c74c063","year":2025},"citing_paper":{"arxiv_id":"2606.10651","last_updated":"2026-06-09T09:58:08Z","snapshot_observed_at":"2026-07-06T23:49:51.672382Z","submitted_at":"2026-06-09T09:58:08Z","title":"Kwai Keye-VL-2.0 Technical Report","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-06-27T13:53:10.352603Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2606.10651"},"observation_digest":"sha256:2366a00682b22d570e9abf421917a0688e522a8211e93b0cd44ea94af732dbea","observation_id":"84f4dd75-9489-49f0-af22-a9d0a2a86fb0","resolution":{"observed_at":"2026-07-03T04:27:37.026443Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-07-06T17:39:53.791209Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-08-04T14:48:44.720562Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-07T14:26:45.526508Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:44.720562Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:a5f4a5a64d2429129b03103bfe8f80a21a9e0f6cbf64f47f12b182a7f74e517b","observation_id":"44400a52-b8cf-4792-98e7-05d0ca7b99e1","resolution":{"observed_at":"2026-08-04T14:48:44.720562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2403.03003/citation-record","integrity":"/paper/2403.03003/integrity","json":"/paper/2403.03003/citation-record.json","paper":"/paper/2403.03003"},"outbound":[],"paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T17:39:53.791209Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 28 inbound Pith citation observations for arXiv:2403.03003."}