{"as_of":"2026-08-08T12:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:07aed4988d161e9cb8be0569c9bb7c030cf20817418b7bd9cb55f989e476fcb0","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T22:51:02.176089Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:33:56.525727Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T00:34:04.453845Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.09051","last_updated":"2025-02-13T08:05:44Z","snapshot_observed_at":"2026-08-07T22:45:10.279607Z","submitted_at":"2025-02-13T08:05:44Z","title":"AIDE: Agentically Improve Visual Language Model with Domain Experts","version":1},"cited_work":{"arxiv_id":"2502.09051","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.09051","snapshot_observed_at":"2026-08-07T00:34:04.453845Z","title":"AIDE: Agentically Improve Visual Language Model with Domain Experts","venue":"cs.CV","work_id":"f68d3fbc-385a-4f04-9db8-86f728895910","year":2025},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:56.525727Z"},"links":{"cited_paper":"/paper/2502.09051","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:d26575b3280ea01c56fe602390c0e5bac3bb4c863e8accdbc23e158333a00fc8","observation_id":"7d51a540-97a0-41d0-9202-02ef0d0b3ea4","resolution":{"observed_at":"2026-08-07T00:34:04.544547Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.09051/citation-record","integrity":"/paper/2502.09051/integrity","json":"/paper/2502.09051/citation-record.json","paper":"/paper/2502.09051"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:51:02.593657Z","title":"https://github.com/PaddlePaddle/PaddleOCR","venue":null,"work_id":"cfc41694-c428-4198-b5a4-97d10f359f2c","year":2024},"citing_paper":{"arxiv_id":"2502.09051","last_updated":"2025-02-13T08:05:44Z","snapshot_observed_at":"2026-08-07T22:45:10.279607Z","submitted_at":"2025-02-13T08:05:44Z","title":"AIDE: Agentically Improve Visual Language Model with Domain Experts","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T22:51:02.029144Z"},"links":{"citing_paper":"/paper/2502.09051"},"observation_digest":"sha256:55082318234a46668ea0b1b89e7458ded2e914feb49f8a0b1f03a1446f728824","observation_id":"9fd34b14-1a2d-4600-be48-0b6c5d838139","resolution":{"observed_at":"2026-08-07T22:51:02.599280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-07T22:51:02.035005Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.09051","last_updated":"2025-02-13T08:05:44Z","snapshot_observed_at":"2026-08-07T22:45:10.279607Z","submitted_at":"2025-02-13T08:05:44Z","title":"AIDE: Agentically Improve Visual Language Model with Domain Experts","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T22:51:02.035005Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2502.09051"},"observation_digest":"sha256:632258c8dce6b42220452cb682215f2cd554a69bc76fa3ee3e367508edf88c4d","observation_id":"e3a99080-5ac5-41f9-a351-04e6bdf735ed","resolution":{"observed_at":"2026-08-07T22:51:02.035005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-04T08:17:54.774738Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-07T22:51:02.040957Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09051","last_updated":"2025-02-13T08:05:44Z","snapshot_observed_at":"2026-08-07T22:45:10.279607Z","submitted_at":"2025-02-13T08:05:44Z","title":"AIDE: Agentically Improve Visual Language Model with Domain Experts","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T22:51:02.040957Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2502.09051"},"observation_digest":"sha256:b23603ac2cbf56517e5ce21ba32a72df7c1b48bd79eef3fe273c8be82c5f7383","observation_id":"477853ad-ab42-431a-8877-4c30b5d58839","resolution":{"observed_at":"2026-08-07T22:51:02.040957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08650","last_updated":"2025-02-13T08:06:42Z","snapshot_observed_at":"2026-07-06T14:31:50.328469Z","submitted_at":"2022-12-16T18:51:41Z","title":"ColorSense: A Study on Color Vision in Machine Visual Recognition","version":3},"cited_work":{"arxiv_id":"2212.08650","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.08650","snapshot_observed_at":"2026-08-07T22:51:02.447020Z","title":"ColorSense: A Study on Color Vision in Machine Visual Recognition","venue":"cs.CV","work_id":"e58cdc48-9799-4b1b-b0ff-4e636c41925c","year":2022},"citing_paper":{"arxiv_id":"2502.09051","last_updated":"2025-02-13T08:05:44Z","snapshot_observed_at":"2026-08-07T22:45:10.279607Z","submitted_at":"2025-02-13T08:05:44Z","title":"AIDE: Agentically Improve Visual Language Model with Domain Experts","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T22:51:02.047493Z"},"links":{"cited_paper":"/paper/2212.08650","citing_paper":"/paper/2502.09051"},"observation_digest":"sha256:2534572a755c183cd1d655e5c61c4ca216a44a9107a05b54b99a7506c6a43326","observation_id":"ae84e11c-25a2-49fc-8504-0c76cd8e3e6b","resolution":{"observed_at":"2026-08-07T22:51:02.454498Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03927","last_updated":"2024-12-05T07:06:17Z","snapshot_observed_at":"2026-07-06T20:01:59.108032Z","submitted_at":"2024-12-05T07:06:17Z","title":"MegaCOIN: Enhancing Medium-Grained Color Perception for Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03927","snapshot_observed_at":"2026-08-07T22:51:02.054133Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09051","last_updated":"2025-02-13T08:05:44Z","snapshot_observed_at":"2026-08-07T22:45:10.279607Z","submitted_at":"2025-02-13T08:05:44Z","title":"AIDE: Agentically Improve Visual Language Model with Domain Experts","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T22:51:02.054133Z"},"links":{"cited_paper":"/paper/2412.03927","citing_paper":"/paper/2502.09051"},"observation_digest":"sha256:7f47cd1d0bbd0996a58be894377f8d1381dac7dc38cc54ae7ee9f1f4a381e983","observation_id":"288263e2-4415-4cd8-973d-2d77755e6549","resolution":{"observed_at":"2026-08-07T22:51:02.054133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17453","last_updated":"2024-10-31T23:23:22Z","snapshot_observed_at":"2026-07-06T18:51:23.832577Z","submitted_at":"2024-07-24T17:37:05Z","title":"VILA$^2$: VILA Augmented VILA","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17453","snapshot_observed_at":"2026-08-07T22:51:02.060115Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09051","last_updated":"2025-02-13T08:05:44Z","snapshot_observed_at":"2026-08-07T22:45:10.279607Z","submitted_at":"2025-02-13T08:05:44Z","title":"AIDE: Agentically Improve Visual Language Model with Domain Experts","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T22:51:02.060115Z"},"links":{"cited_paper":"/paper/2407.17453","citing_paper":"/paper/2502.09051"},"observation_digest":"sha256:1e1d5dc5d1252f152356ffef04b58cce5ebcdef5a12168148561966d5f38fe51","observation_id":"707eaddc-99b1-4369-a018-e021d1ce2148","resolution":{"observed_at":"2026-08-07T22:51:02.060115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:51:02.577534Z","title":null,"venue":null,"work_id":"41968358-47da-468a-9c4e-71374b63e204","year":2024},"citing_paper":{"arxiv_id":"2502.09051","last_updated":"2025-02-13T08:05:44Z","snapshot_observed_at":"2026-08-07T22:45:10.279607Z","submitted_at":"2025-02-13T08:05:44Z","title":"AIDE: Agentically Improve Visual Language Model with Domain Experts","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T22:51:02.066728Z"},"links":{"citing_paper":"/paper/2502.09051"},"observation_digest":"sha256:dc7a0ef17ab8e2df8003f4a3b725e5deb7190e585a2cd3a377d0380a75b35862","observation_id":"17b99959-2ea4-4a07-b09e-aacff4629978","resolution":{"observed_at":"2026-08-07T22:51:02.582399Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-07T22:51:02.077942Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09051","last_updated":"2025-02-13T08:05:44Z","snapshot_observed_at":"2026-08-07T22:45:10.279607Z","submitted_at":"2025-02-13T08:05:44Z","title":"AIDE: Agentically Improve Visual Language Model with Domain Experts","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T22:51:02.077942Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2502.09051"},"observation_digest":"sha256:474615d1acc1e7e52c9171de3f95ddfde1dd2716ed8e851584e5e2ac237d44d2","observation_id":"86d13882-21a5-4091-8838-69c0b071b24b","resolution":{"observed_at":"2026-08-07T22:51:02.077942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.14045","last_updated":"2023-03-01T11:04:51Z","snapshot_observed_at":"2026-08-08T05:52:17.343895Z","submitted_at":"2023-02-27T18:55:27Z","title":"Language Is Not All You Need: Aligning Perception with Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.14045","snapshot_observed_at":"2026-08-07T22:51:02.083431Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09051","last_updated":"2025-02-13T08:05:44Z","snapshot_observed_at":"2026-08-07T22:45:10.279607Z","submitted_at":"2025-02-13T08:05:44Z","title":"AIDE: Agentically Improve Visual Language Model with Domain Experts","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T22:51:02.083431Z"},"links":{"cited_paper":"/paper/2302.14045","citing_paper":"/paper/2502.09051"},"observation_digest":"sha256:66d3a30e40cde575b4f461b449433b60a726e19d760dedbd5e64be1987a45f50","observation_id":"539149fd-9897-41cf-b11c-8f42aeac7118","resolution":{"observed_at":"2026-08-07T22:51:02.083431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-07T22:51:02.089154Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09051","last_updated":"2025-02-13T08:05:44Z","snapshot_observed_at":"2026-08-07T22:45:10.279607Z","submitted_at":"2025-02-13T08:05:44Z","title":"AIDE: Agentically Improve Visual Language Model with Domain Experts","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T22:51:02.089154Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2502.09051"},"observation_digest":"sha256:5a85f36647ddfe2669f522351aa70bc3bee9d0f256d82766097545051bb0b45b","observation_id":"54530509-9881-4191-8e03-df9c6846c256","resolution":{"observed_at":"2026-08-07T22:51:02.089154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14565","last_updated":"2024-03-19T22:53:25Z","snapshot_observed_at":"2026-08-06T22:33:34.254048Z","submitted_at":"2023-06-26T10:26:33Z","title":"Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14565","snapshot_observed_at":"2026-08-07T22:51:02.094840Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09051","last_updated":"2025-02-13T08:05:44Z","snapshot_observed_at":"2026-08-07T22:45:10.279607Z","submitted_at":"2025-02-13T08:05:44Z","title":"AIDE: Agentically Improve Visual Language Model with Domain Experts","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T22:51:02.094840Z"},"links":{"cited_paper":"/paper/2306.14565","citing_paper":"/paper/2502.09051"},"observation_digest":"sha256:ca27bc3e635b743eaa58718bd830900a9bbcd2970c57499c92f4cda4ec2bfe85","observation_id":"8bf98f31-0817-465a-842c-6028598edeba","resolution":{"observed_at":"2026-08-07T22:51:02.094840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10774","last_updated":"2024-04-15T15:48:48Z","snapshot_observed_at":"2026-07-06T16:49:13.099946Z","submitted_at":"2023-11-15T23:36:42Z","title":"MMC: Advancing Multimodal Chart Understanding with Large-scale Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10774","snapshot_observed_at":"2026-08-07T22:51:02.100050Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09051","last_updated":"2025-02-13T08:05:44Z","snapshot_observed_at":"2026-08-07T22:45:10.279607Z","submitted_at":"2025-02-13T08:05:44Z","title":"AIDE: Agentically Improve Visual Language Model with Domain Experts","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T22:51:02.100050Z"},"links":{"cited_paper":"/paper/2311.10774","citing_paper":"/paper/2502.09051"},"observation_digest":"sha256:7f146175c60b1057c47e19030af6235bf2338a9cc9d24077d54341dff1858fc4","observation_id":"6d1c5df0-0697-4f7b-bf31-2729069bfb5f","resolution":{"observed_at":"2026-08-07T22:51:02.100050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-07T22:51:02.105296Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09051","last_updated":"2025-02-13T08:05:44Z","snapshot_observed_at":"2026-08-07T22:45:10.279607Z","submitted_at":"2025-02-13T08:05:44Z","title":"AIDE: Agentically Improve Visual Language Model with Domain Experts","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T22:51:02.105296Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2502.09051"},"observation_digest":"sha256:f4b72970faef99b2c22c4245c64b08c18175d8d1be3db190b059d3b593ded652","observation_id":"32e65011-305e-4243-94c0-f70778bc5d39","resolution":{"observed_at":"2026-08-07T22:51:02.105296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-07T22:51:02.110594Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09051","last_updated":"2025-02-13T08:05:44Z","snapshot_observed_at":"2026-08-07T22:45:10.279607Z","submitted_at":"2025-02-13T08:05:44Z","title":"AIDE: Agentically Improve Visual Language Model with Domain Experts","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T22:51:02.110594Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2502.09051"},"observation_digest":"sha256:985e46c67e3cec47ec14a5d52b7810bca9f13ca68678c0dd74d3c835e38acb4b","observation_id":"801101c5-25ef-4aa6-bb36-b682c8af1162","resolution":{"observed_at":"2026-08-07T22:51:02.110594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-07T22:51:02.115887Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09051","last_updated":"2025-02-13T08:05:44Z","snapshot_observed_at":"2026-08-07T22:45:10.279607Z","submitted_at":"2025-02-13T08:05:44Z","title":"AIDE: Agentically Improve Visual Language Model with Domain Experts","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T22:51:02.115887Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2502.09051"},"observation_digest":"sha256:c4b6f81b7772554b5d0af6bfd334d6b74d524f59c29c48a8093c3ca793751fc8","observation_id":"a95793cf-c7a3-48be-930d-3fc39b394dab","resolution":{"observed_at":"2026-08-07T22:51:02.115887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:51:02.561901Z","title":null,"venue":null,"work_id":"1535bab1-605f-4921-ab5f-895f735ea90e","year":2024},"citing_paper":{"arxiv_id":"2502.09051","last_updated":"2025-02-13T08:05:44Z","snapshot_observed_at":"2026-08-07T22:45:10.279607Z","submitted_at":"2025-02-13T08:05:44Z","title":"AIDE: Agentically Improve Visual Language Model with Domain Experts","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T22:51:02.120928Z"},"links":{"citing_paper":"/paper/2502.09051"},"observation_digest":"sha256:e300526c29c7528271f13c5625854c9bfc925814b96e10098e9ad422ea903086","observation_id":"35d0c92a-b5ab-48f1-bf2e-0f1d10152ea7","resolution":{"observed_at":"2026-08-07T22:51:02.566521Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-07T22:51:02.125610Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.09051","last_updated":"2025-02-13T08:05:44Z","snapshot_observed_at":"2026-08-07T22:45:10.279607Z","submitted_at":"2025-02-13T08:05:44Z","title":"AIDE: Agentically Improve Visual Language Model with Domain Experts","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T22:51:02.125610Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2502.09051"},"observation_digest":"sha256:f466bb1e1c7cbb6ac46d98137f9a2d55302d274f70f5f2c4e08c592cac76fb00","observation_id":"a3334bfa-f0a5-46b5-89b3-b804ec73ca3b","resolution":{"observed_at":"2026-08-07T22:51:02.125610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14159","last_updated":"2024-01-25T13:12:09Z","snapshot_observed_at":"2026-07-06T17:20:25.138890Z","submitted_at":"2024-01-25T13:12:09Z","title":"Grounded SAM: Assembling Open-World Models for Diverse Visual Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14159","snapshot_observed_at":"2026-08-07T22:51:02.130476Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09051","last_updated":"2025-02-13T08:05:44Z","snapshot_observed_at":"2026-08-07T22:45:10.279607Z","submitted_at":"2025-02-13T08:05:44Z","title":"AIDE: Agentically Improve Visual Language Model with Domain Experts","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T22:51:02.130476Z"},"links":{"cited_paper":"/paper/2401.14159","citing_paper":"/paper/2502.09051"},"observation_digest":"sha256:ce40882105a84b808fefc435b1842b886a1683b893ee9b1eee97d9d7be57fe92","observation_id":"7b7deb53-b14d-415b-885b-03ae6c5fcc8f","resolution":{"observed_at":"2026-08-07T22:51:02.130476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:51:02.546958Z","title":null,"venue":null,"work_id":"a2abfaba-b5f9-4845-917e-977a0229b972","year":2022},"citing_paper":{"arxiv_id":"2502.09051","last_updated":"2025-02-13T08:05:44Z","snapshot_observed_at":"2026-08-07T22:45:10.279607Z","submitted_at":"2025-02-13T08:05:44Z","title":"AIDE: Agentically Improve Visual Language Model with Domain Experts","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T22:51:02.135605Z"},"links":{"citing_paper":"/paper/2502.09051"},"observation_digest":"sha256:9d25068f6c917671119cc5b9578b16ee86694f624e618f712a5a19b99e2d27e5","observation_id":"c07c2caa-faa4-46f9-ae1d-b4c4accee154","resolution":{"observed_at":"2026-08-07T22:51:02.551802Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15998","last_updated":"2025-03-02T23:41:37Z","snapshot_observed_at":"2026-07-06T19:07:16.252072Z","submitted_at":"2024-08-28T17:59:31Z","title":"Eagle: Exploring The Design Space for Multimodal LLMs with Mixture of Encoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15998","snapshot_observed_at":"2026-08-07T22:51:02.140407Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09051","last_updated":"2025-02-13T08:05:44Z","snapshot_observed_at":"2026-08-07T22:45:10.279607Z","submitted_at":"2025-02-13T08:05:44Z","title":"AIDE: Agentically Improve Visual Language Model with Domain Experts","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T22:51:02.140407Z"},"links":{"cited_paper":"/paper/2408.15998","citing_paper":"/paper/2502.09051"},"observation_digest":"sha256:5c53a341f39dfaea81a6ac7ee236bc892a912059f5e1e03e969d2b7dc94c8d87","observation_id":"9e50171f-9fac-4c3c-a3d1-e69360510242","resolution":{"observed_at":"2026-08-07T22:51:02.140407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-07T22:51:02.145279Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09051","last_updated":"2025-02-13T08:05:44Z","snapshot_observed_at":"2026-08-07T22:45:10.279607Z","submitted_at":"2025-02-13T08:05:44Z","title":"AIDE: Agentically Improve Visual Language Model with Domain Experts","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T22:51:02.145279Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2502.09051"},"observation_digest":"sha256:7bdf008907b357e6d1a32541c547a709cdf979a606b13134a9f2af5c5a8c7107","observation_id":"29b874c9-f940-4a09-b68b-1e0d9b484a78","resolution":{"observed_at":"2026-08-07T22:51:02.145279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10560","last_updated":"2023-05-25T23:50:07Z","snapshot_observed_at":"2026-07-06T14:33:11.945106Z","submitted_at":"2022-12-20T18:59:19Z","title":"Self-Instruct: Aligning Language Models with Self-Generated Instructions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10560","snapshot_observed_at":"2026-08-07T22:51:02.150470Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.09051","last_updated":"2025-02-13T08:05:44Z","snapshot_observed_at":"2026-08-07T22:45:10.279607Z","submitted_at":"2025-02-13T08:05:44Z","title":"AIDE: Agentically Improve Visual Language Model with Domain Experts","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T22:51:02.150470Z"},"links":{"cited_paper":"/paper/2212.10560","citing_paper":"/paper/2502.09051"},"observation_digest":"sha256:3dc0b4992f568f7631539c48ea897cab027acc3db9631bb931bbecd6b4597170","observation_id":"9288146e-b192-4e30-99dc-fb5f06424d32","resolution":{"observed_at":"2026-08-07T22:51:02.150470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:51:02.531852Z","title":null,"venue":null,"work_id":"9645a3de-3bc4-4f17-9c20-958430ca794b","year":2024},"citing_paper":{"arxiv_id":"2502.09051","last_updated":"2025-02-13T08:05:44Z","snapshot_observed_at":"2026-08-07T22:45:10.279607Z","submitted_at":"2025-02-13T08:05:44Z","title":"AIDE: Agentically Improve Visual Language Model with Domain Experts","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T22:51:02.155520Z"},"links":{"citing_paper":"/paper/2502.09051"},"observation_digest":"sha256:46a0086801e1c53ee586e256954e326f49f6f79000bf4781416463adbdae1811","observation_id":"425c3e3c-6699-4e6a-b98f-4afc0b156f14","resolution":{"observed_at":"2026-08-07T22:51:02.536797Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:51:02.516535Z","title":null,"venue":null,"work_id":"ca2a2b53-4d69-4d00-ba8a-46d4a85e75f2","year":2024},"citing_paper":{"arxiv_id":"2502.09051","last_updated":"2025-02-13T08:05:44Z","snapshot_observed_at":"2026-08-07T22:45:10.279607Z","submitted_at":"2025-02-13T08:05:44Z","title":"AIDE: Agentically Improve Visual Language Model with Domain Experts","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T22:51:02.160317Z"},"links":{"citing_paper":"/paper/2502.09051"},"observation_digest":"sha256:4f44e41b49f2ce45ea8b9614bfbc78af26381854701588ee0b637853e9322f69","observation_id":"b37e27cd-d0da-491f-9f3c-1e4c4349c0ff","resolution":{"observed_at":"2026-08-07T22:51:02.521494Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-08-07T22:51:02.164934Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.09051","last_updated":"2025-02-13T08:05:44Z","snapshot_observed_at":"2026-08-07T22:45:10.279607Z","submitted_at":"2025-02-13T08:05:44Z","title":"AIDE: Agentically Improve Visual Language Model with Domain Experts","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T22:51:02.164934Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2502.09051"},"observation_digest":"sha256:f6050a8a8963358935af835b0f20318595b13fb2f34a76be247696061ec1b231","observation_id":"c062180a-2661-4a6b-a21e-c281cf7ac7ec","resolution":{"observed_at":"2026-08-07T22:51:02.164934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:51:02.170241Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09051","last_updated":"2025-02-13T08:05:44Z","snapshot_observed_at":"2026-08-07T22:45:10.279607Z","submitted_at":"2025-02-13T08:05:44Z","title":"AIDE: Agentically Improve Visual Language Model with Domain Experts","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T22:51:02.170241Z"},"links":{"citing_paper":"/paper/2502.09051"},"observation_digest":"sha256:ea8593120e25d35eef72189bb20d821260bbc64945a85fb3cef1613ad70dcdbd","observation_id":"6c9d1c0e-3121-461b-83d5-51f24c97b64d","resolution":{"observed_at":"2026-08-07T22:51:02.170241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:51:02.176089Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09051","last_updated":"2025-02-13T08:05:44Z","snapshot_observed_at":"2026-08-07T22:45:10.279607Z","submitted_at":"2025-02-13T08:05:44Z","title":"AIDE: Agentically Improve Visual Language Model with Domain Experts","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T22:51:02.176089Z"},"links":{"citing_paper":"/paper/2502.09051"},"observation_digest":"sha256:98231a67f7d0f8d1bf72cd1ea8e458dd5cca2d182cfdfeb99726608aa61c8a0d","observation_id":"76938200-1074-44f6-b82a-50bf4817e6ed","resolution":{"observed_at":"2026-08-07T22:51:02.176089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.09051","last_updated":"2025-02-13T08:05:44Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T22:45:10.279607Z","submitted_at":"2025-02-13T08:05:44Z","title":"AIDE: Agentically Improve Visual Language Model with Domain Experts"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":1,"verified_fuzzy":1},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 1 inbound Pith citation observation for arXiv:2502.09051."}