{"as_of":"2026-08-09T13:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d2710ea00891d25b4e9cf6d96bab6954b261ded0b56358ab0b953b4e8e8a379e","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":28,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T11:32:42.920231Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T15:07:03.935337Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2307.04087","last_updated":"2023-12-28T16:01:36Z","snapshot_observed_at":"2026-08-06T02:13:50.627750Z","submitted_at":"2023-07-09T03:25:14Z","title":"SVIT: Scaling up Visual Instruction Tuning","version":3},"cited_work":{"arxiv_id":"2307.04087","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.04087","snapshot_observed_at":"2026-07-02T15:07:03.935337Z","title":"Svit: Scaling up visual instruction tuning","venue":null,"work_id":"cb1fc191-de60-4941-87ad-8829d88f83c2","year":2023},"citing_paper":{"arxiv_id":"2305.03726","last_updated":"2025-07-28T05:33:36Z","snapshot_observed_at":"2026-07-06T15:23:52.761222Z","submitted_at":"2023-05-05T17:59:46Z","title":"Otter: A Multi-Modal Model with In-Context Instruction Tuning","version":2},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-05-15T02:43:47.775691Z"},"links":{"cited_paper":"/paper/2307.04087","citing_paper":"/paper/2305.03726"},"observation_digest":"sha256:43ac7d8194f2128b58d04b482aeeccbdab510408f9d0a19fc32f01b51e763576","observation_id":"d649401e-77da-4d9e-89be-f84674c165fd","resolution":{"observed_at":"2026-05-15T02:43:47.918523Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04087","last_updated":"2023-12-28T16:01:36Z","snapshot_observed_at":"2026-08-06T02:13:50.627750Z","submitted_at":"2023-07-09T03:25:14Z","title":"SVIT: Scaling up Visual Instruction Tuning","version":3},"cited_work":{"arxiv_id":"2307.04087","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.04087","snapshot_observed_at":"2026-07-02T15:07:03.935337Z","title":"Svit: Scaling up visual instruction tuning","venue":null,"work_id":"cb1fc191-de60-4941-87ad-8829d88f83c2","year":2023},"citing_paper":{"arxiv_id":"2308.12067","last_updated":"2026-04-12T14:13:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-23T11:27:30Z","title":"MM-LIMA: Less Is More for Alignment in Multi-Modal Datasets","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-24T08:13:18.191233Z"},"links":{"cited_paper":"/paper/2307.04087","citing_paper":"/paper/2308.12067"},"observation_digest":"sha256:760d72c01417f578a9d0fe7cce877c54c89131056e5db5c253f7cf96021a62b6","observation_id":"536d51be-36d6-4cb8-99dd-54a5b20de514","resolution":{"observed_at":"2026-05-24T08:14:10.262530Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04087","last_updated":"2023-12-28T16:01:36Z","snapshot_observed_at":"2026-08-06T02:13:50.627750Z","submitted_at":"2023-07-09T03:25:14Z","title":"SVIT: Scaling up Visual Instruction Tuning","version":3},"cited_work":{"arxiv_id":"2307.04087","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.04087","snapshot_observed_at":"2026-07-02T15:07:03.935337Z","title":"Svit: Scaling up visual instruction tuning","venue":null,"work_id":"cb1fc191-de60-4941-87ad-8829d88f83c2","year":2023},"citing_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-12T19:11:33.783746Z"},"links":{"cited_paper":"/paper/2307.04087","citing_paper":"/paper/2310.03744"},"observation_digest":"sha256:f64e7d04ddf89d5747361658faf4f34fbfab065a5e774d5426cdbf5c3de827e7","observation_id":"10ba115d-d398-4bb6-99ff-8555551e5cff","resolution":{"observed_at":"2026-05-12T19:11:33.990145Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04087","last_updated":"2023-12-28T16:01:36Z","snapshot_observed_at":"2026-08-06T02:13:50.627750Z","submitted_at":"2023-07-09T03:25:14Z","title":"SVIT: Scaling up Visual Instruction Tuning","version":3},"cited_work":{"arxiv_id":"2307.04087","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.04087","snapshot_observed_at":"2026-07-02T15:07:03.935337Z","title":"Svit: Scaling up visual instruction tuning","venue":null,"work_id":"cb1fc191-de60-4941-87ad-8829d88f83c2","year":2023},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-08-06T04:08:15.266897Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"cited_paper":"/paper/2307.04087","citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:f64e7413c24a2af7b577fcea6ed191f945973d85aa951afc7900c3efc899eb29","observation_id":"8a1aeacf-975c-4c5d-9467-ad30e2b5fedc","resolution":{"observed_at":"2026-05-18T03:18:51.793866Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04087","last_updated":"2023-12-28T16:01:36Z","snapshot_observed_at":"2026-08-06T02:13:50.627750Z","submitted_at":"2023-07-09T03:25:14Z","title":"SVIT: Scaling up Visual Instruction Tuning","version":3},"cited_work":{"arxiv_id":"2307.04087","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.04087","snapshot_observed_at":"2026-07-02T15:07:03.935337Z","title":"Svit: Scaling up visual instruction tuning","venue":null,"work_id":"cb1fc191-de60-4941-87ad-8829d88f83c2","year":2023},"citing_paper":{"arxiv_id":"2311.16502","last_updated":"2024-06-13T15:02:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-27T17:33:21Z","title":"MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI","version":4},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-15T05:37:41.401736Z"},"links":{"cited_paper":"/paper/2307.04087","citing_paper":"/paper/2311.16502"},"observation_digest":"sha256:19301f7bf7058ada8d6e2868061ee8454430b9e382dff0a4fd4e007400d756b6","observation_id":"d5bd206d-b5b7-4509-850d-b019a7a13b6b","resolution":{"observed_at":"2026-05-15T05:37:41.761969Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04087","last_updated":"2023-12-28T16:01:36Z","snapshot_observed_at":"2026-08-06T02:13:50.627750Z","submitted_at":"2023-07-09T03:25:14Z","title":"SVIT: Scaling up Visual Instruction Tuning","version":3},"cited_work":{"arxiv_id":"2307.04087","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.04087","snapshot_observed_at":"2026-07-02T15:07:03.935337Z","title":"Svit: Scaling up visual instruction tuning","venue":null,"work_id":"cb1fc191-de60-4941-87ad-8829d88f83c2","year":2023},"citing_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"reference_index":184,"source":"pdf_text","source_observed_at":"2026-05-13T22:46:09.693156Z"},"links":{"cited_paper":"/paper/2307.04087","citing_paper":"/paper/2312.14238"},"observation_digest":"sha256:8517f8f3ecc4d0abed4b22001e526eba4b3dacd5f1d09bea035e31417dc2c419","observation_id":"819c52b1-606b-467a-9204-110350fc9fd3","resolution":{"observed_at":"2026-05-13T22:46:10.262028Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04087","last_updated":"2023-12-28T16:01:36Z","snapshot_observed_at":"2026-08-06T02:13:50.627750Z","submitted_at":"2023-07-09T03:25:14Z","title":"SVIT: Scaling up Visual Instruction Tuning","version":3},"cited_work":{"arxiv_id":"2307.04087","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.04087","snapshot_observed_at":"2026-07-02T15:07:03.935337Z","title":"Svit: Scaling up visual instruction tuning","venue":null,"work_id":"cb1fc191-de60-4941-87ad-8829d88f83c2","year":2023},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"cited_paper":"/paper/2307.04087","citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:44b1378d19f092022f8024b1f2938174ae4140e70c48ced951cc7d8554a21f21","observation_id":"60743011-f516-4957-8578-263f3ccdb2dc","resolution":{"observed_at":"2026-05-18T15:27:52.136023Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04087","last_updated":"2023-12-28T16:01:36Z","snapshot_observed_at":"2026-08-06T02:13:50.627750Z","submitted_at":"2023-07-09T03:25:14Z","title":"SVIT: Scaling up Visual Instruction Tuning","version":3},"cited_work":{"arxiv_id":"2307.04087","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.04087","snapshot_observed_at":"2026-07-02T15:07:03.935337Z","title":"Svit: Scaling up visual instruction tuning","venue":null,"work_id":"cb1fc191-de60-4941-87ad-8829d88f83c2","year":2023},"citing_paper":{"arxiv_id":"2403.09611","last_updated":"2024-04-18T18:51:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-14T17:51:32Z","title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","version":4},"reference_index":132,"source":"pdf_text","source_observed_at":"2026-05-16T04:09:36.019146Z"},"links":{"cited_paper":"/paper/2307.04087","citing_paper":"/paper/2403.09611"},"observation_digest":"sha256:b659615146d48253d9296d1db9cf8d9924caaf0e93830b99160885ccda93cc22","observation_id":"bb44d84a-7d91-45f8-a19d-299aaddecf62","resolution":{"observed_at":"2026-05-16T04:09:36.413562Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04087","last_updated":"2023-12-28T16:01:36Z","snapshot_observed_at":"2026-08-06T02:13:50.627750Z","submitted_at":"2023-07-09T03:25:14Z","title":"SVIT: Scaling up Visual Instruction Tuning","version":3},"cited_work":{"arxiv_id":"2307.04087","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.04087","snapshot_observed_at":"2026-07-02T15:07:03.935337Z","title":"Svit: Scaling up visual instruction tuning","venue":null,"work_id":"cb1fc191-de60-4941-87ad-8829d88f83c2","year":2023},"citing_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"reference_index":140,"source":"pdf_text","source_observed_at":"2026-05-12T20:58:58.849040Z"},"links":{"cited_paper":"/paper/2307.04087","citing_paper":"/paper/2404.16821"},"observation_digest":"sha256:5d58a9afcaef07bfa6bf16572533a1d9a804da566593c30355f190691a960a9c","observation_id":"23f91ff9-793f-4653-aeb7-d5669ae8fd77","resolution":{"observed_at":"2026-05-12T20:58:59.314247Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04087","last_updated":"2023-12-28T16:01:36Z","snapshot_observed_at":"2026-08-06T02:13:50.627750Z","submitted_at":"2023-07-09T03:25:14Z","title":"SVIT: Scaling up Visual Instruction Tuning","version":3},"cited_work":{"arxiv_id":"2307.04087","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.04087","snapshot_observed_at":"2026-07-02T15:07:03.935337Z","title":"Svit: Scaling up visual instruction tuning","venue":null,"work_id":"cb1fc191-de60-4941-87ad-8829d88f83c2","year":2023},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":119,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"cited_paper":"/paper/2307.04087","citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:a6d4fa1a1afcbbec5de5cb7eed9c039bd76e714d8c967e75023893914ca09f17","observation_id":"9a92866f-6f73-46a2-8710-fe58ee55fee2","resolution":{"observed_at":"2026-05-10T21:07:32.159977Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04087","last_updated":"2023-12-28T16:01:36Z","snapshot_observed_at":"2026-08-06T02:13:50.627750Z","submitted_at":"2023-07-09T03:25:14Z","title":"SVIT: Scaling up Visual Instruction Tuning","version":3},"cited_work":{"arxiv_id":"2307.04087","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.04087","snapshot_observed_at":"2026-07-02T15:07:03.935337Z","title":"Svit: Scaling up visual instruction tuning","venue":null,"work_id":"cb1fc191-de60-4941-87ad-8829d88f83c2","year":2023},"citing_paper":{"arxiv_id":"2408.04840","last_updated":"2024-08-13T08:10:32Z","snapshot_observed_at":"2026-07-06T18:58:39.334273Z","submitted_at":"2024-08-09T03:25:42Z","title":"mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-05-20T06:20:36.235304Z"},"links":{"cited_paper":"/paper/2307.04087","citing_paper":"/paper/2408.04840"},"observation_digest":"sha256:3fc90a984e8f1dd36efb316c76cd9ce07bf633e3007b856858d4b8e166f72745","observation_id":"d1a283ce-0177-4dc8-a8da-bf383082fd9a","resolution":{"observed_at":"2026-05-20T06:20:36.368777Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04087","last_updated":"2023-12-28T16:01:36Z","snapshot_observed_at":"2026-08-06T02:13:50.627750Z","submitted_at":"2023-07-09T03:25:14Z","title":"SVIT: Scaling up Visual Instruction Tuning","version":3},"cited_work":{"arxiv_id":"2307.04087","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.04087","snapshot_observed_at":"2026-07-02T15:07:03.935337Z","title":"Svit: Scaling up visual instruction tuning","venue":null,"work_id":"cb1fc191-de60-4941-87ad-8829d88f83c2","year":2023},"citing_paper":{"arxiv_id":"2409.02813","last_updated":"2025-05-22T08:22:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-04T15:31:26Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","version":3},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-05-14T00:51:48.163349Z"},"links":{"cited_paper":"/paper/2307.04087","citing_paper":"/paper/2409.02813"},"observation_digest":"sha256:789a9206ab4a3590bbabbb07fded7adce307b7c69087b1d55fc2a76334417ffa","observation_id":"18ffe440-31d2-4533-a0b3-3d5af3f2de93","resolution":{"observed_at":"2026-05-14T00:51:48.483233Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04087","last_updated":"2023-12-28T16:01:36Z","snapshot_observed_at":"2026-08-06T02:13:50.627750Z","submitted_at":"2023-07-09T03:25:14Z","title":"SVIT: Scaling up Visual Instruction Tuning","version":3},"cited_work":{"arxiv_id":"2307.04087","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.04087","snapshot_observed_at":"2026-07-02T15:07:03.935337Z","title":"Svit: Scaling up visual instruction tuning","venue":null,"work_id":"cb1fc191-de60-4941-87ad-8829d88f83c2","year":2023},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":132,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"cited_paper":"/paper/2307.04087","citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:3f287241fea722f917ce1273a49372dc3ba33d39ba9760251dfbc8ff77856804","observation_id":"9176bb75-69a3-44f5-b177-b97c2950872f","resolution":{"observed_at":"2026-05-23T07:42:42.968159Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04087","last_updated":"2023-12-28T16:01:36Z","snapshot_observed_at":"2026-08-06T02:13:50.627750Z","submitted_at":"2023-07-09T03:25:14Z","title":"SVIT: Scaling up Visual Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04087","snapshot_observed_at":"2026-08-08T11:32:42.920231Z","title":"arXiv preprint arXiv:2307.04087 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07905","last_updated":"2025-02-11T19:21:23Z","snapshot_observed_at":"2026-08-09T00:39:02.531369Z","submitted_at":"2025-02-11T19:21:23Z","title":"DeepSeek on a Trip: Inducing Targeted Visual Hallucinations via Representation Vulnerabilities","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T11:32:42.920231Z"},"links":{"cited_paper":"/paper/2307.04087","citing_paper":"/paper/2502.07905"},"observation_digest":"sha256:6879cefd0cc9823c4569f6e5bc85cd0aa57972d68c15e4a20f4271f14508e040","observation_id":"2c31d624-3712-4f64-bc7c-72ca9ff80519","resolution":{"observed_at":"2026-08-08T11:32:42.920231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04087","last_updated":"2023-12-28T16:01:36Z","snapshot_observed_at":"2026-08-06T02:13:50.627750Z","submitted_at":"2023-07-09T03:25:14Z","title":"SVIT: Scaling up Visual Instruction Tuning","version":3},"cited_work":{"arxiv_id":"2307.04087","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.04087","snapshot_observed_at":"2026-07-02T15:07:03.935337Z","title":"Svit: Scaling up visual instruction tuning","venue":null,"work_id":"cb1fc191-de60-4941-87ad-8829d88f83c2","year":2023},"citing_paper":{"arxiv_id":"2505.17726","last_updated":"2026-05-19T09:55:01Z","snapshot_observed_at":"2026-08-03T09:08:10.935540Z","submitted_at":"2025-05-23T10:43:45Z","title":"Slot-MLLM: Object-Centric Visual Tokenization for Multimodal LLM","version":3},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-22T02:06:35.204166Z"},"links":{"cited_paper":"/paper/2307.04087","citing_paper":"/paper/2505.17726"},"observation_digest":"sha256:6589698e71fa3a10ea5ce9e49c189a3a8097bc713c230fd7744333b1c39a384c","observation_id":"13722c96-2eb2-41b1-a5c3-905c9dec1085","resolution":{"observed_at":"2026-05-22T02:10:56.208834Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04087","last_updated":"2023-12-28T16:01:36Z","snapshot_observed_at":"2026-08-06T02:13:50.627750Z","submitted_at":"2023-07-09T03:25:14Z","title":"SVIT: Scaling up Visual Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04087","snapshot_observed_at":"2026-08-07T14:37:54.331667Z","title":"Svit: Scaling up visual instruction tuning.arXiv preprint arXiv:2307.04087, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:54.331667Z"},"links":{"cited_paper":"/paper/2307.04087","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:f08fb880a3ad2753d1d19eaceb993b9be209963ccdb123d16a1ab6105cb4a1d8","observation_id":"05c6122e-8d8d-44a8-bd5b-e427e1374c22","resolution":{"observed_at":"2026-08-07T14:37:54.331667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04087","last_updated":"2023-12-28T16:01:36Z","snapshot_observed_at":"2026-08-06T02:13:50.627750Z","submitted_at":"2023-07-09T03:25:14Z","title":"SVIT: Scaling up Visual Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04087","snapshot_observed_at":"2026-08-07T13:20:34.070554Z","title":"arXiv preprint arXiv:2307.04087 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23830","last_updated":"2025-05-28T08:38:39Z","snapshot_observed_at":"2026-08-09T02:42:01.460246Z","submitted_at":"2025-05-28T08:38:39Z","title":"EvoMoE: Expert Evolution in Mixture of Experts for Multimodal Large Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:34.070554Z"},"links":{"cited_paper":"/paper/2307.04087","citing_paper":"/paper/2505.23830"},"observation_digest":"sha256:455b39f148f92ac4e39edf08dd46a61be94f3a7d1fd417b9067149580b3394a0","observation_id":"1f62fce6-9aa9-49d0-be01-6a51329e294c","resolution":{"observed_at":"2026-08-07T13:20:34.070554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04087","last_updated":"2023-12-28T16:01:36Z","snapshot_observed_at":"2026-08-06T02:13:50.627750Z","submitted_at":"2023-07-09T03:25:14Z","title":"SVIT: Scaling up Visual Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04087","snapshot_observed_at":"2026-08-07T06:07:18.746047Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06406","last_updated":"2025-06-25T12:36:55Z","snapshot_observed_at":"2026-08-07T11:49:17.219924Z","submitted_at":"2025-06-06T12:47:29Z","title":"SMAR: Soft Modality-Aware Routing Strategy for MoE-based Multimodal Large Language Models Preserving Language Capabilities","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:18.746047Z"},"links":{"cited_paper":"/paper/2307.04087","citing_paper":"/paper/2506.06406"},"observation_digest":"sha256:62f46ff63fec4e5c8bcebcaa30de8e0e102d08a210e4728b29fd75937aa69ed2","observation_id":"d3be2cd5-5769-47ea-b6ce-7c20742fe64a","resolution":{"observed_at":"2026-08-07T06:07:18.746047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04087","last_updated":"2023-12-28T16:01:36Z","snapshot_observed_at":"2026-08-06T02:13:50.627750Z","submitted_at":"2023-07-09T03:25:14Z","title":"SVIT: Scaling up Visual Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04087","snapshot_observed_at":"2026-08-06T16:50:05.494156Z","title":"SVIT: scaling up visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-09T09:38:10.605452Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:05.494156Z"},"links":{"cited_paper":"/paper/2307.04087","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:41b423d0576be522779b66eb0320e80874ecaf5b14c29342ee66edeb455fe2c5","observation_id":"d86c7702-3db9-44f1-ab53-65377a19e076","resolution":{"observed_at":"2026-08-06T16:50:05.494156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04087","last_updated":"2023-12-28T16:01:36Z","snapshot_observed_at":"2026-08-06T02:13:50.627750Z","submitted_at":"2023-07-09T03:25:14Z","title":"SVIT: Scaling up Visual Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04087","snapshot_observed_at":"2026-08-06T16:37:23.687949Z","title":"Svit: Scaling up visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:23.687949Z"},"links":{"cited_paper":"/paper/2307.04087","citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:e195b10576c02a54f9ff17ed439310ed6eb08183aa083d447f57199d839ffbea","observation_id":"c04e7633-c62d-43a3-ba52-725bb69e0a6d","resolution":{"observed_at":"2026-08-06T16:37:23.687949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04087","last_updated":"2023-12-28T16:01:36Z","snapshot_observed_at":"2026-08-06T02:13:50.627750Z","submitted_at":"2023-07-09T03:25:14Z","title":"SVIT: Scaling up Visual Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04087","snapshot_observed_at":"2026-08-05T17:13:08.100077Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:08.100077Z"},"links":{"cited_paper":"/paper/2307.04087","citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:b1a3e351d441a746839573458d78b2e82d26788e60b8b645e2ccb6f3412fc1f5","observation_id":"5d3013a8-c5cd-43e0-bdfe-d4519226568b","resolution":{"observed_at":"2026-08-05T17:13:08.100077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04087","last_updated":"2023-12-28T16:01:36Z","snapshot_observed_at":"2026-08-06T02:13:50.627750Z","submitted_at":"2023-07-09T03:25:14Z","title":"SVIT: Scaling up Visual Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04087","snapshot_observed_at":"2026-08-05T12:27:27.703738Z","title":"Svit: Scaling up visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-08T14:14:58.948394Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.703738Z"},"links":{"cited_paper":"/paper/2307.04087","citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:4a3557690665b7c195214c9a0048a0e50a93f11e6532a365c711e1f62339bf5b","observation_id":"bdb9d7e0-39e1-48e3-879a-fda3f07ec52d","resolution":{"observed_at":"2026-08-05T12:27:27.703738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04087","last_updated":"2023-12-28T16:01:36Z","snapshot_observed_at":"2026-08-06T02:13:50.627750Z","submitted_at":"2023-07-09T03:25:14Z","title":"SVIT: Scaling up Visual Instruction Tuning","version":3},"cited_work":{"arxiv_id":"2307.04087","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.04087","snapshot_observed_at":"2026-07-02T15:07:03.935337Z","title":"Svit: Scaling up visual instruction tuning","venue":null,"work_id":"cb1fc191-de60-4941-87ad-8829d88f83c2","year":2023},"citing_paper":{"arxiv_id":"2605.02589","last_updated":"2026-05-04T13:37:13Z","snapshot_observed_at":"2026-08-06T04:06:43.982074Z","submitted_at":"2026-05-04T13:37:13Z","title":"Representation learning from OCT images","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-08T18:32:13.800433Z"},"links":{"cited_paper":"/paper/2307.04087","citing_paper":"/paper/2605.02589"},"observation_digest":"sha256:05672a40d9d10bd97a8188e483c732862f251b90990971cea195d73639f62ce5","observation_id":"dc141185-86d2-427e-8b9e-36bf929837b3","resolution":{"observed_at":"2026-05-09T06:20:43.123677Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04087","last_updated":"2023-12-28T16:01:36Z","snapshot_observed_at":"2026-08-06T02:13:50.627750Z","submitted_at":"2023-07-09T03:25:14Z","title":"SVIT: Scaling up Visual Instruction Tuning","version":3},"cited_work":{"arxiv_id":"2307.04087","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.04087","snapshot_observed_at":"2026-07-02T15:07:03.935337Z","title":"Svit: Scaling up visual instruction tuning","venue":null,"work_id":"cb1fc191-de60-4941-87ad-8829d88f83c2","year":2023},"citing_paper":{"arxiv_id":"2605.03426","last_updated":"2026-05-05T07:02:50Z","snapshot_observed_at":"2026-07-06T23:16:20.322265Z","submitted_at":"2026-05-05T07:02:50Z","title":"Replacing Parameters with Preferences: Federated Alignment of Heterogeneous Vision-Language Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-07T04:07:58.031100Z"},"links":{"cited_paper":"/paper/2307.04087","citing_paper":"/paper/2605.03426"},"observation_digest":"sha256:94f55bffa3e3f104612345cb51eb7ed3fa69614001e690b3db4a5843ed73df76","observation_id":"a0308b5f-a2a2-417c-b789-1feb6cd8f6f3","resolution":{"observed_at":"2026-05-12T10:41:30.831974Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04087","last_updated":"2023-12-28T16:01:36Z","snapshot_observed_at":"2026-08-06T02:13:50.627750Z","submitted_at":"2023-07-09T03:25:14Z","title":"SVIT: Scaling up Visual Instruction Tuning","version":3},"cited_work":{"arxiv_id":"2307.04087","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.04087","snapshot_observed_at":"2026-07-02T15:07:03.935337Z","title":"Svit: Scaling up visual instruction tuning","venue":null,"work_id":"cb1fc191-de60-4941-87ad-8829d88f83c2","year":2023},"citing_paper":{"arxiv_id":"2605.21300","last_updated":"2026-05-20T15:29:20Z","snapshot_observed_at":"2026-07-06T23:31:46.877766Z","submitted_at":"2026-05-20T15:29:20Z","title":"Reducing Object Hallucination in LVLMs via Emphasizing Image-negative Tokens","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-21T05:07:12.965100Z"},"links":{"cited_paper":"/paper/2307.04087","citing_paper":"/paper/2605.21300"},"observation_digest":"sha256:2cdf21bd03039864044389fa7df91927bd19014bf1b6b86f8cb60760ccacaf12","observation_id":"f63dd66d-a399-45fe-96fa-9ec78afd9d6b","resolution":{"observed_at":"2026-05-21T05:09:38.498516Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04087","last_updated":"2023-12-28T16:01:36Z","snapshot_observed_at":"2026-08-06T02:13:50.627750Z","submitted_at":"2023-07-09T03:25:14Z","title":"SVIT: Scaling up Visual Instruction Tuning","version":3},"cited_work":{"arxiv_id":"2307.04087","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.04087","snapshot_observed_at":"2026-07-02T15:07:03.935337Z","title":"Svit: Scaling up visual instruction tuning","venue":null,"work_id":"cb1fc191-de60-4941-87ad-8829d88f83c2","year":2023},"citing_paper":{"arxiv_id":"2606.05552","last_updated":"2026-06-04T01:06:52Z","snapshot_observed_at":"2026-07-06T23:45:33.157370Z","submitted_at":"2026-06-04T01:06:52Z","title":"Balancing Image Compression and Generation with Bootstrapped Tokenization","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-28T03:07:33.054518Z"},"links":{"cited_paper":"/paper/2307.04087","citing_paper":"/paper/2606.05552"},"observation_digest":"sha256:93e44a6af4ac815b75db90a3cb97563b012f3bc4da93b4a64700af14d90593db","observation_id":"9d25ec62-a039-4f2b-8215-c6e822ac182c","resolution":{"observed_at":"2026-07-02T11:46:55.411770Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04087","last_updated":"2023-12-28T16:01:36Z","snapshot_observed_at":"2026-08-06T02:13:50.627750Z","submitted_at":"2023-07-09T03:25:14Z","title":"SVIT: Scaling up Visual Instruction Tuning","version":3},"cited_work":{"arxiv_id":"2307.04087","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.04087","snapshot_observed_at":"2026-07-02T15:07:03.935337Z","title":"Svit: Scaling up visual instruction tuning","venue":null,"work_id":"cb1fc191-de60-4941-87ad-8829d88f83c2","year":2023},"citing_paper":{"arxiv_id":"2607.00465","last_updated":"2026-07-01T05:34:07Z","snapshot_observed_at":"2026-08-02T15:57:39.914387Z","submitted_at":"2026-07-01T05:34:07Z","title":"StochasT: Learning with Stochastic Turn Depth for Visual Instruction Tuning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-02T15:04:18.880016Z"},"links":{"cited_paper":"/paper/2307.04087","citing_paper":"/paper/2607.00465"},"observation_digest":"sha256:2a36b2019af6568f015ad6996b71224ddf8d72c8e3c107880e92e49086583923","observation_id":"db848888-a092-4d1f-9fa6-ed77bb9ad570","resolution":{"observed_at":"2026-07-02T15:07:03.936899Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04087","last_updated":"2023-12-28T16:01:36Z","snapshot_observed_at":"2026-08-06T02:13:50.627750Z","submitted_at":"2023-07-09T03:25:14Z","title":"SVIT: Scaling up Visual Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04087","snapshot_observed_at":"2026-08-01T16:31:11.447932Z","title":"SVIT: Scaling up Visual Instruction Tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-07T12:37:24.746296Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.447932Z"},"links":{"cited_paper":"/paper/2307.04087","citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:193c192d379a41000bcbf2d85a9180f9237a824ea0cf7857fbafebb099e307aa","observation_id":"fe6631cc-985d-41ee-a96b-da517e43bb84","resolution":{"observed_at":"2026-08-01T16:31:11.447932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2307.04087/citation-record","integrity":"/paper/2307.04087/integrity","json":"/paper/2307.04087/citation-record.json","paper":"/paper/2307.04087"},"outbound":[],"paper":{"arxiv_id":"2307.04087","last_updated":"2023-12-28T16:01:36Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T02:13:50.627750Z","submitted_at":"2023-07-09T03:25:14Z","title":"SVIT: Scaling up Visual Instruction Tuning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 28 inbound Pith citation observations for arXiv:2307.04087."}