{"as_of":"2026-08-09T06:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ca6784aae619426d91dba0544c3f2aa8a1171e33b8f485420ccd26fd1153f960","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":40,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T17:13:26.039380Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T15:39:56.491911Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":"2306.17107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-07-04T15:39:56.491911Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":"dd29277b-f960-4169-9950-f29ae3062657","year":2023},"citing_paper":{"arxiv_id":"2305.03726","last_updated":"2025-07-28T05:33:36Z","snapshot_observed_at":"2026-07-06T15:23:52.761222Z","submitted_at":"2023-05-05T17:59:46Z","title":"Otter: A Multi-Modal Model with In-Context Instruction Tuning","version":2},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-05-15T02:43:47.775691Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2305.03726"},"observation_digest":"sha256:28bd195e6d27aa3b43861e8d1463c8bf8a33587ee792eebfe485eb563f3c594c","observation_id":"d4bfc8e1-85d5-47e8-bb2f-fba9bc7fdeb5","resolution":{"observed_at":"2026-05-15T02:43:47.915256Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":"2306.17107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-07-04T15:39:56.491911Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":"dd29277b-f960-4169-9950-f29ae3062657","year":2023},"citing_paper":{"arxiv_id":"2308.12067","last_updated":"2026-04-12T14:13:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-23T11:27:30Z","title":"MM-LIMA: Less Is More for Alignment in Multi-Modal Datasets","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-24T08:13:18.191233Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2308.12067"},"observation_digest":"sha256:27f398ca080bb8a9cc0c9e5cfd2d9e72484ce4505e128a83b8ebeb76c789b2eb","observation_id":"9f0d2089-6468-4dae-8b88-6b1cde9056d4","resolution":{"observed_at":"2026-05-24T08:14:10.243558Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":"2306.17107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-07-04T15:39:56.491911Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":"dd29277b-f960-4169-9950-f29ae3062657","year":2023},"citing_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-12T19:11:33.783746Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2310.03744"},"observation_digest":"sha256:52d2cbe6bbdd907aaa19e5b42ad1b31344d398b4088e523d82c87e952a20f22f","observation_id":"f81cb006-3de7-4356-a7d2-478facbfd48b","resolution":{"observed_at":"2026-05-12T19:11:33.983508Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":"2306.17107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-07-04T15:39:56.491911Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":"dd29277b-f960-4169-9950-f29ae3062657","year":2023},"citing_paper":{"arxiv_id":"2310.14566","last_updated":"2024-03-25T06:05:24Z","snapshot_observed_at":"2026-08-02T21:20:28.501823Z","submitted_at":"2023-10-23T04:49:09Z","title":"HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models","version":5},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-17T01:22:04.035994Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2310.14566"},"observation_digest":"sha256:ed5df20048714f826d39220db3f7b2487c6d7e2290c0a1dae7d9b402b8167ccc","observation_id":"3d5da0f1-f352-4fc5-ad69-54e92950cc89","resolution":{"observed_at":"2026-05-17T01:22:04.209988Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":"2306.17107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-07-04T15:39:56.491911Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":"dd29277b-f960-4169-9950-f29ae3062657","year":2023},"citing_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"reference_index":183,"source":"pdf_text","source_observed_at":"2026-05-13T22:46:09.693156Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2312.14238"},"observation_digest":"sha256:893b7ef4ccdad82b1eb590ea20d86271e68def4aa34a1cf44fd527a750c625ca","observation_id":"752f4153-e37b-4e86-9fd2-0590c19295c6","resolution":{"observed_at":"2026-05-13T22:46:10.257255Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":"2306.17107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-07-04T15:39:56.491911Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":"dd29277b-f960-4169-9950-f29ae3062657","year":2023},"citing_paper":{"arxiv_id":"2401.15947","last_updated":"2024-12-23T08:05:14Z","snapshot_observed_at":"2026-08-06T02:31:58.372974Z","submitted_at":"2024-01-29T08:13:40Z","title":"MoE-LLaVA: Mixture of Experts for Large Vision-Language Models","version":5},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-16T02:33:30.143907Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2401.15947"},"observation_digest":"sha256:4afed6d6c7a5e57a06d8d9acfb86d5062871f66ac18c1e2dd10c4c56b20eaac1","observation_id":"0ee7bdb2-737a-4bac-bedd-c87c5c5dc7ec","resolution":{"observed_at":"2026-05-16T02:33:30.227169Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":"2306.17107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-07-04T15:39:56.491911Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":"dd29277b-f960-4169-9950-f29ae3062657","year":2023},"citing_paper":{"arxiv_id":"2403.04652","last_updated":"2025-01-21T10:12:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-07T16:52:49Z","title":"Yi: Open Foundation Models by 01.AI","version":3},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-13T05:47:27.775529Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2403.04652"},"observation_digest":"sha256:579f40c573afa9608b4eb5f242ed7b7c78ea737504d554f65ab12d421a12ae94","observation_id":"da761b21-bc1c-4309-9a6b-0202105cea7a","resolution":{"observed_at":"2026-05-13T05:47:27.946357Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":"2306.17107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-07-04T15:39:56.491911Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":"dd29277b-f960-4169-9950-f29ae3062657","year":2023},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:a83224d4cdd55b7ad0c6928c725c22ebbc166a9e7782aa0f2456c51f8f97c7b9","observation_id":"40490174-7897-4290-ba07-fe31d5bcba88","resolution":{"observed_at":"2026-05-15T22:48:36.149695Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":"2306.17107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-07-04T15:39:56.491911Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":"dd29277b-f960-4169-9950-f29ae3062657","year":2023},"citing_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"reference_index":149,"source":"pdf_text","source_observed_at":"2026-05-17T00:05:03.547664Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2406.16860"},"observation_digest":"sha256:d72793aeffdd975cd0837b2e0984a374dfca34142b7c55b1213f290f3dd41dd4","observation_id":"7961a538-9c52-4f4e-b58f-0293a8b8c28b","resolution":{"observed_at":"2026-05-17T00:05:03.865968Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":"2306.17107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-07-04T15:39:56.491911Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":"dd29277b-f960-4169-9950-f29ae3062657","year":2023},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":118,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:7a393c7a51f0728d02834b5b1b0bd90e43fdbfe14ac1749b6819b3d7012e6630","observation_id":"a0c9ca41-5014-4f37-9a4e-26ea794e962c","resolution":{"observed_at":"2026-05-10T21:07:32.151963Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":"2306.17107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-07-04T15:39:56.491911Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":"dd29277b-f960-4169-9950-f29ae3062657","year":2023},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":168,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:2db12a7bb88da8a04f4df6b61ed74c6957758b4d0a66ddc98bbaaf2504b9ad5e","observation_id":"43929916-c215-4956-965e-51a3ddd062bb","resolution":{"observed_at":"2026-05-10T14:23:49.586902Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":"2306.17107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-07-04T15:39:56.491911Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":"dd29277b-f960-4169-9950-f29ae3062657","year":2023},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":115,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:cbdcc9383b4d6f58ea44de8d0c8224c94777e05a6ed8ba89d8fd952dfaf5ab44","observation_id":"7d29eb95-245f-4fdb-a75d-d9ca6d406c35","resolution":{"observed_at":"2026-05-23T07:42:43.046117Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":"2306.17107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-07-04T15:39:56.491911Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":"dd29277b-f960-4169-9950-f29ae3062657","year":2023},"citing_paper":{"arxiv_id":"2412.14164","last_updated":"2024-12-18T18:58:50Z","snapshot_observed_at":"2026-08-08T15:05:21.947334Z","submitted_at":"2024-12-18T18:58:50Z","title":"MetaMorph: Multimodal Understanding and Generation via Instruction Tuning","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-05-17T07:51:12.953777Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2412.14164"},"observation_digest":"sha256:e9460e278c98452edbcb8ecced4a16ffc8ca7ac66bfbf48daf464cb6d93e3d20","observation_id":"0ade628d-a4e4-4dfa-9dd1-ceeb3e3f2dc9","resolution":{"observed_at":"2026-05-17T07:51:13.090250Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":"2306.17107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-07-04T15:39:56.491911Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":"dd29277b-f960-4169-9950-f29ae3062657","year":2023},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-07T17:13:10.057242Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:b6e8ace97b2a7838713d29f1aa7029c82f9ef63be01757d43ca82a3d6234d042","observation_id":"a793304d-b92d-4fa4-8199-35015e9dc1ae","resolution":{"observed_at":"2026-05-17T20:33:26.773900Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":"2306.17107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-07-04T15:39:56.491911Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":"dd29277b-f960-4169-9950-f29ae3062657","year":2023},"citing_paper":{"arxiv_id":"2504.09925","last_updated":"2026-04-29T06:12:36Z","snapshot_observed_at":"2026-08-02T07:57:37.201421Z","submitted_at":"2025-04-14T06:33:29Z","title":"FLARE: Fully Integration of Vision-Language Representations for Deep Cross-Modal Understanding","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-22T19:49:00.961388Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2504.09925"},"observation_digest":"sha256:2911f54b5e0cd7f08dfb648ef51efda6ebf4332bdbdeb5aa37f7752c503d4bbc","observation_id":"e83eed00-f88e-40ce-8d5a-061b7c511f41","resolution":{"observed_at":"2026-05-22T19:52:01.814828Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":"2306.17107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-07-04T15:39:56.491911Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":"dd29277b-f960-4169-9950-f29ae3062657","year":2023},"citing_paper":{"arxiv_id":"2505.17726","last_updated":"2026-05-19T09:55:01Z","snapshot_observed_at":"2026-08-03T09:08:10.935540Z","submitted_at":"2025-05-23T10:43:45Z","title":"Slot-MLLM: Object-Centric Visual Tokenization for Multimodal LLM","version":3},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-22T02:06:35.204166Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2505.17726"},"observation_digest":"sha256:0cd74cfd3b15220d07f36e16d24cd1ba9d72fa7f54720de8ae4d68b3ea011a51","observation_id":"b4f09d17-eaf0-4993-bfdf-572bab3e51df","resolution":{"observed_at":"2026-05-22T02:10:56.107060Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-08-07T14:37:54.258922Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:54.258922Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:fc27693fcffb1d80470cec685261e2c85d9132244326f526a7036808f690528c","observation_id":"a346cf23-6cad-4a8b-867c-efcd33e76a44","resolution":{"observed_at":"2026-08-07T14:37:54.258922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-08-07T14:04:57.989894Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:57.989894Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:aecf7db498d2235e4a527bd65e3fc44b3802c58fe28b0502c71746dcdb62fc49","observation_id":"b6e354e6-b377-4bf1-90e4-2954bd1181c7","resolution":{"observed_at":"2026-08-07T14:04:57.989894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-08-07T14:02:52.067992Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding.arXiv preprint arXiv:2306.17107, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-07T13:53:51.495895Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:52.067992Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2505.20256"},"observation_digest":"sha256:f8fe46deccb1f792121c24642edd0e4ecac59cf74c71b71689bbe17e5edb4baf","observation_id":"89728534-4ffa-413d-875c-af011ef21c29","resolution":{"observed_at":"2026-08-07T14:02:52.067992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-08-07T12:42:27.922748Z","title":"LLaV AR: En- hanced visual instruction tuning for text-rich image under- standing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-08T00:05:10.710300Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":109,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:27.922748Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:0db34efcc2d7f8b68ad29fb2d90496c6c95291838c8fbf89f3425a210882f3fe","observation_id":"e5a0e74d-ac7d-4915-8c45-3e16b5a9adaa","resolution":{"observed_at":"2026-08-07T12:42:27.922748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-08-07T06:02:30.509268Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":113,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.509268Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:370a97f9f2fa7bd31a2aa8268a90bfa9bafef928b68c955554b886da933a7c43","observation_id":"b6a9aadf-9721-470a-a358-3ea30994739c","resolution":{"observed_at":"2026-08-07T06:02:30.509268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-08-07T05:34:56.492581Z","title":"Llavar: Enhanced visual instruction tuning for text-rich im- 14 age understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.492581Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:597d8e73fbd72edced34303df4b4a260c6d2288e643e6324e3373e9edd5b1442","observation_id":"ccec615d-d13e-4de7-ba4d-53c35f5b8de5","resolution":{"observed_at":"2026-08-07T05:34:56.492581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-08-06T23:57:28.750521Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15681","last_updated":"2026-06-25T14:33:27Z","snapshot_observed_at":"2026-08-08T08:54:57.204006Z","submitted_at":"2025-06-18T17:59:49Z","title":"GenRecal: Generation after Recalibration from Large to Small Vision-Language Models","version":4},"reference_index":122,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:28.750521Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2506.15681"},"observation_digest":"sha256:5e0d343c18a48add0176f7147dd07c0e2f9e8436aaec236d69cd9646ec5ffa4b","observation_id":"b24f0e5f-e49b-4afd-83d0-bc32bddfb148","resolution":{"observed_at":"2026-08-06T23:57:28.750521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-08-06T20:25:23.916976Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image under- standing,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02804","last_updated":"2026-06-28T12:40:31Z","snapshot_observed_at":"2026-08-08T16:13:23.244408Z","submitted_at":"2025-07-03T17:07:20Z","title":"Multimodal Mathematical Reasoning with Diverse Solving Perspective","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:23.916976Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2507.02804"},"observation_digest":"sha256:e9be5268700b7334455ded2e450ae43887415394db045f1fa5621e15fc4c814c","observation_id":"a96f1011-b795-4124-9646-29a6fe338376","resolution":{"observed_at":"2026-08-06T20:25:23.916976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-08-06T18:43:21.283146Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07572","last_updated":"2025-07-10T09:18:06Z","snapshot_observed_at":"2026-08-06T18:35:13.554849Z","submitted_at":"2025-07-10T09:18:06Z","title":"Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T18:43:21.283146Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2507.07572"},"observation_digest":"sha256:dc4cdc42e6c4145ca219c60461f8383800e433d8e7c2177c53b5027eebfd9027","observation_id":"568769e4-9114-4bd8-9e2e-fe8d9b7c8914","resolution":{"observed_at":"2026-08-06T18:43:21.283146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-08-06T18:24:54.680277Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:54.680277Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:c3f5052676b06ff8a2afa3ae683f5eb9d200cc743a8d09df9886cb5b9321ed3f","observation_id":"40b253b0-067d-4f80-b54f-90b17167e97a","resolution":{"observed_at":"2026-08-06T18:24:54.680277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-08-06T17:59:07.601054Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09531","last_updated":"2025-07-13T08:15:11Z","snapshot_observed_at":"2026-08-08T22:53:46.846502Z","submitted_at":"2025-07-13T08:15:11Z","title":"VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T17:59:07.601054Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2507.09531"},"observation_digest":"sha256:8e5f67f70c2cf4449f71c2e4fb6d35814f9bd488ea156f5543f17676f842c13d","observation_id":"1a888602-e291-42c8-9625-1461a92fcc8a","resolution":{"observed_at":"2026-08-06T17:59:07.601054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":"2306.17107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-07-04T15:39:56.491911Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":"dd29277b-f960-4169-9950-f29ae3062657","year":2023},"citing_paper":{"arxiv_id":"2507.09861","last_updated":"2026-04-21T13:31:05Z","snapshot_observed_at":"2026-07-06T21:56:35.665677Z","submitted_at":"2025-07-14T02:10:31Z","title":"A Survey on MLLM-based Visually Rich Document Understanding: Methods, Challenges, and Emerging Trends","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-05-19T04:38:49.512293Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2507.09861"},"observation_digest":"sha256:fc5016ffe00c515bd10aa312ad71b92185f1fd73c6182a78c556b1b4ead02737","observation_id":"7b8f319d-4258-4591-95f7-2899fd3f623a","resolution":{"observed_at":"2026-05-19T04:42:04.346263Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-08-06T15:14:17.448064Z","title":"Zhao, Y .; Zhang, H.; Xie, L.; Hu, T.; Gan, G.; Long, Y .; Hu, Z.; Chen, W.; Li, C.; Xu, Z.; et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16878","last_updated":"2025-07-22T12:29:13Z","snapshot_observed_at":"2026-08-08T07:13:57.213076Z","submitted_at":"2025-07-22T12:29:13Z","title":"CausalStep: A Benchmark for Explicit Stepwise Causal Reasoning in Videos","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T15:14:17.448064Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2507.16878"},"observation_digest":"sha256:9abb1e8e14579e35bb076ebbc9a8a9f938f167172ed82ec8418db33e85816764","observation_id":"e5af482a-0791-40c7-92f8-9b122181d297","resolution":{"observed_at":"2026-08-06T15:14:17.448064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-08-05T17:13:08.096024Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-08T23:47:29.548798Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:08.096024Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:cf457da1782adaf736e02e9b9ea4da54aa9d53c3cf6bc64b7430e8ae98221563","observation_id":"9f7999db-19ce-4621-af6c-b8935cf10a27","resolution":{"observed_at":"2026-08-05T17:13:08.096024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":"2306.17107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-07-04T15:39:56.491911Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":"dd29277b-f960-4169-9950-f29ae3062657","year":2023},"citing_paper":{"arxiv_id":"2605.00877","last_updated":"2026-05-06T12:52:11Z","snapshot_observed_at":"2026-07-06T23:14:11.211164Z","submitted_at":"2026-04-25T14:53:37Z","title":"OceanPile: A Large-Scale Multimodal Ocean Corpus for Foundation Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-09T20:50:57.818064Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2605.00877"},"observation_digest":"sha256:13fc9ca24aa0d60f21e2661534e5dc51fdd3301fc2ce2b1a2f2e373aa455d92e","observation_id":"2bbfdfc6-adfc-4968-8047-9ba9f6bab163","resolution":{"observed_at":"2026-05-11T14:56:06.970215Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":"2306.17107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-07-04T15:39:56.491911Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":"dd29277b-f960-4169-9950-f29ae3062657","year":2023},"citing_paper":{"arxiv_id":"2605.03426","last_updated":"2026-05-05T07:02:50Z","snapshot_observed_at":"2026-07-06T23:16:20.322265Z","submitted_at":"2026-05-05T07:02:50Z","title":"Replacing Parameters with Preferences: Federated Alignment of Heterogeneous Vision-Language Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-07T04:07:58.031100Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2605.03426"},"observation_digest":"sha256:6b858a8bb0288c6715dc5669b0c8da78c6a1fc6cd37f63f29849aeb3396742d5","observation_id":"000e01be-5b7f-4368-870a-4cb39fd6e76e","resolution":{"observed_at":"2026-05-12T10:41:30.856645Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":"2306.17107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-07-04T15:39:56.491911Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":"dd29277b-f960-4169-9950-f29ae3062657","year":2023},"citing_paper":{"arxiv_id":"2606.07289","last_updated":"2026-06-05T14:00:47Z","snapshot_observed_at":"2026-08-01T07:32:32.007503Z","submitted_at":"2026-06-05T14:00:47Z","title":"Closed-Form Spectral Regularization for Multi-Task Model Merging","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-06-27T22:40:00.510742Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2606.07289"},"observation_digest":"sha256:04662693a0be5768f9aa405c28a0ebe9dc75de68cc18c1dfc26bafc71b7f5f8b","observation_id":"d7ab97c0-7887-4c80-bb99-5e36e3e042cc","resolution":{"observed_at":"2026-07-02T16:27:09.385400Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":"2306.17107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-07-04T15:39:56.491911Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":"dd29277b-f960-4169-9950-f29ae3062657","year":2023},"citing_paper":{"arxiv_id":"2606.09132","last_updated":"2026-06-08T07:30:20Z","snapshot_observed_at":"2026-08-05T18:32:48.128378Z","submitted_at":"2026-06-08T07:30:20Z","title":"Vision Language Model Helps Private Information De-Identification in Vision Data","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-27T16:29:33.294960Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2606.09132"},"observation_digest":"sha256:717ca77c823fd62d55f766d7e989e2b1313b5839fcf748445975079e54f0f1a6","observation_id":"b85f4393-3752-4c7b-afd8-3bd4d3ec02eb","resolution":{"observed_at":"2026-07-03T01:27:31.578905Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":"2306.17107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-07-04T15:39:56.491911Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":"dd29277b-f960-4169-9950-f29ae3062657","year":2023},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":228,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:f672a1bea445107efb87e7bfbdcc32251976a8b64035212c7237aa829ee37e99","observation_id":"c5bd9300-5a26-42df-9cc6-136b81cfbea2","resolution":{"observed_at":"2026-07-03T10:48:03.219425Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":"2306.17107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-07-04T15:39:56.491911Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":"dd29277b-f960-4169-9950-f29ae3062657","year":2023},"citing_paper":{"arxiv_id":"2606.26287","last_updated":"2026-06-24T18:34:00Z","snapshot_observed_at":"2026-07-07T00:00:36.766142Z","submitted_at":"2026-06-24T18:34:00Z","title":"GeMoE: Gating Entropy is All You Need for Uncertainty-aware Adaptive Routing in MoE-based Large Vision-Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-26T01:32:40.435742Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2606.26287"},"observation_digest":"sha256:34707ad39b93889c431f63a0c41cff4dc2798106d1b4a48e1b3267850a30df7a","observation_id":"422eb2e9-c7f5-49af-a622-94650ef89f12","resolution":{"observed_at":"2026-07-04T15:39:56.493243Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding.arXiv preprint arXiv:2306.17107, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":135,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:4191d3e3c4771ee3d54a90158ffa496ff68d7c7112132036895269f9aa99358c","observation_id":"929cea13-7215-4400-b797-b5db081d1334","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-08-01T04:30:11.681602Z","title":"arXiv preprint arXiv:2306.17107 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22531","last_updated":"2026-07-24T17:59:39Z","snapshot_observed_at":"2026-08-07T13:04:18.211748Z","submitted_at":"2026-07-24T17:59:39Z","title":"Twins: Learn to Predict Unified Representations with Focal Loss","version":1},"reference_index":282,"source":"arxiv_source","source_observed_at":"2026-08-01T04:30:11.681602Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2607.22531"},"observation_digest":"sha256:8ffc352d399aab5c711c85215c5a03946d97fafe79ad71793d08d8a3d0095bc8","observation_id":"a7a7a505-b829-4e90-9f55-e476e8698b32","resolution":{"observed_at":"2026-08-01T04:30:11.681602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-08-04T17:23:16.244130Z","title":"arXiv preprint arXiv:2306.17107 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01979","last_updated":"2026-08-03T09:42:34Z","snapshot_observed_at":"2026-08-09T03:14:31.292514Z","submitted_at":"2026-08-03T09:42:34Z","title":"ET-Prune: Evidence-Aware Dynamic Budgeting for Visual Token Pruning in Text-Rich MLLMs","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T17:23:16.244130Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2608.01979"},"observation_digest":"sha256:937a038c373ec1cd00c79b0a9f3be1b58a8e09841edb32dc30ed99072a8ca8e9","observation_id":"af204b94-4cd4-4e3f-91de-fc9cdbedc8e3","resolution":{"observed_at":"2026-08-04T17:23:16.244130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-08-08T17:13:26.039380Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding.arXiv preprint arXiv:2306.17107, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05249","last_updated":"2026-08-05T15:55:15Z","snapshot_observed_at":"2026-08-09T06:10:44.823264Z","submitted_at":"2026-08-05T15:55:15Z","title":"PRISM: Priority-aware Rubric Internalization via Structured Multimodal Data Synthesis","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T17:13:26.039380Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2608.05249"},"observation_digest":"sha256:e001dbe2dd777097555d0c1c7284773ad6ea7ed06387b2eaa618a0a1d0232b37","observation_id":"7cab4f00-62f7-40d1-9b1f-c814d20e9488","resolution":{"observed_at":"2026-08-08T17:13:26.039380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2306.17107/citation-record","integrity":"/paper/2306.17107/integrity","json":"/paper/2306.17107/citation-record.json","paper":"/paper/2306.17107"},"outbound":[],"paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 40 inbound Pith citation observations for arXiv:2306.17107."}