{"as_of":"2026-08-07T23:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cedb039bdf32ced1fb8b9a09d6cbc87caf47c21d130dc3190fb2c9aae28ce465","coverage":[{"denominator":90,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":90,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:37:54.579360Z","state":"measured"},{"denominator":90,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":90,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.18115/citation-record","integrity":"/paper/2505.18115/integrity","json":"/paper/2505.18115/citation-record.json","paper":"/paper/2505.18115"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:46.891987Z","title":"anthropic.com/news/claude-3-family, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:46.891987Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:7f0b8ab77008f8a3e19cefb26a70c37da38c4c9aea539df1c1420ef74d4edc1e","observation_id":"46b57075-b50b-4e2b-8eda-d6c7d4a00491","resolution":{"observed_at":"2026-08-07T14:37:46.891987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-07T14:37:46.984855Z","title":"Phi-3 technical report: A highly capable language model locally on your phone.arXiv preprint arXiv:2404.14219, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:46.984855Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:7ceb3a6f54dc65067434228452f1e471ea9bb5e130338a420ee1560710c5452a","observation_id":"782c97b6-a0ee-48a1-98b5-ddaddf9a3ffe","resolution":{"observed_at":"2026-08-07T14:37:46.984855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:47.057781Z","title":"Easyocr: Ready-to-use ocr with 80+ supported languages, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:47.057781Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:b034df2376f71ca50382f34725cd751870c302a49cbfcd27aeb69404b4fa1b95","observation_id":"104d0814-623d-4e48-b819-5e760535fa89","resolution":{"observed_at":"2026-08-07T14:37:47.057781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-07T14:37:47.145455Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:47.145455Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:d67df726ca5b7c16cbf455eaf4581a1c5d0f273ce58a9d5b1d36c3e22b38d369","observation_id":"796be892-b44a-4377-ac8d-ab004995c347","resolution":{"observed_at":"2026-08-07T14:37:47.145455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:47.204766Z","title":"Visual instruction tuning with polite flamingo, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:47.204766Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:3aa37e00948133bfa34e3d0a49b1562eda0e3f409a6567176b2792506f1a9d78","observation_id":"651eafbd-c59b-4130-9934-46bd7538a63c","resolution":{"observed_at":"2026-08-07T14:37:47.204766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04160","last_updated":"2023-05-22T02:37:02Z","snapshot_observed_at":"2026-08-03T10:34:58.776935Z","submitted_at":"2023-05-07T02:25:42Z","title":"X-LLM: Bootstrapping Advanced Large Language Models by Treating Multi-Modalities as Foreign Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.04160","snapshot_observed_at":"2026-08-07T14:37:47.318544Z","title":"X-llm: Bootstrapping ad- vanced large language models by treating multi-modalities as foreign languages.arXiv preprint arXiv:2305.04160, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:47.318544Z"},"links":{"cited_paper":"/paper/2305.04160","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:2d1760b18e9c09b2b2a648c83ff3bb789496a49cf98776328bb636ed81fb6e72","observation_id":"c831eee2-e73b-417e-9027-f3269ee61fb9","resolution":{"observed_at":"2026-08-07T14:37:47.318544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-08-07T14:37:47.428346Z","title":"Allava: Harness- ing gpt4v-synthesized data for a lite vision-language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:47.428346Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:1e390b045b8b27633a48872ae8f771f576fb81d10a4973c937ecce03f8006118","observation_id":"5cb8c7c1-401d-412e-8e3e-0e7c97190d55","resolution":{"observed_at":"2026-08-07T14:37:47.428346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:47.525458Z","title":"A spatial-temporal attention- based method and a new dataset for remote sensing image change detection.Remote Sensing, 12(10), 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:47.525458Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:9c66dd140b4956e573165c89b9c485509b3d3a5e8c529084315e896738c6ebe8","observation_id":"b95a4dfe-e21a-45e8-b711-6b0a9c66063b","resolution":{"observed_at":"2026-08-07T14:37:47.525458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-04T08:17:54.774738Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-07T14:37:47.643807Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:47.643807Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:496abc451d9f64fa5a74e6a4f4c7e2d30759a4dbbfdbbb7fcc697df397999499","observation_id":"bd16a6c8-3983-407a-bbbc-0a74463d333d","resolution":{"observed_at":"2026-08-07T14:37:47.643807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-07-06T18:26:42.010940Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-07T14:37:47.747310Z","title":"Sharegpt4video: Improving video understand- ing and generation with better captions.arXiv preprint arXiv:2406.04325, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:47.747310Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:c3f9928d664b8831d8f7307122e8662ea9656690b52eb9721708e16f05d51abe","observation_id":"b005e4b9-97e1-43e2-939f-20470ea8ce43","resolution":{"observed_at":"2026-08-07T14:37:47.747310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:47.869048Z","title":"Lawrence Zit- nick","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:47.869048Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:93fb250047590e5573fc62f0c3d7272135d2462b760bf0888a721a8e0ca46055","observation_id":"f9834eef-a3de-46c0-862d-9ffd3fdb35b8","resolution":{"observed_at":"2026-08-07T14:37:47.869048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-07T14:37:47.991699Z","title":"Microsoft coco captions: Data collection and evaluation server.arXiv preprint arXiv:1504.00325, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:47.991699Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:ab9bd469ea2ff90b1a082d0c452e01d37cb3a7ef57e55e7f3e9cf6325b5ad23c","observation_id":"9996ac57-7c7b-4b9a-87ba-f060f5621bb1","resolution":{"observed_at":"2026-08-07T14:37:47.991699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-08-07T14:37:48.067033Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks.arXiv preprint arXiv:2312.14238, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:48.067033Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:e9088adf448df2766ea58b96df1f124fa87ec20849142e470f3b93ca6a274242","observation_id":"2099f931-f9a5-4ddb-ad83-46088d849220","resolution":{"observed_at":"2026-08-07T14:37:48.067033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:48.157821Z","title":"InstructBLIP: Towards General-purpose Vision- Language Models with Instruction Tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:48.157821Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:6f9c9625fa5c2fa8b023b14e143dc3f1681899e20b82eb678650735a77b86ac4","observation_id":"f14b0b32-e92c-413b-97d5-96e04a4e1db4","resolution":{"observed_at":"2026-08-07T14:37:48.157821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-07T14:37:48.256692Z","title":"Molmo and pixmo: Open weights and open data for state-of-the-art multimodal models.arXiv preprint arXiv:2409.17146, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:48.256692Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:b1152743e37a12c24d390b5f25c4cd61b1ac3bf9044e30bd22a141172bfa2306","observation_id":"60b60378-128d-4a51-bfab-a54d8ec06a15","resolution":{"observed_at":"2026-08-07T14:37:48.256692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17453","last_updated":"2024-10-31T23:23:22Z","snapshot_observed_at":"2026-07-06T18:51:23.832577Z","submitted_at":"2024-07-24T17:37:05Z","title":"VILA$^2$: VILA Augmented VILA","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17453","snapshot_observed_at":"2026-08-07T14:37:48.380183Z","title":"Vila 2: Vila augmented vila.arXiv preprint arXiv:2407.17453, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:48.380183Z"},"links":{"cited_paper":"/paper/2407.17453","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:9d6783967144029dce2bd715f89c34fa28271318808fff0e0b907c1748c5fd01","observation_id":"5b0978de-f67e-4d56-95cc-d7f8b6cb2cb6","resolution":{"observed_at":"2026-08-07T14:37:48.380183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.15010","last_updated":"2023-04-28T17:59:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-28T17:59:25Z","title":"LLaMA-Adapter V2: Parameter-Efficient Visual Instruction Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.15010","snapshot_observed_at":"2026-08-07T14:37:48.490128Z","title":"Llama-adapter v2: Parameter-efficient vi- sual instruction model.arXiv preprint arXiv:2304.15010,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:48.490128Z"},"links":{"cited_paper":"/paper/2304.15010","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:4e2a29b5969ce5ddcfcfb66b1c5b7a3dfb96af8547feda200e10bdaf55050dde","observation_id":"d7ecdb0d-2492-49a6-a8cc-52313f9dbd76","resolution":{"observed_at":"2026-08-07T14:37:48.490128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04790","last_updated":"2023-06-13T13:31:12Z","snapshot_observed_at":"2026-07-06T15:24:38.226044Z","submitted_at":"2023-05-08T15:45:42Z","title":"MultiModal-GPT: A Vision and Language Model for Dialogue with Humans","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.04790","snapshot_observed_at":"2026-08-07T14:37:48.592607Z","title":"Multimodal-gpt: A vision and lan- guage model for dialogue with humans.arXiv preprint arXiv:2305.04790, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:48.592607Z"},"links":{"cited_paper":"/paper/2305.04790","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:aaf51758ae48677ae6e64a68b4c8070134cb83ac7203aa23a10e6ca7b25203d9","observation_id":"b6714ece-d05d-4107-9b94-f2872aac866a","resolution":{"observed_at":"2026-08-07T14:37:48.592607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:48.728782Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answer- ing, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:48.728782Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:851bd6abd5c9111eda10476fb4f2831301c9acef00da76f376bf1be3e8a4cde7","observation_id":"5f0a3843-0cf2-4425-99ad-8c4993c74386","resolution":{"observed_at":"2026-08-07T14:37:48.728782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:48.817491Z","title":"Lvis: A dataset for large vocabulary instance segmentation, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:48.817491Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:408a352a373e48012751cf8b3f9a950e904e644054834a743675971f6d864e99","observation_id":"67454761-f5da-407e-a1de-f6713a34c68e","resolution":{"observed_at":"2026-08-07T14:37:48.817491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:48.902463Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:48.902463Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:3147c5d8aa99ab9eb5dd832384310e0980a9ce556b574ba4ecdf862f2866f0b2","observation_id":"fcce6116-1ad7-4ac3-ab54-2bfeac289962","resolution":{"observed_at":"2026-08-07T14:37:48.902463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:49.015592Z","title":"A diagram is worth a dozen images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:49.015592Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:879cd882e7a71c95e8b737ac733699b6d66280f6c384523401eb3257f1872a0d","observation_id":"138539a2-acc1-45ab-ac6e-ffe5b680a44d","resolution":{"observed_at":"2026-08-07T14:37:49.015592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:38:00.080822Z","title":"A hierarchical approach for generating descriptive image paragraphs, 2017","venue":null,"work_id":"68396fbf-9311-4386-8882-96e59aa8459d","year":2017},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:49.108696Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:7d22cd8152c6ecae461d39da6c6c2e2b44f29a0470bfc0c2ccf3e3a03bfabf0c","observation_id":"1701edd4-247a-4a7e-8207-88461434a3e7","resolution":{"observed_at":"2026-08-07T14:38:00.174744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:59.963170Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annotations.International journal of computer vision, 123:32–73, 2017","venue":null,"work_id":"6c700d00-ddb3-4a42-973d-ba78a0216a85","year":2017},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:49.174900Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:f5f7f3d5e93d8884cc86514d0f09f37fa34d71ad9d35569c94e47a49e1dc96e3","observation_id":"52b62b25-d5d4-4d13-9baf-7587316d19f3","resolution":{"observed_at":"2026-08-07T14:38:00.001617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-07T14:37:49.240559Z","title":"Seed-bench: Benchmarking mul- timodal llms with generative comprehension.arXiv preprint arXiv:2307.16125, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:49.240559Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:6ad1985acb75b3d95b303159ac49361dd875b3bceda8014a862a4874d16619ec","observation_id":"be1b42e2-5ddb-4079-abfe-66c8fdcd20f3","resolution":{"observed_at":"2026-08-07T14:37:49.240559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T14:37:49.346808Z","title":"LLaV A-OneVision: Easy Visual Task Trans- fer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:49.346808Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:b6385a7f5b8f9be2a7a5854a999ab0dc228d95e311fddb83b8f04d59be9cad85","observation_id":"371ba48b-ccb0-4cbe-afbe-c7981a230f11","resolution":{"observed_at":"2026-08-07T14:37:49.346808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:59.847377Z","title":"Llava-med: Training a large language- and-vision assistant for biomedicine in one day.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":"6096d3f1-f199-467b-bc1f-b5089a0a256a","year":2024},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:49.455236Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:75204e6ebe627ff7327768bf49d4d20712755250b31c2dd5e9fe500be2f1a8de","observation_id":"a77ebe23-372f-4444-aed5-cd0fa947b70b","resolution":{"observed_at":"2026-08-07T14:37:59.903935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-07T14:37:49.502166Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models.arXiv preprint arXiv:2301.12597, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:49.502166Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:43916996e541c871c5faf80a604e8c28e8eab860be78173e5d8a88bb79c7225e","observation_id":"a8c558c5-a72f-45e9-a9d7-1f7ebbe0173a","resolution":{"observed_at":"2026-08-07T14:37:49.502166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-07T14:37:49.563235Z","title":"Videochat: Chat-centric video understanding.arXiv preprint arXiv:2305.06355, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:49.563235Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:3bf338f9bc052d38ab9f48dce1833ba37a0e31e3f6121b7955ddb8f70fc6fb14","observation_id":"faaad85f-8620-4213-b570-1c8ea8c4ffc9","resolution":{"observed_at":"2026-08-07T14:37:49.563235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04387","last_updated":"2023-06-08T13:44:24Z","snapshot_observed_at":"2026-07-06T15:39:41.431581Z","submitted_at":"2023-06-07T12:35:37Z","title":"M$^3$IT: A Large-Scale Dataset towards Multi-Modal Multilingual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04387","snapshot_observed_at":"2026-08-07T14:37:49.620424Z","title":"M3it: A large-scale dataset towards multi- modal multilingual instruction tuning.arXiv preprint arXiv:2306.04387, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:49.620424Z"},"links":{"cited_paper":"/paper/2306.04387","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:a9b7418a968f40c3ce6b77f93cf4a71ed03c9fbb0dace21f7c729bf53366eabc","observation_id":"14856309-26db-41ac-9566-3a4537ffc053","resolution":{"observed_at":"2026-08-07T14:37:49.620424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:59.725780Z","title":"Vqa-e: Explaining, elaborating, and enhancing your answers for visual questions, 2018","venue":null,"work_id":"10d37a5f-7d55-474b-86f0-bee82f338fab","year":2018},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:49.686490Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:b0429cc09730220b507c022a436ba43687cb4f4167dbbc2a2231051cf911b1cc","observation_id":"c585b79d-269e-4c02-9308-fcf74de76a1e","resolution":{"observed_at":"2026-08-07T14:37:59.790604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-07T14:37:49.747886Z","title":"Evaluating object hallucina- tion in large vision-language models.arXiv preprint arXiv:2305.10355, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:49.747886Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:ac47eb2689e1c8f1377bf880238226044e41746f9c3752e2e90ea65b3c44212d","observation_id":"94969b14-d44d-47c2-8861-5070f20e3530","resolution":{"observed_at":"2026-08-07T14:37:49.747886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:59.603058Z","title":"Visual spatial reasoning, 2023","venue":null,"work_id":"00cf1e7e-091e-4c25-8bd4-8e196d69f78c","year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:49.838964Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:a0bba21a41ebb53b0be2294bc2bb7d9ca1cead9bc163587f8f5d482d0426acc9","observation_id":"7c0382da-693a-4f3a-9776-458f24d0c6e3","resolution":{"observed_at":"2026-08-07T14:37:59.666472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:59.473741Z","title":"Mitigating hallucination in large multi-modal models via robust instruction tuning","venue":null,"work_id":"8ae094b4-0d5c-4f25-bf35-0a5bfe1ed9cb","year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:49.905071Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:d6d97512bf4910e86cb284bba4aebda554a3d7a0b0927b22e96ce10cc6837d07","observation_id":"cab813d8-41d8-4017-b08c-62601713ff13","resolution":{"observed_at":"2026-08-07T14:37:59.545183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:59.346820Z","title":"Re- moteclip: A vision language foundation model for remote sensing, 2024","venue":null,"work_id":"b577bf2c-3aa4-490f-b33c-08cecd707f9c","year":2024},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:50.020164Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:1ebd4aee3197b2147991491209a6d5728398849a3939f8ad0636f1af8a2e664f","observation_id":"215f9bce-d532-40d2-9738-92b79cd9c2c3","resolution":{"observed_at":"2026-08-07T14:37:59.390252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-07T14:37:50.139418Z","title":"LLaV A-Next (LLaV A 1.6).arXiv:2310.03744, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:50.139418Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:31d1daee28a6cb984f67f961db538a932b65ab2c36a0d1c664b534085bf605d5","observation_id":"7d2fbc4c-7672-43e1-8e6d-30159bf48853","resolution":{"observed_at":"2026-08-07T14:37:50.139418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:59.204389Z","title":"Visual Instruction Tuning","venue":null,"work_id":"4fc407ea-8192-40c0-8e7a-810511c9e5ee","year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:50.191652Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:b8827e579801e1ae46371badc96c15036560c9b4f8922a20e1e7ccb0d8a71988","observation_id":"e31ce97b-c664-4210-859c-2a0a52e2a0a3","resolution":{"observed_at":"2026-08-07T14:37:59.264947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07895","last_updated":"2024-08-26T02:37:14Z","snapshot_observed_at":"2026-07-06T15:26:46.489500Z","submitted_at":"2023-05-13T11:28:37Z","title":"OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07895","snapshot_observed_at":"2026-08-07T14:37:50.260198Z","title":"On the hidden mystery of ocr in large multimodal models.arXiv preprint arXiv:2305.07895, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:50.260198Z"},"links":{"cited_paper":"/paper/2305.07895","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:1df4a581c22057a78e1d29a3c24cf47370ea3928a9d12af0fe268f19f87ed4a0","observation_id":"06f694ee-ae57-43f3-9b51-af7dfbf81379","resolution":{"observed_at":"2026-08-07T14:37:50.260198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:50.359568Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering.Advances in Neural Information Processing Systems, 35:2507–2521,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:50.359568Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:dfa61a4e459782d5e7ee546d76c2c9b428bef24fe0bda48afb6392071c2254a8","observation_id":"ef8d6850-20a7-4319-ab31-b52b2775110e","resolution":{"observed_at":"2026-08-07T14:37:50.359568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:59.075559Z","title":"Cheap and quick: Efficient vision- language instruction tuning for large language models.Ad- vances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":"c4303bb5-ddee-45b2-872b-f6768fcfde29","year":2024},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:50.416318Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:e584a29e6995f857c3d6081c18db77dc34ddb17a7b52289d8c3f63da2ee1ec75","observation_id":"1677e10a-078b-4e21-a9f7-49a49750125d","resolution":{"observed_at":"2026-08-07T14:37:59.127343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:58.937143Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge","venue":null,"work_id":"e918ccfb-2176-4379-8af3-13c95911e3fe","year":2019},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:50.498036Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:26d623a123c5056b13c0bdb5ed2f2a6c049393415d803bcedeee0ea068c4f75d","observation_id":"ca9547b3-7859-44f6-81e2-abd7d2890ecc","resolution":{"observed_at":"2026-08-07T14:37:59.000551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:58.832198Z","title":"ChartQA: A benchmark for question answer- ing about charts with visual and logical reasoning","venue":null,"work_id":"4516e947-0160-4c2b-bcdb-c457318a2215","year":2022},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:50.601306Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:800845bcd85f252591f288e16e4194fcbd0573737799bec1d23473e60b8036cd","observation_id":"dd0db20d-f593-4607-8163-e0c6fdd3d277","resolution":{"observed_at":"2026-08-07T14:37:58.871384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:58.695132Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":"3c3316c8-be54-4186-9cc0-0bc5e6a88606","year":2021},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:50.652514Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:76a37a655ffa1cde7b191b3a8334e196b4acb0a26a7cb8557e0a424ccff6a7b3","observation_id":"784ff458-d379-46e3-9ff8-67e5b2e9d52d","resolution":{"observed_at":"2026-08-07T14:37:58.756318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:58.569778Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":"50594879-d3f3-4d2e-ab46-6c647f91ef16","year":2021},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:50.686865Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:35fc59b67a3b993d12d486030adc8caff8e9257da585e371189823b02edb94a9","observation_id":"d21ae786-c348-4a0a-a84f-33f36383efbd","resolution":{"observed_at":"2026-08-07T14:37:58.625510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:58.432515Z","title":"Infographicvqa","venue":null,"work_id":"12a4d1c6-fc5c-4089-9455-2b8eca0d8002","year":2022},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:50.750838Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:ffd11e633c5c45d537e53f409e2e5327e3661a5b682133c5b90f211be69d339a","observation_id":"06388035-1aea-42a3-be92-4b1475ccde45","resolution":{"observed_at":"2026-08-07T14:37:58.498770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:58.302810Z","title":"Introducing llama 3.1: Our most capable models to date, 2024","venue":null,"work_id":"3dcc9183-5b15-4c4b-a03f-8d2212db78a0","year":2024},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:50.862393Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:2c540c861155bcbeeb34eaa5dff398d5db8ee4d7e3659a86e23f7da106edb6a6","observation_id":"4776cc86-5905-4a10-a79d-db2de8dde0bb","resolution":{"observed_at":"2026-08-07T14:37:58.357548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:58.182157Z","title":"Ocr-vqa: Visual question answering by reading text in images","venue":null,"work_id":"3a642c3e-4f69-44d2-bb1b-7cd158d1c5a2","year":2019},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:50.960826Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:2c55b53c792abbf646a3ffa0182b90ab112411b36eb218e74b34de76fbf87547","observation_id":"66ace162-e509-4286-86b4-c8dd4db39ea8","resolution":{"observed_at":"2026-08-07T14:37:58.243549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T14:37:51.068769Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:51.068769Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:9495638a432d4b73263d741ffebd499907f97f90b44d909fadc8f16f2b65ba7f","observation_id":"a4a480c5-8733-4000-9d67-3dfc28e2529d","resolution":{"observed_at":"2026-08-07T14:37:51.068769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:58.034925Z","title":"Gpt-4 technical report.ArXiv, 2303:08774,","venue":null,"work_id":"09534709-ea9f-4657-90e1-23dc5955eda4","year":null},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:51.149206Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:11879588dfb78f54a85f56a9fd8c8fab6a20210582523b0c2e1893e0ae5f65ee","observation_id":"7056f086-e554-422e-a905-bbf7d132200e","resolution":{"observed_at":"2026-08-07T14:37:58.096391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:57.862825Z","title":"Im2text: Describing images using 1 million captioned pho- tographs.Advances in neural information processing sys- tems, 24, 2011","venue":null,"work_id":"05a6b9ed-e4a2-47eb-8f96-4d7d87239e60","year":2011},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:51.239072Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:248da3eee2705786dc82e8fd4e3c97a26a2de3ed371ec1ff58bc1a69d5f6f7c1","observation_id":"5cae0bc2-df35-4cb3-a429-ba3d5a4969ae","resolution":{"observed_at":"2026-08-07T14:37:57.959041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:57.729269Z","title":"Flickr30k entities: Collecting region-to-phrase corre- spondences for richer image-to-sentence models","venue":null,"work_id":"39e08e46-184d-4a40-bc11-5c1d8b8bd33d","year":2015},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:51.305339Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:8722aa71d8f2753672bac1f4d93f8328aa924f191de1af141057ddafa088de59","observation_id":"54bf0e9f-0d87-4f8f-b08c-d3b7863163e0","resolution":{"observed_at":"2026-08-07T14:37:57.800017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:51.426771Z","title":"Connecting vision and lan- guage with localized narratives","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:51.426771Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:228d64a094371202e6a231d689acffcd7971f62710f8c0e33d34ac492bf9eaf4","observation_id":"cd0bd085-48de-4114-8338-4ecd557293d4","resolution":{"observed_at":"2026-08-07T14:37:51.426771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:57.563368Z","title":"Connecting vision and lan- guage with localized narratives, 2020","venue":null,"work_id":"37b15b96-2554-4ae4-8e27-3df4392fad6b","year":2020},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:51.548336Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:03a6480f4f7b4cbf98429f26f8dbb42e3f90b75c566a9b936d312f2dd52f3423","observation_id":"f3b8d652-7b42-461e-b27b-47389529bc39","resolution":{"observed_at":"2026-08-07T14:37:57.640816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:57.388866Z","title":"Learning Transferable Visual Models from Natural Language Supervi- sion","venue":null,"work_id":"b775f4e4-525f-4207-bd2c-e89a202b0e50","year":2021},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:51.644142Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:b63a837887a99d39078ab10c91744a6292825eca2ae9d1c70cee61767e8f48c8","observation_id":"8d661666-9ccd-4410-9e1f-88ff7c3cc442","resolution":{"observed_at":"2026-08-07T14:37:57.481113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:51.718046Z","title":"Sam 2: Segment anything in images and videos,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:51.718046Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:2e5e10d1c11e8a736881edc1fbf97e85568989dc9f44db1a50b60ec6d9359c1a","observation_id":"91df7c65-2a47-41ee-8a80-046a9b9afc38","resolution":{"observed_at":"2026-08-07T14:37:51.718046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:57.214841Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models, 2022","venue":null,"work_id":"c0e4b739-41c2-49a1-afe2-4b1aae468198","year":2022},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:51.814560Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:40a7dc917fa1ed5d5a67aec8fac7d75266b86e0bfeb7907497c90d9d12373c82","observation_id":"ef1219ee-359e-4e0b-b56a-f987b3b47ed1","resolution":{"observed_at":"2026-08-07T14:37:57.268836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:57.043927Z","title":"LAION-5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":"6951e72d-8ee6-4224-8d86-07b962575074","year":2022},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:51.909444Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:057c843b5c2ae09f26f6bd73312a655037d7314b5c73ad836702e5acf14e602a","observation_id":"d9436920-017a-44a7-afda-5d1af3ec8759","resolution":{"observed_at":"2026-08-07T14:37:57.125445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:56.887898Z","title":"A-okvqa: A benchmark for visual question answering using world knowl- edge, 2022","venue":null,"work_id":"4d67c01b-3dc9-4f9a-b0c6-7c93a4b0f4f2","year":2022},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:51.987410Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:c9009fcf3b7122b196ce76fafaed7536796a37dc694c68656a0336ade3b9241b","observation_id":"90b898b8-7c71-46e2-95cb-1566aef7fb9e","resolution":{"observed_at":"2026-08-07T14:37:56.954674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:52.061066Z","title":"Conceptual captions: A cleaned, hypernymed, im- age alt-text dataset for automatic image captioning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:52.061066Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:da4f93879921d857226603f88c9471614db8742c01175b986e9dbaa86da22c17","observation_id":"3356d403-ad9b-4824-8be7-6416ca85b22c","resolution":{"observed_at":"2026-08-07T14:37:52.061066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17294","last_updated":"2024-10-08T06:58:27Z","snapshot_observed_at":"2026-08-04T00:41:59.024387Z","submitted_at":"2024-06-25T05:43:21Z","title":"Math-LLaVA: Bootstrapping Mathematical Reasoning for Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17294","snapshot_observed_at":"2026-08-07T14:37:52.139069Z","title":"Math- llava: Bootstrapping mathematical reasoning for multimodal large language models.arXiv preprint arXiv:2406.17294,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:52.139069Z"},"links":{"cited_paper":"/paper/2406.17294","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:9d3a4ca6e5ab8e311c53d5294e623e08f8b5e222c2f0ce003633f3e1a5b02cb6","observation_id":"004772e0-2b2d-4d52-b3ea-10f23bce2144","resolution":{"observed_at":"2026-08-07T14:37:52.139069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:56.731667Z","title":"Textcaps: a dataset for image captioning with reading comprehension, 2020","venue":null,"work_id":"c66acc80-8f44-4ea1-8956-a2ad7178ae09","year":2020},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:52.225514Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:eb6322aca49b65aa931ddebd23e24856d2dee8ef9192c61d7edbf0e3cfdf07bd","observation_id":"d92235de-80c8-4b4f-bef1-c0820066dc7c","resolution":{"observed_at":"2026-08-07T14:37:56.806437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:56.548743Z","title":"Towards vqa models that can read","venue":null,"work_id":"446d6f02-c8a8-4926-9872-dca948626513","year":2019},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:52.325073Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:ff262d497dd43cc1404f3d97adc12f9a86da7227a99bfde036ff65bacabfaac6","observation_id":"a49b2bf3-6aba-4f4c-9b1c-21bc58b08f63","resolution":{"observed_at":"2026-08-07T14:37:56.621102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:56.411424Z","title":"Expressing visual relationships via language,","venue":null,"work_id":"9299bf94-849f-41d0-9422-c4c896cc8dbf","year":null},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:52.400976Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:4ea43c63830f2e929247233de64b53fecb5a78d418cdc16c3aa4f324dd12eae0","observation_id":"fa194d73-e61a-437c-90c9-b34f3b6187a6","resolution":{"observed_at":"2026-08-07T14:37:56.482837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:56.262714Z","title":"Vi- sualmrc: Machine reading comprehension on document im- ages, 2021","venue":null,"work_id":"339f7f95-1460-4559-9172-e8b70c8b3717","year":2021},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:52.451431Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:0d0f44ca0b6a9cf772d573150ccb2f3864a3daadcb63a63066701f1d42321918","observation_id":"7869d6d7-f163-4c65-bb7d-4966d4508cb6","resolution":{"observed_at":"2026-08-07T14:37:56.336625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-07T14:37:52.521778Z","title":"Gemma 2: Improving open lan- guage models at a practical size, 2024.URL https://arxiv","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:52.521778Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:8051f445f6a6dec68bcbc43ac99eec1b9186dda2fd0f80f83570e429bb8cfab2","observation_id":"a922125a-d40a-42cd-88e0-b8e911720714","resolution":{"observed_at":"2026-08-07T14:37:52.521778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T14:37:52.582430Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:52.582430Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:0ed0496328fe5293c8db32073d852b50f1fcbca7320ba76ff5f8ad51612c2b70","observation_id":"9c42d8e9-8075-4a81-9d7f-c781c5e161b8","resolution":{"observed_at":"2026-08-07T14:37:52.582430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-07T14:37:52.700977Z","title":"Cambrian- 1: A fully open, vision-centric exploration of multimodal llms.arXiv preprint arXiv:2406.16860, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:52.700977Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:e661af822a3859b8da576e5196ee9122d0c628c23f872fbefa025941549860bb","observation_id":"38bf7cf7-0be6-46ee-b247-97608eee72ae","resolution":{"observed_at":"2026-08-07T14:37:52.700977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-06T03:52:00.226360Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-08-07T14:37:52.789583Z","title":"To see is to believe: Prompting gpt-4v for better visual instruction tuning.arXiv preprint arXiv:2311.07574, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:52.789583Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:c135d5d1d38a8ac10467a4dc951fe33b64c8b6892679bf9941ae5e40ef007082","observation_id":"380b9a90-ab99-4a3d-8c4d-52846bee1ac0","resolution":{"observed_at":"2026-08-07T14:37:52.789583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02677","last_updated":"2023-07-06T13:47:21Z","snapshot_observed_at":"2026-07-06T15:23:10.114682Z","submitted_at":"2023-05-04T09:48:22Z","title":"Caption Anything: Interactive Image Description with Diverse Multimodal Controls","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02677","snapshot_observed_at":"2026-08-07T14:37:52.880552Z","title":"Caption anything: Interactive image description with diverse multi- modal controls.arXiv preprint arXiv:2305.02677, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:52.880552Z"},"links":{"cited_paper":"/paper/2305.02677","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:6466717ad101470bfb8dbef86a8dac9bb14adefded195236771e4181efd1cbbe","observation_id":"3b1342ee-9a8c-49d0-a595-5350d486a591","resolution":{"observed_at":"2026-08-07T14:37:52.880552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:56.100257Z","title":"Visionllm: Large language model is also an open- ended decoder for vision-centric tasks.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":"53ae7502-c744-4880-8299-14b68a5e567f","year":2024},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:52.996429Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:f14198b04d54e2ed7e284b4005503e617ae18f14a48510cff91aa65fb7e4852d","observation_id":"198dbafe-e916-4c44-9197-d8817203973c","resolution":{"observed_at":"2026-08-07T14:37:56.167971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12067","last_updated":"2026-04-12T14:13:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-23T11:27:30Z","title":"MM-LIMA: Less Is More for Alignment in Multi-Modal Datasets","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12067","snapshot_observed_at":"2026-08-07T14:37:53.072593Z","title":"Instructiongpt-4: A 200-instruction paradigm for fine-tuning minigpt-4.arXiv preprint arXiv:2308.12067, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:53.072593Z"},"links":{"cited_paper":"/paper/2308.12067","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:efa349b7a1f46d62f9ef7bb3b5c9182efb570e0610062193cb3bc1cb04d9a5bd","observation_id":"5b49823c-2299-4c5a-b696-a4f930bba88f","resolution":{"observed_at":"2026-08-07T14:37:53.072593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14181","last_updated":"2024-01-01T14:48:48Z","snapshot_observed_at":"2026-07-06T16:23:18.453624Z","submitted_at":"2023-09-25T14:43:43Z","title":"Q-Bench: A Benchmark for General-Purpose Foundation Models on Low-level Vision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14181","snapshot_observed_at":"2026-08-07T14:37:53.136267Z","title":"Q-bench: A benchmark for general-purpose foundation models on low-level vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:53.136267Z"},"links":{"cited_paper":"/paper/2309.14181","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:12976309b442e933e52e8638ff9bb706d448dacc44814134a41403e5a93cc08b","observation_id":"b4595a73-fa6a-4f5a-9acd-dace869b8128","resolution":{"observed_at":"2026-08-07T14:37:53.136267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:55.978899Z","title":"Grok-1.5 vision preview, 2024","venue":null,"work_id":"b2d59879-0986-4924-9011-06728f6ea13b","year":2024},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:53.189797Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:8592068a0aa683c715cff324967fa2cb169577e545aa0c44dc6c6ae46837af98","observation_id":"49d01f9d-7713-4b5f-be24-b4ddca4e6e66","resolution":{"observed_at":"2026-08-07T14:37:56.031446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10773","last_updated":"2023-06-10T18:33:21Z","snapshot_observed_at":"2026-07-06T14:33:20.852718Z","submitted_at":"2022-12-21T05:17:06Z","title":"MultiInstruct: Improving Multi-Modal Zero-Shot Learning via Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10773","snapshot_observed_at":"2026-08-07T14:37:53.282556Z","title":"Multiinstruct: Im- proving multi-modal zero-shot learning via instruction tun- ing.arXiv preprint arXiv:2212.10773, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:53.282556Z"},"links":{"cited_paper":"/paper/2212.10773","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:c14073086622af8dab9dc07df7c894c33c9a02f6864374694f3d473e60caf454","observation_id":"7b2e6457-62fd-42fb-a0e8-3d9c75c8c7c7","resolution":{"observed_at":"2026-08-07T14:37:53.282556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:53.381001Z","title":"Depth any- thing v2, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:53.381001Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:2754af188a1494bbc3b02231d4200a1f7efa5b25d1b5f268a5c944177f6becce","observation_id":"6942175e-fc92-4847-a539-083a5e111a60","resolution":{"observed_at":"2026-08-07T14:37:53.381001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02499","last_updated":"2023-07-04T11:28:07Z","snapshot_observed_at":"2026-08-01T15:24:02.956161Z","submitted_at":"2023-07-04T11:28:07Z","title":"mPLUG-DocOwl: Modularized Multimodal Large Language Model for Document Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02499","snapshot_observed_at":"2026-08-07T14:37:53.457998Z","title":"mplug-docowl: Modularized multimodal large language model for document understanding.arXiv preprint arXiv:2307.02499, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:53.457998Z"},"links":{"cited_paper":"/paper/2307.02499","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:65655f6e41155b0486066837546e404574253c8b66babdf900ae140aba2dd6af","observation_id":"a3f2b3ba-ba36-44b4-85d1-72b640d28a8d","resolution":{"observed_at":"2026-08-07T14:37:53.457998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-07T14:37:53.547479Z","title":"mplug-owl: Modularization empowers large language models with multimodality.arXiv preprint arXiv:2304.14178, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:53.547479Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:f5b5c65739282873eb49a4415f6ec8b668bf1b5c2b6f97e0db190ba2f1f33308","observation_id":"0e25ae2a-754a-4ccc-9765-bee5c3134768","resolution":{"observed_at":"2026-08-07T14:37:53.547479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:55.851769Z","title":"Berg, and Tamara L","venue":null,"work_id":"980524df-bb19-4e99-a980-12ddd174d58c","year":2016},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:53.643876Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:e15c27da0f084e8cbd86392ce9764cd9dc3b83e7b58a560a158fa37c39454a7c","observation_id":"5b4c1e2a-b493-4099-9e37-d7226f266c96","resolution":{"observed_at":"2026-08-07T14:37:55.940987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:55.732202Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for ex- pert agi","venue":null,"work_id":"48274891-2b41-49ca-9f3f-d400cf2e7df5","year":2024},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:53.717638Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:9677d00db4a1a404fac5face188b1b28a398af9df8658f2074bba9945f5fe34b","observation_id":"adab7efc-a886-42f9-bb80-f7790886c47f","resolution":{"observed_at":"2026-08-07T14:37:55.792963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:55.614223Z","title":null,"venue":null,"work_id":"fbf66213-25fc-48ea-be0d-2c37f2506f68","year":2024},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:53.805718Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:cafa241a00545915327e57a061abb505ba9ff4994d966f4ad605c517a9da854f","observation_id":"ab4b3daa-e6ad-49dc-927d-d3c5aa0b623d","resolution":{"observed_at":"2026-08-07T14:37:55.668988Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:55.470876Z","title":"Rsvg: Exploring data and models for visual grounding on remote sensing data","venue":null,"work_id":"f4f326e0-4b3f-4d66-bf4b-4a76c3fa0d5e","year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:53.898696Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:7f230e77d825e775f905d2af92bb9f4a4e0d237f29496d5dff7bce492134f06f","observation_id":"b03a1f4f-3d0b-4a85-9256-5af7f73046ce","resolution":{"observed_at":"2026-08-07T14:37:55.534422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:55.317495Z","title":"Lmms- eval: Reality check on the evaluation of large multimodal models, 2024","venue":null,"work_id":"3a399544-2383-4867-97dc-7659eda0eeaf","year":2024},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:53.962404Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:cb99834e61c00003bdc5c78aae28699d1e972da201c4bd45a416d42fcf0e7b9f","observation_id":"a6a07919-ca3a-4726-933d-7a98911f55b3","resolution":{"observed_at":"2026-08-07T14:37:55.393162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15112","snapshot_observed_at":"2026-08-07T14:37:54.044923Z","title":"Internlm- xcomposer: A vision-language large model for advanced text-image comprehension and composition.arXiv preprint arXiv:2309.15112, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:54.044923Z"},"links":{"cited_paper":"/paper/2309.15112","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:e1b7e1b28d96b296d58fa82865ad5f6eb62dffb3ddfe72dcfb4a3c968e129b82","observation_id":"15480673-59f4-46b2-b0ea-d123ad922208","resolution":{"observed_at":"2026-08-07T14:37:54.044923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16199","last_updated":"2024-09-18T23:54:36Z","snapshot_observed_at":"2026-08-06T06:36:02.994951Z","submitted_at":"2023-03-28T17:59:12Z","title":"LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16199","snapshot_observed_at":"2026-08-07T14:37:54.116967Z","title":"Llama-adapter: Efficient fine-tuning of language models with zero-init attention.arXiv preprint arXiv:2303.16199, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:54.116967Z"},"links":{"cited_paper":"/paper/2303.16199","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:cb3ceeb34db99f789b1ec18c232e0afc98056e5ebf3b62ce862a3e982ccef3fa","observation_id":"d2f15a56-beea-495f-9df7-5032803d62a4","resolution":{"observed_at":"2026-08-07T14:37:54.116967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:55.166546Z","title":"Hierarchical and robust convolutional neural network for very high-resolution remote sensing object detection","venue":null,"work_id":"c513a9a6-6a38-4541-b3a6-3637c33fd4af","year":2019},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:54.194802Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:97d8b1b362aad22e44d55b87c0db2b83b4b676e574455f8f95fbc6a596a11cae","observation_id":"1253bd24-febe-40c5-a414-cd03f10b8c9b","resolution":{"observed_at":"2026-08-07T14:37:55.246086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-08-07T14:37:54.258922Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:54.258922Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:76ba1a9ec35b0298a98d3190b97e2927e6bd2229778873115a13972fd716d864","observation_id":"a346cf23-6cad-4a8b-867c-efcd33e76a44","resolution":{"observed_at":"2026-08-07T14:37:54.258922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04087","last_updated":"2023-12-28T16:01:36Z","snapshot_observed_at":"2026-08-06T02:13:50.627750Z","submitted_at":"2023-07-09T03:25:14Z","title":"SVIT: Scaling up Visual Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04087","snapshot_observed_at":"2026-08-07T14:37:54.331667Z","title":"Svit: Scaling up visual instruction tuning.arXiv preprint arXiv:2307.04087, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:54.331667Z"},"links":{"cited_paper":"/paper/2307.04087","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:709d12c5389b664d8507c8f168203bf450f2aa96cf0833ff5183a1aead71f224","observation_id":"05c6122e-8d8d-44a8-bd5b-e427e1374c22","resolution":{"observed_at":"2026-08-07T14:37:54.331667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16103","last_updated":"2023-05-25T14:34:08Z","snapshot_observed_at":"2026-07-06T15:33:23.984280Z","submitted_at":"2023-05-25T14:34:08Z","title":"ChatBridge: Bridging Modalities with Large Language Model as a Language Catalyst","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16103","snapshot_observed_at":"2026-08-07T14:37:54.397753Z","title":"Chatbridge: Bridging modalities with large language model as a language catalyst.arXiv preprint arXiv:2305.16103, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:54.397753Z"},"links":{"cited_paper":"/paper/2305.16103","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:bc38cb0e9cfc1d64a71c1378c96a49b538dd07ad3aca8b4c9f5331383ba7253b","observation_id":"f40fa1de-f74d-43db-8c29-353c44361fce","resolution":{"observed_at":"2026-08-07T14:37:54.397753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-07T14:37:54.505962Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:54.505962Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:0548748d290600a6ff6fd8e44231c7f266e189c05ca69ab372b96a7c92e42c8e","observation_id":"6619e153-8a2f-46be-a2bd-06e10ce65ca6","resolution":{"observed_at":"2026-08-07T14:37:54.505962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:55.000454Z","title":"Visual7w: Grounded question answering in images, 2016","venue":null,"work_id":"5914098e-c34d-42d7-8782-e34d24ff131c","year":2016},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:54.579360Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:e8947acd05c016a72ea4072a4d6fb980819bb08180c07a02f19cc10f0592ee6d","observation_id":"a5dbdd01-7047-4333-b9db-7191c179e2e4","resolution":{"observed_at":"2026-08-07T14:37:55.062673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T14:32:54.571577Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion"},"reference_resolution":{"displayed":90,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":54,"verified_exact":0,"verified_fuzzy":36},"total_outbound_references":90},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 90 of 90 outbound references and 0 inbound Pith citation observations for arXiv:2505.18115."}