{"as_of":"2026-08-12T05:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4760c8bfba1139ed8b6e254358343f901315b50c2ec469eb20d338f7ab9ada9c","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T10:43:08.380678Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T15:32:48.356870Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-10T15:32:48.405652Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"cited_work":{"arxiv_id":"2412.16364","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.16364","snapshot_observed_at":"2026-08-10T15:32:48.405652Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","venue":"cs.CV","work_id":"1ef944a0-3f7e-4eb7-b5e3-665d453346a1","year":2024},"citing_paper":{"arxiv_id":"2501.13921","last_updated":"2025-02-11T16:48:15Z","snapshot_observed_at":"2026-08-12T04:54:04.225924Z","submitted_at":"2025-01-23T18:59:02Z","title":"The Breeze 2 Herd of Models: Traditional Chinese LLMs Based on Llama with Vision-Aware and Function-Calling Capabilities","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-10T15:32:48.356870Z"},"links":{"cited_paper":"/paper/2412.16364","citing_paper":"/paper/2501.13921"},"observation_digest":"sha256:49186960fee918fa32e12ba3af1d27b7fac75d6551ac5bdc298edd763e37466c","observation_id":"7b2f1c54-e03b-44af-b3cf-ae100fa0aa5e","resolution":{"observed_at":"2026-08-10T15:32:48.411909Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16364","snapshot_observed_at":"2026-08-03T08:15:38.147584Z","title":"A high-quality text-rich image instruction tuning dataset via hybrid instruction generation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.17717","last_updated":"2026-06-09T20:25:14Z","snapshot_observed_at":"2026-08-08T23:34:38.789355Z","submitted_at":"2026-01-25T06:40:25Z","title":"A Survey on Evaluating Quality and Trustworthiness in LLM-Generated Data","version":3},"reference_index":280,"source":"arxiv_source","source_observed_at":"2026-08-03T08:15:38.147584Z"},"links":{"cited_paper":"/paper/2412.16364","citing_paper":"/paper/2601.17717"},"observation_digest":"sha256:2bf60a732dc98f11ad1343ffd12c0adac0d9f113b80f88443212b646f7140fb2","observation_id":"1a5d8708-20ca-457e-91b6-9079ea167a94","resolution":{"observed_at":"2026-08-03T08:15:38.147584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.16364/citation-record","integrity":"/paper/2412.16364/integrity","json":"/paper/2412.16364/citation-record.json","paper":"/paper/2412.16364"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-10T14:07:02.234322Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-11T10:43:08.015968Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.015968Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:1457d11967ace55732d746bc7f73b73937927a55846a70078706b59279da8107","observation_id":"5aacc674-890a-4e79-a0c6-81092622eb59","resolution":{"observed_at":"2026-08-11T10:43:08.015968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:43:09.638998Z","title":null,"venue":null,"work_id":"0bd277e5-0233-4976-a37d-54e4d28fce9d","year":2019},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.022473Z"},"links":{"citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:e5b9e9c00b15ffb91f082d6a07cad17b80ec07e901c7251c2fbd89864ec82625","observation_id":"aef6de57-ada9-4950-90b9-189813c046f7","resolution":{"observed_at":"2026-08-11T10:43:09.644327Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:43:08.028411Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.028411Z"},"links":{"citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:d75961864d92e03bb0341b51dc56880c580c5c5d4d831ca480c874d7890e8320","observation_id":"7a91493e-ad36-4acd-b3f5-756b4178e5fa","resolution":{"observed_at":"2026-08-11T10:43:08.028411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-11T10:43:08.034935Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.034935Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:90d9fabaea7ce63e1f4c6a3dac084e5cfe395e0da028416dc58875e35473fbd7","observation_id":"dbad5b1a-de18-4cd4-95c4-376891cc6205","resolution":{"observed_at":"2026-08-11T10:43:08.034935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-11T10:43:08.040942Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.040942Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:0389037584a0b6b51248a16e146f4781580598ebef90ab245dbceb47a8ba51ed","observation_id":"c9aced62-d86c-499a-9f61-c0bbade12ff2","resolution":{"observed_at":"2026-08-11T10:43:08.040942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-11T10:43:08.047462Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.047462Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:22d30ec40b8b0f55efe144b2d06ba6ffc12c72310faa42d2c745e8652e9fc25f","observation_id":"456f2e71-686d-4cbc-9525-5d55b18abacb","resolution":{"observed_at":"2026-08-11T10:43:08.047462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:43:08.054234Z","title":null,"venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.054234Z"},"links":{"citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:7b67081e59717273d7c6f20fae793e62a0e64dc179606ed9cf41930c2837f007","observation_id":"b1ccb274-a20f-4c6d-b211-3fd36e23abba","resolution":{"observed_at":"2026-08-11T10:43:08.054234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:43:08.059750Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.059750Z"},"links":{"citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:0fe35b8388a184ecbeb6b26aa7923213ebd8a72c51fc5b6ba101473a9efe36fd","observation_id":"2f1ee924-13e8-41eb-855e-e2ea59aa1595","resolution":{"observed_at":"2026-08-11T10:43:08.059750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:43:08.065314Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.065314Z"},"links":{"citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:29d09bc24da68e31358e8780c07b123b8fa7b07c6d0bf1d7539f0f59f389c349","observation_id":"08368eb0-7df9-4183-892e-b4b7cf4c808d","resolution":{"observed_at":"2026-08-11T10:43:08.065314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:43:08.071267Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.071267Z"},"links":{"citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:3f5d24cebbafb08e555f51da685c20361456d794f2f0ddd952df9b363bb96926","observation_id":"f5819198-0513-4c32-8114-88143f42e9d3","resolution":{"observed_at":"2026-08-11T10:43:08.071267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-08-11T10:43:08.076731Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.076731Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:d3a50818713661ada95223ed21bfd92e680a4375e8933e4f5fee6a0a9337e43b","observation_id":"31d5aa54-06cb-499c-a7a8-d6e5c7dbd311","resolution":{"observed_at":"2026-08-11T10:43:08.076731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-04T08:17:54.774738Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-11T10:43:08.082289Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.082289Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:ff30b4fc7e643016a3da41ffd93d32a6c3f66f5212c150eb34ea8545b76f6611","observation_id":"f68f39bf-0ae6-4b10-a708-822246bf7dcd","resolution":{"observed_at":"2026-08-11T10:43:08.082289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-11T10:43:08.088107Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.088107Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:7a27c21940589692f6f25b52747c2ba91040d4f02bdda46cdce724b203cb38b5","observation_id":"ad00a16b-2107-40b4-9d40-b3ff799b7734","resolution":{"observed_at":"2026-08-11T10:43:08.088107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-08-11T10:43:08.093445Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.093445Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:074d8268161138612eb21f527712422b8faff070f226ef8f61fbc3a449bf8e6b","observation_id":"b4953843-a2cf-4ada-84b5-63a33a282ab2","resolution":{"observed_at":"2026-08-11T10:43:08.093445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:43:08.099118Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.099118Z"},"links":{"citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:729067a6ccad7aba3677eabcabb830840cb489e67db948f16c84a6d324ed6bde","observation_id":"03b891d6-79f4-47fe-b99a-8f1b243851b2","resolution":{"observed_at":"2026-08-11T10:43:08.099118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16420","last_updated":"2024-01-29T18:59:02Z","snapshot_observed_at":"2026-08-05T03:42:54.599829Z","submitted_at":"2024-01-29T18:59:02Z","title":"InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16420","snapshot_observed_at":"2026-08-11T10:43:08.104693Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.104693Z"},"links":{"cited_paper":"/paper/2401.16420","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:5d17cb5594edea89e438ad1c23a503924cca2e6b0bcb3172d89c876f587b3a6b","observation_id":"10e10636-9685-4993-b3c9-bb76777af97c","resolution":{"observed_at":"2026-08-11T10:43:08.104693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.15010","last_updated":"2023-04-28T17:59:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-28T17:59:25Z","title":"LLaMA-Adapter V2: Parameter-Efficient Visual Instruction Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.15010","snapshot_observed_at":"2026-08-11T10:43:08.111217Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.111217Z"},"links":{"cited_paper":"/paper/2304.15010","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:322083cd001242c54383e3a031402ec5c2b7c0f84700d9991f92d41f2ce39f18","observation_id":"6e901dd1-c024-4d6e-a312-6a7d435ad9e5","resolution":{"observed_at":"2026-08-11T10:43:08.111217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:43:09.552848Z","title":null,"venue":null,"work_id":"4699271d-1a0e-4a60-acad-fe097eb4c3de","year":2019},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.116972Z"},"links":{"citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:f2289481f0d570040ad3d87107ad6f394baf940b25fbf4bd41dd90fd4dc318da","observation_id":"1363a921-11cf-432e-9ef4-255feebfeea8","resolution":{"observed_at":"2026-08-11T10:43:09.558346Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:43:09.536371Z","title":null,"venue":null,"work_id":"0169adfe-5a55-4e9d-a66a-d6d74f4478f0","year":2019},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.121871Z"},"links":{"citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:0c4169e119a616dc98afc629b1048e7b3cf2995cbd975bf24a3670e757538583","observation_id":"fd1c25d7-e7d1-495c-90a9-16cf49b50fc8","resolution":{"observed_at":"2026-08-11T10:43:09.541404Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.07300","last_updated":"2018-02-22T22:50:42Z","snapshot_observed_at":"2026-08-04T06:17:25.388464Z","submitted_at":"2017-10-19T18:01:38Z","title":"FigureQA: An Annotated Figure Dataset for Visual Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.07300","snapshot_observed_at":"2026-08-11T10:43:08.126593Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.126593Z"},"links":{"cited_paper":"/paper/1710.07300","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:a9a8c0f8cb1964f9fc97d92ddbe09f6a133e4380478c8e2873c3f76db5446333","observation_id":"747d26dd-1952-4d61-a751-8fa681cfff86","resolution":{"observed_at":"2026-08-11T10:43:08.126593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12637","last_updated":"2024-08-22T17:47:24Z","snapshot_observed_at":"2026-08-08T02:32:36.154874Z","submitted_at":"2024-08-22T17:47:24Z","title":"Building and better understanding vision-language models: insights and future directions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12637","snapshot_observed_at":"2026-08-11T10:43:08.131404Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.131404Z"},"links":{"cited_paper":"/paper/2408.12637","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:8c0cb809bff7471f9b32a0ce3bd27f4d948fb316bd7fb0cda543d743aba0e40e","observation_id":"4bad5c29-2f67-490c-be1d-f7bb08f05aa9","resolution":{"observed_at":"2026-08-11T10:43:08.131404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02246","last_updated":"2024-05-03T17:00:00Z","snapshot_observed_at":"2026-08-08T17:33:57.727194Z","submitted_at":"2024-05-03T17:00:00Z","title":"What matters when building vision-language models?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02246","snapshot_observed_at":"2026-08-11T10:43:08.136042Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.136042Z"},"links":{"cited_paper":"/paper/2405.02246","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:28148c92cfa5b711d246007d52671269ebabe3a72b6772821f642ddfdf2cf5f6","observation_id":"d522efe4-aeba-4d33-b122-5344e7deb0a1","resolution":{"observed_at":"2026-08-11T10:43:08.136042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13840","last_updated":"2025-07-02T21:53:51Z","snapshot_observed_at":"2026-08-11T19:51:00.200288Z","submitted_at":"2023-06-24T02:25:56Z","title":"Beyond Scale: The Diversity Coefficient as a Data Quality Metric for Variability in Natural Language Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13840","snapshot_observed_at":"2026-08-11T10:43:08.140756Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.140756Z"},"links":{"cited_paper":"/paper/2306.13840","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:cfaefa78c3ad73148a81d6c105d69ac42435b5375eba7759599b13624b57b975","observation_id":"255da361-d0a9-4079-9334-10dfc9b4a91f","resolution":{"observed_at":"2026-08-11T10:43:08.140756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-11T10:43:08.145499Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.145499Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:cd738525f855183d9ced1ba3d9ef5e993ff64612e34098ff810443d0ea6f84fd","observation_id":"be2a0fa4-5fcd-42d2-8c89-e5a8607e13d9","resolution":{"observed_at":"2026-08-11T10:43:08.145499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10020","last_updated":"2023-09-18T17:56:28Z","snapshot_observed_at":"2026-08-11T13:54:16.213777Z","submitted_at":"2023-09-18T17:56:28Z","title":"Multimodal Foundation Models: From Specialists to General-Purpose Assistants","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10020","snapshot_observed_at":"2026-08-11T10:43:08.150494Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.150494Z"},"links":{"cited_paper":"/paper/2309.10020","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:edca24e45bc89c53caa96740e5c089d2a4dcb87c141f6901f8443e2a725e43a5","observation_id":"9fc6c466-f7e4-4222-a81a-f9a6d9f3d38b","resolution":{"observed_at":"2026-08-11T10:43:08.150494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:43:08.155150Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.155150Z"},"links":{"citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:6b3306a7f415abd21005976bbb6132abb9a565e41def35194a2d5385da8b60bb","observation_id":"28191912-273f-4eef-b0c1-c64b068cea95","resolution":{"observed_at":"2026-08-11T10:43:08.155150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12032","last_updated":"2024-04-06T03:52:04Z","snapshot_observed_at":"2026-08-09T18:45:15.884087Z","submitted_at":"2023-08-23T09:45:29Z","title":"From Quantity to Quality: Boosting LLM Performance with Self-Guided Data Selection for Instruction Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12032","snapshot_observed_at":"2026-08-11T10:43:08.159936Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.159936Z"},"links":{"cited_paper":"/paper/2308.12032","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:7f4ce183a2f1ebf9d663011f4caf07a5f030214ea7048454c690d2d9ab01f78e","observation_id":"67d16506-8c00-4edb-9dcd-180883516aa8","resolution":{"observed_at":"2026-08-11T10:43:08.159936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:43:09.508424Z","title":null,"venue":null,"work_id":"775e13f5-c27b-42d9-a5e3-f5347dec4fb2","year":2024},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.164632Z"},"links":{"citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:892881b70f5ffd8ae5187677113f8fd01f8a1588d750b93c53947ced6c9235cb","observation_id":"3fee9e36-0d0d-4994-9c58-de20c1335339","resolution":{"observed_at":"2026-08-11T10:43:09.513539Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:43:08.169290Z","title":null,"venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.169290Z"},"links":{"citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:5eb580abd807449c0779948d014dbdbbd6a540d0fab498bf93017d6d80aa979b","observation_id":"42e9e741-e613-40d1-912a-94582f8773d0","resolution":{"observed_at":"2026-08-11T10:43:08.169290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:43:08.174228Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.174228Z"},"links":{"citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:686c43075b5870b9ba21711e03b07ac748abd91899bb00c98d7531eee4ebb332","observation_id":"8cc2fb93-52c7-4778-892d-c0421725b7e1","resolution":{"observed_at":"2026-08-11T10:43:08.174228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:43:08.179262Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.179262Z"},"links":{"citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:4f9b7e731c21ac33513a537aed8cb306813ac1ca80567295b0e975ded9394d45","observation_id":"e17d3b1d-91f7-4c8b-9d5a-d2832ddd1a74","resolution":{"observed_at":"2026-08-11T10:43:08.179262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:43:08.184299Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.184299Z"},"links":{"citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:0c808902f082d4e76699813edd68f92c9e0b5ce53a9f0b08978f6431d22de334","observation_id":"8b73e3aa-3a16-4350-bcc1-3e5a57987d8d","resolution":{"observed_at":"2026-08-11T10:43:08.184299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:43:08.189517Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.189517Z"},"links":{"citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:bd6c504d3f44b1a8f1f0af2073adb75c57f2dfccc3e5349200e0136a0f8753ea","observation_id":"79c41576-adb8-49a9-8249-12504a124eb8","resolution":{"observed_at":"2026-08-11T10:43:08.189517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-11T10:43:08.194693Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.194693Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:2bf86b071e275283d82af2c17ba5c450495878e8df972de7e0fbff9d98abbd6f","observation_id":"823076d6-51a6-4cc2-a594-43e901f5f457","resolution":{"observed_at":"2026-08-11T10:43:08.194693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07895","last_updated":"2024-08-26T02:37:14Z","snapshot_observed_at":"2026-07-06T15:26:46.489500Z","submitted_at":"2023-05-13T11:28:37Z","title":"OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07895","snapshot_observed_at":"2026-08-11T10:43:08.200561Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.200561Z"},"links":{"cited_paper":"/paper/2305.07895","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:e95d3c565edea7fe1040f2762f3411b9a320b6861b981f382552a071e0dd2289","observation_id":"9d3cded9-7343-4fba-93c2-17c02b5ab6ce","resolution":{"observed_at":"2026-08-11T10:43:08.200561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04473","last_updated":"2024-03-15T06:51:30Z","snapshot_observed_at":"2026-08-09T20:40:14.205704Z","submitted_at":"2024-03-07T13:16:24Z","title":"TextMonkey: An OCR-Free Large Multimodal Model for Understanding Document","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04473","snapshot_observed_at":"2026-08-11T10:43:08.206401Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.206401Z"},"links":{"cited_paper":"/paper/2403.04473","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:fe9b57f134d0228e6bc208babbd0030c19ccdd53bfbe0b7b244abb073d710e7e","observation_id":"68958a47-46d5-4079-9441-3d430f02dc99","resolution":{"observed_at":"2026-08-11T10:43:08.206401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-08-10T11:40:09.342794Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-08-11T10:43:08.212053Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.212053Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:292b00a0614a1a194e119c02af2c7a81f88b559525e84faceed799d237c2d930","observation_id":"d7a9b546-68f6-4722-add5-1fba7b2724c1","resolution":{"observed_at":"2026-08-11T10:43:08.212053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-08-11T03:45:43.920485Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-11T10:43:08.217303Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.217303Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:8650a8719b9c861ca65e91c204d8bbe8e0dea8db43aaa1e3c0fac30e1a8d3d1c","observation_id":"637a3691-509c-46d7-9e79-adb2080d4e06","resolution":{"observed_at":"2026-08-11T10:43:08.217303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:43:08.223014Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.223014Z"},"links":{"citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:febcebdc9138e04ba5c1435563311f76fd6e34f2330da24c0fd5f5cebaec9c08","observation_id":"f08d9e99-b392-4428-9f5f-de5d3983499d","resolution":{"observed_at":"2026-08-11T10:43:08.223014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:43:08.227921Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.227921Z"},"links":{"citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:5bb717b6aafd2ee98a2db8ae55396eb82e75691f21170d4eecce74d8cd47e707","observation_id":"ae2dc1fe-b717-4c00-97f1-1ca9741ab3a7","resolution":{"observed_at":"2026-08-11T10:43:08.227921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:43:08.233284Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.233284Z"},"links":{"citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:c47855a24934777983f7d9806004936f30d4c5c4aa5d7415e7ce5d1dfa3a3082","observation_id":"5511b1bc-08cb-4d2a-a873-3ee6dc34abfe","resolution":{"observed_at":"2026-08-11T10:43:08.233284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:43:08.238556Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.238556Z"},"links":{"citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:0a98308526297f8fac79accd2d4d253b17d517e707a446c36497ed87e78dad88","observation_id":"85c2ceb8-1290-4bf9-9aa0-94302cca30b6","resolution":{"observed_at":"2026-08-11T10:43:08.238556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:43:08.243860Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.243860Z"},"links":{"citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:8e7e0626f7cf58a518a3caabe0eb450fd63723cfc30b73c53b8b1fc7dae0dbd2","observation_id":"7c107ef1-2274-45ad-b018-1025e2bd7f32","resolution":{"observed_at":"2026-08-11T10:43:08.243860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:43:08.248898Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.248898Z"},"links":{"citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:0ff540f5ac08ba170c365a3257ae70e0bbd23c1bc1f8aa837f1c5180863fe8e3","observation_id":"f2ed88f0-b8b6-4a0c-bcda-7f20f7169886","resolution":{"observed_at":"2026-08-11T10:43:08.248898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10084","last_updated":"2019-08-27T08:50:17Z","snapshot_observed_at":"2026-07-06T08:17:05.681370Z","submitted_at":"2019-08-27T08:50:17Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.10084","snapshot_observed_at":"2026-08-11T10:43:08.254025Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.254025Z"},"links":{"cited_paper":"/paper/1908.10084","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:5f86553562a416736895d919ef6d1bf5ee5f107b6672b53a0dc843c959ad4039","observation_id":"de5324e3-3a32-44a0-a14c-207650ee37e9","resolution":{"observed_at":"2026-08-11T10:43:08.254025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15998","last_updated":"2025-03-02T23:41:37Z","snapshot_observed_at":"2026-07-06T19:07:16.252072Z","submitted_at":"2024-08-28T17:59:31Z","title":"Eagle: Exploring The Design Space for Multimodal LLMs with Mixture of Encoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15998","snapshot_observed_at":"2026-08-11T10:43:08.259469Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.259469Z"},"links":{"cited_paper":"/paper/2408.15998","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:c1c2538f068ce7540ef61425db9c7581b272986587c871f2437db4ebef0be56a","observation_id":"fa9e2839-d2f8-4f32-b1b4-61908a1ba1e7","resolution":{"observed_at":"2026-08-11T10:43:08.259469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:43:08.264439Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.264439Z"},"links":{"citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:db33aee6e59c636c6c4d101801ed8f060fa865191f6efcfc355d64f2cc0100db","observation_id":"83e3ba0f-5a8b-44cf-98c4-82a29bed14f3","resolution":{"observed_at":"2026-08-11T10:43:08.264439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:43:09.344688Z","title":null,"venue":null,"work_id":"e6c5e700-275c-4191-8572-bfd325516b20","year":2021},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.269511Z"},"links":{"citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:53f15dfae5081d16313dfa24b5597aae1474e992b446945578722f95d2bac174","observation_id":"084ea4e5-4ca3-4848-b4e4-03a678783b6c","resolution":{"observed_at":"2026-08-11T10:43:09.350050Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-11T10:43:08.274466Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.274466Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:96743485034e924cdc4b7de61849286525f65ed8b3451ac4dee8b48ad3252409","observation_id":"6ee6884b-69f4-481a-9f67-263f29763ccb","resolution":{"observed_at":"2026-08-11T10:43:08.274466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:43:08.279350Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.279350Z"},"links":{"citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:19c9510cbe7e7cf766adcf4ec28f3d1f0b030fbd5c009fb5b89e2bb314aacb7c","observation_id":"660abd36-6da8-426d-a5df-ea81382b457c","resolution":{"observed_at":"2026-08-11T10:43:08.279350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:43:08.284180Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.284180Z"},"links":{"citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:276ef81e61c6b651ed7820c1fc93e95175b54dde61790f168856475bc9eea374","observation_id":"db90e8f6-2ebb-4bde-8364-563eaeb3d8d3","resolution":{"observed_at":"2026-08-11T10:43:08.284180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-11T10:43:08.289122Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.289122Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:e03a1a03abd2b5f39f2dc00fc82edb0aa29062e34d76e2f724e83055b9132d5a","observation_id":"3504fa73-4fd3-4924-a1f6-f4c77c5adda4","resolution":{"observed_at":"2026-08-11T10:43:08.289122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10560","last_updated":"2023-05-25T23:50:07Z","snapshot_observed_at":"2026-07-06T14:33:11.945106Z","submitted_at":"2022-12-20T18:59:19Z","title":"Self-Instruct: Aligning Language Models with Self-Generated Instructions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10560","snapshot_observed_at":"2026-08-11T10:43:08.294005Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.294005Z"},"links":{"cited_paper":"/paper/2212.10560","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:dae614ff0f77a53b281c87ab32a73631f439fcc1b93ef3a38b462cedc4873eae","observation_id":"37a2c492-2125-4336-b4b9-052f6a34d4bb","resolution":{"observed_at":"2026-08-11T10:43:08.294005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:43:09.301389Z","title":null,"venue":null,"work_id":"7c3e80dd-8edc-45dd-831f-718b758a0cb0","year":2023},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.298833Z"},"links":{"citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:4d5ab2d6f85f703bd319ca03803bfea07173c4c334b154a2f60693fd94672b66","observation_id":"819bbdeb-4eee-42cb-8852-9622a2f95d9b","resolution":{"observed_at":"2026-08-11T10:43:09.307105Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.12244","last_updated":"2025-05-27T06:49:09Z","snapshot_observed_at":"2026-08-11T20:57:48.098709Z","submitted_at":"2023-04-24T16:31:06Z","title":"WizardLM: Empowering large pre-trained language models to follow complex instructions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.12244","snapshot_observed_at":"2026-08-11T10:43:08.304211Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.304211Z"},"links":{"cited_paper":"/paper/2304.12244","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:fd1405d8e349c2a9d5ef942307be5179cfba13538d767fe55d0ba028414b89d7","observation_id":"1bb51277-e1c3-4935-83b6-ec35b11cdbb0","resolution":{"observed_at":"2026-08-11T10:43:08.304211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-06T16:32:30.757011Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-08-11T10:43:08.309295Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.309295Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:04001bdd33046fc7bd199be42da3159928187c43311e0635b2316a8b860e4cb7","observation_id":"bd986c29-9567-499f-ab33-9bc948658b71","resolution":{"observed_at":"2026-08-11T10:43:08.309295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-11T10:43:08.314525Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.314525Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:43029a42b5f99f1bab9d8c00417f1fc731413fc6b0d74813190bd086e0321852","observation_id":"ef38d3f2-5405-4ae5-bee0-17e04f7452bb","resolution":{"observed_at":"2026-08-11T10:43:08.314525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05126","last_updated":"2023-10-08T11:33:09Z","snapshot_observed_at":"2026-07-06T16:29:23.853368Z","submitted_at":"2023-10-08T11:33:09Z","title":"UReader: Universal OCR-free Visually-situated Language Understanding with Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05126","snapshot_observed_at":"2026-08-11T10:43:08.320223Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.320223Z"},"links":{"cited_paper":"/paper/2310.05126","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:10b555140944352d009c563f213301a3bb68b72b90efe35c105ae3ef3ae93fe7","observation_id":"bf827e25-0aed-4782-8627-8dfd9377e165","resolution":{"observed_at":"2026-08-11T10:43:08.320223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-11T10:43:08.330976Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.330976Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:b85851109ef7cb4956aab16354d4000ec4fb01e91350b0394f8d0c5bcdec66c8","observation_id":"bba694e8-6c14-4073-a46e-480ac2bcdcea","resolution":{"observed_at":"2026-08-11T10:43:08.330976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16199","last_updated":"2024-09-18T23:54:36Z","snapshot_observed_at":"2026-08-06T06:36:02.994951Z","submitted_at":"2023-03-28T17:59:12Z","title":"LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16199","snapshot_observed_at":"2026-08-11T10:43:08.336017Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.336017Z"},"links":{"cited_paper":"/paper/2303.16199","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:71ceb63f16297fc6115b63280caf7270663fead627d7cfa0b3d35b1c79ce03c5","observation_id":"9e3dde9d-e7b0-4f54-b686-4a4033c772ec","resolution":{"observed_at":"2026-08-11T10:43:08.336017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:43:09.283081Z","title":null,"venue":null,"work_id":"e7273ba2-0f96-45f0-89c9-13c07cafe60e","year":2024},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.341568Z"},"links":{"citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:0944df8f627016af6ba4e9ca0fbb8c214c81f8f764ce8b300c96a12a53974a42","observation_id":"d493ed16-3acd-4a52-b132-6fa5eed4ebed","resolution":{"observed_at":"2026-08-11T10:43:09.288560Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:43:08.346668Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.346668Z"},"links":{"citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:44852fd8d74651a5bd881144f551f2981ca7d5236f2e6c5c88a5281865d25072","observation_id":"039c9c1c-7118-4aa7-b692-2ad34cec58f7","resolution":{"observed_at":"2026-08-11T10:43:08.346668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-08-11T10:43:08.351843Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.351843Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:6afbf972aacf2c40432b43a005140ec768040b818a9cf391debe86ebff7dadd4","observation_id":"76e70a1b-40d9-4db0-b8c3-58ef0c8b9815","resolution":{"observed_at":"2026-08-11T10:43:08.351843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06731","last_updated":"2024-08-27T19:51:13Z","snapshot_observed_at":"2026-07-06T17:00:04.276081Z","submitted_at":"2023-12-11T09:44:41Z","title":"Genixer: Empowering Multimodal Large Language Models as a Powerful Data Generator","version":6},"cited_work":{"arxiv_id":"2312.06731","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.06731","snapshot_observed_at":"2026-08-11T10:43:08.438315Z","title":"Genixer: Empowering Multimodal Large Language Models as a Powerful Data Generator","venue":"cs.CV","work_id":"683ead8e-bd0f-4581-9f32-bc19d4aeb9bb","year":2023},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.357447Z"},"links":{"cited_paper":"/paper/2312.06731","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:a0b1300850563c8c497de78b629af639cdb8cb47d60c7feb24a91f9853232045","observation_id":"9f71f3fe-2089-4064-b1c9-612f4db72381","resolution":{"observed_at":"2026-08-11T10:43:08.445289Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-11T10:43:08.367718Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.367718Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:6a666df3c7b0ec910bc0550f8b1a29975c4256e53a2cb0f84c275ed63642e932","observation_id":"f5749c3a-7a2a-4bff-86e9-52f2ca6bdcea","resolution":{"observed_at":"2026-08-11T10:43:08.367718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:43:08.374718Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.374718Z"},"links":{"citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:ee50a99228e9461ea50179d2c26d2013932372ceee69036d288a80d4e9ccabdd","observation_id":"746f9fb3-8af6-47cc-a585-49c169dd95e8","resolution":{"observed_at":"2026-08-11T10:43:08.374718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:43:08.380678Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.380678Z"},"links":{"citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:cdce294d7f5e4e7cb21afebcb4a9fe472a4cde1d131e2414226e62ced088df2f","observation_id":"240ab25e-bb93-4ba0-9e60-afb92eeac574","resolution":{"observed_at":"2026-08-11T10:43:08.380678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":66,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 2 inbound Pith citation observations for arXiv:2412.16364."}