{"as_of":"2026-08-17T06:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c8370a4908b99f166e685c983d4894e8cd37137a46fed9fc0d96d1b594ef67eb","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T17:56:46.279061Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-19T20:43:16.364125Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-19T20:47:45.997187Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.08378","last_updated":"2025-04-30T08:49:56Z","snapshot_observed_at":"2026-08-14T05:34:59.511553Z","submitted_at":"2024-12-11T13:41:21Z","title":"FILA: Fine-Grained Vision Language Models","version":3},"cited_work":{"arxiv_id":"2412.08378","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.08378","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fila: Fine- grained vision language models","venue":null,"work_id":"af414920-fdbf-43a0-99f1-3d4ff0a29ef4","year":2024},"citing_paper":{"arxiv_id":"2605.16909","last_updated":"2026-05-16T09:49:25Z","snapshot_observed_at":"2026-08-15T14:15:47.623703Z","submitted_at":"2026-05-16T09:49:25Z","title":"TOBench: A Task-Oriented Omni-Modal Benchmark for Real-World Tool-Using Agents","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-19T20:43:16.364125Z"},"links":{"cited_paper":"/paper/2412.08378","citing_paper":"/paper/2605.16909"},"observation_digest":"sha256:3b6cac28d93fc46c0652b48c9346ee8195cbb92b15411a9528a3e6bdadbcb1f1","observation_id":"c76ac201-24c0-48b3-93cf-51a6d244060f","resolution":{"observed_at":"2026-05-19T20:47:45.998928Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.08378/citation-record","integrity":"/paper/2412.08378/integrity","json":"/paper/2412.08378/citation-record.json","paper":"/paper/2412.08378"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-08-13T18:58:34.541884Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-11T17:56:46.154642Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08378","last_updated":"2025-04-30T08:49:56Z","snapshot_observed_at":"2026-08-14T05:34:59.511553Z","submitted_at":"2024-12-11T13:41:21Z","title":"FILA: Fine-Grained Vision Language Models","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T17:56:46.154642Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2412.08378"},"observation_digest":"sha256:ad590d4f3e4301665a7fdf63d4632685f19589b41ab442be96437f0809554b10","observation_id":"f813ec16-4a44-46b2-96c0-1376501fd228","resolution":{"observed_at":"2026-08-11T17:56:46.154642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-11T17:56:46.160077Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.08378","last_updated":"2025-04-30T08:49:56Z","snapshot_observed_at":"2026-08-14T05:34:59.511553Z","submitted_at":"2024-12-11T13:41:21Z","title":"FILA: Fine-Grained Vision Language Models","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T17:56:46.160077Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2412.08378"},"observation_digest":"sha256:4d10c490dfe151728666dca4d5d15657ca03cdfe340a59e271db06955acf76eb","observation_id":"4909a288-bb1f-4aee-b11f-df4b973d623e","resolution":{"observed_at":"2026-08-11T17:56:46.160077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-11T17:56:46.165232Z","title":"Chaoyou Fu, Peixian Chen, Yunhang Shen, Yulei Qin, Mengdan Zhang, Xu Lin, Zhenyu Qiu, Wei Lin, Jinrui Yang, Xiawu Zheng, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08378","last_updated":"2025-04-30T08:49:56Z","snapshot_observed_at":"2026-08-14T05:34:59.511553Z","submitted_at":"2024-12-11T13:41:21Z","title":"FILA: Fine-Grained Vision Language Models","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T17:56:46.165232Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2412.08378"},"observation_digest":"sha256:ab8edb3dfea0d2ae13f24cf3db6a51a2f1116b618262ece63287db93cb0d16c8","observation_id":"888df4e2-6bce-4c69-945a-8a2489a81a2d","resolution":{"observed_at":"2026-08-11T17:56:46.165232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03420","last_updated":"2024-09-09T05:36:27Z","snapshot_observed_at":"2026-08-16T13:21:07.303548Z","submitted_at":"2024-09-05T11:09:00Z","title":"mPLUG-DocOwl2: High-resolution Compressing for OCR-free Multi-page Document Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03420","snapshot_observed_at":"2026-08-11T17:56:46.175229Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08378","last_updated":"2025-04-30T08:49:56Z","snapshot_observed_at":"2026-08-14T05:34:59.511553Z","submitted_at":"2024-12-11T13:41:21Z","title":"FILA: Fine-Grained Vision Language Models","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T17:56:46.175229Z"},"links":{"cited_paper":"/paper/2409.03420","citing_paper":"/paper/2412.08378"},"observation_digest":"sha256:e89449e895aceaa0e858f26c55131366bc98d811efbd529664c7712240e44279","observation_id":"ea4bc805-2138-49c8-b0d4-f514d986f7c1","resolution":{"observed_at":"2026-08-11T17:56:46.175229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-08-08T05:14:59.435033Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-11T17:56:46.186496Z","title":"Andreas K ¨opf, Yannic Kilcher, Dimitri von R ¨utte, Sotiris Anagnostidis, Zhi Rui Tam, Keith Stevens, Abdullah Barhoum, Duc Nguyen, Oliver Stanley, Rich ´ard Nagyfi, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08378","last_updated":"2025-04-30T08:49:56Z","snapshot_observed_at":"2026-08-14T05:34:59.511553Z","submitted_at":"2024-12-11T13:41:21Z","title":"FILA: Fine-Grained Vision Language Models","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T17:56:46.186496Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2412.08378"},"observation_digest":"sha256:9305904bc63feb36aec27336ac1316e3b8c7dad8e4ad1ae08e1301ba6a7a8520","observation_id":"b3d3e998-e05f-4e26-97dc-c4565a33a5c6","resolution":{"observed_at":"2026-08-11T17:56:46.186496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-11T17:56:46.192029Z","title":"Mini-gemini: Mining the potential of multi-modality vision language models, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08378","last_updated":"2025-04-30T08:49:56Z","snapshot_observed_at":"2026-08-14T05:34:59.511553Z","submitted_at":"2024-12-11T13:41:21Z","title":"FILA: Fine-Grained Vision Language Models","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T17:56:46.192029Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2412.08378"},"observation_digest":"sha256:9183dac29c74d4a2f62ec28cb8437c0dc7cc57949c6413b8e46502be34693b36","observation_id":"428fa63d-aa58-43e8-87c2-8b460dfb63c0","resolution":{"observed_at":"2026-08-11T17:56:46.192029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-11T01:38:59.827005Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-11T17:56:46.197387Z","title":"Deepseek-vl: Towards real-world vision-language understanding, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08378","last_updated":"2025-04-30T08:49:56Z","snapshot_observed_at":"2026-08-14T05:34:59.511553Z","submitted_at":"2024-12-11T13:41:21Z","title":"FILA: Fine-Grained Vision Language Models","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T17:56:46.197387Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2412.08378"},"observation_digest":"sha256:8f43dd5eae71ca8fd0f69a6fc223a70e6616cc506f374a7c11ea90e5f53c468a","observation_id":"1175c106-796f-429e-8a42-686da30ca90b","resolution":{"observed_at":"2026-08-11T17:56:46.197387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-08-16T14:12:38.033838Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-08-11T17:56:46.202345Z","title":"Ahmed Masry, Do Xuan Long, Jia Qing Tan, Shafiq Joty, and Enamul Hoque","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08378","last_updated":"2025-04-30T08:49:56Z","snapshot_observed_at":"2026-08-14T05:34:59.511553Z","submitted_at":"2024-12-11T13:41:21Z","title":"FILA: Fine-Grained Vision Language Models","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T17:56:46.202345Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2412.08378"},"observation_digest":"sha256:b381e4449cc932b80b206ce707da7cc54b214a462b2f85695044db44751d529c","observation_id":"6ba66138-4fc2-4694-8843-2fba4401a95b","resolution":{"observed_at":"2026-08-11T17:56:46.202345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-08-11T03:45:43.920485Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-11T17:56:46.207284Z","title":"Minesh Mathew, Viraj Bagal, Rub `en P´erez Tito, Dimosthenis Karatzas, Ernest Valveny, and C","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2412.08378","last_updated":"2025-04-30T08:49:56Z","snapshot_observed_at":"2026-08-14T05:34:59.511553Z","submitted_at":"2024-12-11T13:41:21Z","title":"FILA: Fine-Grained Vision Language Models","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T17:56:46.207284Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2412.08378"},"observation_digest":"sha256:e88b3d8b3780b4cc35df0cfa900071478ef63df4bedf3155130728646e93f47e","observation_id":"9bc0d697-dd1d-4f1d-87fe-7262da9f3897","resolution":{"observed_at":"2026-08-11T17:56:46.207284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-11T17:56:46.213549Z","title":"Samyam Rajbhandari, Jeff Rasley, Olatunji Ruwase, and Yuxiong He","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08378","last_updated":"2025-04-30T08:49:56Z","snapshot_observed_at":"2026-08-14T05:34:59.511553Z","submitted_at":"2024-12-11T13:41:21Z","title":"FILA: Fine-Grained Vision Language Models","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T17:56:46.213549Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2412.08378"},"observation_digest":"sha256:c4f4fce99fcf4d16cdfd39b84853f90fe7f5c43bddd915deed11ddf1277b6429","observation_id":"8d3c4315-3ca8-4715-82c9-2179207d2bc1","resolution":{"observed_at":"2026-08-11T17:56:46.213549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:56:46.764801Z","title":null,"venue":null,"work_id":"6e3fb62a-c8b3-47d6-9c4c-23a1ce8a1a81","year":1910},"citing_paper":{"arxiv_id":"2412.08378","last_updated":"2025-04-30T08:49:56Z","snapshot_observed_at":"2026-08-14T05:34:59.511553Z","submitted_at":"2024-12-11T13:41:21Z","title":"FILA: Fine-Grained Vision Language Models","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T17:56:46.218289Z"},"links":{"citing_paper":"/paper/2412.08378"},"observation_digest":"sha256:adf9277290cc6e9f646fd5c88c5e77c32da1d6b092aeb59961d11b70a8a2dbe5","observation_id":"a0970d59-34c6-4972-a6b9-5388cb254a10","resolution":{"observed_at":"2026-08-11T17:56:46.770043Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.08402","last_updated":"2022-10-16T00:08:18Z","snapshot_observed_at":"2026-08-13T17:36:16.794649Z","submitted_at":"2022-10-16T00:08:18Z","title":"LAION-5B: An open large-scale dataset for training next generation image-text models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.08402","snapshot_observed_at":"2026-08-11T17:56:46.222949Z","title":"Amanpreet Singh, Vivek Natarajan, Meet Shah, Yu Jiang, Xinlei Chen, Dhruv Batra, Devi Parikh, and Marcus Rohrbach","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08378","last_updated":"2025-04-30T08:49:56Z","snapshot_observed_at":"2026-08-14T05:34:59.511553Z","submitted_at":"2024-12-11T13:41:21Z","title":"FILA: Fine-Grained Vision Language Models","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T17:56:46.222949Z"},"links":{"cited_paper":"/paper/2210.08402","citing_paper":"/paper/2412.08378"},"observation_digest":"sha256:fe2e6db883c9889068832d72062baba433c596e049e64ee1966a34075b1780ad","observation_id":"f2e99b39-f197-4592-836e-3a76de13f774","resolution":{"observed_at":"2026-08-11T17:56:46.222949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-11T17:56:46.233399Z","title":"A Vaswani","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08378","last_updated":"2025-04-30T08:49:56Z","snapshot_observed_at":"2026-08-14T05:34:59.511553Z","submitted_at":"2024-12-11T13:41:21Z","title":"FILA: Fine-Grained Vision Language Models","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T17:56:46.233399Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2412.08378"},"observation_digest":"sha256:7449d83d2c7807352d476a217a231626379b04d7eb101e7761b7dbb62ef6d39e","observation_id":"44f6bc17-8221-4c0d-8520-aafe88bde415","resolution":{"observed_at":"2026-08-11T17:56:46.233399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06109","last_updated":"2023-12-11T04:26:17Z","snapshot_observed_at":"2026-08-16T14:36:01.153196Z","submitted_at":"2023-12-11T04:26:17Z","title":"Vary: Scaling up the Vision Vocabulary for Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06109","snapshot_observed_at":"2026-08-11T17:56:46.238546Z","title":"Ruyi Xu, Yuan Yao, Zonghao Guo, Junbo Cui, Zanlin Ni, Chunjiang Ge, Tat-Seng Chua, Zhiyuan Liu, Maosong Sun, and Gao Huang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08378","last_updated":"2025-04-30T08:49:56Z","snapshot_observed_at":"2026-08-14T05:34:59.511553Z","submitted_at":"2024-12-11T13:41:21Z","title":"FILA: Fine-Grained Vision Language Models","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T17:56:46.238546Z"},"links":{"cited_paper":"/paper/2312.06109","citing_paper":"/paper/2412.08378"},"observation_digest":"sha256:e34079805a6e71a97b870f64243b1194fc3d21ffffb6b2f58fd7cfc5c7c3d76a","observation_id":"ae29ba6e-f9d1-4903-a0f4-529a03f08af7","resolution":{"observed_at":"2026-08-11T17:56:46.238546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05126","last_updated":"2023-10-08T11:33:09Z","snapshot_observed_at":"2026-08-16T14:54:06.604406Z","submitted_at":"2023-10-08T11:33:09Z","title":"UReader: Universal OCR-free Visually-situated Language Understanding with Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05126","snapshot_observed_at":"2026-08-11T17:56:46.243482Z","title":"Ureader: Universal ocr-free visually-situated language understanding with multimodal large language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.08378","last_updated":"2025-04-30T08:49:56Z","snapshot_observed_at":"2026-08-14T05:34:59.511553Z","submitted_at":"2024-12-11T13:41:21Z","title":"FILA: Fine-Grained Vision Language Models","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T17:56:46.243482Z"},"links":{"cited_paper":"/paper/2310.05126","citing_paper":"/paper/2412.08378"},"observation_digest":"sha256:bebdb6c723f71b24496958d91b3431eee23891f0d0a190415553543bdc98f3e2","observation_id":"55c95798-9e2b-41f5-b04c-686960fd8bd6","resolution":{"observed_at":"2026-08-11T17:56:46.243482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15343","last_updated":"2023-09-27T12:05:41Z","snapshot_observed_at":"2026-07-06T15:08:30.190912Z","submitted_at":"2023-03-27T15:53:01Z","title":"Sigmoid Loss for Language Image Pre-Training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15343","snapshot_observed_at":"2026-08-11T17:56:46.248659Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08378","last_updated":"2025-04-30T08:49:56Z","snapshot_observed_at":"2026-08-14T05:34:59.511553Z","submitted_at":"2024-12-11T13:41:21Z","title":"FILA: Fine-Grained Vision Language Models","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T17:56:46.248659Z"},"links":{"cited_paper":"/paper/2303.15343","citing_paper":"/paper/2412.08378"},"observation_digest":"sha256:bd75e798b0381ee8cd807642ff1cb2d2d1ca8db96e5343662b1baf2289d256a6","observation_id":"8a2f6583-0adc-40a9-ad94-e54e32ebd7f6","resolution":{"observed_at":"2026-08-11T17:56:46.248659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-11T17:56:46.253816Z","title":"org/abs/2205.01068","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08378","last_updated":"2025-04-30T08:49:56Z","snapshot_observed_at":"2026-08-14T05:34:59.511553Z","submitted_at":"2024-12-11T13:41:21Z","title":"FILA: Fine-Grained Vision Language Models","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T17:56:46.253816Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2412.08378"},"observation_digest":"sha256:319daa40f314e4d7052c95cebfeda12825ecafbde96919c5ca0ce2853136ec11","observation_id":"7a54fad1-509b-4f1b-a290-bca8dd6e1302","resolution":{"observed_at":"2026-08-11T17:56:46.253816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-08-16T15:19:58.984110Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-08-11T17:56:46.258654Z","title":"Dehua Zheng, Wenhui Dong, Hailin Hu, Xinghao Chen, and Yunhe Wang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08378","last_updated":"2025-04-30T08:49:56Z","snapshot_observed_at":"2026-08-14T05:34:59.511553Z","submitted_at":"2024-12-11T13:41:21Z","title":"FILA: Fine-Grained Vision Language Models","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T17:56:46.258654Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2412.08378"},"observation_digest":"sha256:df3164bc6a7382d1e4b771c91c9f5052f2bfad6a694aa0a4c53ecbe4a41c87af","observation_id":"13a0b67e-8927-45fa-b62a-1bb7f7b13556","resolution":{"observed_at":"2026-08-11T17:56:46.258654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11206","last_updated":"2023-05-18T17:45:22Z","snapshot_observed_at":"2026-08-08T19:18:06.171048Z","submitted_at":"2023-05-18T17:45:22Z","title":"LIMA: Less Is More for Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11206","snapshot_observed_at":"2026-08-11T17:56:46.263567Z","title":"Deyao Zhu, Jun Chen, Xiaoqian Shen, Xiang Li, and Mohamed Elhoseiny","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08378","last_updated":"2025-04-30T08:49:56Z","snapshot_observed_at":"2026-08-14T05:34:59.511553Z","submitted_at":"2024-12-11T13:41:21Z","title":"FILA: Fine-Grained Vision Language Models","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T17:56:46.263567Z"},"links":{"cited_paper":"/paper/2305.11206","citing_paper":"/paper/2412.08378"},"observation_digest":"sha256:857eb64f5167d192249f4d78a632523828fa3414640d4b0a28fa93cde5558112","observation_id":"d7a57c20-ba52-4629-bb46-b6dcbdfef324","resolution":{"observed_at":"2026-08-11T17:56:46.263567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:56:46.747747Z","title":"We compared our model with Minigemini-HD and LLaV A-NeXT","venue":null,"work_id":"a0b61e20-63ed-41b0-8fcd-8d5520163989","year":2025},"citing_paper":{"arxiv_id":"2412.08378","last_updated":"2025-04-30T08:49:56Z","snapshot_observed_at":"2026-08-14T05:34:59.511553Z","submitted_at":"2024-12-11T13:41:21Z","title":"FILA: Fine-Grained Vision Language Models","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T17:56:46.268813Z"},"links":{"citing_paper":"/paper/2412.08378"},"observation_digest":"sha256:56f313bb6b16ce48b534324228d8d024945b3c06e7e7df97135f8eb416bab886","observation_id":"97de2a77-2931-475b-ba2a-127cf6c5935f","resolution":{"observed_at":"2026-08-11T17:56:46.753400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:56:46.731650Z","title":"For the language model, we utilize LLaMA3-8B-Instruct (Touvron et al., 2023)","venue":null,"work_id":"7c49a37d-f48b-4490-9296-4d7c2b3b7eca","year":2023},"citing_paper":{"arxiv_id":"2412.08378","last_updated":"2025-04-30T08:49:56Z","snapshot_observed_at":"2026-08-14T05:34:59.511553Z","submitted_at":"2024-12-11T13:41:21Z","title":"FILA: Fine-Grained Vision Language Models","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T17:56:46.274343Z"},"links":{"citing_paper":"/paper/2412.08378"},"observation_digest":"sha256:8af70bd4487183f444d7cb63e539bcd22905fb92b048453aea815b1d3840f517","observation_id":"3cc98f9f-d5eb-4096-94be-a52d521ab81a","resolution":{"observed_at":"2026-08-11T17:56:46.736611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:56:46.713599Z","title":"1 Published as a conference paper at ICLR 2025 C A LIGNMENT STRATEGY Conv StageInput Dimensions (D, H, W)Output Dimensions (D, H, W)ViT LayerViT Dimensions (D, H, W) 1 (192, 192,","venue":null,"work_id":"bdb629d5-c044-4abb-a27b-06e79407a83a","year":2025},"citing_paper":{"arxiv_id":"2412.08378","last_updated":"2025-04-30T08:49:56Z","snapshot_observed_at":"2026-08-14T05:34:59.511553Z","submitted_at":"2024-12-11T13:41:21Z","title":"FILA: Fine-Grained Vision Language Models","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T17:56:46.279061Z"},"links":{"citing_paper":"/paper/2412.08378"},"observation_digest":"sha256:c9e592eeab4a12aecea3a3ef91c8c491a898f99fc0e3123c6fda6704b8001918","observation_id":"e10d6f62-724e-42c3-a318-5986a7073dfd","resolution":{"observed_at":"2026-08-11T17:56:46.720232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.08163","last_updated":"2018-03-29T17:42:15Z","snapshot_observed_at":"2026-08-14T19:52:17.945143Z","submitted_at":"2018-01-24T19:47:04Z","title":"DVQA: Understanding Data Visualizations via Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.08163","snapshot_observed_at":"2026-08-11T17:56:46.180959Z","title":"Aniruddha Kembhavi, Mike Salvato, Eric Kolve, Minjoon Seo, Hannaneh Hajishirzi, and Ali Farhadi","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08378","last_updated":"2025-04-30T08:49:56Z","snapshot_observed_at":"2026-08-14T05:34:59.511553Z","submitted_at":"2024-12-11T13:41:21Z","title":"FILA: Fine-Grained Vision Language Models","version":3},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-11T17:56:46.180959Z"},"links":{"cited_paper":"/paper/1801.08163","citing_paper":"/paper/2412.08378"},"observation_digest":"sha256:b9cbefb3083f491651ea967bc86388c457aa7108ac799cc697c0a03be928a384","observation_id":"90357c10-ccc6-4179-9542-bb05f495d320","resolution":{"observed_at":"2026-08-11T17:56:46.180959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.08920","last_updated":"2019-05-13T23:28:48Z","snapshot_observed_at":"2026-08-16T14:34:13.145148Z","submitted_at":"2019-04-18T17:55:37Z","title":"Towards VQA Models That Can Read","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.08920","snapshot_observed_at":"2026-08-11T17:56:46.227473Z","title":"Rub`en Tito, Dimosthenis Karatzas, and Ernest Valveny","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2412.08378","last_updated":"2025-04-30T08:49:56Z","snapshot_observed_at":"2026-08-14T05:34:59.511553Z","submitted_at":"2024-12-11T13:41:21Z","title":"FILA: Fine-Grained Vision Language Models","version":3},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-11T17:56:46.227473Z"},"links":{"cited_paper":"/paper/1904.08920","citing_paper":"/paper/2412.08378"},"observation_digest":"sha256:c793215c74ed8d9d5a0ffa29c0a33f96a14128afea5829afbe7f92e7f88457f7","observation_id":"4c3cc7a5-af74-4f29-a919-0133eb80ee98","resolution":{"observed_at":"2026-08-11T17:56:46.227473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-11T17:56:46.136537Z","title":"Soravit Changpinyo, Piyush Sharma, Nan Ding, and Radu Soricut","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.08378","last_updated":"2025-04-30T08:49:56Z","snapshot_observed_at":"2026-08-14T05:34:59.511553Z","submitted_at":"2024-12-11T13:41:21Z","title":"FILA: Fine-Grained Vision Language Models","version":3},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-11T17:56:46.136537Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2412.08378"},"observation_digest":"sha256:421bdad61d1f9c8e5c09e33126e9163fcaeb845e201a7d18783a236dc39de951","observation_id":"154c7030-8c73-4199-a715-a1fa32a30540","resolution":{"observed_at":"2026-08-11T17:56:46.136537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.08981","last_updated":"2021-03-30T08:20:34Z","snapshot_observed_at":"2026-08-16T18:44:50.804742Z","submitted_at":"2021-02-17T19:15:53Z","title":"Conceptual 12M: Pushing Web-Scale Image-Text Pre-Training To Recognize Long-Tail Visual Concepts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.08981","snapshot_observed_at":"2026-08-11T17:56:46.142751Z","title":"Guiming Hardy Chen, Shunian Chen, Ruifei Zhang, Junying Chen, Xiangbo Wu, Zhiyi Zhang, Zhi- hong Chen, Jianquan Li, Xiang Wan, and Benyou Wang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08378","last_updated":"2025-04-30T08:49:56Z","snapshot_observed_at":"2026-08-14T05:34:59.511553Z","submitted_at":"2024-12-11T13:41:21Z","title":"FILA: Fine-Grained Vision Language Models","version":3},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-11T17:56:46.142751Z"},"links":{"cited_paper":"/paper/2102.08981","citing_paper":"/paper/2412.08378"},"observation_digest":"sha256:80752642932fb95be755440e0dd945f3ae7e8df2e666b619545d6d1df6f48dcc","observation_id":"cc89895b-463a-4be5-adbb-c83152f070e5","resolution":{"observed_at":"2026-08-11T17:56:46.142751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-11T17:56:46.130070Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08378","last_updated":"2025-04-30T08:49:56Z","snapshot_observed_at":"2026-08-14T05:34:59.511553Z","submitted_at":"2024-12-11T13:41:21Z","title":"FILA: Fine-Grained Vision Language Models","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-11T17:56:46.130070Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2412.08378"},"observation_digest":"sha256:191e100b46d7f1075f99a0f1cc6bf4e552cc336d67545f72f481eff841f73171","observation_id":"4094e0ec-f248-4279-add7-b8db8605f171","resolution":{"observed_at":"2026-08-11T17:56:46.130070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-14T06:42:43.375489Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-11T17:56:46.148931Z","title":"Zhe Chen, Jiannan Wu, Wenhai Wang, Weijie Su, Guo Chen, Sen Xing, Muyan Zhong, Qinglong Zhang, Xizhou Zhu, Lewei Lu, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08378","last_updated":"2025-04-30T08:49:56Z","snapshot_observed_at":"2026-08-14T05:34:59.511553Z","submitted_at":"2024-12-11T13:41:21Z","title":"FILA: Fine-Grained Vision Language Models","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T17:56:46.148931Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2412.08378"},"observation_digest":"sha256:b51872e708cc904f1c9139ea6034adc27e537554ba3c1c9720451faeb2cd2324","observation_id":"c2f87344-0c1a-4a6f-8958-2bf4f66c849d","resolution":{"observed_at":"2026-08-11T17:56:46.148931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14566","last_updated":"2024-03-25T06:05:24Z","snapshot_observed_at":"2026-08-02T21:20:28.501823Z","submitted_at":"2023-10-23T04:49:09Z","title":"HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14566","snapshot_observed_at":"2026-08-11T17:56:46.170245Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.08378","last_updated":"2025-04-30T08:49:56Z","snapshot_observed_at":"2026-08-14T05:34:59.511553Z","submitted_at":"2024-12-11T13:41:21Z","title":"FILA: Fine-Grained Vision Language Models","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T17:56:46.170245Z"},"links":{"cited_paper":"/paper/2310.14566","citing_paper":"/paper/2412.08378"},"observation_digest":"sha256:861b2a3253139b34fbb92466566503e041a4c56644f54c625259bc0be99053b4","observation_id":"81823777-0b65-4849-b7b2-a4ce37034255","resolution":{"observed_at":"2026-08-11T17:56:46.170245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.08378","last_updated":"2025-04-30T08:49:56Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T05:34:59.511553Z","submitted_at":"2024-12-11T13:41:21Z","title":"FILA: Fine-Grained Vision Language Models"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 1 inbound Pith citation observation for arXiv:2412.08378."}