{"as_of":"2026-08-07T22:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8acc9a32882d06d03911e9288375bf7cf6b9d24dbe0ad0920f44ecfc13d0683e","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:51:16.306201Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T04:32:54.811976Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-18T04:35:52.532541Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.01293","last_updated":"2025-06-02T04:00:35Z","snapshot_observed_at":"2026-08-07T17:04:28.844476Z","submitted_at":"2025-06-02T04:00:35Z","title":"Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation","version":1},"cited_work":{"arxiv_id":"2506.01293","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01293","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"12 Pre-print Paper","venue":null,"work_id":"f294253a-b103-4097-927c-5f64a0e822d8","year":null},"citing_paper":{"arxiv_id":"2510.21828","last_updated":"2026-04-29T06:52:53Z","snapshot_observed_at":"2026-07-06T22:34:03.489056Z","submitted_at":"2025-10-22T02:23:40Z","title":"Structured and Abstractive Reasoning on Multi-modal Relational Knowledge Images","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-18T04:32:54.811976Z"},"links":{"cited_paper":"/paper/2506.01293","citing_paper":"/paper/2510.21828"},"observation_digest":"sha256:09ad855a08bc0c518799e11c652f4fbfe634ac5674d3c20b5ad42d4536618376","observation_id":"79b94a1b-5a30-405f-8010-acead9ca0538","resolution":{"observed_at":"2026-05-18T04:35:52.534603Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.01293/citation-record","integrity":"/paper/2506.01293/integrity","json":"/paper/2506.01293/citation-record.json","paper":"/paper/2506.01293"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-07T11:51:14.934338Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01293","last_updated":"2025-06-02T04:00:35Z","snapshot_observed_at":"2026-08-07T17:04:28.844476Z","submitted_at":"2025-06-02T04:00:35Z","title":"Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:14.934338Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2506.01293"},"observation_digest":"sha256:70da485423b1556ef661cae896c7faba5e1445b09ea3c132c3b656a587e44ff8","observation_id":"f85a4ec7-6c68-4f24-abca-ade0c4b7fd47","resolution":{"observed_at":"2026-08-07T11:51:14.934338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:14.970760Z","title":"Bollacker, Colin Evans, Praveen K","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01293","last_updated":"2025-06-02T04:00:35Z","snapshot_observed_at":"2026-08-07T17:04:28.844476Z","submitted_at":"2025-06-02T04:00:35Z","title":"Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:14.970760Z"},"links":{"citing_paper":"/paper/2506.01293"},"observation_digest":"sha256:e57b9aaca14ce33133ad64a8b031e814cc552917e6ebe8e12021db04629723c3","observation_id":"bd6c2653-a238-4fec-bac9-d7846396b54f","resolution":{"observed_at":"2026-08-07T11:51:14.970760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:17.960951Z","title":null,"venue":null,"work_id":"b4dac684-b843-4109-b000-e2c556d99f6b","year":2013},"citing_paper":{"arxiv_id":"2506.01293","last_updated":"2025-06-02T04:00:35Z","snapshot_observed_at":"2026-08-07T17:04:28.844476Z","submitted_at":"2025-06-02T04:00:35Z","title":"Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:14.983109Z"},"links":{"citing_paper":"/paper/2506.01293"},"observation_digest":"sha256:6a05055bd750282439c337ea5903a28a5530e5dba39d2094219fbe7fc1e0bf34","observation_id":"5e07069e-e5df-4098-81cf-dbfd16e72bac","resolution":{"observed_at":"2026-08-07T11:51:17.993288Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T11:51:14.988403Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01293","last_updated":"2025-06-02T04:00:35Z","snapshot_observed_at":"2026-08-07T17:04:28.844476Z","submitted_at":"2025-06-02T04:00:35Z","title":"Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:14.988403Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2506.01293"},"observation_digest":"sha256:1b6dcdfe2c9f4e9c160482c449be9f6497efbcc966ba055e7dfb8fbf1b55e827","observation_id":"0e6fe2f7-205c-4d23-bd7a-9b9e7cd2f583","resolution":{"observed_at":"2026-08-07T11:51:14.988403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05391","last_updated":"2024-02-26T09:57:12Z","snapshot_observed_at":"2026-07-06T17:27:11.705550Z","submitted_at":"2024-02-08T04:04:36Z","title":"Knowledge Graphs Meet Multi-Modal Learning: A Comprehensive Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05391","snapshot_observed_at":"2026-08-07T11:51:15.009701Z","title":"Pan, Ningyu Zhang, and Huajun Chen","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01293","last_updated":"2025-06-02T04:00:35Z","snapshot_observed_at":"2026-08-07T17:04:28.844476Z","submitted_at":"2025-06-02T04:00:35Z","title":"Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:15.009701Z"},"links":{"cited_paper":"/paper/2402.05391","citing_paper":"/paper/2506.01293"},"observation_digest":"sha256:11aca1dcf02a80dd9be58920bdc3aa68d985fc74feecd1bddacbd5e276bb7f30","observation_id":"2f17ef87-211b-4f7f-b9d8-c474e5c30f8a","resolution":{"observed_at":"2026-08-07T11:51:15.009701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:17.891851Z","title":null,"venue":null,"work_id":"decaca75-cc16-40c9-80ad-36369eaf0a0e","year":2023},"citing_paper":{"arxiv_id":"2506.01293","last_updated":"2025-06-02T04:00:35Z","snapshot_observed_at":"2026-08-07T17:04:28.844476Z","submitted_at":"2025-06-02T04:00:35Z","title":"Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:15.067266Z"},"links":{"citing_paper":"/paper/2506.01293"},"observation_digest":"sha256:3fafad9bc3081373a9405a50de896b23b96d95b9751aa5e3e19d19dfd9c67b33","observation_id":"fa49860d-a675-4ad9-a8de-52023691e378","resolution":{"observed_at":"2026-08-07T11:51:17.924839Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T11:51:15.139416Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01293","last_updated":"2025-06-02T04:00:35Z","snapshot_observed_at":"2026-08-07T17:04:28.844476Z","submitted_at":"2025-06-02T04:00:35Z","title":"Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:15.139416Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2506.01293"},"observation_digest":"sha256:84d04c872d583f3563f3ab8f7c2f87073ab79ee9f7c8da714ea94fa1e6534340","observation_id":"e2fd3f54-1f23-4ee1-b89c-9dd83b27e8a9","resolution":{"observed_at":"2026-08-07T11:51:15.139416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T11:51:15.219504Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01293","last_updated":"2025-06-02T04:00:35Z","snapshot_observed_at":"2026-08-07T17:04:28.844476Z","submitted_at":"2025-06-02T04:00:35Z","title":"Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:15.219504Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.01293"},"observation_digest":"sha256:4c92b658f2547ab91aee7abe3f5966b9854693cb62b04aaaf92f6ff410527bfe","observation_id":"4b61334d-4eec-4a94-a82b-1102f8b727c1","resolution":{"observed_at":"2026-08-07T11:51:15.219504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15296","last_updated":"2024-12-08T04:24:31Z","snapshot_observed_at":"2026-08-07T09:14:56.498818Z","submitted_at":"2024-11-22T18:59:54Z","title":"MME-Survey: A Comprehensive Survey on Evaluation of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15296","snapshot_observed_at":"2026-08-07T11:51:15.288212Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01293","last_updated":"2025-06-02T04:00:35Z","snapshot_observed_at":"2026-08-07T17:04:28.844476Z","submitted_at":"2025-06-02T04:00:35Z","title":"Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:15.288212Z"},"links":{"cited_paper":"/paper/2411.15296","citing_paper":"/paper/2506.01293"},"observation_digest":"sha256:e26bcdfcaac80dbf321bbe8a07a135dd00d6f01a762e32e548e31882cd52c1ba","observation_id":"15910943-7fd6-4bd0-975b-f2f21ac59ccd","resolution":{"observed_at":"2026-08-07T11:51:15.288212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03700","last_updated":"2025-01-09T09:12:06Z","snapshot_observed_at":"2026-08-04T10:20:08.342718Z","submitted_at":"2023-12-06T18:59:19Z","title":"OneLLM: One Framework to Align All Modalities with Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.03700","snapshot_observed_at":"2026-08-07T11:51:15.373641Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01293","last_updated":"2025-06-02T04:00:35Z","snapshot_observed_at":"2026-08-07T17:04:28.844476Z","submitted_at":"2025-06-02T04:00:35Z","title":"Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:15.373641Z"},"links":{"cited_paper":"/paper/2312.03700","citing_paper":"/paper/2506.01293"},"observation_digest":"sha256:529d593738c905cd718e9dc9a455bf9e1e9eb81dde9604ec295a8d05e4368595","observation_id":"4925e626-4ae7-49a8-b780-4c964a3ff5d8","resolution":{"observed_at":"2026-08-07T11:51:15.373641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:17.822132Z","title":null,"venue":null,"work_id":"ce564bdd-fb0a-43e1-86c2-664d485255ec","year":2024},"citing_paper":{"arxiv_id":"2506.01293","last_updated":"2025-06-02T04:00:35Z","snapshot_observed_at":"2026-08-07T17:04:28.844476Z","submitted_at":"2025-06-02T04:00:35Z","title":"Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:15.439238Z"},"links":{"citing_paper":"/paper/2506.01293"},"observation_digest":"sha256:7640f5a7e03627de2741f6bccaca41e0be46151eb28abb9f32b4ee77f55dac88","observation_id":"e80e2c79-5e1e-4f6c-9775-848493ee149c","resolution":{"observed_at":"2026-08-07T11:51:17.854091Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:17.759232Z","title":null,"venue":null,"work_id":"2add2e42-45c0-4aeb-9355-78ee7579f9c0","year":2024},"citing_paper":{"arxiv_id":"2506.01293","last_updated":"2025-06-02T04:00:35Z","snapshot_observed_at":"2026-08-07T17:04:28.844476Z","submitted_at":"2025-06-02T04:00:35Z","title":"Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:15.524054Z"},"links":{"citing_paper":"/paper/2506.01293"},"observation_digest":"sha256:bd67c318fb683ba32c6325e9090f2c88a02aada8b9fa9d0148ff4745a51cb30f","observation_id":"0eb020bb-8e50-4a9f-acea-e9b1639499a3","resolution":{"observed_at":"2026-08-07T11:51:17.788961Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-07T11:51:15.555590Z","title":"Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, and Dario Amodei","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.01293","last_updated":"2025-06-02T04:00:35Z","snapshot_observed_at":"2026-08-07T17:04:28.844476Z","submitted_at":"2025-06-02T04:00:35Z","title":"Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:15.555590Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2506.01293"},"observation_digest":"sha256:48d783174f49ffc1f92b242ff1edfe53216adf0a717cae5164fc5d7592c38d5c","observation_id":"be20d428-de4b-4cc9-8280-f5ab42511894","resolution":{"observed_at":"2026-08-07T11:51:15.555590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:15.562728Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01293","last_updated":"2025-06-02T04:00:35Z","snapshot_observed_at":"2026-08-07T17:04:28.844476Z","submitted_at":"2025-06-02T04:00:35Z","title":"Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:15.562728Z"},"links":{"citing_paper":"/paper/2506.01293"},"observation_digest":"sha256:0f50b1ea8c77f9b04c467e5cebb400c5ec2491594c9f153aa5ecc0323697ed8f","observation_id":"3e719622-a401-43e0-a42b-976544239029","resolution":{"observed_at":"2026-08-07T11:51:15.562728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:17.685544Z","title":null,"venue":null,"work_id":"b0e54c6c-fb0d-4774-8024-345c04beb5e5","year":2018},"citing_paper":{"arxiv_id":"2506.01293","last_updated":"2025-06-02T04:00:35Z","snapshot_observed_at":"2026-08-07T17:04:28.844476Z","submitted_at":"2025-06-02T04:00:35Z","title":"Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:15.568393Z"},"links":{"citing_paper":"/paper/2506.01293"},"observation_digest":"sha256:172fc72ca124ab7c60e6448812443bf1c045960e31687d1320c0b833219f7f5f","observation_id":"e806497e-639d-4bae-bba5-4399b5d1bdd1","resolution":{"observed_at":"2026-08-07T11:51:17.716792Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:17.624380Z","title":null,"venue":null,"work_id":"5dcc584a-3b8c-4816-a904-ebdcbf8b995a","year":2024},"citing_paper":{"arxiv_id":"2506.01293","last_updated":"2025-06-02T04:00:35Z","snapshot_observed_at":"2026-08-07T17:04:28.844476Z","submitted_at":"2025-06-02T04:00:35Z","title":"Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:15.574497Z"},"links":{"citing_paper":"/paper/2506.01293"},"observation_digest":"sha256:7bbacc6df8e878330424fea28a2c8360b449bd9843878761c1d12a44ef725ff0","observation_id":"c0795128-4efc-4446-86c4-9c94afd16760","resolution":{"observed_at":"2026-08-07T11:51:17.647745Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:15.580176Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01293","last_updated":"2025-06-02T04:00:35Z","snapshot_observed_at":"2026-08-07T17:04:28.844476Z","submitted_at":"2025-06-02T04:00:35Z","title":"Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:15.580176Z"},"links":{"citing_paper":"/paper/2506.01293"},"observation_digest":"sha256:d95c0643a6893b43625d885a4cc44341d1758ac0396ef7ac176a9960196a648c","observation_id":"42dd0028-a61c-4a3e-ac92-de6042eef898","resolution":{"observed_at":"2026-08-07T11:51:15.580176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:15.645016Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01293","last_updated":"2025-06-02T04:00:35Z","snapshot_observed_at":"2026-08-07T17:04:28.844476Z","submitted_at":"2025-06-02T04:00:35Z","title":"Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:15.645016Z"},"links":{"citing_paper":"/paper/2506.01293"},"observation_digest":"sha256:7de052474050882329adcc8f5a6f597207a09f1e003c891da997bde14dbe5678","observation_id":"9cd4d6ec-cbbd-4a28-a9d7-34499724d3c9","resolution":{"observed_at":"2026-08-07T11:51:15.645016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:15.711014Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01293","last_updated":"2025-06-02T04:00:35Z","snapshot_observed_at":"2026-08-07T17:04:28.844476Z","submitted_at":"2025-06-02T04:00:35Z","title":"Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:15.711014Z"},"links":{"citing_paper":"/paper/2506.01293"},"observation_digest":"sha256:5882dd696ec9c81b6456ad2f9a467d09b8b384f6a9dbaa33cff75da706005eda","observation_id":"cdd1339f-8475-4367-8077-3a72f326d1ad","resolution":{"observed_at":"2026-08-07T11:51:15.711014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:17.471472Z","title":"Rosenblum","venue":null,"work_id":"d29885d0-f995-40a6-b925-5d5500db3606","year":2019},"citing_paper":{"arxiv_id":"2506.01293","last_updated":"2025-06-02T04:00:35Z","snapshot_observed_at":"2026-08-07T17:04:28.844476Z","submitted_at":"2025-06-02T04:00:35Z","title":"Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:15.882390Z"},"links":{"citing_paper":"/paper/2506.01293"},"observation_digest":"sha256:8a10de5f6ec02e193c2c309d653bb7f163280aa692ed463253ad06218650cb1c","observation_id":"fae42c11-6228-4121-9762-281257b6f578","resolution":{"observed_at":"2026-08-07T11:51:17.504730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-05T16:51:32.094151Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-07T11:51:15.958555Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01293","last_updated":"2025-06-02T04:00:35Z","snapshot_observed_at":"2026-08-07T17:04:28.844476Z","submitted_at":"2025-06-02T04:00:35Z","title":"Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:15.958555Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2506.01293"},"observation_digest":"sha256:8957ef046465a03c2ee00976d8ee64394cd15f7231acbc43b992eedf8789b310","observation_id":"d807275d-f543-4f33-8acb-d65b268182fe","resolution":{"observed_at":"2026-08-07T11:51:15.958555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:17.401485Z","title":null,"venue":null,"work_id":"d58aa53a-0dda-453f-b750-88797a2063a7","year":2024},"citing_paper":{"arxiv_id":"2506.01293","last_updated":"2025-06-02T04:00:35Z","snapshot_observed_at":"2026-08-07T17:04:28.844476Z","submitted_at":"2025-06-02T04:00:35Z","title":"Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:16.048454Z"},"links":{"citing_paper":"/paper/2506.01293"},"observation_digest":"sha256:590050ec567f54c7b4d92efd8e6af69305c37091d1acbe9b1861389f156a2bf2","observation_id":"7a893f4d-30ef-46cb-b8a5-d0f12402f4c6","resolution":{"observed_at":"2026-08-07T11:51:17.435202Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:17.332372Z","title":null,"venue":null,"work_id":"66676ecc-289d-4742-8453-d50c8d6c209a","year":2022},"citing_paper":{"arxiv_id":"2506.01293","last_updated":"2025-06-02T04:00:35Z","snapshot_observed_at":"2026-08-07T17:04:28.844476Z","submitted_at":"2025-06-02T04:00:35Z","title":"Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:16.134853Z"},"links":{"citing_paper":"/paper/2506.01293"},"observation_digest":"sha256:506485b39829f7b16a6e20a52c137fac37448b9223329b51352070d1256fc9db","observation_id":"c85ec951-f156-43e0-84cf-e2c17e0951ab","resolution":{"observed_at":"2026-08-07T11:51:17.365615Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:17.263533Z","title":null,"venue":null,"work_id":"0d758f73-5b8c-447a-b3a8-cc7952052721","year":2024},"citing_paper":{"arxiv_id":"2506.01293","last_updated":"2025-06-02T04:00:35Z","snapshot_observed_at":"2026-08-07T17:04:28.844476Z","submitted_at":"2025-06-02T04:00:35Z","title":"Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:16.142260Z"},"links":{"citing_paper":"/paper/2506.01293"},"observation_digest":"sha256:9a61bed622c67e919ebfd84629fb4874b96a9dd3534f8f23f12846e233383816","observation_id":"c2c8a216-8a1f-4b63-b8bc-cb9df591cb30","resolution":{"observed_at":"2026-08-07T11:51:17.294513Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:16.149377Z","title":"Joty, and Enamul Hoque","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01293","last_updated":"2025-06-02T04:00:35Z","snapshot_observed_at":"2026-08-07T17:04:28.844476Z","submitted_at":"2025-06-02T04:00:35Z","title":"Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:16.149377Z"},"links":{"citing_paper":"/paper/2506.01293"},"observation_digest":"sha256:e6f2f1e23eed1e2c60d6020adc2c5da6e6416eec0b49686ce86efeafa761ece3","observation_id":"5afbda54-7bd4-43f5-851d-e66c2984b371","resolution":{"observed_at":"2026-08-07T11:51:16.149377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T11:51:16.160550Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01293","last_updated":"2025-06-02T04:00:35Z","snapshot_observed_at":"2026-08-07T17:04:28.844476Z","submitted_at":"2025-06-02T04:00:35Z","title":"Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:16.160550Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.01293"},"observation_digest":"sha256:f2571e27e101cecc786406460250d1cda98bd820b1ab4d4b56e4c73864cbf5b6","observation_id":"5ef70f23-95af-4c05-a03f-d49bda4aa050","resolution":{"observed_at":"2026-08-07T11:51:16.160550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T11:51:16.166355Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01293","last_updated":"2025-06-02T04:00:35Z","snapshot_observed_at":"2026-08-07T17:04:28.844476Z","submitted_at":"2025-06-02T04:00:35Z","title":"Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:16.166355Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.01293"},"observation_digest":"sha256:c4d8f30ed94463d070b30177016c283adbb26c0eff2d0dd765fbb60865c6c8a5","observation_id":"a8a2edcd-f88f-4f70-bafe-cbadfc14f834","resolution":{"observed_at":"2026-08-07T11:51:16.166355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00732","last_updated":"2023-08-11T04:00:59Z","snapshot_observed_at":"2026-08-03T10:01:45.488471Z","submitted_at":"2022-10-28T12:54:30Z","title":"Kuaipedia: a Large-scale Multi-modal Short-video Encyclopedia","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00732","snapshot_observed_at":"2026-08-07T11:51:16.171723Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01293","last_updated":"2025-06-02T04:00:35Z","snapshot_observed_at":"2026-08-07T17:04:28.844476Z","submitted_at":"2025-06-02T04:00:35Z","title":"Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:16.171723Z"},"links":{"cited_paper":"/paper/2211.00732","citing_paper":"/paper/2506.01293"},"observation_digest":"sha256:2863cdb6411016299b34620b3c4bcea890a9d7976f6219981c8980a4297ec2b1","observation_id":"0c37cfed-053a-4551-a000-4f8175778a67","resolution":{"observed_at":"2026-08-07T11:51:16.171723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:16.175972Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01293","last_updated":"2025-06-02T04:00:35Z","snapshot_observed_at":"2026-08-07T17:04:28.844476Z","submitted_at":"2025-06-02T04:00:35Z","title":"Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:16.175972Z"},"links":{"citing_paper":"/paper/2506.01293"},"observation_digest":"sha256:f70deb8bcc300534e1b9313a50a67a0d2a5d2ac4cf187c7d32790eabd0de88c8","observation_id":"0c7e798d-c948-4f30-852d-2019d917333f","resolution":{"observed_at":"2026-08-07T11:51:16.175972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-07T11:51:16.188018Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01293","last_updated":"2025-06-02T04:00:35Z","snapshot_observed_at":"2026-08-07T17:04:28.844476Z","submitted_at":"2025-06-02T04:00:35Z","title":"Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:16.188018Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2506.01293"},"observation_digest":"sha256:418318acf7de594a87e5b41cc1392f414871c8b5e794a877c7fb6d1d7763d4d7","observation_id":"de866fb6-b880-41cd-8ac0-662a665fff80","resolution":{"observed_at":"2026-08-07T11:51:16.188018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07594","last_updated":"2025-01-08T02:33:37Z","snapshot_observed_at":"2026-07-06T16:46:57.403995Z","submitted_at":"2023-11-10T09:51:24Z","title":"How to Bridge the Gap between Modalities: Survey on Multimodal Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07594","snapshot_observed_at":"2026-08-07T11:51:16.195471Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01293","last_updated":"2025-06-02T04:00:35Z","snapshot_observed_at":"2026-08-07T17:04:28.844476Z","submitted_at":"2025-06-02T04:00:35Z","title":"Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:16.195471Z"},"links":{"cited_paper":"/paper/2311.07594","citing_paper":"/paper/2506.01293"},"observation_digest":"sha256:ea760e1354025e0a515cb8af1bce66673a0482a7ec7595aefb12cabaa0d88b06","observation_id":"f227e881-ef47-4bef-94d7-0b0e3a407181","resolution":{"observed_at":"2026-08-07T11:51:16.195471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-07T22:11:30.869700Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-07T11:51:16.201170Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01293","last_updated":"2025-06-02T04:00:35Z","snapshot_observed_at":"2026-08-07T17:04:28.844476Z","submitted_at":"2025-06-02T04:00:35Z","title":"Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:16.201170Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2506.01293"},"observation_digest":"sha256:8db3e4aebac128a3b9a996ed11121366a048224e9cbee6753179dbdd6ba80d4a","observation_id":"c0388242-6620-4555-affc-a1e8af75cd0c","resolution":{"observed_at":"2026-08-07T11:51:16.201170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:17.123496Z","title":"IEEE Trans","venue":null,"work_id":"9537868b-c8fb-4452-9fd1-f874fdee7592","year":2024},"citing_paper":{"arxiv_id":"2506.01293","last_updated":"2025-06-02T04:00:35Z","snapshot_observed_at":"2026-08-07T17:04:28.844476Z","submitted_at":"2025-06-02T04:00:35Z","title":"Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:16.181041Z"},"links":{"citing_paper":"/paper/2506.01293"},"observation_digest":"sha256:824b01a96af84181b1f11f79afac37d2f2ce923c8ab36e2baee4ad0d61f1bb1b","observation_id":"98e5c32a-6400-4507-be1b-19e49f40accd","resolution":{"observed_at":"2026-08-07T11:51:17.152517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:17.048636Z","title":"Chawla, and Panpan Xu","venue":null,"work_id":"95a73b6b-e31c-47b7-b3a9-91abed2cea7c","year":2024},"citing_paper":{"arxiv_id":"2506.01293","last_updated":"2025-06-02T04:00:35Z","snapshot_observed_at":"2026-08-07T17:04:28.844476Z","submitted_at":"2025-06-02T04:00:35Z","title":"Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:16.213125Z"},"links":{"citing_paper":"/paper/2506.01293"},"observation_digest":"sha256:0c1d3c7f10be4dbd84718fffab258103e7cbfea29bd796ced4361f144fb44c07","observation_id":"7be4cc69-8431-4813-a8a1-34237f9c3da4","resolution":{"observed_at":"2026-08-07T11:51:17.081367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:16.979434Z","title":null,"venue":null,"work_id":"560337ca-cff3-4ecd-80a8-9b1caca70f6b","year":2024},"citing_paper":{"arxiv_id":"2506.01293","last_updated":"2025-06-02T04:00:35Z","snapshot_observed_at":"2026-08-07T17:04:28.844476Z","submitted_at":"2025-06-02T04:00:35Z","title":"Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:16.218726Z"},"links":{"citing_paper":"/paper/2506.01293"},"observation_digest":"sha256:070fef8b9d841dc2e169204505902305716de929302d6324cdf36f8abfae00a8","observation_id":"30853f77-c422-463d-90b4-d2f0e6c45910","resolution":{"observed_at":"2026-08-07T11:51:17.008897Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T11:51:16.225420Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01293","last_updated":"2025-06-02T04:00:35Z","snapshot_observed_at":"2026-08-07T17:04:28.844476Z","submitted_at":"2025-06-02T04:00:35Z","title":"Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:16.225420Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.01293"},"observation_digest":"sha256:8bafdf99bc3569c062784cec82330802fb62c83f783b3ee7a6eead84c2c5bc80","observation_id":"7c2ccbc7-c146-4aff-8724-9abc7024cb9c","resolution":{"observed_at":"2026-08-07T11:51:16.225420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:16.207299Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01293","last_updated":"2025-06-02T04:00:35Z","snapshot_observed_at":"2026-08-07T17:04:28.844476Z","submitted_at":"2025-06-02T04:00:35Z","title":"Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:16.207299Z"},"links":{"citing_paper":"/paper/2506.01293"},"observation_digest":"sha256:40dc3c88b29308e76cab60dfccb7fb91edb75bef5a7a36cc14f7e2dc7aded01f","observation_id":"d66bcf13-144d-4bd6-b517-58efaba1c970","resolution":{"observed_at":"2026-08-07T11:51:16.207299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:16.834956Z","title":null,"venue":null,"work_id":"ab139755-c91c-4621-8241-8265842aad89","year":2024},"citing_paper":{"arxiv_id":"2506.01293","last_updated":"2025-06-02T04:00:35Z","snapshot_observed_at":"2026-08-07T17:04:28.844476Z","submitted_at":"2025-06-02T04:00:35Z","title":"Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:16.245046Z"},"links":{"citing_paper":"/paper/2506.01293"},"observation_digest":"sha256:3a5ca4a3cb0787c6579ca0ad60890312fb9b17b2b9309ab5c5443f80e1a32671","observation_id":"69cc3f49-50a9-4637-a92e-116397dcb47a","resolution":{"observed_at":"2026-08-07T11:51:16.867705Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:16.764675Z","title":null,"venue":null,"work_id":"005fda85-5068-4b84-9e26-4c0d9cb241b3","year":2020},"citing_paper":{"arxiv_id":"2506.01293","last_updated":"2025-06-02T04:00:35Z","snapshot_observed_at":"2026-08-07T17:04:28.844476Z","submitted_at":"2025-06-02T04:00:35Z","title":"Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:16.249883Z"},"links":{"citing_paper":"/paper/2506.01293"},"observation_digest":"sha256:bb211b3feff5c3f4808cb64c14d0426f5331795765e1b3a4825ccf775e5e26d5","observation_id":"a7b9fe35-3a97-47f2-9a05-93ac6ac27d10","resolution":{"observed_at":"2026-08-07T11:51:16.797502Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-07T11:51:16.255941Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01293","last_updated":"2025-06-02T04:00:35Z","snapshot_observed_at":"2026-08-07T17:04:28.844476Z","submitted_at":"2025-06-02T04:00:35Z","title":"Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:16.255941Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2506.01293"},"observation_digest":"sha256:c2fc558bb40f07acce76f992450e0fc5965b04274424f2d3f86b6df28775376e","observation_id":"ad2e5686-ddc5-4ae3-bee1-fad971c0b80d","resolution":{"observed_at":"2026-08-07T11:51:16.255941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:16.232549Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01293","last_updated":"2025-06-02T04:00:35Z","snapshot_observed_at":"2026-08-07T17:04:28.844476Z","submitted_at":"2025-06-02T04:00:35Z","title":"Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:16.232549Z"},"links":{"citing_paper":"/paper/2506.01293"},"observation_digest":"sha256:b00e7a507c98a3aebe948b23bb101100767ebef43b62fe6fe0308612c7fadeac","observation_id":"2525553e-e713-4d49-a377-b3ea977ecf0a","resolution":{"observed_at":"2026-08-07T11:51:16.232549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:16.693561Z","title":null,"venue":null,"work_id":"e60d16f9-7252-4b3e-91a8-2f7c2bbe0332","year":2024},"citing_paper":{"arxiv_id":"2506.01293","last_updated":"2025-06-02T04:00:35Z","snapshot_observed_at":"2026-08-07T17:04:28.844476Z","submitted_at":"2025-06-02T04:00:35Z","title":"Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:16.267361Z"},"links":{"citing_paper":"/paper/2506.01293"},"observation_digest":"sha256:883a0beb8fcd059e92417efd51da804204de7a3f866f5d9f353cc2c0a2f8f90e","observation_id":"d5c14feb-38b6-463f-b5e5-374bfdb6c4f6","resolution":{"observed_at":"2026-08-07T11:51:16.727299Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:16.613744Z","title":null,"venue":null,"work_id":"ad7e2fc5-8ab3-4993-98b3-e7ed91b552bb","year":2024},"citing_paper":{"arxiv_id":"2506.01293","last_updated":"2025-06-02T04:00:35Z","snapshot_observed_at":"2026-08-07T17:04:28.844476Z","submitted_at":"2025-06-02T04:00:35Z","title":"Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:16.273100Z"},"links":{"citing_paper":"/paper/2506.01293"},"observation_digest":"sha256:a9acdc6100a71d927ca68508e31e5bc8a3e5b84d914b54afdb055de55b731546","observation_id":"8f68fa8f-97f5-46ce-a1a4-44fbfd0dc2a0","resolution":{"observed_at":"2026-08-07T11:51:16.646606Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-07T11:51:16.278433Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01293","last_updated":"2025-06-02T04:00:35Z","snapshot_observed_at":"2026-08-07T17:04:28.844476Z","submitted_at":"2025-06-02T04:00:35Z","title":"Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:16.278433Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2506.01293"},"observation_digest":"sha256:6767257e006f217035130c661532f9a7545f603ec4d8c5feef999148a7428967","observation_id":"169f654e-76f6-47f3-a49b-bffe7a36218c","resolution":{"observed_at":"2026-08-07T11:51:16.278433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00244","last_updated":"2024-12-31T03:20:22Z","snapshot_observed_at":"2026-07-06T20:15:03.658292Z","submitted_at":"2024-12-31T03:20:22Z","title":"Have We Designed Generalizable Structural Knowledge Promptings? Systematic Evaluation and Rethinking","version":1},"cited_work":{"arxiv_id":"2501.00244","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.00244","snapshot_observed_at":"2026-08-07T11:51:16.352714Z","title":"Have We Designed Generalizable Structural Knowledge Promptings? Systematic Evaluation and Rethinking","venue":"cs.CL","work_id":"fcbd46a7-9658-4402-a50e-1546c486f673","year":2024},"citing_paper":{"arxiv_id":"2506.01293","last_updated":"2025-06-02T04:00:35Z","snapshot_observed_at":"2026-08-07T17:04:28.844476Z","submitted_at":"2025-06-02T04:00:35Z","title":"Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:16.283390Z"},"links":{"cited_paper":"/paper/2501.00244","citing_paper":"/paper/2506.01293"},"observation_digest":"sha256:6018aaf548be059f814bb1349006a105c5f296b59dbc346ca5d6f1fe7dd37e03","observation_id":"0bd727e8-f489-4b97-b52c-73ca5150b444","resolution":{"observed_at":"2026-08-07T11:51:16.360772Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T11:51:16.261704Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01293","last_updated":"2025-06-02T04:00:35Z","snapshot_observed_at":"2026-08-07T17:04:28.844476Z","submitted_at":"2025-06-02T04:00:35Z","title":"Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:16.261704Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2506.01293"},"observation_digest":"sha256:6b058dd3638c90f20469d7e7917a05ec6d2a3c60cf3e56cf6f358892bf02a97f","observation_id":"091b15b2-f200-4028-937f-f7da0a9aa7fb","resolution":{"observed_at":"2026-08-07T11:51:16.261704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:16.469987Z","title":null,"venue":null,"work_id":"d854a96f-1903-4411-a1f9-ac421739273c","year":2024},"citing_paper":{"arxiv_id":"2506.01293","last_updated":"2025-06-02T04:00:35Z","snapshot_observed_at":"2026-08-07T17:04:28.844476Z","submitted_at":"2025-06-02T04:00:35Z","title":"Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:16.293965Z"},"links":{"citing_paper":"/paper/2506.01293"},"observation_digest":"sha256:b27834c26d4597efd647398012d7d8c0a3298a714bc492b17381be8bc211b5d5","observation_id":"856c8394-6ef6-41f2-91a9-9fe980927cd9","resolution":{"observed_at":"2026-08-07T11:51:16.504504Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-07T11:51:16.299953Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01293","last_updated":"2025-06-02T04:00:35Z","snapshot_observed_at":"2026-08-07T17:04:28.844476Z","submitted_at":"2025-06-02T04:00:35Z","title":"Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:16.299953Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2506.01293"},"observation_digest":"sha256:9215446fb480b95b1b2bcded12e5ccfbae58956f90b70a650850d7602a9d302a","observation_id":"8a11779f-a22c-4535-89f1-15ed8176387e","resolution":{"observed_at":"2026-08-07T11:51:16.299953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11453","last_updated":"2025-02-17T05:28:04Z","snapshot_observed_at":"2026-08-07T18:13:40.486358Z","submitted_at":"2025-02-17T05:28:04Z","title":"Connector-S: A Survey of Connectors in Multi-modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11453","snapshot_observed_at":"2026-08-07T11:51:16.306201Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01293","last_updated":"2025-06-02T04:00:35Z","snapshot_observed_at":"2026-08-07T17:04:28.844476Z","submitted_at":"2025-06-02T04:00:35Z","title":"Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:16.306201Z"},"links":{"cited_paper":"/paper/2502.11453","citing_paper":"/paper/2506.01293"},"observation_digest":"sha256:f3981500568a9fd0f0aff064bb3ff03af1b089ea7c19497bd2de39d2cd7622de","observation_id":"f4b93b65-7163-43f6-909c-f0408dc942e7","resolution":{"observed_at":"2026-08-07T11:51:16.306201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:16.542502Z","title":null,"venue":null,"work_id":"eb91f832-d312-436f-885a-77359f49e396","year":2025},"citing_paper":{"arxiv_id":"2506.01293","last_updated":"2025-06-02T04:00:35Z","snapshot_observed_at":"2026-08-07T17:04:28.844476Z","submitted_at":"2025-06-02T04:00:35Z","title":"Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:16.288193Z"},"links":{"citing_paper":"/paper/2506.01293"},"observation_digest":"sha256:c6e87a6e9ab39392a7ae47675be3d9529a314fe64964951c140974e3d6602d29","observation_id":"4829ac6a-63d3-4b1f-8663-c0bec75ce00c","resolution":{"observed_at":"2026-08-07T11:51:16.575342Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:18.031013Z","title":"In SIGMOD Conference","venue":null,"work_id":"13a56839-ec0c-48db-8c40-0d391fb16271","year":null},"citing_paper":{"arxiv_id":"2506.01293","last_updated":"2025-06-02T04:00:35Z","snapshot_observed_at":"2026-08-07T17:04:28.844476Z","submitted_at":"2025-06-02T04:00:35Z","title":"Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation","version":1},"reference_index":2008,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:14.978406Z"},"links":{"citing_paper":"/paper/2506.01293"},"observation_digest":"sha256:02dc86228c894583382e16e54c6f2f80097e36e3bdffcb9fd40e6ed7db153a5c","observation_id":"2b7dc90c-492d-4d66-8c2b-f91d0e9d055d","resolution":{"observed_at":"2026-08-07T11:51:18.063411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:17.192154Z","title":"In ACL (Findings)","venue":null,"work_id":"6e1eb90a-f025-4837-94c8-585fb54a537e","year":null},"citing_paper":{"arxiv_id":"2506.01293","last_updated":"2025-06-02T04:00:35Z","snapshot_observed_at":"2026-08-07T17:04:28.844476Z","submitted_at":"2025-06-02T04:00:35Z","title":"Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:16.154332Z"},"links":{"citing_paper":"/paper/2506.01293"},"observation_digest":"sha256:c0af78327268396799cc987b5dee68de717ef1ae8d5d6d0fb94f8624429f5973","observation_id":"d21b96e8-6096-40dd-bd36-a3ae3269e3cd","resolution":{"observed_at":"2026-08-07T11:51:17.221590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:16.904449Z","title":"In ACM Multimedia","venue":null,"work_id":"ae5916ae-9a90-4860-b0f6-b361be7b3a80","year":null},"citing_paper":{"arxiv_id":"2506.01293","last_updated":"2025-06-02T04:00:35Z","snapshot_observed_at":"2026-08-07T17:04:28.844476Z","submitted_at":"2025-06-02T04:00:35Z","title":"Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:16.238436Z"},"links":{"citing_paper":"/paper/2506.01293"},"observation_digest":"sha256:72578673a7cc7395048aa4b7cc7bcd42ea41762649be488348e9ad7736adeadc","observation_id":"184a5668-ea23-4763-899d-e8248b653917","resolution":{"observed_at":"2026-08-07T11:51:16.939546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:17.542212Z","title":"In ECCV (6) (Lecture Notes in Computer Science, Vol","venue":null,"work_id":"2b7d7df8-0fc2-46d3-bb73-818b30008cb0","year":null},"citing_paper":{"arxiv_id":"2506.01293","last_updated":"2025-06-02T04:00:35Z","snapshot_observed_at":"2026-08-07T17:04:28.844476Z","submitted_at":"2025-06-02T04:00:35Z","title":"Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:15.788175Z"},"links":{"citing_paper":"/paper/2506.01293"},"observation_digest":"sha256:e44c208518cb010585c6c2980c9ec3af5128a60ab76ab6a1429c28abe8577ecf","observation_id":"43e48b18-3428-4434-a82b-096c9b79dab2","resolution":{"observed_at":"2026-08-07T11:51:17.574672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.01293","last_updated":"2025-06-02T04:00:35Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T17:04:28.844476Z","submitted_at":"2025-06-02T04:00:35Z","title":"Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":46,"verified_exact":1,"verified_fuzzy":7},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 1 inbound Pith citation observation for arXiv:2506.01293."}