{"as_of":"2026-08-08T14:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:961d12f53106c36134931b059b341e6c50b15abf5fdfa4f9139dacd3a7562996","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:19:59.121503Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.08575/citation-record","integrity":"/paper/2507.08575/integrity","json":"/paper/2507.08575/citation-record.json","paper":"/paper/2507.08575"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T18:19:58.967536Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08575","last_updated":"2025-07-11T13:23:25Z","snapshot_observed_at":"2026-08-06T18:12:39.414027Z","submitted_at":"2025-07-11T13:23:25Z","title":"Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.967536Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.08575"},"observation_digest":"sha256:88837a40f64c67ee62508fd5eb7f76d3d5a7db03a450904ba0e5c61afb0d7cdf","observation_id":"2f850f75-b021-4635-8d30-f25ed505b968","resolution":{"observed_at":"2026-08-06T18:19:58.967536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-06T18:19:58.994170Z","title":"Palm-e: An embodied multimodal language model.arXiv preprint arXiv:2303.03378,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08575","last_updated":"2025-07-11T13:23:25Z","snapshot_observed_at":"2026-08-06T18:12:39.414027Z","submitted_at":"2025-07-11T13:23:25Z","title":"Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.994170Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2507.08575"},"observation_digest":"sha256:97d1f998c1e74525a62d59b8a22a6946821f963dc38bf65fde3696c5164e3962","observation_id":"b5372bbb-cb5c-4103-a6e9-84bb2767805d","resolution":{"observed_at":"2026-08-06T18:19:58.994170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:58.998910Z","title":"URL: https://aclanthology.org/P18-1119, doi:10.18653/v1/P18-1119","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08575","last_updated":"2025-07-11T13:23:25Z","snapshot_observed_at":"2026-08-06T18:12:39.414027Z","submitted_at":"2025-07-11T13:23:25Z","title":"Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.998910Z"},"links":{"citing_paper":"/paper/2507.08575"},"observation_digest":"sha256:a05a8e9f6d7e3cbdd30183b788f81f533c6b3db352a26b1caac8a04854e90b3e","observation_id":"070fce44-a963-48c6-a482-f3dcae919d39","resolution":{"observed_at":"2026-08-06T18:19:58.998910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T18:19:59.011087Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08575","last_updated":"2025-07-11T13:23:25Z","snapshot_observed_at":"2026-08-06T18:12:39.414027Z","submitted_at":"2025-07-11T13:23:25Z","title":"Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.011087Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.08575"},"observation_digest":"sha256:37e94969eb42fe9717c360bede3ca9deb091f0397eaedc2f40aaa9d89bc96255","observation_id":"061f5130-8738-41c6-a169-9c4c2c225d99","resolution":{"observed_at":"2026-08-06T18:19:59.011087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.650972Z","title":"Grounding spatial named entities for information extraction and question answering","venue":null,"work_id":"f13c94c9-be39-4d62-91be-8dcdc9feeea0","year":2003},"citing_paper":{"arxiv_id":"2507.08575","last_updated":"2025-07-11T13:23:25Z","snapshot_observed_at":"2026-08-06T18:12:39.414027Z","submitted_at":"2025-07-11T13:23:25Z","title":"Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.033967Z"},"links":{"citing_paper":"/paper/2507.08575"},"observation_digest":"sha256:600fdd9a10bedb2e32f74bae07c14d4e8c43d5672365a214ecc37ba3587389d4","observation_id":"d329a34d-baec-401c-858c-244e2a9c0e5b","resolution":{"observed_at":"2026-08-06T18:19:59.657870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09082","last_updated":"2025-03-19T13:31:16Z","snapshot_observed_at":"2026-08-07T22:39:21.328829Z","submitted_at":"2024-12-12T09:08:13Z","title":"Towards Long-Horizon Vision-Language Navigation: Platform, Benchmark and Method","version":3},"cited_work":{"arxiv_id":"2412.09082","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.09082","snapshot_observed_at":"2026-08-06T18:19:59.323958Z","title":"Towards Long-Horizon Vision-Language Navigation: Platform, Benchmark and Method","venue":"cs.CV","work_id":"43452ffe-e0f2-4eda-ba71-c05e3dac62de","year":2024},"citing_paper":{"arxiv_id":"2507.08575","last_updated":"2025-07-11T13:23:25Z","snapshot_observed_at":"2026-08-06T18:12:39.414027Z","submitted_at":"2025-07-11T13:23:25Z","title":"Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.057936Z"},"links":{"cited_paper":"/paper/2412.09082","citing_paper":"/paper/2507.08575"},"observation_digest":"sha256:c5d52e8685dddf0a05e0a40c24bcdbcb31c735d595257a7becf3ee6685943d9c","observation_id":"3ca0bd32-4809-48cb-a01e-0c67a2811234","resolution":{"observed_at":"2026-08-06T18:19:59.328241Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03054","last_updated":"2022-08-05T09:19:46Z","snapshot_observed_at":"2026-07-06T13:39:03.515752Z","submitted_at":"2022-08-05T09:19:46Z","title":"Global Pointer: Novel Efficient Span-based Approach for Named Entity Recognition","version":1},"cited_work":{"arxiv_id":"2208.03054","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.03054","snapshot_observed_at":"2026-08-06T18:19:59.298642Z","title":"Global Pointer: Novel Efficient Span-based Approach for Named Entity Recognition","venue":"cs.CL","work_id":"5ea9e103-5309-4943-a38b-aa565f80cfea","year":2022},"citing_paper":{"arxiv_id":"2507.08575","last_updated":"2025-07-11T13:23:25Z","snapshot_observed_at":"2026-08-06T18:12:39.414027Z","submitted_at":"2025-07-11T13:23:25Z","title":"Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.062417Z"},"links":{"cited_paper":"/paper/2208.03054","citing_paper":"/paper/2507.08575"},"observation_digest":"sha256:b8163e600147cc3509b116023a1091d418e6e92e6d4ab06d12b7456efb64a161","observation_id":"a76411f8-78d3-49d5-91bd-f7578568ac73","resolution":{"observed_at":"2026-08-06T18:19:59.304088Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11382","last_updated":"2023-02-21T12:42:44Z","snapshot_observed_at":"2026-07-06T14:54:37.559648Z","submitted_at":"2023-02-21T12:42:44Z","title":"A Prompt Pattern Catalog to Enhance Prompt Engineering with ChatGPT","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.11382","snapshot_observed_at":"2026-08-06T18:19:59.088000Z","title":"A prompt pattern catalog to enhance prompt engineering with chatgpt.arXiv preprint arXiv:2302.11382,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08575","last_updated":"2025-07-11T13:23:25Z","snapshot_observed_at":"2026-08-06T18:12:39.414027Z","submitted_at":"2025-07-11T13:23:25Z","title":"Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.088000Z"},"links":{"cited_paper":"/paper/2302.11382","citing_paper":"/paper/2507.08575"},"observation_digest":"sha256:e481cff68e20f784953787b86827e37c965c32f99e5fe954f820bd8dc68eaedb","observation_id":"f2326d49-382f-4aec-a1be-6f96cbcc1ee1","resolution":{"observed_at":"2026-08-06T18:19:59.088000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.628474Z","title":"In-context learning for few-shot nested named entity recognition","venue":null,"work_id":"a0856e5f-e4f8-4374-8888-52be4ded89e1","year":2024},"citing_paper":{"arxiv_id":"2507.08575","last_updated":"2025-07-11T13:23:25Z","snapshot_observed_at":"2026-08-06T18:12:39.414027Z","submitted_at":"2025-07-11T13:23:25Z","title":"Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.096943Z"},"links":{"citing_paper":"/paper/2507.08575"},"observation_digest":"sha256:7afbe2550c1c35372038ac963fd9f75d7a8a10f693b49be6444dae36879a10f5","observation_id":"6cb5e9d4-9e70-4b37-abd8-4c19925aee41","resolution":{"observed_at":"2026-08-06T18:19:59.634015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.615468Z","title":"A review on entity relation extraction","venue":null,"work_id":"0d5c8cd6-d347-4dc4-887f-0331d25a2b18","year":2017},"citing_paper":{"arxiv_id":"2507.08575","last_updated":"2025-07-11T13:23:25Z","snapshot_observed_at":"2026-08-06T18:12:39.414027Z","submitted_at":"2025-07-11T13:23:25Z","title":"Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.103239Z"},"links":{"citing_paper":"/paper/2507.08575"},"observation_digest":"sha256:486fae13251f2f934641283bbd9e17b3d822d799a2ed238517eb16b319401f4d","observation_id":"d9f3e58a-0a35-41b3-86b6-11a5327f6e6f","resolution":{"observed_at":"2026-08-06T18:19:59.620492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03493","last_updated":"2022-10-07T12:28:21Z","snapshot_observed_at":"2026-07-06T14:01:50.333970Z","submitted_at":"2022-10-07T12:28:21Z","title":"Automatic Chain of Thought Prompting in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03493","snapshot_observed_at":"2026-08-06T18:19:59.108408Z","title":"Automatic chain of thought prompting in large language models.arXiv preprint arXiv:2210.03493,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08575","last_updated":"2025-07-11T13:23:25Z","snapshot_observed_at":"2026-08-06T18:12:39.414027Z","submitted_at":"2025-07-11T13:23:25Z","title":"Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.108408Z"},"links":{"cited_paper":"/paper/2210.03493","citing_paper":"/paper/2507.08575"},"observation_digest":"sha256:f18ba92892c05c160e0ca2e89734a82e0dc38b05c946fb79bf00971d8e41b63f","observation_id":"493f346d-baa6-456f-8d54-81b62e4951eb","resolution":{"observed_at":"2026-08-06T18:19:59.108408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.13339","last_updated":"2024-03-26T01:53:30Z","snapshot_observed_at":"2026-07-06T16:22:42.704981Z","submitted_at":"2023-09-23T11:21:12Z","title":"Enhancing Zero-Shot Chain-of-Thought Reasoning in Large Language Models through Logic","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.13339","snapshot_observed_at":"2026-08-06T18:19:59.112934Z","title":"Enhancing zero-shot chain-of-thought reasoning in large language models through logic","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08575","last_updated":"2025-07-11T13:23:25Z","snapshot_observed_at":"2026-08-06T18:12:39.414027Z","submitted_at":"2025-07-11T13:23:25Z","title":"Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.112934Z"},"links":{"cited_paper":"/paper/2309.13339","citing_paper":"/paper/2507.08575"},"observation_digest":"sha256:8fd5b4dd43daa65d960c3c3f4213aedf100ef39fcf3f94ce13958f7e5afc5239","observation_id":"c9e9eca3-7b2e-446a-82c4-a49f0f4bb7fd","resolution":{"observed_at":"2026-08-06T18:19:59.112934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.590905Z","title":"A frustratingly easy approach for entity and relation extraction","venue":null,"work_id":"72ce1ab8-20e6-4ac4-a7bd-de5afe07df62","year":2021},"citing_paper":{"arxiv_id":"2507.08575","last_updated":"2025-07-11T13:23:25Z","snapshot_observed_at":"2026-08-06T18:12:39.414027Z","submitted_at":"2025-07-11T13:23:25Z","title":"Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.117455Z"},"links":{"citing_paper":"/paper/2507.08575"},"observation_digest":"sha256:8a5f877180f4be84f9a7fdfb44654dd72dd719224b6dd1a38bad4c7cc49d829c","observation_id":"fce66932-9b5a-478b-b1b1-a15fb387ec3c","resolution":{"observed_at":"2026-08-06T18:19:59.598471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.573942Z","title":"Geolocation on cartographic maps with multi-modal fusion","venue":null,"work_id":"93a77157-22b8-4fed-ab75-5735a75a0249","year":2024},"citing_paper":{"arxiv_id":"2507.08575","last_updated":"2025-07-11T13:23:25Z","snapshot_observed_at":"2026-08-06T18:12:39.414027Z","submitted_at":"2025-07-11T13:23:25Z","title":"Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.121503Z"},"links":{"citing_paper":"/paper/2507.08575"},"observation_digest":"sha256:647c85ef3a544ab10d75366c4818342a490744cb09388096c78837a57fd897bf","observation_id":"577a26f8-d4b6-460a-9845-5754281a89f7","resolution":{"observed_at":"2026-08-06T18:19:59.579481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16006","last_updated":"2024-04-24T17:37:05Z","snapshot_observed_at":"2026-07-06T18:05:03.284784Z","submitted_at":"2024-04-24T17:37:05Z","title":"MMT-Bench: A Comprehensive Multimodal Benchmark for Evaluating Large Vision-Language Models Towards Multitask AGI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16006","snapshot_observed_at":"2026-08-06T18:19:59.092552Z","title":"Mmt-bench: A comprehensive multimodal benchmark for evaluatinglargevision-languagemodelstowardsmultitaskagi","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08575","last_updated":"2025-07-11T13:23:25Z","snapshot_observed_at":"2026-08-06T18:12:39.414027Z","submitted_at":"2025-07-11T13:23:25Z","title":"Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing","version":1},"reference_index":2007,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.092552Z"},"links":{"cited_paper":"/paper/2404.16006","citing_paper":"/paper/2507.08575"},"observation_digest":"sha256:4b042d37034773dd85fd92ecda8ff3a3048e15a82066ff98759441f460e4f49a","observation_id":"194404aa-8c2c-4111-bd6d-595658e045ed","resolution":{"observed_at":"2026-08-06T18:19:59.092552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1603.08474","last_updated":"2016-03-28T18:38:46Z","snapshot_observed_at":"2026-07-06T04:50:53.488565Z","submitted_at":"2016-03-28T18:38:46Z","title":"Deep Embedding for Spatial Role Labeling","version":1},"cited_work":{"arxiv_id":"1603.08474","doi":null,"metadata_source":"pith","pith_arxiv_id":"1603.08474","snapshot_observed_at":"2026-08-06T18:19:59.358315Z","title":"Deep Embedding for Spatial Role Labeling","venue":"cs.CL","work_id":"c3e0dba5-64c3-439b-88c6-97608af1e3ec","year":2016},"citing_paper":{"arxiv_id":"2507.08575","last_updated":"2025-07-11T13:23:25Z","snapshot_observed_at":"2026-08-06T18:12:39.414027Z","submitted_at":"2025-07-11T13:23:25Z","title":"Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing","version":1},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.049593Z"},"links":{"cited_paper":"/paper/1603.08474","citing_paper":"/paper/2507.08575"},"observation_digest":"sha256:020e87599855a6de83abbfdf4133f372a68d23871f1621c457733d083d624570","observation_id":"01214886-ca42-4c5d-814d-7f7e8e087fb1","resolution":{"observed_at":"2026-08-06T18:19:59.362605Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T18:19:58.977609Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08575","last_updated":"2025-07-11T13:23:25Z","snapshot_observed_at":"2026-08-06T18:12:39.414027Z","submitted_at":"2025-07-11T13:23:25Z","title":"Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing","version":1},"reference_index":2010,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.977609Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2507.08575"},"observation_digest":"sha256:cb97652e7ef876f85b9b6c775e873eba55105916870ebcb04de71634e5101ac6","observation_id":"086ab75d-abdb-45d0-8780-a0562ec06b05","resolution":{"observed_at":"2026-08-06T18:19:58.977609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"4848.25348","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.479487Z","title":"24 Yoonsik Kim, Moonbin Yim, and Ka Yeon Song","venue":null,"work_id":"7b0b20f3-0dd6-42ab-a2fc-08e0c55f9fc6","year":null},"citing_paper":{"arxiv_id":"2507.08575","last_updated":"2025-07-11T13:23:25Z","snapshot_observed_at":"2026-08-06T18:12:39.414027Z","submitted_at":"2025-07-11T13:23:25Z","title":"Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing","version":1},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.027410Z"},"links":{"citing_paper":"/paper/2507.08575"},"observation_digest":"sha256:5438afaf75c229cef5d7715df1b41d05b80810b1613ac061e3210068a3e74f52","observation_id":"290b1aad-18df-4aa2-ab3f-cebbf98e35be","resolution":{"observed_at":"2026-08-06T18:19:59.485488Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/2629685","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.163813Z","title":null,"venue":null,"work_id":"8e254f97-fc98-47d4-abb0-fb059b9434d4","year":2025},"citing_paper":{"arxiv_id":"2507.08575","last_updated":"2025-07-11T13:23:25Z","snapshot_observed_at":"2026-08-06T18:12:39.414027Z","submitted_at":"2025-07-11T13:23:25Z","title":"Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.070619Z"},"links":{"citing_paper":"/paper/2507.08575"},"observation_digest":"sha256:1ec21b4618fe466cf934f66f99877cb14f89916375c38cd5084809833dee6717","observation_id":"be06cf4a-4fb7-4f1a-9c28-5d94b593515f","resolution":{"observed_at":"2026-08-06T18:19:59.168946Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02105","last_updated":"2023-12-09T02:05:05Z","snapshot_observed_at":"2026-08-03T17:11:00.296256Z","submitted_at":"2023-05-03T13:28:08Z","title":"GPT-RE: In-context Learning for Relation Extraction using Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02105","snapshot_observed_at":"2026-08-06T18:19:59.074638Z","title":"Gpt-re: In-context learning for relation extraction using large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08575","last_updated":"2025-07-11T13:23:25Z","snapshot_observed_at":"2026-08-06T18:12:39.414027Z","submitted_at":"2025-07-11T13:23:25Z","title":"Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.074638Z"},"links":{"cited_paper":"/paper/2305.02105","citing_paper":"/paper/2507.08575"},"observation_digest":"sha256:61a8ffc15a545dc8d81979486904b21aa5f9048cb1613404f5afde45dce242fa","observation_id":"48d2d07b-9d23-4fd4-a809-37840541772b","resolution":{"observed_at":"2026-08-06T18:19:59.074638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-06T18:19:58.986291Z","title":"Janus-pro: Unified multimodal understanding and generation with data and model scaling.arXiv preprint arXiv:2501.17811,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08575","last_updated":"2025-07-11T13:23:25Z","snapshot_observed_at":"2026-08-06T18:12:39.414027Z","submitted_at":"2025-07-11T13:23:25Z","title":"Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.986291Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2507.08575"},"observation_digest":"sha256:04d98bf6f313c04328cd135889a344c7351852f0c87e2cc529909ca4d18d438f","observation_id":"ec5fe78f-d0a6-4ab1-90e7-b7527bf3e4e0","resolution":{"observed_at":"2026-08-06T18:19:58.986291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.080445Z","title":"59 Jason Wei, Xuezhi Wang, Dale Schuurmans, Maarten Bosma, Fei Xia, Ed Chi, Quoc V Le, Denny Zhou, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08575","last_updated":"2025-07-11T13:23:25Z","snapshot_observed_at":"2026-08-06T18:12:39.414027Z","submitted_at":"2025-07-11T13:23:25Z","title":"Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.080445Z"},"links":{"citing_paper":"/paper/2507.08575"},"observation_digest":"sha256:98eb136cd6622be4492cf3662ce3c3643ac0c2dc841262dd402cba93b2f06359","observation_id":"2b709d42-0538-4c77-a415-ebb661b4d579","resolution":{"observed_at":"2026-08-06T18:19:59.080445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T18:19:59.066219Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08575","last_updated":"2025-07-11T13:23:25Z","snapshot_observed_at":"2026-08-06T18:12:39.414027Z","submitted_at":"2025-07-11T13:23:25Z","title":"Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.066219Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.08575"},"observation_digest":"sha256:5fd72e370772fd7b2f560aaf94e6b744ce0aadd570f3a2c0956ea02f75915abd","observation_id":"fd567148-4df0-4a48-955a-92c6a09183ea","resolution":{"observed_at":"2026-08-06T18:19:59.066219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03791","last_updated":"2024-08-26T07:13:47Z","snapshot_observed_at":"2026-07-06T18:41:27.621784Z","submitted_at":"2024-07-04T09:55:04Z","title":"M5 -- A Diverse Benchmark to Assess the Performance of Large Multimodal Models Across Multilingual and Multicultural Vision-Language Tasks","version":2},"cited_work":{"arxiv_id":"2407.03791","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.03791","snapshot_observed_at":"2026-08-06T18:19:59.341459Z","title":"M5 -- A Diverse Benchmark to Assess the Performance of Large Multimodal Models Across Multilingual and Multicultural Vision-Language Tasks","venue":"cs.CL","work_id":"67c09f98-df1a-4b2a-89e7-4c7304daf278","year":2024},"citing_paper":{"arxiv_id":"2507.08575","last_updated":"2025-07-11T13:23:25Z","snapshot_observed_at":"2026-08-06T18:12:39.414027Z","submitted_at":"2025-07-11T13:23:25Z","title":"Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.053584Z"},"links":{"cited_paper":"/paper/2407.03791","citing_paper":"/paper/2507.08575"},"observation_digest":"sha256:5b24ad7850d86d59e974afd1f4f2853329d40039ca5756b79d8664ed34fbf6b0","observation_id":"445ad10e-b5e3-45ea-bff3-caae10fb8c52","resolution":{"observed_at":"2026-08-06T18:19:59.346091Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.038022Z","title":"A transformer-based framework for poi- level social post geolocation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08575","last_updated":"2025-07-11T13:23:25Z","snapshot_observed_at":"2026-08-06T18:12:39.414027Z","submitted_at":"2025-07-11T13:23:25Z","title":"Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.038022Z"},"links":{"citing_paper":"/paper/2507.08575"},"observation_digest":"sha256:5bb4edf1152866c8b19f3d0a8c86ce40690f08f453a8158e567c4e350110920c","observation_id":"dbb14d36-a4a6-4345-bfcd-dd00aca3842b","resolution":{"observed_at":"2026-08-06T18:19:59.038022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-06T18:19:58.990203Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding.arXiv preprint arXiv:1810.04805,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08575","last_updated":"2025-07-11T13:23:25Z","snapshot_observed_at":"2026-08-06T18:12:39.414027Z","submitted_at":"2025-07-11T13:23:25Z","title":"Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.990203Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2507.08575"},"observation_digest":"sha256:35d11305a31873a793005bfb9ca3070b13739b3e17cef0e648a2ea199fb15db3","observation_id":"53351287-095b-4972-b180-3e85ad35486f","resolution":{"observed_at":"2026-08-06T18:19:58.990203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-06T18:19:59.043443Z","title":"Deepseek-v3 technical report.arXiv preprint arXiv:2412.19437,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08575","last_updated":"2025-07-11T13:23:25Z","snapshot_observed_at":"2026-08-06T18:12:39.414027Z","submitted_at":"2025-07-11T13:23:25Z","title":"Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.043443Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2507.08575"},"observation_digest":"sha256:d5297273936f322d24ff01576b904929b4ea8d8115a5ed02aac77eaa0031ad9d","observation_id":"1ceb43d4-b75e-4ce5-a815-76d33231b77c","resolution":{"observed_at":"2026-08-06T18:19:59.043443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.668924Z","title":null,"venue":null,"work_id":"88d9d2d6-1f04-47b4-8c0d-6c4e9047e12b","year":2025},"citing_paper":{"arxiv_id":"2507.08575","last_updated":"2025-07-11T13:23:25Z","snapshot_observed_at":"2026-08-06T18:12:39.414027Z","submitted_at":"2025-07-11T13:23:25Z","title":"Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.023282Z"},"links":{"citing_paper":"/paper/2507.08575"},"observation_digest":"sha256:8d426072220020fb68bc6d4bd3f4546207beac3a18da7295685d18357d81857a","observation_id":"99d47f5e-5a25-4663-a847-3451780e21fe","resolution":{"observed_at":"2026-08-06T18:19:59.674004Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.08575","last_updated":"2025-07-11T13:23:25Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-06T18:12:39.414027Z","submitted_at":"2025-07-11T13:23:25Z","title":"Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":17,"verified_exact":4,"verified_fuzzy":5},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 0 inbound Pith citation observations for arXiv:2507.08575."}