{"as_of":"2026-08-14T08:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e2cf43b374f8876733354c569ad7e808352944fcf54fb2be9451b70cbd851950","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":10,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":10,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T20:24:58.819520Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":4,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2310.00653","last_updated":"2023-10-01T12:35:18Z","snapshot_observed_at":"2026-08-14T05:35:37.531059Z","submitted_at":"2023-10-01T12:35:18Z","title":"Reformulating Vision-Language Foundation Models and Datasets Towards Universal Multimodal Assistants","version":1},"cited_work":{"arxiv_id":"2310.00653","doi":"10.48550/arxiv.2310.00653","metadata_source":"arxiv_reference","pith_arxiv_id":"2310.00653","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reformulating Vision-Language Foundation Models and Datasets Towards Universal Multimodal Assistants","venue":"arXiv (Cornell University)","work_id":"0694672f-55a1-47eb-9414-cb5f251314ff","year":2023},"citing_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-10T20:25:33.854923Z"},"links":{"cited_paper":"/paper/2310.00653","citing_paper":"/paper/2306.13394"},"observation_digest":"sha256:0837220712b367df1f1f2f4f7877be51481a04246d3c0cbba2401d636c5d30c5","observation_id":"217ca226-394d-49d1-82e7-fb462604f334","resolution":{"observed_at":"2026-05-10T20:25:34.309406Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:02.973999+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:02.973999+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00653","last_updated":"2023-10-01T12:35:18Z","snapshot_observed_at":"2026-08-14T05:35:37.531059Z","submitted_at":"2023-10-01T12:35:18Z","title":"Reformulating Vision-Language Foundation Models and Datasets Towards Universal Multimodal Assistants","version":1},"cited_work":{"arxiv_id":"2310.00653","doi":"10.48550/arxiv.2310.00653","metadata_source":"arxiv_reference","pith_arxiv_id":"2310.00653","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reformulating Vision-Language Foundation Models and Datasets Towards Universal Multimodal Assistants","venue":"arXiv (Cornell University)","work_id":"0694672f-55a1-47eb-9414-cb5f251314ff","year":2023},"citing_paper":{"arxiv_id":"2404.18930","last_updated":"2025-04-01T18:36:08Z","snapshot_observed_at":"2026-08-06T19:08:14.800394Z","submitted_at":"2024-04-29T17:59:41Z","title":"Hallucination of Multimodal Large Language Models: A Survey","version":2},"reference_index":197,"source":"pdf_text","source_observed_at":"2026-05-11T12:33:32.631346Z"},"links":{"cited_paper":"/paper/2310.00653","citing_paper":"/paper/2404.18930"},"observation_digest":"sha256:067d12674a7649403ea1517df8bcce80b8d649dae8bf7c877ec4a78fbc4d300b","observation_id":"6aa60318-4518-4baf-b743-feb9d0bdf296","resolution":{"observed_at":"2026-05-11T12:33:33.307160Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:02.973999+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:02.973999+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00653","last_updated":"2023-10-01T12:35:18Z","snapshot_observed_at":"2026-08-14T05:35:37.531059Z","submitted_at":"2023-10-01T12:35:18Z","title":"Reformulating Vision-Language Foundation Models and Datasets Towards Universal Multimodal Assistants","version":1},"cited_work":{"arxiv_id":"2310.00653","doi":"10.48550/arxiv.2310.00653","metadata_source":"arxiv_reference","pith_arxiv_id":"2310.00653","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reformulating Vision-Language Foundation Models and Datasets Towards Universal Multimodal Assistants","venue":"arXiv (Cornell University)","work_id":"0694672f-55a1-47eb-9414-cb5f251314ff","year":2023},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":110,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"cited_paper":"/paper/2310.00653","citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:075289c20338e820e504e2c37a502003af14b95a507041c43ed1244afc05d8aa","observation_id":"b5641bb9-40a0-4262-8502-9a954cfc4b04","resolution":{"observed_at":"2026-05-10T21:07:32.087932Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:02.973999+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:02.973999+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00653","last_updated":"2023-10-01T12:35:18Z","snapshot_observed_at":"2026-08-14T05:35:37.531059Z","submitted_at":"2023-10-01T12:35:18Z","title":"Reformulating Vision-Language Foundation Models and Datasets Towards Universal Multimodal Assistants","version":1},"cited_work":{"arxiv_id":"2310.00653","doi":"10.48550/arxiv.2310.00653","metadata_source":"arxiv_reference","pith_arxiv_id":"2310.00653","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reformulating Vision-Language Foundation Models and Datasets Towards Universal Multimodal Assistants","venue":"arXiv (Cornell University)","work_id":"0694672f-55a1-47eb-9414-cb5f251314ff","year":2023},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":130,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"cited_paper":"/paper/2310.00653","citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:d954a481376495f3bac933f4d6d4cfa00103297051d04c0bd54566cdd5fe35fa","observation_id":"0b33969a-66ec-4006-8894-d29737ff13b1","resolution":{"observed_at":"2026-05-23T07:42:42.993709Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:02.973999+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:02.973999+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00653","last_updated":"2023-10-01T12:35:18Z","snapshot_observed_at":"2026-08-14T05:35:37.531059Z","submitted_at":"2023-10-01T12:35:18Z","title":"Reformulating Vision-Language Foundation Models and Datasets Towards Universal Multimodal Assistants","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00653","snapshot_observed_at":"2026-08-11T20:24:58.819520Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-12T02:39:12.224910Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.819520Z"},"links":{"cited_paper":"/paper/2310.00653","citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:71b4a50ef9ce9384fa67b8a7e0b2b1dac4cb34b22b751c41d5dbe37417842598","observation_id":"c745772d-88be-4c47-9f00-6d7516d1e0ac","resolution":{"observed_at":"2026-08-11T20:24:58.819520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00653","last_updated":"2023-10-01T12:35:18Z","snapshot_observed_at":"2026-08-14T05:35:37.531059Z","submitted_at":"2023-10-01T12:35:18Z","title":"Reformulating Vision-Language Foundation Models and Datasets Towards Universal Multimodal Assistants","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00653","snapshot_observed_at":"2026-08-10T11:53:55.481346Z","title":"Reformulating vision-language foundation models and datasets towards universal multimodal assistants","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16629","last_updated":"2025-01-28T02:05:38Z","snapshot_observed_at":"2026-08-10T13:19:53.028871Z","submitted_at":"2025-01-28T02:05:38Z","title":"CHiP: Cross-modal Hierarchical Direct Preference Optimization for Multimodal LLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T11:53:55.481346Z"},"links":{"cited_paper":"/paper/2310.00653","citing_paper":"/paper/2501.16629"},"observation_digest":"sha256:3af3168dd07103e8ab6fb688ba91f2aaa7dbc4b43fc4948edd7b0b5a911f6936","observation_id":"1edcaefa-fd54-4104-8ec9-14bc52363ac6","resolution":{"observed_at":"2026-08-10T11:53:55.481346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00653","last_updated":"2023-10-01T12:35:18Z","snapshot_observed_at":"2026-08-14T05:35:37.531059Z","submitted_at":"2023-10-01T12:35:18Z","title":"Reformulating Vision-Language Foundation Models and Datasets Towards Universal Multimodal Assistants","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00653","snapshot_observed_at":"2026-08-07T22:43:59.490358Z","title":"Reformulating vision-language foundation models and datasets towards universal multimodal assistants","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09093","last_updated":"2025-02-13T09:04:28Z","snapshot_observed_at":"2026-08-13T17:42:20.149917Z","submitted_at":"2025-02-13T09:04:28Z","title":"From Visuals to Vocabulary: Establishing Equivalence Between Image and Text Token Through Autoregressive Pre-training in MLLMs","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T22:43:59.490358Z"},"links":{"cited_paper":"/paper/2310.00653","citing_paper":"/paper/2502.09093"},"observation_digest":"sha256:791b68f3f7b819caf1308f26ceeefcf99ad1d9094af8e57a402e9cc86eff9842","observation_id":"82484be8-65d5-475b-8c38-226399ffc1f5","resolution":{"observed_at":"2026-08-07T22:43:59.490358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00653","last_updated":"2023-10-01T12:35:18Z","snapshot_observed_at":"2026-08-14T05:35:37.531059Z","submitted_at":"2023-10-01T12:35:18Z","title":"Reformulating Vision-Language Foundation Models and Datasets Towards Universal Multimodal Assistants","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00653","snapshot_observed_at":"2026-08-07T14:22:59.580874Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19100","last_updated":"2025-05-25T11:33:08Z","snapshot_observed_at":"2026-08-09T04:49:33.633639Z","submitted_at":"2025-05-25T11:33:08Z","title":"ASPO: Adaptive Sentence-Level Preference Optimization for Fine-Grained Multimodal Reasoning","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T14:22:59.580874Z"},"links":{"cited_paper":"/paper/2310.00653","citing_paper":"/paper/2505.19100"},"observation_digest":"sha256:a0d93d77ddbdf05b626eba15b6ac5b1cb2108a7dd883d9e62ee700337434fd20","observation_id":"d24988dc-67bf-42b4-b1df-8f20cb1da434","resolution":{"observed_at":"2026-08-07T14:22:59.580874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00653","last_updated":"2023-10-01T12:35:18Z","snapshot_observed_at":"2026-08-14T05:35:37.531059Z","submitted_at":"2023-10-01T12:35:18Z","title":"Reformulating Vision-Language Foundation Models and Datasets Towards Universal Multimodal Assistants","version":1},"cited_work":{"arxiv_id":"2310.00653","doi":"10.48550/arxiv.2310.00653","metadata_source":"arxiv_reference","pith_arxiv_id":"2310.00653","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reformulating Vision-Language Foundation Models and Datasets Towards Universal Multimodal Assistants","venue":"arXiv (Cornell University)","work_id":"0694672f-55a1-47eb-9414-cb5f251314ff","year":2023},"citing_paper":{"arxiv_id":"2605.15300","last_updated":"2026-05-14T18:14:15Z","snapshot_observed_at":"2026-08-13T21:50:57.884397Z","submitted_at":"2026-05-14T18:14:15Z","title":"Deep Pre-Alignment for VLMs","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-19T16:26:41.094936Z"},"links":{"cited_paper":"/paper/2310.00653","citing_paper":"/paper/2605.15300"},"observation_digest":"sha256:7274ea7f5c8e121317c06ca43a57eef2d1dc30473e0c387a11a6a82636e14677","observation_id":"f30a3137-a4df-42e0-871f-31751ce3591c","resolution":{"observed_at":"2026-05-19T16:27:39.259198Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:02.973999+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:02.973999+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00653","last_updated":"2023-10-01T12:35:18Z","snapshot_observed_at":"2026-08-14T05:35:37.531059Z","submitted_at":"2023-10-01T12:35:18Z","title":"Reformulating Vision-Language Foundation Models and Datasets Towards Universal Multimodal Assistants","version":1},"cited_work":{"arxiv_id":"2310.00653","doi":"10.48550/arxiv.2310.00653","metadata_source":"arxiv_reference","pith_arxiv_id":"2310.00653","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reformulating Vision-Language Foundation Models and Datasets Towards Universal Multimodal Assistants","venue":"arXiv (Cornell University)","work_id":"0694672f-55a1-47eb-9414-cb5f251314ff","year":2023},"citing_paper":{"arxiv_id":"2606.11853","last_updated":"2026-06-10T09:30:25Z","snapshot_observed_at":"2026-08-02T20:07:37.622537Z","submitted_at":"2026-06-10T09:30:25Z","title":"Task-Aware Structured Memory for Dynamic Multi-modal In-Context Learning","version":1},"reference_index":168,"source":"arxiv_source","source_observed_at":"2026-06-27T10:28:11.440915Z"},"links":{"cited_paper":"/paper/2310.00653","citing_paper":"/paper/2606.11853"},"observation_digest":"sha256:539ac294daee32b062f2ae04d939d188f2de15137ca7016a106c967e94eda405","observation_id":"965a76ad-644f-4ffc-87e6-c643293715e6","resolution":{"observed_at":"2026-07-03T09:07:48.417157Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:02.973999+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:02.973999+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2310.00653/citation-record","integrity":"/paper/2310.00653/integrity","json":"/paper/2310.00653/citation-record.json","paper":"/paper/2310.00653"},"outbound":[],"paper":{"arxiv_id":"2310.00653","last_updated":"2023-10-01T12:35:18Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T05:35:37.531059Z","submitted_at":"2023-10-01T12:35:18Z","title":"Reformulating Vision-Language Foundation Models and Datasets Towards Universal Multimodal Assistants"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 10 inbound Pith citation observations for arXiv:2310.00653."}