{"as_of":"2026-08-05T20:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d9ad4c053a7032a1f13f307645a3c71207e7330784499034c12840fd3d28e660","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":8,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":8,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-17T13:48:48.661566Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-17T13:48:48.809031Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2307.02469","last_updated":"2023-07-30T13:20:39Z","snapshot_observed_at":"2026-08-05T18:01:35.670542Z","submitted_at":"2023-07-05T17:44:28Z","title":"What Matters in Training a GPT4-Style Language Model with Multimodal Inputs?","version":2},"cited_work":{"arxiv_id":"2307.02469","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.02469","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"What matters in training a gpt4-style language model with multi- modal inputs? ArXiv, abs/2307.02469","venue":null,"work_id":"0ca2bbbf-940f-4625-af5f-1770b416694c","year":2023},"citing_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-10T20:25:33.854923Z"},"links":{"cited_paper":"/paper/2307.02469","citing_paper":"/paper/2306.13394"},"observation_digest":"sha256:e98d0ff7ea1000777ec2e0716963ab59b240b21c3da7389cf868c8e62757dcfa","observation_id":"97fe064e-72d2-436f-a61e-1e6fef227178","resolution":{"observed_at":"2026-05-10T20:25:34.330760Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02469","last_updated":"2023-07-30T13:20:39Z","snapshot_observed_at":"2026-08-05T18:01:35.670542Z","submitted_at":"2023-07-05T17:44:28Z","title":"What Matters in Training a GPT4-Style Language Model with Multimodal Inputs?","version":2},"cited_work":{"arxiv_id":"2307.02469","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.02469","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"What matters in training a gpt4-style language model with multi- modal inputs? ArXiv, abs/2307.02469","venue":null,"work_id":"0ca2bbbf-940f-4625-af5f-1770b416694c","year":2023},"citing_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-16T02:56:41.658658Z"},"links":{"cited_paper":"/paper/2307.02469","citing_paper":"/paper/2306.13549"},"observation_digest":"sha256:1768d583df863b52bb67a0799cee7997b3d07a38443781c3b74a796e68f3170d","observation_id":"cf6f323a-1b96-494b-a7ea-2a486b3c7a8f","resolution":{"observed_at":"2026-05-16T02:56:42.572284Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02469","last_updated":"2023-07-30T13:20:39Z","snapshot_observed_at":"2026-08-05T18:01:35.670542Z","submitted_at":"2023-07-05T17:44:28Z","title":"What Matters in Training a GPT4-Style Language Model with Multimodal Inputs?","version":2},"cited_work":{"arxiv_id":"2307.02469","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.02469","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"What matters in training a gpt4-style language model with multi- modal inputs? ArXiv, abs/2307.02469","venue":null,"work_id":"0ca2bbbf-940f-4625-af5f-1770b416694c","year":2023},"citing_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T23:57:08.818348Z"},"links":{"cited_paper":"/paper/2307.02469","citing_paper":"/paper/2308.06721"},"observation_digest":"sha256:6f4566ac335ee836a6e4472f932486293296f14c62969d89f174e4a91c67e1fe","observation_id":"25237c60-43e8-4f83-8214-bd179d311a9d","resolution":{"observed_at":"2026-05-10T23:57:09.061703Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02469","last_updated":"2023-07-30T13:20:39Z","snapshot_observed_at":"2026-08-05T18:01:35.670542Z","submitted_at":"2023-07-05T17:44:28Z","title":"What Matters in Training a GPT4-Style Language Model with Multimodal Inputs?","version":2},"cited_work":{"arxiv_id":"2307.02469","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.02469","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"What matters in training a gpt4-style language model with multi- modal inputs? ArXiv, abs/2307.02469","venue":null,"work_id":"0ca2bbbf-940f-4625-af5f-1770b416694c","year":2023},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"cited_paper":"/paper/2307.02469","citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:eb3aeda9a635214a415bee58e88ba8f1232df611f547cc0fe26b961d5724b0ac","observation_id":"5e3faddd-0351-409c-b533-c105526e204d","resolution":{"observed_at":"2026-05-17T13:48:48.813327Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02469","last_updated":"2023-07-30T13:20:39Z","snapshot_observed_at":"2026-08-05T18:01:35.670542Z","submitted_at":"2023-07-05T17:44:28Z","title":"What Matters in Training a GPT4-Style Language Model with Multimodal Inputs?","version":2},"cited_work":{"arxiv_id":"2307.02469","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.02469","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"What matters in training a gpt4-style language model with multi- modal inputs? ArXiv, abs/2307.02469","venue":null,"work_id":"0ca2bbbf-940f-4625-af5f-1770b416694c","year":2023},"citing_paper":{"arxiv_id":"2310.14566","last_updated":"2024-03-25T06:05:24Z","snapshot_observed_at":"2026-08-02T21:20:28.501823Z","submitted_at":"2023-10-23T04:49:09Z","title":"HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models","version":5},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-17T01:22:04.035994Z"},"links":{"cited_paper":"/paper/2307.02469","citing_paper":"/paper/2310.14566"},"observation_digest":"sha256:f0b573033d257f8590aa17a1507184915e21324d6d444a66f3d7209898e26a54","observation_id":"8b0dbc90-91ca-44d6-bf23-fb31328afd03","resolution":{"observed_at":"2026-05-17T01:22:04.195502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02469","last_updated":"2023-07-30T13:20:39Z","snapshot_observed_at":"2026-08-05T18:01:35.670542Z","submitted_at":"2023-07-05T17:44:28Z","title":"What Matters in Training a GPT4-Style Language Model with Multimodal Inputs?","version":2},"cited_work":{"arxiv_id":"2307.02469","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.02469","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"What matters in training a gpt4-style language model with multi- modal inputs? ArXiv, abs/2307.02469","venue":null,"work_id":"0ca2bbbf-940f-4625-af5f-1770b416694c","year":2023},"citing_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"reference_index":173,"source":"pdf_text","source_observed_at":"2026-05-13T22:46:09.693156Z"},"links":{"cited_paper":"/paper/2307.02469","citing_paper":"/paper/2312.14238"},"observation_digest":"sha256:7c1f6ed2cb2e792d84538d9f1d470fe5bd65f7570bc6ff976ad939b7b3d77740","observation_id":"af676ff4-e473-4d76-a556-4a79dd83cf88","resolution":{"observed_at":"2026-05-13T22:46:10.224847Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02469","last_updated":"2023-07-30T13:20:39Z","snapshot_observed_at":"2026-08-05T18:01:35.670542Z","submitted_at":"2023-07-05T17:44:28Z","title":"What Matters in Training a GPT4-Style Language Model with Multimodal Inputs?","version":2},"cited_work":{"arxiv_id":"2307.02469","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.02469","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"What matters in training a gpt4-style language model with multi- modal inputs? ArXiv, abs/2307.02469","venue":null,"work_id":"0ca2bbbf-940f-4625-af5f-1770b416694c","year":2023},"citing_paper":{"arxiv_id":"2402.12289","last_updated":"2024-06-25T17:55:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-19T17:04:04Z","title":"DriveVLM: The Convergence of Autonomous Driving and Large Vision-Language Models","version":5},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T19:22:35.305220Z"},"links":{"cited_paper":"/paper/2307.02469","citing_paper":"/paper/2402.12289"},"observation_digest":"sha256:baf64e209357feb88c48ffcc5210559021ee2114a7ad0f37c8ee10c4604bdd68","observation_id":"00a15118-ef80-4fd6-9517-4d71f41dae92","resolution":{"observed_at":"2026-05-12T19:22:35.390815Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02469","last_updated":"2023-07-30T13:20:39Z","snapshot_observed_at":"2026-08-05T18:01:35.670542Z","submitted_at":"2023-07-05T17:44:28Z","title":"What Matters in Training a GPT4-Style Language Model with Multimodal Inputs?","version":2},"cited_work":{"arxiv_id":"2307.02469","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.02469","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"What matters in training a gpt4-style language model with multi- modal inputs? ArXiv, abs/2307.02469","venue":null,"work_id":"0ca2bbbf-940f-4625-af5f-1770b416694c","year":2023},"citing_paper":{"arxiv_id":"2404.18930","last_updated":"2025-04-01T18:36:08Z","snapshot_observed_at":"2026-08-05T02:45:38.008864Z","submitted_at":"2024-04-29T17:59:41Z","title":"Hallucination of Multimodal Large Language Models: A Survey","version":2},"reference_index":203,"source":"pdf_text","source_observed_at":"2026-05-11T12:33:32.631346Z"},"links":{"cited_paper":"/paper/2307.02469","citing_paper":"/paper/2404.18930"},"observation_digest":"sha256:57ccd2ba7db752887ee29504238dd3f58f37403d547c97ed58757d687baa37bb","observation_id":"1563d9f1-f958-4f54-bf58-411fca5787de","resolution":{"observed_at":"2026-05-11T12:33:33.349839Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2307.02469/citation-record","integrity":"/paper/2307.02469/integrity","json":"/paper/2307.02469/citation-record.json","paper":"/paper/2307.02469"},"outbound":[],"paper":{"arxiv_id":"2307.02469","last_updated":"2023-07-30T13:20:39Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-05T18:01:35.670542Z","submitted_at":"2023-07-05T17:44:28Z","title":"What Matters in Training a GPT4-Style Language Model with Multimodal Inputs?"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 8 inbound Pith citation observations for arXiv:2307.02469."}