{"as_of":"2026-08-22T22:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:91057c8cf2913084d6d159304c8ea3e252baf59ad3a26c24675f9c270b5eed14","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":12,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":12,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T05:01:12.829064Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-15T22:48:36.084743Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2312.09251","last_updated":"2023-12-14T18:59:43Z","snapshot_observed_at":"2026-08-19T22:22:32.088147Z","submitted_at":"2023-12-14T18:59:43Z","title":"VL-GPT: A Generative Pre-trained Transformer for Vision and Language Understanding and Generation","version":1},"cited_work":{"arxiv_id":"2312.09251","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.09251","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vl-gpt: A generative pre-trained transformer for vision and language understanding and generation","venue":null,"work_id":"2891128c-bc6e-4651-be44-a7b8f6f3ad91","year":2023},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-08-12T19:12:43.246639Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2312.09251","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:0d58f0e0debf44926e51e0eb5c3670fc63be7ceb1b2ccbfab0dc6dd31aa86938","observation_id":"5928f9cd-bb60-4b94-a0f9-ed2f6486b02a","resolution":{"observed_at":"2026-05-15T22:48:36.089738Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09251","last_updated":"2023-12-14T18:59:43Z","snapshot_observed_at":"2026-08-19T22:22:32.088147Z","submitted_at":"2023-12-14T18:59:43Z","title":"VL-GPT: A Generative Pre-trained Transformer for Vision and Language Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09251","snapshot_observed_at":"2026-08-12T05:01:12.829064Z","title":"Vl-gpt: A generative pre-trained transformer for vision and language understanding and generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00832","last_updated":"2024-12-01T14:38:40Z","snapshot_observed_at":"2026-08-15T05:47:33.287055Z","submitted_at":"2024-12-01T14:38:40Z","title":"EventGPT: Event Stream Understanding with Multimodal Large Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T05:01:12.829064Z"},"links":{"cited_paper":"/paper/2312.09251","citing_paper":"/paper/2412.00832"},"observation_digest":"sha256:fbb6d6d822f93f63908de2016fdf6703b1f9c7c1258e9554bb1a03f9748ed7c0","observation_id":"517844bd-825e-4b7e-bd36-135d6f994670","resolution":{"observed_at":"2026-08-12T05:01:12.829064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09251","last_updated":"2023-12-14T18:59:43Z","snapshot_observed_at":"2026-08-19T22:22:32.088147Z","submitted_at":"2023-12-14T18:59:43Z","title":"VL-GPT: A Generative Pre-trained Transformer for Vision and Language Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09251","snapshot_observed_at":"2026-08-11T21:30:08.634738Z","title":"Vl-gpt: A generative pre-trained transformer for vision and language un- derstanding and generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-14T13:59:34.648701Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.634738Z"},"links":{"cited_paper":"/paper/2312.09251","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:a1b4f9e4ce36a4f9bad67b47f3630599335e534084e5329887acebad23f1d10b","observation_id":"226b838e-729e-416e-b6dd-31d478af8707","resolution":{"observed_at":"2026-08-11T21:30:08.634738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09251","last_updated":"2023-12-14T18:59:43Z","snapshot_observed_at":"2026-08-19T22:22:32.088147Z","submitted_at":"2023-12-14T18:59:43Z","title":"VL-GPT: A Generative Pre-trained Transformer for Vision and Language Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09251","snapshot_observed_at":"2026-08-11T20:14:56.605430Z","title":"Jinguo Zhu, Xiaohan Ding, Yixiao Ge, Yuying Ge, Sijie Zhao, Hengshuang Zhao, Xiaohua Wang, and Ying Shan","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.05939","last_updated":"2024-12-08T13:45:44Z","snapshot_observed_at":"2026-08-19T22:47:35.200206Z","submitted_at":"2024-12-08T13:45:44Z","title":"Exploring Multi-Grained Concept Annotations for Multimodal Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T20:14:56.605430Z"},"links":{"cited_paper":"/paper/2312.09251","citing_paper":"/paper/2412.05939"},"observation_digest":"sha256:6d690f932373d33dae3b620e0d07056eb80f2550270a7107906a420d144074c9","observation_id":"a92aea54-cee4-49cf-a20e-bbf5f78850c7","resolution":{"observed_at":"2026-08-11T20:14:56.605430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09251","last_updated":"2023-12-14T18:59:43Z","snapshot_observed_at":"2026-08-19T22:22:32.088147Z","submitted_at":"2023-12-14T18:59:43Z","title":"VL-GPT: A Generative Pre-trained Transformer for Vision and Language Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09251","snapshot_observed_at":"2026-08-11T17:00:09.118464Z","title":"就一起回未白镇去吧。","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09604","last_updated":"2024-12-12T18:59:26Z","snapshot_observed_at":"2026-08-16T05:48:44.789665Z","submitted_at":"2024-12-12T18:59:26Z","title":"SynerGen-VL: Towards Synergistic Image Understanding and Generation with Vision Experts and Token Folding","version":1},"reference_index":108,"source":"pdf_text","source_observed_at":"2026-08-11T17:00:09.118464Z"},"links":{"cited_paper":"/paper/2312.09251","citing_paper":"/paper/2412.09604"},"observation_digest":"sha256:996952930d1f6dfac9d04f4baf648354425b754eb7e6f0eee1519fb17f56b8cb","observation_id":"ba0cdd7b-2591-4cd2-b95f-5bcce834c269","resolution":{"observed_at":"2026-08-11T17:00:09.118464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09251","last_updated":"2023-12-14T18:59:43Z","snapshot_observed_at":"2026-08-19T22:22:32.088147Z","submitted_at":"2023-12-14T18:59:43Z","title":"VL-GPT: A Generative Pre-trained Transformer for Vision and Language Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09251","snapshot_observed_at":"2026-08-11T16:57:06.802539Z","title":"VL-GPT: A generative pre-trained transformer for vision and language understanding and generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-18T01:48:53.175172Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.802539Z"},"links":{"cited_paper":"/paper/2312.09251","citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:7d495f8ee8f6e0b19560e34a6b7c105d0c2dc8e7b507842dc4d0896ea6eed597","observation_id":"2020f042-2401-46d7-aa31-dfdfa02ce3c7","resolution":{"observed_at":"2026-08-11T16:57:06.802539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09251","last_updated":"2023-12-14T18:59:43Z","snapshot_observed_at":"2026-08-19T22:22:32.088147Z","submitted_at":"2023-12-14T18:59:43Z","title":"VL-GPT: A Generative Pre-trained Transformer for Vision and Language Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09251","snapshot_observed_at":"2026-08-10T22:08:09.771587Z","title":"Vl-gpt: A generative pre-trained transformer for vision and language understanding and generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-14T12:32:34.328935Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":225,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.771587Z"},"links":{"cited_paper":"/paper/2312.09251","citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:13ee446054fc4e6c0283d403e33da63b6e5a5b17608816346049303b63c6f79d","observation_id":"b9a7e13b-ff2b-46b4-aeb5-c499a095d2dd","resolution":{"observed_at":"2026-08-10T22:08:09.771587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09251","last_updated":"2023-12-14T18:59:43Z","snapshot_observed_at":"2026-08-19T22:22:32.088147Z","submitted_at":"2023-12-14T18:59:43Z","title":"VL-GPT: A Generative Pre-trained Transformer for Vision and Language Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09251","snapshot_observed_at":"2026-08-10T20:39:35.478614Z","title":"Vl-gpt: A generative pre-trained transformer for vision and language understanding and generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07783","last_updated":"2025-01-14T01:57:41Z","snapshot_observed_at":"2026-08-16T21:00:42.878558Z","submitted_at":"2025-01-14T01:57:41Z","title":"Parameter-Inverted Image Pyramid Networks for Visual Perception and Multimodal Understanding","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:35.478614Z"},"links":{"cited_paper":"/paper/2312.09251","citing_paper":"/paper/2501.07783"},"observation_digest":"sha256:a043a5e6be33ba4ff0e449c744f53969b35d71e4da62865f498f44cb064f94cd","observation_id":"e600f1ea-3796-4743-af71-30635ca88f4f","resolution":{"observed_at":"2026-08-10T20:39:35.478614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09251","last_updated":"2023-12-14T18:59:43Z","snapshot_observed_at":"2026-08-19T22:22:32.088147Z","submitted_at":"2023-12-14T18:59:43Z","title":"VL-GPT: A Generative Pre-trained Transformer for Vision and Language Understanding and Generation","version":1},"cited_work":{"arxiv_id":"2312.09251","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.09251","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vl-gpt: A generative pre-trained transformer for vision and language understanding and generation","venue":null,"work_id":"2891128c-bc6e-4651-be44-a7b8f6f3ad91","year":2023},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-08-16T07:03:45.766617Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"cited_paper":"/paper/2312.09251","citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:e3d8877d860f143057ea7de45fa4810116aa86d10ebf9d068b85f35107706c94","observation_id":"0d456aa7-05ec-41fe-a08f-a3a0500c832c","resolution":{"observed_at":"2026-05-15T14:50:59.848027Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09251","last_updated":"2023-12-14T18:59:43Z","snapshot_observed_at":"2026-08-19T22:22:32.088147Z","submitted_at":"2023-12-14T18:59:43Z","title":"VL-GPT: A Generative Pre-trained Transformer for Vision and Language Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09251","snapshot_observed_at":"2026-08-07T04:34:12.154340Z","title":"VL-GPT: A generative pre-trained transformer for vision and language understanding and generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:12.154340Z"},"links":{"cited_paper":"/paper/2312.09251","citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:02f4d361df9b3b0da9c8c7e114992d75976d10d7146981d36fc9413565ea5a73","observation_id":"9c091c59-76f3-4992-bda8-50607a9d87c7","resolution":{"observed_at":"2026-08-07T04:34:12.154340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09251","last_updated":"2023-12-14T18:59:43Z","snapshot_observed_at":"2026-08-19T22:22:32.088147Z","submitted_at":"2023-12-14T18:59:43Z","title":"VL-GPT: A Generative Pre-trained Transformer for Vision and Language Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09251","snapshot_observed_at":"2026-08-06T17:38:20.743420Z","title":"arXiv:2312.09251 (2023) 2 13","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-21T17:02:20.024126Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:20.743420Z"},"links":{"cited_paper":"/paper/2312.09251","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:01ad3eb5981daa9f116da68bc51bf6a0c0b73600a1dbc8198bfe2126e7bdc0b2","observation_id":"f7f5f831-62fd-475b-bc0d-3474d9e72514","resolution":{"observed_at":"2026-08-06T17:38:20.743420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09251","last_updated":"2023-12-14T18:59:43Z","snapshot_observed_at":"2026-08-19T22:22:32.088147Z","submitted_at":"2023-12-14T18:59:43Z","title":"VL-GPT: A Generative Pre-trained Transformer for Vision and Language Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09251","snapshot_observed_at":"2026-08-01T18:56:57.735425Z","title":"Vl-gpt: A generative pre-trained transformer for vision and language understanding and generation.arXiv preprint arXiv:2312.09251, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17140","last_updated":"2026-07-19T08:53:01Z","snapshot_observed_at":"2026-08-21T01:06:41.475390Z","submitted_at":"2026-07-19T08:53:01Z","title":"STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T18:56:57.735425Z"},"links":{"cited_paper":"/paper/2312.09251","citing_paper":"/paper/2607.17140"},"observation_digest":"sha256:bb7f27f48d4c0954c0bcf18d66436dde0406fa06a91795dd272e595a37223791","observation_id":"88709946-dcf2-487f-870a-4537ffaccfc5","resolution":{"observed_at":"2026-08-01T18:56:57.735425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2312.09251/citation-record","integrity":"/paper/2312.09251/integrity","json":"/paper/2312.09251/citation-record.json","paper":"/paper/2312.09251"},"outbound":[],"paper":{"arxiv_id":"2312.09251","last_updated":"2023-12-14T18:59:43Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-19T22:22:32.088147Z","submitted_at":"2023-12-14T18:59:43Z","title":"VL-GPT: A Generative Pre-trained Transformer for Vision and Language Understanding and Generation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 12 inbound Pith citation observations for arXiv:2312.09251."}