{"as_of":"2026-08-09T12:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c67957c40f481a47683009bb2e72660e6a9f8d429e9f0bc3d8a71ffc74a796a6","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":17,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":17,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":17,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T20:05:16.125929Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-18T15:11:32.537911Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2310.02992","last_updated":"2024-04-26T01:24:57Z","snapshot_observed_at":"2026-07-06T16:27:47.445841Z","submitted_at":"2023-10-04T17:28:44Z","title":"Kosmos-G: Generating Images in Context with Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02992","snapshot_observed_at":"2026-08-08T20:05:16.125929Z","title":"Kosmos-g: Generating images in context with multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05165","last_updated":"2025-02-07T18:48:54Z","snapshot_observed_at":"2026-08-09T08:34:13.595948Z","submitted_at":"2025-02-07T18:48:54Z","title":"Multitwine: Multi-Object Compositing with Text and Layout Control","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T20:05:16.125929Z"},"links":{"cited_paper":"/paper/2310.02992","citing_paper":"/paper/2502.05165"},"observation_digest":"sha256:8ec37991bc38fd7960c6f88345e055f7bb79112dabaf4f72d7482b64933e0f6f","observation_id":"7ee35b5d-4d11-4b72-8216-e62c5eb15e9c","resolution":{"observed_at":"2026-08-08T20:05:16.125929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02992","last_updated":"2024-04-26T01:24:57Z","snapshot_observed_at":"2026-07-06T16:27:47.445841Z","submitted_at":"2023-10-04T17:28:44Z","title":"Kosmos-G: Generating Images in Context with Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02992","snapshot_observed_at":"2026-08-08T10:24:41.564014Z","title":"Kosmos-g: Generating images in context with multimodal large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10458","last_updated":"2025-02-12T05:30:08Z","snapshot_observed_at":"2026-08-08T10:16:55.365971Z","submitted_at":"2025-02-12T05:30:08Z","title":"I Think, Therefore I Diffuse: Enabling Multimodal In-Context Reasoning in Diffusion Models","version":1},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-08T10:24:41.564014Z"},"links":{"cited_paper":"/paper/2310.02992","citing_paper":"/paper/2502.10458"},"observation_digest":"sha256:0cbd1a33158547b157aadebcadc62a74270a512f13e08ffbabe68fc64fd93359","observation_id":"2d81f8f4-bbf6-47d5-8c78-f11dd0ff8683","resolution":{"observed_at":"2026-08-08T10:24:41.564014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02992","last_updated":"2024-04-26T01:24:57Z","snapshot_observed_at":"2026-07-06T16:27:47.445841Z","submitted_at":"2023-10-04T17:28:44Z","title":"Kosmos-G: Generating Images in Context with Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02992","snapshot_observed_at":"2026-08-07T14:17:35.431664Z","title":"Kosmos-g: Generating images in context with multimodal large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-07T14:12:18.054397Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:35.431664Z"},"links":{"cited_paper":"/paper/2310.02992","citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:376c20b48ec1bbe36cea51b33f71bb80051386b89efad48a9003d61fdbe283c2","observation_id":"f90bcb09-fe16-46c2-b5b9-42cba39f935c","resolution":{"observed_at":"2026-08-07T14:17:35.431664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02992","last_updated":"2024-04-26T01:24:57Z","snapshot_observed_at":"2026-07-06T16:27:47.445841Z","submitted_at":"2023-10-04T17:28:44Z","title":"Kosmos-G: Generating Images in Context with Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02992","snapshot_observed_at":"2026-08-07T14:14:42.998277Z","title":"Kosmos- g: Generating images in context with multimodal large language models.arXiv preprint arXiv:2310.02992, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-09T09:30:25.697403Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:42.998277Z"},"links":{"cited_paper":"/paper/2310.02992","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:71d793667fdc3c3238f08a95b880216a52b49c6bcc9b0409bdb9a3be9bf27f29","observation_id":"0b9d012b-7ae5-462b-905a-907bb39c1e1c","resolution":{"observed_at":"2026-08-07T14:14:42.998277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02992","last_updated":"2024-04-26T01:24:57Z","snapshot_observed_at":"2026-07-06T16:27:47.445841Z","submitted_at":"2023-10-04T17:28:44Z","title":"Kosmos-G: Generating Images in Context with Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02992","snapshot_observed_at":"2026-08-07T14:09:00.316876Z","title":"Kosmos-G: Generating images in context with multimodal large language models.ArXiv, abs/2310.02992, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19901","last_updated":"2025-06-03T07:32:50Z","snapshot_observed_at":"2026-08-07T14:01:44.324106Z","submitted_at":"2025-05-26T12:29:34Z","title":"Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:00.316876Z"},"links":{"cited_paper":"/paper/2310.02992","citing_paper":"/paper/2505.19901"},"observation_digest":"sha256:d930fdb8eeef200cd0fb5ad26c1aa3837b772367000fb9fd9a66604335e251f8","observation_id":"996c4bfb-196b-4917-96b6-78e9ee86cc08","resolution":{"observed_at":"2026-08-07T14:09:00.316876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02992","last_updated":"2024-04-26T01:24:57Z","snapshot_observed_at":"2026-07-06T16:27:47.445841Z","submitted_at":"2023-10-04T17:28:44Z","title":"Kosmos-G: Generating Images in Context with Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02992","snapshot_observed_at":"2026-08-07T14:03:03.103132Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:03.103132Z"},"links":{"cited_paper":"/paper/2310.02992","citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:dfaa82784db63633ad97a5db6c42beeb785a50b0208219d43d4ac2685285871b","observation_id":"bcf822f8-01b4-4cdd-a64d-b01db4ae688a","resolution":{"observed_at":"2026-08-07T14:03:03.103132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02992","last_updated":"2024-04-26T01:24:57Z","snapshot_observed_at":"2026-07-06T16:27:47.445841Z","submitted_at":"2023-10-04T17:28:44Z","title":"Kosmos-G: Generating Images in Context with Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02992","snapshot_observed_at":"2026-08-07T13:48:34.203912Z","title":"Kosmos-g: Generating images in context with multimodal large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20909","last_updated":"2025-05-27T08:57:07Z","snapshot_observed_at":"2026-08-08T21:30:55.452623Z","submitted_at":"2025-05-27T08:57:07Z","title":"Create Anything Anywhere: Layout-Controllable Personalized Diffusion Model for Multiple Subjects","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:34.203912Z"},"links":{"cited_paper":"/paper/2310.02992","citing_paper":"/paper/2505.20909"},"observation_digest":"sha256:c620c1b5d56e881777b312540ebc3e57d88b06c6ed7af14c3218dd2994ef27dc","observation_id":"c3a3fb72-17da-4008-a3fc-acab907f9fec","resolution":{"observed_at":"2026-08-07T13:48:34.203912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02992","last_updated":"2024-04-26T01:24:57Z","snapshot_observed_at":"2026-07-06T16:27:47.445841Z","submitted_at":"2023-10-04T17:28:44Z","title":"Kosmos-G: Generating Images in Context with Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02992","snapshot_observed_at":"2026-08-05T22:32:51.941613Z","title":"arXiv preprint arXiv:2310.02992 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.06905","last_updated":"2025-08-26T12:18:14Z","snapshot_observed_at":"2026-08-07T03:28:03.679250Z","submitted_at":"2025-08-09T09:36:21Z","title":"MultiRef: Controllable Image Generation with Multiple Visual References","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T22:32:51.941613Z"},"links":{"cited_paper":"/paper/2310.02992","citing_paper":"/paper/2508.06905"},"observation_digest":"sha256:5c197c2823238b5a78bc580b5b39936d30e0afee2d06826a6703fc0a3acda905","observation_id":"578a4aeb-8b48-4569-8d07-50c2268e04d2","resolution":{"observed_at":"2026-08-05T22:32:51.941613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02992","last_updated":"2024-04-26T01:24:57Z","snapshot_observed_at":"2026-07-06T16:27:47.445841Z","submitted_at":"2023-10-04T17:28:44Z","title":"Kosmos-G: Generating Images in Context with Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02992","snapshot_observed_at":"2026-08-05T20:44:38.060925Z","title":"Kosmos-g: Generating images in context with multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09945","last_updated":"2025-08-13T17:00:44Z","snapshot_observed_at":"2026-08-08T00:13:29.644971Z","submitted_at":"2025-08-13T17:00:44Z","title":"VisCodex: Unified Multimodal Code Generation via Merging Vision and Coding Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:38.060925Z"},"links":{"cited_paper":"/paper/2310.02992","citing_paper":"/paper/2508.09945"},"observation_digest":"sha256:6281b215b9be1aa6db7882ba91c274614205ad82e48b868678eadacee7238914","observation_id":"6b75740f-d7fa-4856-9c42-0d80c079ea97","resolution":{"observed_at":"2026-08-05T20:44:38.060925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02992","last_updated":"2024-04-26T01:24:57Z","snapshot_observed_at":"2026-07-06T16:27:47.445841Z","submitted_at":"2023-10-04T17:28:44Z","title":"Kosmos-G: Generating Images in Context with Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02992","snapshot_observed_at":"2026-08-05T18:37:20.497388Z","title":"Kosmos-g: Generating images in context with multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.14441","last_updated":"2025-08-20T05:53:05Z","snapshot_observed_at":"2026-08-05T18:37:15.366913Z","submitted_at":"2025-08-20T05:53:05Z","title":"FBI: Learning Dexterous In-hand Manipulation with Dynamic Visuotactile Shortcut Policy","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T18:37:20.497388Z"},"links":{"cited_paper":"/paper/2310.02992","citing_paper":"/paper/2508.14441"},"observation_digest":"sha256:7b0ca9c81a79eb19f50133c875d3d71074f6b07408cdaae074de00854a5e4e74","observation_id":"196a0af4-6044-4fb0-ae30-1a79c158ce70","resolution":{"observed_at":"2026-08-05T18:37:20.497388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02992","last_updated":"2024-04-26T01:24:57Z","snapshot_observed_at":"2026-07-06T16:27:47.445841Z","submitted_at":"2023-10-04T17:28:44Z","title":"Kosmos-G: Generating Images in Context with Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":"2310.02992","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.02992","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kosmos-g: Generating images in context with multimodal large language models","venue":null,"work_id":"b6b58f3c-c80b-4855-ae08-9943ec0d4462","year":2023},"citing_paper":{"arxiv_id":"2509.16702","last_updated":"2026-04-27T07:06:51Z","snapshot_observed_at":"2026-08-02T09:03:27.739361Z","submitted_at":"2025-09-20T14:09:48Z","title":"Animalbooth: multimodal feature enhancement for animal subject personalization","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-18T15:08:36.365653Z"},"links":{"cited_paper":"/paper/2310.02992","citing_paper":"/paper/2509.16702"},"observation_digest":"sha256:3a1bfb2acf335879f8a4347975e6a168cafea7d28e93ce7faadbe4ce9f88d86b","observation_id":"de5bd812-9285-47a5-8b1f-221e151053eb","resolution":{"observed_at":"2026-05-18T15:11:32.540567Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02992","last_updated":"2024-04-26T01:24:57Z","snapshot_observed_at":"2026-07-06T16:27:47.445841Z","submitted_at":"2023-10-04T17:28:44Z","title":"Kosmos-G: Generating Images in Context with Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02992","snapshot_observed_at":"2026-08-03T08:15:27.197738Z","title":"Kosmos-g: Generating images in context with multimodal large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.17717","last_updated":"2026-06-09T20:25:14Z","snapshot_observed_at":"2026-08-08T23:34:38.789355Z","submitted_at":"2026-01-25T06:40:25Z","title":"A Survey on Evaluating Quality and Trustworthiness in LLM-Generated Data","version":3},"reference_index":164,"source":"arxiv_source","source_observed_at":"2026-08-03T08:15:27.197738Z"},"links":{"cited_paper":"/paper/2310.02992","citing_paper":"/paper/2601.17717"},"observation_digest":"sha256:53db4a8d6a161d66539847be6e0822e52dcc85872eadb2c0fe77e20c5068b97d","observation_id":"d680225d-4a78-4d18-b437-6670990faabe","resolution":{"observed_at":"2026-08-03T08:15:27.197738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02992","last_updated":"2024-04-26T01:24:57Z","snapshot_observed_at":"2026-07-06T16:27:47.445841Z","submitted_at":"2023-10-04T17:28:44Z","title":"Kosmos-G: Generating Images in Context with Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02992","snapshot_observed_at":"2026-08-02T19:14:08.831286Z","title":"org/abs/2310.029923 Geometry-Guided RL for Multi-view Consistent 3D Scene Editing 17","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.03143","last_updated":"2026-06-28T07:21:56Z","snapshot_observed_at":"2026-08-07T08:56:16.763487Z","submitted_at":"2026-03-03T16:31:10Z","title":"Edit in 2D, Verify in 3D: Reinforcement Learning for Multi-view Consistent Scene Editing","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T19:14:08.831286Z"},"links":{"cited_paper":"/paper/2310.02992","citing_paper":"/paper/2603.03143"},"observation_digest":"sha256:3dc3109c1387786fd1863d8e5f2ffe3c41712523bd6eee9861ad6d2cf794998d","observation_id":"180e9d82-cd15-43cf-ace4-40e5331e917e","resolution":{"observed_at":"2026-08-02T19:14:08.831286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02992","last_updated":"2024-04-26T01:24:57Z","snapshot_observed_at":"2026-07-06T16:27:47.445841Z","submitted_at":"2023-10-04T17:28:44Z","title":"Kosmos-G: Generating Images in Context with Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02992","snapshot_observed_at":"2026-08-02T17:19:38.228209Z","title":"Kosmos-g: Generating images in context with multimodal large language models.arXiv preprint arXiv:2310.02992, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.27176","last_updated":"2026-07-28T06:00:54Z","snapshot_observed_at":"2026-08-06T10:30:41.635476Z","submitted_at":"2026-03-28T07:26:40Z","title":"MEDIC-AD: Towards Medical Vision-Language Model's Clinical Intelligence","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T17:19:38.228209Z"},"links":{"cited_paper":"/paper/2310.02992","citing_paper":"/paper/2603.27176"},"observation_digest":"sha256:8c1af9dfb2f93aecedd58f83e0ebb93fc4ca68d1b4d3541b5537875c625ea655","observation_id":"f902196e-3227-4786-8612-9571422c4488","resolution":{"observed_at":"2026-08-02T17:19:38.228209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02992","last_updated":"2024-04-26T01:24:57Z","snapshot_observed_at":"2026-07-06T16:27:47.445841Z","submitted_at":"2023-10-04T17:28:44Z","title":"Kosmos-G: Generating Images in Context with Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":"2310.02992","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.02992","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kosmos-g: Generating images in context with multimodal large language models","venue":null,"work_id":"b6b58f3c-c80b-4855-ae08-9943ec0d4462","year":2023},"citing_paper":{"arxiv_id":"2604.18562","last_updated":"2026-04-22T02:31:50Z","snapshot_observed_at":"2026-08-04T10:02:00.731719Z","submitted_at":"2026-04-20T17:49:22Z","title":"AnchorSeg: Language Grounded Query Banks for Reasoning Segmentation","version":3},"reference_index":192,"source":"arxiv_source","source_observed_at":"2026-05-10T05:10:44.608959Z"},"links":{"cited_paper":"/paper/2310.02992","citing_paper":"/paper/2604.18562"},"observation_digest":"sha256:56dc2822e922c69c90f2597eb90968f7f09e87f2eb4ce8959a741786db3c9b2c","observation_id":"7f858af0-8f98-4295-89b3-e569a54e5417","resolution":{"observed_at":"2026-05-10T09:43:49.467697Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02992","last_updated":"2024-04-26T01:24:57Z","snapshot_observed_at":"2026-07-06T16:27:47.445841Z","submitted_at":"2023-10-04T17:28:44Z","title":"Kosmos-G: Generating Images in Context with Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":"2310.02992","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.02992","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kosmos-g: Generating images in context with multimodal large language models","venue":null,"work_id":"b6b58f3c-c80b-4855-ae08-9943ec0d4462","year":2023},"citing_paper":{"arxiv_id":"2605.12305","last_updated":"2026-05-12T15:54:49Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T15:54:49Z","title":"Images in Sentences: Scaling Interleaved Instructions for Unified Visual Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-13T05:48:04.997796Z"},"links":{"cited_paper":"/paper/2310.02992","citing_paper":"/paper/2605.12305"},"observation_digest":"sha256:00c1f043e315cd99a34ad265468247f42ad946d51d2e08b0051f4f169ff17cdc","observation_id":"74bb8080-a6af-4291-9980-545ac4c94525","resolution":{"observed_at":"2026-05-13T05:52:22.770498Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02992","last_updated":"2024-04-26T01:24:57Z","snapshot_observed_at":"2026-07-06T16:27:47.445841Z","submitted_at":"2023-10-04T17:28:44Z","title":"Kosmos-G: Generating Images in Context with Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02992","snapshot_observed_at":"2026-07-31T22:25:12.415671Z","title":"Kosmos-g: Generat- ing images in context with multimodal large language models.arXiv preprint arXiv:2310.02992, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-07-31T22:25:11.476976Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.415671Z"},"links":{"cited_paper":"/paper/2310.02992","citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:a0ea834f55e2b5e340090f189cd28b861fb5cb59e75fb643498e42c2716ef7bb","observation_id":"c3140dda-cb53-4d50-a7b9-a704c8732e78","resolution":{"observed_at":"2026-07-31T22:25:12.415671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2310.02992/citation-record","integrity":"/paper/2310.02992/integrity","json":"/paper/2310.02992/citation-record.json","paper":"/paper/2310.02992"},"outbound":[],"paper":{"arxiv_id":"2310.02992","last_updated":"2024-04-26T01:24:57Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T16:27:47.445841Z","submitted_at":"2023-10-04T17:28:44Z","title":"Kosmos-G: Generating Images in Context with Multimodal Large Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 17 inbound Pith citation observations for arXiv:2310.02992."}