{"as_of":"2026-08-09T02:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c5989d56a31a544f955ed1a2d5cc88448f6701bbca31b6bb0c9a961d3b36bcb7","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":17,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":17,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":17,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T15:24:46.417390Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":7,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2312.13286","last_updated":"2024-05-08T03:09:22Z","snapshot_observed_at":"2026-07-06T17:06:08.967869Z","submitted_at":"2023-12-20T18:59:58Z","title":"Generative Multimodal Models are In-Context Learners","version":2},"cited_work":{"arxiv_id":"2312.13286","doi":"10.48550/arxiv.2312.13286","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.13286","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Generative multimodal models are in-context learners","venue":"arXiv (Cornell University)","work_id":"a80a95eb-a4c1-4074-b835-c862cc4bd0ce","year":2023},"citing_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-15T15:46:06.334088Z"},"links":{"cited_paper":"/paper/2312.13286","citing_paper":"/paper/2311.03079"},"observation_digest":"sha256:e476208407971860c414403f302f850dd16afa529ddd80a88eb09e8d11e32deb","observation_id":"ae3d4092-7407-449d-8aa4-9e8916771767","resolution":{"observed_at":"2026-05-15T15:46:06.530109Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13286","last_updated":"2024-05-08T03:09:22Z","snapshot_observed_at":"2026-07-06T17:06:08.967869Z","submitted_at":"2023-12-20T18:59:58Z","title":"Generative Multimodal Models are In-Context Learners","version":2},"cited_work":{"arxiv_id":"2312.13286","doi":"10.48550/arxiv.2312.13286","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.13286","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Generative multimodal models are in-context learners","venue":"arXiv (Cornell University)","work_id":"a80a95eb-a4c1-4074-b835-c862cc4bd0ce","year":2023},"citing_paper":{"arxiv_id":"2311.16502","last_updated":"2024-06-13T15:02:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-27T17:33:21Z","title":"MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI","version":4},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-15T05:37:41.401736Z"},"links":{"cited_paper":"/paper/2312.13286","citing_paper":"/paper/2311.16502"},"observation_digest":"sha256:34ed9ae8ee3d0cda43b0c0bd546ef0b6334a3de68716f972217cbf1da9aa21f1","observation_id":"6825f400-1343-4766-84a6-68c9cac61b92","resolution":{"observed_at":"2026-05-15T05:37:41.625490Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13286","last_updated":"2024-05-08T03:09:22Z","snapshot_observed_at":"2026-07-06T17:06:08.967869Z","submitted_at":"2023-12-20T18:59:58Z","title":"Generative Multimodal Models are In-Context Learners","version":2},"cited_work":{"arxiv_id":"2312.13286","doi":"10.48550/arxiv.2312.13286","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.13286","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Generative multimodal models are in-context learners","venue":"arXiv (Cornell University)","work_id":"a80a95eb-a4c1-4074-b835-c862cc4bd0ce","year":2023},"citing_paper":{"arxiv_id":"2403.09611","last_updated":"2024-04-18T18:51:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-14T17:51:32Z","title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","version":4},"reference_index":105,"source":"pdf_text","source_observed_at":"2026-05-16T04:09:36.019146Z"},"links":{"cited_paper":"/paper/2312.13286","citing_paper":"/paper/2403.09611"},"observation_digest":"sha256:d65742473fca73db3db231403972200919c6e28d7eb9813ff1f9dec10a02abf2","observation_id":"b0911ed6-c864-4058-885a-60fdd5a49a52","resolution":{"observed_at":"2026-05-16T04:09:36.258789Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13286","last_updated":"2024-05-08T03:09:22Z","snapshot_observed_at":"2026-07-06T17:06:08.967869Z","submitted_at":"2023-12-20T18:59:58Z","title":"Generative Multimodal Models are In-Context Learners","version":2},"cited_work":{"arxiv_id":"2312.13286","doi":"10.48550/arxiv.2312.13286","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.13286","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Generative multimodal models are in-context learners","venue":"arXiv (Cornell University)","work_id":"a80a95eb-a4c1-4074-b835-c862cc4bd0ce","year":2023},"citing_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-17T07:44:47.355960Z"},"links":{"cited_paper":"/paper/2312.13286","citing_paper":"/paper/2403.18814"},"observation_digest":"sha256:d13d2b578338d802a9f28bdc73794526eb984da3aa7614c6b2b211e1f1bba237","observation_id":"a979d1ca-2f30-44fb-abeb-5bd5a1198235","resolution":{"observed_at":"2026-05-17T07:44:47.444102Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13286","last_updated":"2024-05-08T03:09:22Z","snapshot_observed_at":"2026-07-06T17:06:08.967869Z","submitted_at":"2023-12-20T18:59:58Z","title":"Generative Multimodal Models are In-Context Learners","version":2},"cited_work":{"arxiv_id":"2312.13286","doi":"10.48550/arxiv.2312.13286","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.13286","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Generative multimodal models are in-context learners","venue":"arXiv (Cornell University)","work_id":"a80a95eb-a4c1-4074-b835-c862cc4bd0ce","year":2023},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2312.13286","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:14778f15ccca389caa408782b9d9789f51a9349970354d567b02a54045d46ca2","observation_id":"c634f635-b37b-4346-92e7-85eb92dcf127","resolution":{"observed_at":"2026-05-15T22:48:36.198403Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13286","last_updated":"2024-05-08T03:09:22Z","snapshot_observed_at":"2026-07-06T17:06:08.967869Z","submitted_at":"2023-12-20T18:59:58Z","title":"Generative Multimodal Models are In-Context Learners","version":2},"cited_work":{"arxiv_id":"2312.13286","doi":"10.48550/arxiv.2312.13286","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.13286","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Generative multimodal models are in-context learners","venue":"arXiv (Cornell University)","work_id":"a80a95eb-a4c1-4074-b835-c862cc4bd0ce","year":2023},"citing_paper":{"arxiv_id":"2406.09411","last_updated":"2024-07-02T01:56:14Z","snapshot_observed_at":"2026-08-08T21:28:23.195012Z","submitted_at":"2024-06-13T17:59:52Z","title":"MuirBench: A Comprehensive Benchmark for Robust Multi-image Understanding","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-17T01:09:30.360275Z"},"links":{"cited_paper":"/paper/2312.13286","citing_paper":"/paper/2406.09411"},"observation_digest":"sha256:2bc021c410c3f37fc1fd1d7ded297f92c63ad097e06a74c116ba266cc45e456f","observation_id":"9a5d5d9d-7d52-4730-b776-94eaa623f032","resolution":{"observed_at":"2026-05-17T01:09:30.412895Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13286","last_updated":"2024-05-08T03:09:22Z","snapshot_observed_at":"2026-07-06T17:06:08.967869Z","submitted_at":"2023-12-20T18:59:58Z","title":"Generative Multimodal Models are In-Context Learners","version":2},"cited_work":{"arxiv_id":"2312.13286","doi":"10.48550/arxiv.2312.13286","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.13286","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Generative multimodal models are in-context learners","venue":"arXiv (Cornell University)","work_id":"a80a95eb-a4c1-4074-b835-c862cc4bd0ce","year":2023},"citing_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"reference_index":123,"source":"pdf_text","source_observed_at":"2026-05-11T13:10:19.972353Z"},"links":{"cited_paper":"/paper/2312.13286","citing_paper":"/paper/2407.07726"},"observation_digest":"sha256:583b76e7ad8e9533b24a106036131e86e914f4cb70c0135073d9802a8aa06e75","observation_id":"61279890-74ee-4548-bfe9-d7e7817849f0","resolution":{"observed_at":"2026-05-11T13:10:20.569913Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13286","last_updated":"2024-05-08T03:09:22Z","snapshot_observed_at":"2026-07-06T17:06:08.967869Z","submitted_at":"2023-12-20T18:59:58Z","title":"Generative Multimodal Models are In-Context Learners","version":2},"cited_work":{"arxiv_id":"2312.13286","doi":"10.48550/arxiv.2312.13286","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.13286","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Generative multimodal models are in-context learners","venue":"arXiv (Cornell University)","work_id":"a80a95eb-a4c1-4074-b835-c862cc4bd0ce","year":2023},"citing_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-11T21:03:33.427939Z"},"links":{"cited_paper":"/paper/2312.13286","citing_paper":"/paper/2408.12528"},"observation_digest":"sha256:57ce76695697dd62bef3900bac8fc3431128b9e0867f33bbb2c4539297415e31","observation_id":"e6da27c2-5c8e-4e1b-a7ba-711c96c4e96b","resolution":{"observed_at":"2026-05-11T21:03:33.563332Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13286","last_updated":"2024-05-08T03:09:22Z","snapshot_observed_at":"2026-07-06T17:06:08.967869Z","submitted_at":"2023-12-20T18:59:58Z","title":"Generative Multimodal Models are In-Context Learners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13286","snapshot_observed_at":"2026-08-08T15:24:46.417390Z","title":"Generative multimodal models are in-context learners","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06474","last_updated":"2025-02-10T13:52:52Z","snapshot_observed_at":"2026-08-08T15:17:59.067687Z","submitted_at":"2025-02-10T13:52:52Z","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T15:24:46.417390Z"},"links":{"cited_paper":"/paper/2312.13286","citing_paper":"/paper/2502.06474"},"observation_digest":"sha256:c912432a39d34662204b39d81c2633ea251c253fd550e2a342d0c7299e7c49da","observation_id":"110289f0-5ca2-4927-8b8a-e23636be0980","resolution":{"observed_at":"2026-08-08T15:24:46.417390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13286","last_updated":"2024-05-08T03:09:22Z","snapshot_observed_at":"2026-07-06T17:06:08.967869Z","submitted_at":"2023-12-20T18:59:58Z","title":"Generative Multimodal Models are In-Context Learners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13286","snapshot_observed_at":"2026-08-08T14:25:55.834228Z","title":"Generative multi- modal models are in-context learners","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-08T14:17:36.435110Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.834228Z"},"links":{"cited_paper":"/paper/2312.13286","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:01ed9b81f731727b88b829cc6b9f95436592c964fb3e1e8ef4a49715970c1d56","observation_id":"93fee7ad-4953-479f-a040-2b380c6b26f9","resolution":{"observed_at":"2026-08-08T14:25:55.834228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13286","last_updated":"2024-05-08T03:09:22Z","snapshot_observed_at":"2026-07-06T17:06:08.967869Z","submitted_at":"2023-12-20T18:59:58Z","title":"Generative Multimodal Models are In-Context Learners","version":2},"cited_work":{"arxiv_id":"2312.13286","doi":"10.48550/arxiv.2312.13286","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.13286","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Generative multimodal models are in-context learners","venue":"arXiv (Cornell University)","work_id":"a80a95eb-a4c1-4074-b835-c862cc4bd0ce","year":2023},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-08-05T05:27:10.277230Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"cited_paper":"/paper/2312.13286","citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:34e9f5aa37f5a20b28b089280d00c7aeada58749a5428b85d338563e4479161f","observation_id":"ec11eb0b-6777-46b3-b61b-780cc315fee6","resolution":{"observed_at":"2026-05-15T14:50:59.902495Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13286","last_updated":"2024-05-08T03:09:22Z","snapshot_observed_at":"2026-07-06T17:06:08.967869Z","submitted_at":"2023-12-20T18:59:58Z","title":"Generative Multimodal Models are In-Context Learners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13286","snapshot_observed_at":"2026-08-07T12:48:55.005689Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-07T20:36:09.670028Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:55.005689Z"},"links":{"cited_paper":"/paper/2312.13286","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:d53e0897cba28e1a005ac45e447f2e4d9d833b421ced8b0709c1a880488ef899","observation_id":"c2c0e2d7-3117-4f63-9400-0e3e1d0fe880","resolution":{"observed_at":"2026-08-07T12:48:55.005689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13286","last_updated":"2024-05-08T03:09:22Z","snapshot_observed_at":"2026-07-06T17:06:08.967869Z","submitted_at":"2023-12-20T18:59:58Z","title":"Generative Multimodal Models are In-Context Learners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13286","snapshot_observed_at":"2026-08-07T10:27:36.829877Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05182","last_updated":"2025-08-20T20:52:35Z","snapshot_observed_at":"2026-08-08T14:59:33.448999Z","submitted_at":"2025-06-05T15:52:44Z","title":"On the Comprehensibility of Multi-structured Financial Documents using LLMs and Pre-processing Tools","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T10:27:36.829877Z"},"links":{"cited_paper":"/paper/2312.13286","citing_paper":"/paper/2506.05182"},"observation_digest":"sha256:ba54160f65f28f5f32a0921b6c2bf5047b6768707c9fdb7fd8004ff72c8aeca6","observation_id":"6e9ff967-d6ae-49d2-9586-7c1815053cbd","resolution":{"observed_at":"2026-08-07T10:27:36.829877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13286","last_updated":"2024-05-08T03:09:22Z","snapshot_observed_at":"2026-07-06T17:06:08.967869Z","submitted_at":"2023-12-20T18:59:58Z","title":"Generative Multimodal Models are In-Context Learners","version":2},"cited_work":{"arxiv_id":"2312.13286","doi":"10.48550/arxiv.2312.13286","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.13286","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Generative multimodal models are in-context learners","venue":"arXiv (Cornell University)","work_id":"a80a95eb-a4c1-4074-b835-c862cc4bd0ce","year":2023},"citing_paper":{"arxiv_id":"2512.10554","last_updated":"2026-04-02T03:14:28Z","snapshot_observed_at":"2026-07-30T11:23:08.233438Z","submitted_at":"2025-12-11T11:38:50Z","title":"Grounding Everything in Tokens for Multimodal Large Language Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-16T23:31:05.422935Z"},"links":{"cited_paper":"/paper/2312.13286","citing_paper":"/paper/2512.10554"},"observation_digest":"sha256:b39879b2721187ff892244338d487b8032295ae2a725e40a34e597fea031a490","observation_id":"4da437f8-b144-4448-a08b-69ee1b9052b8","resolution":{"observed_at":"2026-05-16T23:31:21.916857Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13286","last_updated":"2024-05-08T03:09:22Z","snapshot_observed_at":"2026-07-06T17:06:08.967869Z","submitted_at":"2023-12-20T18:59:58Z","title":"Generative Multimodal Models are In-Context Learners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13286","snapshot_observed_at":"2026-08-02T19:58:25.979720Z","title":"Generative multi- modal models are in-context learners.arXiv preprint arXiv:2312.13286, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.00461","last_updated":"2026-06-10T06:57:00Z","snapshot_observed_at":"2026-08-05T02:58:46.928689Z","submitted_at":"2026-02-28T04:42:34Z","title":"ReMoT: Reinforcement Learning with Motion Contrast Triplets","version":3},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-02T19:58:25.979720Z"},"links":{"cited_paper":"/paper/2312.13286","citing_paper":"/paper/2603.00461"},"observation_digest":"sha256:8ab4b4cf6e30da15deba97243ed9d191f49b851bb72442b5e2cf484c2051213c","observation_id":"7e283520-1b01-40ee-84a0-82bf6d97e28f","resolution":{"observed_at":"2026-08-02T19:58:25.979720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13286","last_updated":"2024-05-08T03:09:22Z","snapshot_observed_at":"2026-07-06T17:06:08.967869Z","submitted_at":"2023-12-20T18:59:58Z","title":"Generative Multimodal Models are In-Context Learners","version":2},"cited_work":{"arxiv_id":"2312.13286","doi":"10.48550/arxiv.2312.13286","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.13286","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Generative multimodal models are in-context learners","venue":"arXiv (Cornell University)","work_id":"a80a95eb-a4c1-4074-b835-c862cc4bd0ce","year":2023},"citing_paper":{"arxiv_id":"2606.21734","last_updated":"2026-06-19T20:43:49Z","snapshot_observed_at":"2026-08-05T18:05:51.515234Z","submitted_at":"2026-06-19T20:43:49Z","title":"HPP: Hierarchical Programmatic Probing for Long Video Understanding by Decoupling Perception and Reasoning","version":1},"reference_index":245,"source":"arxiv_source","source_observed_at":"2026-06-26T14:19:53.450263Z"},"links":{"cited_paper":"/paper/2312.13286","citing_paper":"/paper/2606.21734"},"observation_digest":"sha256:5c8bd18fb1f68f6ea55453eaeaadaceaf2f27f88fe3f971f2192d55805c03f8c","observation_id":"756d0efe-bc9d-4e89-99d9-89e0a93114cc","resolution":{"observed_at":"2026-07-04T06:39:37.521811Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13286","last_updated":"2024-05-08T03:09:22Z","snapshot_observed_at":"2026-07-06T17:06:08.967869Z","submitted_at":"2023-12-20T18:59:58Z","title":"Generative Multimodal Models are In-Context Learners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13286","snapshot_observed_at":"2026-07-14T03:31:19.309532Z","title":"arXiv preprint arXiv:2312.13286 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11738","last_updated":"2026-07-13T16:00:03Z","snapshot_observed_at":"2026-08-06T12:36:13.363835Z","submitted_at":"2026-07-13T16:00:03Z","title":"Qwen-Audio-VAE Technical Report","version":1},"reference_index":154,"source":"arxiv_source","source_observed_at":"2026-07-14T03:31:19.309532Z"},"links":{"cited_paper":"/paper/2312.13286","citing_paper":"/paper/2607.11738"},"observation_digest":"sha256:c335ad2ad4bc2f2f8a630cd28f59a325bd4ded56446069fea41135c14bc58d72","observation_id":"d96f5082-d825-49ea-9723-2d8cf0e31c10","resolution":{"observed_at":"2026-07-14T03:31:19.309532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2312.13286/citation-record","integrity":"/paper/2312.13286/integrity","json":"/paper/2312.13286/citation-record.json","paper":"/paper/2312.13286"},"outbound":[],"paper":{"arxiv_id":"2312.13286","last_updated":"2024-05-08T03:09:22Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T17:06:08.967869Z","submitted_at":"2023-12-20T18:59:58Z","title":"Generative Multimodal Models are In-Context Learners"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 17 inbound Pith citation observations for arXiv:2312.13286."}