{"as_of":"2026-08-12T18:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b351b9deeaf829f81270910acbe4e11db3e3dfaa5626e710b648f0ab28d0c882","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T15:41:07.654957Z","state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.10758/citation-record","integrity":"/paper/2412.10758/integrity","json":"/paper/2412.10758/citation-record.json","paper":"/paper/2412.10758"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-07-06T18:32:23.999019Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-11T15:41:07.405342Z","title":"Unveili ng encoder-free vision-language models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10758","last_updated":"2024-12-14T09:04:32Z","snapshot_observed_at":"2026-08-12T05:43:40.407127Z","submitted_at":"2024-12-14T09:04:32Z","title":"Optimizing Vision-Language Interactions Through Decoder-Only Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:07.405342Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2412.10758"},"observation_digest":"sha256:cdbec4e439e9f0b4c4e5419eafbf1c57cbf7b1a44e4baf7394d89ec7dbf54a52","observation_id":"de7930ef-f9ba-4cdf-8795-e67183fa8da3","resolution":{"observed_at":"2026-08-11T15:41:07.405342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19732","last_updated":"2024-12-20T16:19:17Z","snapshot_observed_at":"2026-08-03T16:04:58.991344Z","submitted_at":"2024-10-25T17:59:09Z","title":"Rethinking Visual Dependency in Long-Context Reasoning for Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.19732","snapshot_observed_at":"2026-08-11T15:41:07.418467Z","title":"Rethinking visual de pendency in long-context reasoning for large vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10758","last_updated":"2024-12-14T09:04:32Z","snapshot_observed_at":"2026-08-12T05:43:40.407127Z","submitted_at":"2024-12-14T09:04:32Z","title":"Optimizing Vision-Language Interactions Through Decoder-Only Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:07.418467Z"},"links":{"cited_paper":"/paper/2410.19732","citing_paper":"/paper/2412.10758"},"observation_digest":"sha256:0acfc58107a09eb741ba61db90a79331cd47b93328f99888a8d199203f7d6ec5","observation_id":"0f3c027a-23f5-49e5-bf7b-c9340a66c595","resolution":{"observed_at":"2026-08-11T15:41:07.418467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:41:07.424605Z","title":"Visual in-context le arning for large vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10758","last_updated":"2024-12-14T09:04:32Z","snapshot_observed_at":"2026-08-12T05:43:40.407127Z","submitted_at":"2024-12-14T09:04:32Z","title":"Optimizing Vision-Language Interactions Through Decoder-Only Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:07.424605Z"},"links":{"citing_paper":"/paper/2412.10758"},"observation_digest":"sha256:115839a57211db0a4affe4fb59d25a3d15f26d40402bc4512bb648065ea2d156","observation_id":"29fe954b-93b0-43eb-ba0b-5604e6484cf9","resolution":{"observed_at":"2026-08-11T15:41:07.424605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:41:08.034461Z","title":"Claret: P re-training a correlation-aware context-to-event transformer for eve nt-centric gener- ation and classiﬁcation,","venue":null,"work_id":"daa0c00a-882a-4cfb-9f65-cb4fb26acde7","year":2022},"citing_paper":{"arxiv_id":"2412.10758","last_updated":"2024-12-14T09:04:32Z","snapshot_observed_at":"2026-08-12T05:43:40.407127Z","submitted_at":"2024-12-14T09:04:32Z","title":"Optimizing Vision-Language Interactions Through Decoder-Only Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:07.434018Z"},"links":{"citing_paper":"/paper/2412.10758"},"observation_digest":"sha256:942a8b57fbc0680565db53f30fa0393250c2983b55807a0917af3080be358a88","observation_id":"7c6a1830-2b1b-448d-9a27-2f52f892de80","resolution":{"observed_at":"2026-08-11T15:41:08.041191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:41:07.439801Z","title":"Eventber t: A pre- trained model for event correlation reasoning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10758","last_updated":"2024-12-14T09:04:32Z","snapshot_observed_at":"2026-08-12T05:43:40.407127Z","submitted_at":"2024-12-14T09:04:32Z","title":"Optimizing Vision-Language Interactions Through Decoder-Only Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:07.439801Z"},"links":{"citing_paper":"/paper/2412.10758"},"observation_digest":"sha256:d7e20c1e71b432ea0c85895ebdb92273171bd23cacfd22ce1609b25d4fea76d8","observation_id":"884311d6-0dfb-43ad-acea-83f94f7efda6","resolution":{"observed_at":"2026-08-11T15:41:07.439801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:41:08.001307Z","title":"Visionllm: Large language mode l is also an open-ended decoder for vision-centric tasks,","venue":null,"work_id":"f051bb42-0590-49eb-b0c4-af3653b3a5d9","year":2023},"citing_paper":{"arxiv_id":"2412.10758","last_updated":"2024-12-14T09:04:32Z","snapshot_observed_at":"2026-08-12T05:43:40.407127Z","submitted_at":"2024-12-14T09:04:32Z","title":"Optimizing Vision-Language Interactions Through Decoder-Only Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:07.445111Z"},"links":{"citing_paper":"/paper/2412.10758"},"observation_digest":"sha256:eb0d874321096826e536c9930b6d10308ac2417c2c7e22e05ca9833eb2feb7ca","observation_id":"0f360099-d185-4b02-80c6-1149ae41d554","resolution":{"observed_at":"2026-08-11T15:41:08.006708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08394","last_updated":"2024-12-31T05:35:05Z","snapshot_observed_at":"2026-08-06T17:31:18.801416Z","submitted_at":"2024-06-12T16:44:50Z","title":"VisionLLM v2: An End-to-End Generalist Multimodal Large Language Model for Hundreds of Vision-Language Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08394","snapshot_observed_at":"2026-08-11T15:41:07.450255Z","title":"Visionllm v2: An end-to-end generalist multimodal large language model for hundreds of vision-language tasks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10758","last_updated":"2024-12-14T09:04:32Z","snapshot_observed_at":"2026-08-12T05:43:40.407127Z","submitted_at":"2024-12-14T09:04:32Z","title":"Optimizing Vision-Language Interactions Through Decoder-Only Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:07.450255Z"},"links":{"cited_paper":"/paper/2406.08394","citing_paper":"/paper/2412.10758"},"observation_digest":"sha256:43082fcd084e30a188fb79c0ca15cfc86742623220403fe74e84708192f9b069","observation_id":"8c35f26c-cc7b-4475-89e5-dd16497b03d6","resolution":{"observed_at":"2026-08-11T15:41:07.450255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15947","last_updated":"2024-12-23T08:05:14Z","snapshot_observed_at":"2026-08-06T02:31:58.372974Z","submitted_at":"2024-01-29T08:13:40Z","title":"MoE-LLaVA: Mixture of Experts for Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15947","snapshot_observed_at":"2026-08-11T15:41:07.456101Z","title":"Moe-llava: Mixture of experts for large vision -language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10758","last_updated":"2024-12-14T09:04:32Z","snapshot_observed_at":"2026-08-12T05:43:40.407127Z","submitted_at":"2024-12-14T09:04:32Z","title":"Optimizing Vision-Language Interactions Through Decoder-Only Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:07.456101Z"},"links":{"cited_paper":"/paper/2401.15947","citing_paper":"/paper/2412.10758"},"observation_digest":"sha256:e410bddd1ae62f01e6b374b67e593c0a173555357d7604de42be010686ee8aa8","observation_id":"d2fb4fb8-c10f-4b83-9891-1ae0033fe3ed","resolution":{"observed_at":"2026-08-11T15:41:07.456101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19716","last_updated":"2024-11-24T03:47:38Z","snapshot_observed_at":"2026-08-12T06:15:00.923492Z","submitted_at":"2024-05-30T05:53:49Z","title":"Enhancing Large Vision Language Models with Self-Training on Image Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19716","snapshot_observed_at":"2026-08-11T15:41:07.461270Z","title":"Enhancing large vision language models with self- training on image comprehension,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10758","last_updated":"2024-12-14T09:04:32Z","snapshot_observed_at":"2026-08-12T05:43:40.407127Z","submitted_at":"2024-12-14T09:04:32Z","title":"Optimizing Vision-Language Interactions Through Decoder-Only Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:07.461270Z"},"links":{"cited_paper":"/paper/2405.19716","citing_paper":"/paper/2412.10758"},"observation_digest":"sha256:27ec8dadc101dd36cfb2573a89d39303457f75d90564868d2044884c37104557","observation_id":"dffc29d3-fe2f-412e-94bb-ab98399cc140","resolution":{"observed_at":"2026-08-11T15:41:07.461270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10292","last_updated":"2024-10-07T19:13:47Z","snapshot_observed_at":"2026-07-06T18:15:24.541427Z","submitted_at":"2024-05-16T17:50:19Z","title":"Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10292","snapshot_observed_at":"2026-08-11T15:41:07.467266Z","title":"Fine-tuning large vision-language models as decision-making agents via rein forcement learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10758","last_updated":"2024-12-14T09:04:32Z","snapshot_observed_at":"2026-08-12T05:43:40.407127Z","submitted_at":"2024-12-14T09:04:32Z","title":"Optimizing Vision-Language Interactions Through Decoder-Only Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:07.467266Z"},"links":{"cited_paper":"/paper/2405.10292","citing_paper":"/paper/2412.10758"},"observation_digest":"sha256:3b46160e4e7a6e94e5cd2e82fe7bdf5a38ace8b062614f8193a29d0b7db5e277","observation_id":"efdb86d5-6a57-4f20-8773-6fa05cfdb689","resolution":{"observed_at":"2026-08-11T15:41:07.467266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:41:07.473518Z","title":"Triple sequence generati ve adversarial nets for unsupervised image captioning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.10758","last_updated":"2024-12-14T09:04:32Z","snapshot_observed_at":"2026-08-12T05:43:40.407127Z","submitted_at":"2024-12-14T09:04:32Z","title":"Optimizing Vision-Language Interactions Through Decoder-Only Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:07.473518Z"},"links":{"citing_paper":"/paper/2412.10758"},"observation_digest":"sha256:d9653256e526ce61f3a3758da17d5aa0f9e76d7273e9113dcd4a1ccecab2f72e","observation_id":"69dd160d-b850-46cc-9e8e-b2abe60ea223","resolution":{"observed_at":"2026-08-11T15:41:07.473518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:41:07.605049Z","title":"Sketch storytelling,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10758","last_updated":"2024-12-14T09:04:32Z","snapshot_observed_at":"2026-08-12T05:43:40.407127Z","submitted_at":"2024-12-14T09:04:32Z","title":"Optimizing Vision-Language Interactions Through Decoder-Only Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:07.605049Z"},"links":{"citing_paper":"/paper/2412.10758"},"observation_digest":"sha256:50db326e9a7a0a47e2670f20883c1192124a7c2054d053f084ec64d3b8554789","observation_id":"79da6fd4-c041-4c53-b86b-d7ba60b2fd29","resolution":{"observed_at":"2026-08-11T15:41:07.605049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-11T15:41:07.611175Z","title":"Are we on the right way fo r evaluating large vision-language models?","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10758","last_updated":"2024-12-14T09:04:32Z","snapshot_observed_at":"2026-08-12T05:43:40.407127Z","submitted_at":"2024-12-14T09:04:32Z","title":"Optimizing Vision-Language Interactions Through Decoder-Only Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:07.611175Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2412.10758"},"observation_digest":"sha256:82d4914dc585fde0b700265fb37488185cc676af46effa2cd113480fad46a4e6","observation_id":"08ee393c-8162-45b1-a029-1bcd41085a7a","resolution":{"observed_at":"2026-08-11T15:41:07.611175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-08-11T15:41:07.634043Z","title":"Internvl: Scaling up vision foundation models and alignin g for generic visual-linguistic tasks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10758","last_updated":"2024-12-14T09:04:32Z","snapshot_observed_at":"2026-08-12T05:43:40.407127Z","submitted_at":"2024-12-14T09:04:32Z","title":"Optimizing Vision-Language Interactions Through Decoder-Only Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:07.634043Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2412.10758"},"observation_digest":"sha256:aee9680b39f6cfde6d18152037ecfaa0ac9be6c0e04be71c2cc5fd373120299c","observation_id":"6d269bcc-721f-4cba-ab9b-9803bb332f29","resolution":{"observed_at":"2026-08-11T15:41:07.634043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-11T15:41:07.628483Z","title":"Available: https://doi.org/10.48550/ar Xiv.2403.20330","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10758","last_updated":"2024-12-14T09:04:32Z","snapshot_observed_at":"2026-08-12T05:43:40.407127Z","submitted_at":"2024-12-14T09:04:32Z","title":"Optimizing Vision-Language Interactions Through Decoder-Only Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:07.628483Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2412.10758"},"observation_digest":"sha256:0c6fc0c614f2906ef168c6be92c8859591be309b98c57dfc913b9cb6e0e3fee0","observation_id":"47267141-3a43-4ce5-9677-5de5bbb57551","resolution":{"observed_at":"2026-08-11T15:41:07.628483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:41:07.645686Z","title":"Multimodal event transformer for i mage-guided story ending generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10758","last_updated":"2024-12-14T09:04:32Z","snapshot_observed_at":"2026-08-12T05:43:40.407127Z","submitted_at":"2024-12-14T09:04:32Z","title":"Optimizing Vision-Language Interactions Through Decoder-Only Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:07.645686Z"},"links":{"citing_paper":"/paper/2412.10758"},"observation_digest":"sha256:5075d4e3419891e97922d11a95209a19f623b66fbf36c70087f0363415bc265e","observation_id":"2e08b26e-817c-4f41-9012-f37a34ff83ae","resolution":{"observed_at":"2026-08-11T15:41:07.645686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05261","last_updated":"2024-10-07T17:58:35Z","snapshot_observed_at":"2026-08-12T05:43:02.656333Z","submitted_at":"2024-10-07T17:58:35Z","title":"TextHawk2: A Large Vision-Language Model Excels in Bilingual OCR and Grounding with 16x Fewer Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05261","snapshot_observed_at":"2026-08-11T15:41:07.639261Z","title":"Texthawk2: A large vi sion- language model excels in bilingual OCR and grounding with 16 x fewer tokens,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10758","last_updated":"2024-12-14T09:04:32Z","snapshot_observed_at":"2026-08-12T05:43:40.407127Z","submitted_at":"2024-12-14T09:04:32Z","title":"Optimizing Vision-Language Interactions Through Decoder-Only Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:07.639261Z"},"links":{"cited_paper":"/paper/2410.05261","citing_paper":"/paper/2412.10758"},"observation_digest":"sha256:d85b6a61a93ac941c005f60c6a8fa8c6047370b3eef4571bc9312fbe407d5ddc","observation_id":"290f8d76-452e-4d2d-bfc2-4da99cfc6534","resolution":{"observed_at":"2026-08-11T15:41:07.639261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:41:07.928825Z","title":"Vilt: Vision-and-language t ransformer without convolution or region supervision,","venue":null,"work_id":"8a5c4521-8449-4ad9-a27e-9fcb4434f33d","year":2021},"citing_paper":{"arxiv_id":"2412.10758","last_updated":"2024-12-14T09:04:32Z","snapshot_observed_at":"2026-08-12T05:43:40.407127Z","submitted_at":"2024-12-14T09:04:32Z","title":"Optimizing Vision-Language Interactions Through Decoder-Only Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:07.654957Z"},"links":{"citing_paper":"/paper/2412.10758"},"observation_digest":"sha256:df5d09b4df36c2c211a1f2f16f9eba38457ecdb80855bfe6f487bc71b83a7514","observation_id":"aa2f60fb-8b6b-4693-8d29-832a263aaa79","resolution":{"observed_at":"2026-08-11T15:41:07.935301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:41:07.948062Z","title":"Style-aware contrastive learning for multi-styl e image caption- ing,","venue":null,"work_id":"0cfd2e5c-2953-4103-b2ad-f7d368bd60e6","year":2023},"citing_paper":{"arxiv_id":"2412.10758","last_updated":"2024-12-14T09:04:32Z","snapshot_observed_at":"2026-08-12T05:43:40.407127Z","submitted_at":"2024-12-14T09:04:32Z","title":"Optimizing Vision-Language Interactions Through Decoder-Only Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:07.650306Z"},"links":{"citing_paper":"/paper/2412.10758"},"observation_digest":"sha256:bcd2ed29d8c1ed0c1f45e9522e4fde13f74f657d5eeba8dac341b9f773d788c9","observation_id":"5b40c818-fa1b-4aaa-a51c-8228ed812c57","resolution":{"observed_at":"2026-08-11T15:41:07.953949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-07-06T18:32:23.999019Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-11T15:41:07.412311Z","title":"Available: https://doi.org/10.48550/ar Xiv.2406.11832","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10758","last_updated":"2024-12-14T09:04:32Z","snapshot_observed_at":"2026-08-12T05:43:40.407127Z","submitted_at":"2024-12-14T09:04:32Z","title":"Optimizing Vision-Language Interactions Through Decoder-Only Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:07.412311Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2412.10758"},"observation_digest":"sha256:c200d91c85f359fda47a43b5161d05a8c201d31aee427349f2de9a3758840fa0","observation_id":"d9efcc2f-8978-4d23-97a8-97fad21a7f40","resolution":{"observed_at":"2026-08-11T15:41:07.412311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.10758","last_updated":"2024-12-14T09:04:32Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T05:43:40.407127Z","submitted_at":"2024-12-14T09:04:32Z","title":"Optimizing Vision-Language Interactions Through Decoder-Only Models"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":0,"verified_fuzzy":4},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 0 inbound Pith citation observations for arXiv:2412.10758."}