{"as_of":"2026-08-09T09:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3f0338d42ebdfab8fa08bbd3423db8c16a55023dad99ee26206476da5c0c00b0","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":3,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":3,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T12:20:08.298615Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-16T18:51:11.412566Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2405.09215","last_updated":"2024-06-20T07:31:13Z","snapshot_observed_at":"2026-07-06T18:14:37.777553Z","submitted_at":"2024-05-15T09:47:59Z","title":"Xmodel-VLM: A Simple Baseline for Multimodal Vision Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09215","snapshot_observed_at":"2026-08-08T12:20:08.298615Z","title":"Screenai: A vision-language model for ui and infographics understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07855","last_updated":"2025-06-13T12:20:30Z","snapshot_observed_at":"2026-08-08T16:43:44.128026Z","submitted_at":"2025-02-11T14:04:43Z","title":"Vision-Language Models for Edge Networks: A Comprehensive Survey","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:08.298615Z"},"links":{"cited_paper":"/paper/2405.09215","citing_paper":"/paper/2502.07855"},"observation_digest":"sha256:2631e74b0d40a94f4c8e8d145ce1ee24a9fe4a314448a750159fa2528b0264b5","observation_id":"de96865c-906e-4b81-9e27-5b953f30b7d4","resolution":{"observed_at":"2026-08-08T12:20:08.298615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09215","last_updated":"2024-06-20T07:31:13Z","snapshot_observed_at":"2026-07-06T18:14:37.777553Z","submitted_at":"2024-05-15T09:47:59Z","title":"Xmodel-VLM: A Simple Baseline for Multimodal Vision Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09215","snapshot_observed_at":"2026-08-06T18:58:59.400444Z","title":"Xmodel-vlm: A simple baseline for multimodal vision language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06761","last_updated":"2025-07-09T11:38:20Z","snapshot_observed_at":"2026-08-09T04:41:50.816249Z","submitted_at":"2025-07-09T11:38:20Z","title":"Finetuning Vision-Language Models as OCR Systems for Low-Resource Languages: A Case Study of Manchu","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:58:59.400444Z"},"links":{"cited_paper":"/paper/2405.09215","citing_paper":"/paper/2507.06761"},"observation_digest":"sha256:ed604a18fc2b794db80e6528a3f3fd3a6edc4e414e1c9184771cca1dbee22a40","observation_id":"0a6b4da9-a799-44fb-a891-62b290915077","resolution":{"observed_at":"2026-08-06T18:58:59.400444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09215","last_updated":"2024-06-20T07:31:13Z","snapshot_observed_at":"2026-07-06T18:14:37.777553Z","submitted_at":"2024-05-15T09:47:59Z","title":"Xmodel-VLM: A Simple Baseline for Multimodal Vision Language Model","version":3},"cited_work":{"arxiv_id":"2405.09215","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09215","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Xmodel- vlm: A simple baseline for multimodal vision language model","venue":null,"work_id":"a0b7392a-749c-4463-8b58-9bb52b60e41f","year":null},"citing_paper":{"arxiv_id":"2512.22991","last_updated":"2026-05-07T08:56:54Z","snapshot_observed_at":"2026-07-06T22:40:12.666349Z","submitted_at":"2025-12-28T16:20:36Z","title":"Fusion or Confusion? Multimodal Complexity Is Not All You Need","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-16T18:50:19.712241Z"},"links":{"cited_paper":"/paper/2405.09215","citing_paper":"/paper/2512.22991"},"observation_digest":"sha256:354933721cc9295ef06322d64d363bcb75d0c68908dbe60bb9c4ca08290be519","observation_id":"b88c5637-0d4a-4377-a44e-74efc130f083","resolution":{"observed_at":"2026-05-16T18:51:11.415711Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2405.09215/citation-record","integrity":"/paper/2405.09215/integrity","json":"/paper/2405.09215/citation-record.json","paper":"/paper/2405.09215"},"outbound":[],"paper":{"arxiv_id":"2405.09215","last_updated":"2024-06-20T07:31:13Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T18:14:37.777553Z","submitted_at":"2024-05-15T09:47:59Z","title":"Xmodel-VLM: A Simple Baseline for Multimodal Vision Language Model"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 3 inbound Pith citation observations for arXiv:2405.09215."}