{"as_of":"2026-08-08T01:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7b72e023e0ed38f9d519c900842367dc03cc8551a482735c1e2fff0492fca01e","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":4,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":4,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:40:19.557859Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-13T20:23:51.698247Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.13611","last_updated":"2024-10-17T14:46:34Z","snapshot_observed_at":"2026-07-06T19:35:21.868885Z","submitted_at":"2024-10-17T14:46:34Z","title":"H2OVL-Mississippi Vision Language Models Technical Report","version":1},"cited_work":{"arxiv_id":"2410.13611","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.13611","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"H2ovl-mississippi vision language models technical report, 2024.https://arxiv.org/abs/2410.13611","venue":null,"work_id":"03a819a9-101a-497a-ac17-66a2b1a62118","year":2024},"citing_paper":{"arxiv_id":"2504.05299","last_updated":"2025-04-07T17:58:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-07T17:58:57Z","title":"SmolVLM: Redefining small and efficient multimodal models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-13T20:23:50.552549Z"},"links":{"cited_paper":"/paper/2410.13611","citing_paper":"/paper/2504.05299"},"observation_digest":"sha256:e0dbb3e4a3ad96cc8c2f6a315ba43052296a4c49623b6ae137069bbefccbc816","observation_id":"97ff18c4-10de-41ba-b264-b0b64bcebbce","resolution":{"observed_at":"2026-05-13T20:23:51.701262Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13611","last_updated":"2024-10-17T14:46:34Z","snapshot_observed_at":"2026-07-06T19:35:21.868885Z","submitted_at":"2024-10-17T14:46:34Z","title":"H2OVL-Mississippi Vision Language Models Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13611","snapshot_observed_at":"2026-08-07T13:40:19.557859Z","title":"H2ovl-mississippi vision language models technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-07T21:47:39.640757Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:19.557859Z"},"links":{"cited_paper":"/paper/2410.13611","citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:8799446eaca66ddd9ee6966728a09f0a906c963213e6356760938aa608128e88","observation_id":"e25bf317-5f2d-40ca-955e-33badcf75361","resolution":{"observed_at":"2026-08-07T13:40:19.557859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13611","last_updated":"2024-10-17T14:46:34Z","snapshot_observed_at":"2026-07-06T19:35:21.868885Z","submitted_at":"2024-10-17T14:46:34Z","title":"H2OVL-Mississippi Vision Language Models Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13611","snapshot_observed_at":"2026-08-07T04:22:55.846897Z","title":"H2ovl-mississippi vision language models technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-08T00:05:09.574699Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.846897Z"},"links":{"cited_paper":"/paper/2410.13611","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:a68981143341a9091fc3f9d7239877afc32247765aba8dd8ab7f38cc99c8bc7b","observation_id":"2695ae24-3a76-4e1f-a39a-35dc60f54fbe","resolution":{"observed_at":"2026-08-07T04:22:55.846897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13611","last_updated":"2024-10-17T14:46:34Z","snapshot_observed_at":"2026-07-06T19:35:21.868885Z","submitted_at":"2024-10-17T14:46:34Z","title":"H2OVL-Mississippi Vision Language Models Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13611","snapshot_observed_at":"2026-08-06T21:52:18.427568Z","title":"Galib, Shanshan Wang, Guanshuo Xu, Pascal Pfeiffer, Ryan Chesler, Mark Landry, and SriSatish Ambati","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:18.427568Z"},"links":{"cited_paper":"/paper/2410.13611","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:a675792f3cba34d4f237596c89cb992b19bdabff351585700c4c58109a1552f4","observation_id":"ddad7a53-b8f2-4202-8256-79c24da2b0b9","resolution":{"observed_at":"2026-08-06T21:52:18.427568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2410.13611/citation-record","integrity":"/paper/2410.13611/integrity","json":"/paper/2410.13611/citation-record.json","paper":"/paper/2410.13611"},"outbound":[],"paper":{"arxiv_id":"2410.13611","last_updated":"2024-10-17T14:46:34Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T19:35:21.868885Z","submitted_at":"2024-10-17T14:46:34Z","title":"H2OVL-Mississippi Vision Language Models Technical Report"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 4 inbound Pith citation observations for arXiv:2410.13611."}