{"as_of":"2026-08-22T22:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:70de05eebb14c7a0b739f89207dc9a4cd81056db3e1bb0a1a80da9555530935c","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":12,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":12,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T21:49:27.734866Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T16:50:10.233691Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.06438","last_updated":"2024-12-13T23:11:31Z","snapshot_observed_at":"2026-08-16T13:35:58.335260Z","submitted_at":"2024-07-08T22:40:15Z","title":"SOLO: A Single Transformer for Scalable Vision-Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06438","snapshot_observed_at":"2026-08-11T17:00:08.613191Z","title":"A single transformer for scalable vision-language modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09604","last_updated":"2024-12-12T18:59:26Z","snapshot_observed_at":"2026-08-16T05:48:44.789665Z","submitted_at":"2024-12-12T18:59:26Z","title":"SynerGen-VL: Towards Synergistic Image Understanding and Generation with Vision Experts and Token Folding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T17:00:08.613191Z"},"links":{"cited_paper":"/paper/2407.06438","citing_paper":"/paper/2412.09604"},"observation_digest":"sha256:40d79029b762db33c3655de14f38930153954a93f5b83ad564df83f98a057049","observation_id":"b0c3328d-b256-43ab-91ea-11c8c42329ab","resolution":{"observed_at":"2026-08-11T17:00:08.613191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06438","last_updated":"2024-12-13T23:11:31Z","snapshot_observed_at":"2026-08-16T13:35:58.335260Z","submitted_at":"2024-07-08T22:40:15Z","title":"SOLO: A Single Transformer for Scalable Vision-Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06438","snapshot_observed_at":"2026-08-11T14:13:24.434647Z","title":"A single transformer for scalable vision-language modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12359","last_updated":"2025-01-07T15:36:54Z","snapshot_observed_at":"2026-08-13T23:35:02.697596Z","submitted_at":"2024-12-16T21:14:11Z","title":"LLaVA Steering: Visual Instruction Tuning with 500x Fewer Parameters through Modality Linear Representation-Steering","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T14:13:24.434647Z"},"links":{"cited_paper":"/paper/2407.06438","citing_paper":"/paper/2412.12359"},"observation_digest":"sha256:3a384dcc73380edd4e4d57640ce1e0706fb5639a2dd0b2c338e4223bf69b8d62","observation_id":"ae2dcaa5-bf61-40e2-8bce-da9ee0cf63ce","resolution":{"observed_at":"2026-08-11T14:13:24.434647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06438","last_updated":"2024-12-13T23:11:31Z","snapshot_observed_at":"2026-08-16T13:35:58.335260Z","submitted_at":"2024-07-08T22:40:15Z","title":"SOLO: A Single Transformer for Scalable Vision-Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06438","snapshot_observed_at":"2026-08-11T12:46:59.454414Z","title":"A single transformer for scalable vision-language modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.454414Z"},"links":{"cited_paper":"/paper/2407.06438","citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:8231ec0ca6b459228de32a2755f33269c9bbf91e9c5865d8aed19db7f167019d","observation_id":"6d27094e-ac80-4478-9cc7-737b3866e3d9","resolution":{"observed_at":"2026-08-11T12:46:59.454414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06438","last_updated":"2024-12-13T23:11:31Z","snapshot_observed_at":"2026-08-16T13:35:58.335260Z","submitted_at":"2024-07-08T22:40:15Z","title":"SOLO: A Single Transformer for Scalable Vision-Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06438","snapshot_observed_at":"2026-08-11T10:49:07.975874Z","title":"A single transformer for scalable vision-language modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-15T07:37:36.527948Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:07.975874Z"},"links":{"cited_paper":"/paper/2407.06438","citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:5b034dfae7cab24554f1f5fd8473fb261be464a3624e0d7ac3cc07757f760739","observation_id":"3b1b00db-8e89-435d-aa31-4194798f1758","resolution":{"observed_at":"2026-08-11T10:49:07.975874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06438","last_updated":"2024-12-13T23:11:31Z","snapshot_observed_at":"2026-08-16T13:35:58.335260Z","submitted_at":"2024-07-08T22:40:15Z","title":"SOLO: A Single Transformer for Scalable Vision-Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06438","snapshot_observed_at":"2026-08-11T14:59:01.379180Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-21T08:28:48.041857Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.379180Z"},"links":{"cited_paper":"/paper/2407.06438","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:fcb6c170130dce714016f554f27522944a58e852de7a5dc1b9fdb9b56c77e4e4","observation_id":"75fee6e8-3154-41aa-9617-1ab5e12fcb06","resolution":{"observed_at":"2026-08-11T14:59:01.379180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06438","last_updated":"2024-12-13T23:11:31Z","snapshot_observed_at":"2026-08-16T13:35:58.335260Z","submitted_at":"2024-07-08T22:40:15Z","title":"SOLO: A Single Transformer for Scalable Vision-Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06438","snapshot_observed_at":"2026-08-08T14:25:55.590338Z","title":"A single transformer for scalable vision-language modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-21T14:44:01.602363Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.590338Z"},"links":{"cited_paper":"/paper/2407.06438","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:317c6bae1d89a7656d9c3d5a7221ae10dec66ba0f4f168ebd4b9927ef38c4a33","observation_id":"d783e8fa-cc1c-4ef8-b4d6-8b90a045d9f8","resolution":{"observed_at":"2026-08-08T14:25:55.590338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06438","last_updated":"2024-12-13T23:11:31Z","snapshot_observed_at":"2026-08-16T13:35:58.335260Z","submitted_at":"2024-07-08T22:40:15Z","title":"SOLO: A Single Transformer for Scalable Vision-Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06438","snapshot_observed_at":"2026-08-15T21:49:27.734866Z","title":"A single transformer for scalable vision- language modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-19T19:05:03.485037Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.734866Z"},"links":{"cited_paper":"/paper/2407.06438","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:12542f79c3dfad4fcf5c367ffc8915c6a2c090f0e9c794559fb40c0bca75c19d","observation_id":"f7a0b0cc-42e7-4957-8077-93ec3a6cb291","resolution":{"observed_at":"2026-08-15T21:49:27.734866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06438","last_updated":"2024-12-13T23:11:31Z","snapshot_observed_at":"2026-08-16T13:35:58.335260Z","submitted_at":"2024-07-08T22:40:15Z","title":"SOLO: A Single Transformer for Scalable Vision-Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06438","snapshot_observed_at":"2026-08-06T21:19:43.915177Z","title":"A sin- gle transformer for scalable vision-language modeling.arXiv preprint arXiv:2407.06438, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-15T20:28:40.863571Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:43.915177Z"},"links":{"cited_paper":"/paper/2407.06438","citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:a6d2957e903da7aecb5c8c245fe070617bc2929e44a26e7672a30ffe96e0f697","observation_id":"545f009c-c476-415b-8c41-ec954171c74e","resolution":{"observed_at":"2026-08-06T21:19:43.915177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06438","last_updated":"2024-12-13T23:11:31Z","snapshot_observed_at":"2026-08-16T13:35:58.335260Z","submitted_at":"2024-07-08T22:40:15Z","title":"SOLO: A Single Transformer for Scalable Vision-Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06438","snapshot_observed_at":"2026-08-06T21:17:09.614748Z","title":"A single transformer for scalable vision- language modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-20T11:48:44.428153Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:09.614748Z"},"links":{"cited_paper":"/paper/2407.06438","citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:8887f546e90cf37061538f7b7b7cdfbac2b8eb0d6530268308ba63da74a4f72c","observation_id":"c1b79421-ce28-4c47-b15b-bc68e211d958","resolution":{"observed_at":"2026-08-06T21:17:09.614748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06438","last_updated":"2024-12-13T23:11:31Z","snapshot_observed_at":"2026-08-16T13:35:58.335260Z","submitted_at":"2024-07-08T22:40:15Z","title":"SOLO: A Single Transformer for Scalable Vision-Language Modeling","version":3},"cited_work":{"arxiv_id":"2407.06438","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.06438","snapshot_observed_at":"2026-08-06T16:50:10.233691Z","title":"SOLO: A Single Transformer for Scalable Vision-Language Modeling","venue":"cs.CV","work_id":"502d8ac0-31a5-40d6-838e-82597f85a7ea","year":2024},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-16T04:56:37.330824Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:56.373596Z"},"links":{"cited_paper":"/paper/2407.06438","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:1060f7441d98f73e0b9c9bf74bf8c3cddb7b88433326c99c66d23dda12061617","observation_id":"1c525bd1-5ec4-4b4f-9005-06ab4929f066","resolution":{"observed_at":"2026-08-06T16:50:10.351624Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06438","last_updated":"2024-12-13T23:11:31Z","snapshot_observed_at":"2026-08-16T13:35:58.335260Z","submitted_at":"2024-07-08T22:40:15Z","title":"SOLO: A Single Transformer for Scalable Vision-Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06438","snapshot_observed_at":"2026-08-03T13:01:57.577357Z","title":"arXiv preprint arXiv:2407.06438 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.01095","last_updated":"2026-08-02T22:17:06Z","snapshot_observed_at":"2026-08-19T18:00:21.944637Z","submitted_at":"2026-01-03T07:12:55Z","title":"NarrativeTrack: Evaluating Entity-Centric Reasoning for Narrative Understanding","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T13:01:57.577357Z"},"links":{"cited_paper":"/paper/2407.06438","citing_paper":"/paper/2601.01095"},"observation_digest":"sha256:b2c32ac489f2a196f0a1e48cc520b0621c2115b1d860f867b44488c6e5cc2fbd","observation_id":"b02216c0-a23f-4b29-9223-7e859dbb5a5b","resolution":{"observed_at":"2026-08-03T13:01:57.577357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06438","last_updated":"2024-12-13T23:11:31Z","snapshot_observed_at":"2026-08-16T13:35:58.335260Z","submitted_at":"2024-07-08T22:40:15Z","title":"SOLO: A Single Transformer for Scalable Vision-Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06438","snapshot_observed_at":"2026-08-04T06:36:33.779965Z","title":"arXiv preprint arXiv:2407.06438 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.01095","last_updated":"2026-08-02T22:17:06Z","snapshot_observed_at":"2026-08-19T18:00:21.944637Z","submitted_at":"2026-01-03T07:12:55Z","title":"NarrativeTrack: Evaluating Entity-Centric Reasoning for Narrative Understanding","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T06:36:33.779965Z"},"links":{"cited_paper":"/paper/2407.06438","citing_paper":"/paper/2601.01095"},"observation_digest":"sha256:5628f580149b90b6ebf7361f09d7e781ffeaa7fa3ed0d98341e2bb24b9150a17","observation_id":"41d5c32b-d851-49e6-af21-ed1bce506d36","resolution":{"observed_at":"2026-08-04T06:36:33.779965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2407.06438/citation-record","integrity":"/paper/2407.06438/integrity","json":"/paper/2407.06438/citation-record.json","paper":"/paper/2407.06438"},"outbound":[],"paper":{"arxiv_id":"2407.06438","last_updated":"2024-12-13T23:11:31Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T13:35:58.335260Z","submitted_at":"2024-07-08T22:40:15Z","title":"SOLO: A Single Transformer for Scalable Vision-Language Modeling"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 12 inbound Pith citation observations for arXiv:2407.06438."}