{"as_of":"2026-08-11T12:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6e676bebd2efb36e701ec21250d5d87e3414822bbf057f8ec3309151d43b95a6","coverage":[{"denominator":6,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T13:29:53.006064Z","state":"measured"},{"denominator":7,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":7,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-01T05:44:12.758733Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-01T10:15:44.322072Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.28820","last_updated":"2026-05-27T17:59:55Z","snapshot_observed_at":"2026-07-06T23:38:19.096349Z","submitted_at":"2026-05-27T17:59:55Z","title":"From Pixels to Words -- Towards Native One-Vision Models at Scale","version":1},"cited_work":{"arxiv_id":"2605.28820","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.28820","snapshot_observed_at":"2026-07-01T10:15:44.322072Z","title":"From Pixels to Words -- Towards Native One-Vision Models at Scale","venue":"cs.CV","work_id":"0b59b457-fbfe-4142-aa31-7f1b60923256","year":2026},"citing_paper":{"arxiv_id":"2606.31982","last_updated":"2026-06-30T17:20:29Z","snapshot_observed_at":"2026-08-02T20:40:00.392185Z","submitted_at":"2026-06-30T17:20:29Z","title":"ERA: Entropy-Guided Visual Token Pruning with Rectified Attention for Efficient MLLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-01T05:44:12.758733Z"},"links":{"cited_paper":"/paper/2605.28820","citing_paper":"/paper/2606.31982"},"observation_digest":"sha256:77f465480cd9d6e16e9c8deafb13a0ef5bd2b6a1c7f2d22515f7d54bc6ecc9a7","observation_id":"c1487200-b3a3-4620-be98-4bbd4f3ce553","resolution":{"observed_at":"2026-07-01T10:15:44.323340Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2605.28820/citation-record","integrity":"/paper/2605.28820/integrity","json":"/paper/2605.28820/citation-record.json","paper":"/paper/2605.28820"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-07-06T18:32:23.999019Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2406.11832","doi":"10.48550/arxiv.2406.11832","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart-sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"89919d42-8c59-4aa5-8229-9d3bed0670e3","year":2024},"citing_paper":{"arxiv_id":"2605.28820","last_updated":"2026-05-27T17:59:55Z","snapshot_observed_at":"2026-07-06T23:38:19.096349Z","submitted_at":"2026-05-27T17:59:55Z","title":"From Pixels to Words -- Towards Native One-Vision Models at Scale","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T13:29:53.006064Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2605.28820"},"observation_digest":"sha256:8e78ccc6a6686741a83eb86f26b72c48587f22d1404d76349dd7db71e63aab55","observation_id":"3ff67812-984b-4a7f-8fc2-d12182f1d980","resolution":{"observed_at":"2026-06-29T13:33:28.011099Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:29:53.006064Z","title":"InEuro- pean Conference on Computer Vision, volume 9908, pages 235–251, Amsterdam, The Netherlands","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.28820","last_updated":"2026-05-27T17:59:55Z","snapshot_observed_at":"2026-07-06T23:38:19.096349Z","submitted_at":"2026-05-27T17:59:55Z","title":"From Pixels to Words -- Towards Native One-Vision Models at Scale","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T13:29:53.006064Z"},"links":{"citing_paper":"/paper/2605.28820"},"observation_digest":"sha256:adaaf9f3473bc1dcf5d547e24b0dad7e227cbedc9e2397a59113c9360dbc0108","observation_id":"c332b767-a910-4eec-8996-2c315bf9a5be","resolution":{"observed_at":"2026-06-29T13:29:53.006064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10462","last_updated":"2025-04-14T17:50:20Z","snapshot_observed_at":"2026-08-07T16:05:47.316608Z","submitted_at":"2025-04-14T17:50:20Z","title":"The Scalability of Simplicity: Empirical Analysis of Vision-Language Learning with a Single Transformer","version":1},"cited_work":{"arxiv_id":"2504.10462","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.10462","snapshot_observed_at":"2026-06-29T13:33:28.015082Z","title":"The scalability of simplicity: Empirical analysis of vision-language learning with a single transformer","venue":null,"work_id":"ad1dd878-7ad3-4bb4-9aeb-d80b89cc76ac","year":2023},"citing_paper":{"arxiv_id":"2605.28820","last_updated":"2026-05-27T17:59:55Z","snapshot_observed_at":"2026-07-06T23:38:19.096349Z","submitted_at":"2026-05-27T17:59:55Z","title":"From Pixels to Words -- Towards Native One-Vision Models at Scale","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T13:29:53.006064Z"},"links":{"cited_paper":"/paper/2504.10462","citing_paper":"/paper/2605.28820"},"observation_digest":"sha256:b145ebe1a549886927574060cbd8efbcceaf12cdf4027bbc68a7f86908418d33","observation_id":"d3dcd580-27df-4fee-9729-3b3de8ca34c9","resolution":{"observed_at":"2026-06-29T13:33:28.016525Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.19404","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:33:28.012509Z","title":"Langbridge: Interpreting image as a combination of language embeddings","venue":null,"work_id":"beaf8836-04ca-419b-bdaf-c7a271b8d615","year":2019},"citing_paper":{"arxiv_id":"2605.28820","last_updated":"2026-05-27T17:59:55Z","snapshot_observed_at":"2026-07-06T23:38:19.096349Z","submitted_at":"2026-05-27T17:59:55Z","title":"From Pixels to Words -- Towards Native One-Vision Models at Scale","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T13:29:53.006064Z"},"links":{"citing_paper":"/paper/2605.28820"},"observation_digest":"sha256:e782ac16dfd831e48786c13b2164f3972efa90e1d4d82169b154968a325f841b","observation_id":"a983fc5c-43b3-4e05-9891-3768fc8af4fb","resolution":{"observed_at":"2026-06-29T13:33:28.013987Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":"2307.09288","doi":"10.24963/ijcai.2025/706","metadata_source":"pith","pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","venue":"cs.CL","work_id":"68a5177f-d644-44c1-bd4f-4e5278c22f5d","year":2023},"citing_paper":{"arxiv_id":"2605.28820","last_updated":"2026-05-27T17:59:55Z","snapshot_observed_at":"2026-07-06T23:38:19.096349Z","submitted_at":"2026-05-27T17:59:55Z","title":"From Pixels to Words -- Towards Native One-Vision Models at Scale","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T13:29:53.006064Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2605.28820"},"observation_digest":"sha256:efc36bfe9f4aa1cb587b3f11832b742a321e06f6a489975e0f8c8541fefffe91","observation_id":"a2a6460c-55b5-4cea-9c7c-64f554b43d5e","resolution":{"observed_at":"2026-06-29T13:33:28.008391Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14694","last_updated":"2025-03-12T06:01:05Z","snapshot_observed_at":"2026-08-07T17:11:01.815885Z","submitted_at":"2025-03-12T06:01:05Z","title":"HaploVL: A Single-Transformer Baseline for Multi-Modal Understanding","version":1},"cited_work":{"arxiv_id":"2503.14694","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.14694","snapshot_observed_at":"2026-06-29T13:33:28.004393Z","title":"Haplovl: A single- transformer baseline for multi-modal understanding","venue":null,"work_id":"72a8544e-2cc4-4127-8e65-59e99a339407","year":2024},"citing_paper":{"arxiv_id":"2605.28820","last_updated":"2026-05-27T17:59:55Z","snapshot_observed_at":"2026-07-06T23:38:19.096349Z","submitted_at":"2026-05-27T17:59:55Z","title":"From Pixels to Words -- Towards Native One-Vision Models at Scale","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T13:29:53.006064Z"},"links":{"cited_paper":"/paper/2503.14694","citing_paper":"/paper/2605.28820"},"observation_digest":"sha256:bc07ad18e82e6c91b238aabd763eef3bdb005c1af104320f1847eb9d781dab83","observation_id":"91f6ad7a-cd68-46cc-a942-2e48006fb6d1","resolution":{"observed_at":"2026-06-29T13:33:28.005804Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.28820","last_updated":"2026-05-27T17:59:55Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:38:19.096349Z","submitted_at":"2026-05-27T17:59:55Z","title":"From Pixels to Words -- Towards Native One-Vision Models at Scale"},"reference_resolution":{"displayed":6,"state_counts":{"malformed_identifier":0,"metadata_mismatch":5,"parse_uncertain":0,"unresolved":1,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":6},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 6 of 6 outbound references and 1 inbound Pith citation observation for arXiv:2605.28820."}