{"as_of":"2026-08-06T19:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:337a429dd06ce255b7e7d90f9a3dcf3bd84af88689754534baa7717053c42dbb","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-01T06:29:01.706006Z","state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.27313/citation-record","integrity":"/paper/2606.27313/integrity","json":"/paper/2606.27313/citation-record.json","paper":"/paper/2606.27313"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"cited_work":{"arxiv_id":"2501.03575","doi":"10.48550/arxiv.2501.03575","metadata_source":"pith","pith_arxiv_id":"2501.03575","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cosmos World Foundation Model Platform for Physical AI","venue":"cs.CV","work_id":"a2dba24c-318d-476a-8b21-4289c265810c","year":2025},"citing_paper":{"arxiv_id":"2606.27313","last_updated":"2026-06-30T15:05:33Z","snapshot_observed_at":"2026-07-07T00:01:34.696890Z","submitted_at":"2026-06-25T17:29:27Z","title":"ViQ: Text-Aligned Visual Quantized Representations at Any Resolution","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-01T06:29:01.706006Z"},"links":{"cited_paper":"/paper/2501.03575","citing_paper":"/paper/2606.27313"},"observation_digest":"sha256:f4111328b3f26fb5e5f06d7fb686f8a2954389410600aad1a523989ce0a3bbb2","observation_id":"ae17375d-8cfe-46bb-91e5-ab4ce7e5c972","resolution":{"observed_at":"2026-07-01T09:35:39.806093Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:29.560535+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:29.560535+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-02T21:55:15.857183Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":"2403.20330","doi":"10.48550/arxiv.2403.20330","metadata_source":"pith","pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","venue":"cs.CV","work_id":"0d0b977c-a42e-49b1-869e-b7360dca5282","year":2024},"citing_paper":{"arxiv_id":"2606.27313","last_updated":"2026-06-30T15:05:33Z","snapshot_observed_at":"2026-07-07T00:01:34.696890Z","submitted_at":"2026-06-25T17:29:27Z","title":"ViQ: Text-Aligned Visual Quantized Representations at Any Resolution","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-01T06:29:01.706006Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2606.27313"},"observation_digest":"sha256:66e24933e3f1e830bb33bd529d310faee092a4903c2cecf3e83b04d2535bf80c","observation_id":"7625bbb0-e978-495d-a6e3-5b411253699b","resolution":{"observed_at":"2026-07-01T09:35:39.828216Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17425","last_updated":"2023-11-06T02:47:51Z","snapshot_observed_at":"2026-07-06T16:25:38.571377Z","submitted_at":"2023-09-29T17:37:29Z","title":"Data Filtering Networks","version":3},"cited_work":{"arxiv_id":"2309.17425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.17425","snapshot_observed_at":"2026-07-04T20:50:12.674098Z","title":"arXiv preprint arXiv:2309.17425 (2023)","venue":null,"work_id":"9922937e-9c54-4233-8816-d729dfaf746e","year":2023},"citing_paper":{"arxiv_id":"2606.27313","last_updated":"2026-06-30T15:05:33Z","snapshot_observed_at":"2026-07-07T00:01:34.696890Z","submitted_at":"2026-06-25T17:29:27Z","title":"ViQ: Text-Aligned Visual Quantized Representations at Any Resolution","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-01T06:29:01.706006Z"},"links":{"cited_paper":"/paper/2309.17425","citing_paper":"/paper/2606.27313"},"observation_digest":"sha256:d009d7b48b57e2a8add6e4227f9f68372c74f8a757e1e232d1f32e1d81b111c3","observation_id":"2e72d204-3baf-4a88-b48e-6e343d5a7140","resolution":{"observed_at":"2026-07-01T09:35:39.778449Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2505.07062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-08T16:15:06.198778Z","title":"Seed1.5-VL Technical Report","venue":"cs.CV","work_id":"0e8e025f-ca1e-49cc-aee2-33f3a0201f3c","year":2025},"citing_paper":{"arxiv_id":"2606.27313","last_updated":"2026-06-30T15:05:33Z","snapshot_observed_at":"2026-07-07T00:01:34.696890Z","submitted_at":"2026-06-25T17:29:27Z","title":"ViQ: Text-Aligned Visual Quantized Representations at Any Resolution","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-01T06:29:01.706006Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2606.27313"},"observation_digest":"sha256:6a6bcef262f7e8279fbd2b1ba0fb4ab4ea8928b412c6bd3e117be33c45a0a139","observation_id":"38873eda-e451-4b91-a063-828699d464ed","resolution":{"observed_at":"2026-07-01T09:35:39.817141Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":"1412.6980","doi":"10.1002/mrm.28086","metadata_source":"pith","pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Adam: A Method for Stochastic Optimization","venue":"cs.LG","work_id":"1910796d-9b52-4683-bf5c-de9632c1028b","year":2014},"citing_paper":{"arxiv_id":"2606.27313","last_updated":"2026-06-30T15:05:33Z","snapshot_observed_at":"2026-07-07T00:01:34.696890Z","submitted_at":"2026-06-25T17:29:27Z","title":"ViQ: Text-Aligned Visual Quantized Representations at Any Resolution","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-01T06:29:01.706006Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2606.27313"},"observation_digest":"sha256:fad82ac53be18548914d242e3155bfc2ea38f12e40395aec00c090372c03f915","observation_id":"0e8c2db2-213c-4ac7-bf67-c2e813ea4a1c","resolution":{"observed_at":"2026-07-01T09:35:39.798333Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2606.27313","last_updated":"2026-06-30T15:05:33Z","snapshot_observed_at":"2026-07-07T00:01:34.696890Z","submitted_at":"2026-06-25T17:29:27Z","title":"ViQ: Text-Aligned Visual Quantized Representations at Any Resolution","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-01T06:29:01.706006Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2606.27313"},"observation_digest":"sha256:f168e1230e44a326bef8020377394e7c5258c3091e789291e4d0b77f5a0b7c0c","observation_id":"1bcc357d-d70a-4af0-b359-a918c7e62b88","resolution":{"observed_at":"2026-07-01T09:35:39.802336Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12961","last_updated":"2025-02-27T06:09:46Z","snapshot_observed_at":"2026-07-06T19:18:17.523057Z","submitted_at":"2024-09-19T17:59:51Z","title":"Oryx MLLM: On-Demand Spatial-Temporal Understanding at Arbitrary Resolution","version":4},"cited_work":{"arxiv_id":"2409.12961","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.12961","snapshot_observed_at":"2026-07-04T13:09:50.847114Z","title":"Oryx mllm: On- demand spatial-temporal understanding at arbitrary resolution","venue":null,"work_id":"4a905ca2-7426-40db-a509-3452624d3ae5","year":2024},"citing_paper":{"arxiv_id":"2606.27313","last_updated":"2026-06-30T15:05:33Z","snapshot_observed_at":"2026-07-07T00:01:34.696890Z","submitted_at":"2026-06-25T17:29:27Z","title":"ViQ: Text-Aligned Visual Quantized Representations at Any Resolution","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-01T06:29:01.706006Z"},"links":{"cited_paper":"/paper/2409.12961","citing_paper":"/paper/2606.27313"},"observation_digest":"sha256:432715f1e993a291b3ee6feb700eb260efe7d5bbdbc1ef4212829187c6b646ad","observation_id":"1fa8c5de-9e72-4954-ac08-d538123a1901","resolution":{"observed_at":"2026-07-01T09:35:39.749751Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04410","last_updated":"2025-02-09T08:59:19Z","snapshot_observed_at":"2026-08-06T03:43:29.067278Z","submitted_at":"2024-09-06T17:14:53Z","title":"Open-MAGVIT2: An Open-Source Project Toward Democratizing Auto-regressive Visual Generation","version":3},"cited_work":{"arxiv_id":"2409.04410","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.04410","snapshot_observed_at":"2026-07-04T13:09:50.831210Z","title":"Open-magvit2: An open-source project toward democratizing auto-regressive visual gener- ation","venue":null,"work_id":"a2523977-d17d-43e1-8c06-1f6ba1c28388","year":2025},"citing_paper":{"arxiv_id":"2606.27313","last_updated":"2026-06-30T15:05:33Z","snapshot_observed_at":"2026-07-07T00:01:34.696890Z","submitted_at":"2026-06-25T17:29:27Z","title":"ViQ: Text-Aligned Visual Quantized Representations at Any Resolution","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-01T06:29:01.706006Z"},"links":{"cited_paper":"/paper/2409.04410","citing_paper":"/paper/2606.27313"},"observation_digest":"sha256:83b58e5ee3ff99dd49d988395b0a7edc80ebed895ab725ac4798cc734ede2126","observation_id":"4e0b7bf6-83b7-486c-abbb-6aad52799b9a","resolution":{"observed_at":"2026-07-01T09:35:39.766107Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.20321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T13:09:50.827602Z","title":"Unitok: A unified tokenizer for visual generation and understanding.arXiv preprint arXiv:2502.20321, 2025a","venue":null,"work_id":"31d5c278-398d-4fee-8130-a864fb6b3717","year":2025},"citing_paper":{"arxiv_id":"2606.27313","last_updated":"2026-06-30T15:05:33Z","snapshot_observed_at":"2026-07-07T00:01:34.696890Z","submitted_at":"2026-06-25T17:29:27Z","title":"ViQ: Text-Aligned Visual Quantized Representations at Any Resolution","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-01T06:29:01.706006Z"},"links":{"citing_paper":"/paper/2606.27313"},"observation_digest":"sha256:39083bc6880c9c85b601bd43c9f79f8236474e81731df36adfc9299ee3f6c3bf","observation_id":"dfe4d32a-b1e7-4033-905c-3b8c1291d452","resolution":{"observed_at":"2026-07-01T09:35:39.810511Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":"2203.10244","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-07-04T16:39:57.602645Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","venue":"cs.CL","work_id":"8b49b78c-7e1d-4f57-af10-7c11cd63ff7c","year":2022},"citing_paper":{"arxiv_id":"2606.27313","last_updated":"2026-06-30T15:05:33Z","snapshot_observed_at":"2026-07-07T00:01:34.696890Z","submitted_at":"2026-06-25T17:29:27Z","title":"ViQ: Text-Aligned Visual Quantized Representations at Any Resolution","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-01T06:29:01.706006Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2606.27313"},"observation_digest":"sha256:eaa8b361094173ceb5de7a65035fb9e7a76dd20ecb3bfc6d5819da32ae6f7199","observation_id":"354cf9f5-4d8a-4eb2-9241-e8d4a08cab49","resolution":{"observed_at":"2026-07-01T09:35:39.787611Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2606.27313","last_updated":"2026-06-30T15:05:33Z","snapshot_observed_at":"2026-07-07T00:01:34.696890Z","submitted_at":"2026-06-25T17:29:27Z","title":"ViQ: Text-Aligned Visual Quantized Representations at Any Resolution","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-01T06:29:01.706006Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2606.27313"},"observation_digest":"sha256:e734a9e75ec2d8624b892a2e20257baa42098a1c6bff1c5a895fe8ca18510048","observation_id":"f9c1cfc3-f1f9-4d7f-b681-9cdc08b910ad","resolution":{"observed_at":"2026-07-01T09:35:39.770072Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":"2406.06525","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-07-10T11:37:03.266757Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","venue":"cs.CV","work_id":"41efe203-9377-4c63-b1d6-e499cd6e46f6","year":2024},"citing_paper":{"arxiv_id":"2606.27313","last_updated":"2026-06-30T15:05:33Z","snapshot_observed_at":"2026-07-07T00:01:34.696890Z","submitted_at":"2026-06-25T17:29:27Z","title":"ViQ: Text-Aligned Visual Quantized Representations at Any Resolution","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-01T06:29:01.706006Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2606.27313"},"observation_digest":"sha256:99d2e87118b05b7666078938ad55521f76bd2ddc2cdcf338dd5c5bf157df9973","observation_id":"65cdf4b7-5c5e-497f-a99b-c2daa071f8fe","resolution":{"observed_at":"2026-07-01T09:35:39.790242Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2606.27313","last_updated":"2026-06-30T15:05:33Z","snapshot_observed_at":"2026-07-07T00:01:34.696890Z","submitted_at":"2026-06-25T17:29:27Z","title":"ViQ: Text-Aligned Visual Quantized Representations at Any Resolution","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-01T06:29:01.706006Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2606.27313"},"observation_digest":"sha256:b2cfd96523cfd615f4fb2b084d5dedfb00a22edd22756466e7f78ff1d2784623","observation_id":"c47199f5-6eca-44f0-bc2e-9a0b1c4dfdeb","resolution":{"observed_at":"2026-07-01T09:35:39.814018Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.27538","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T13:59:52.882376Z","title":"Longcat-next: Lexicalizing modalities as discrete tokens","venue":null,"work_id":"b02143c1-c2e9-4a92-ad39-93f93fd2eba7","year":2026},"citing_paper":{"arxiv_id":"2606.27313","last_updated":"2026-06-30T15:05:33Z","snapshot_observed_at":"2026-07-07T00:01:34.696890Z","submitted_at":"2026-06-25T17:29:27Z","title":"ViQ: Text-Aligned Visual Quantized Representations at Any Resolution","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-01T06:29:01.706006Z"},"links":{"citing_paper":"/paper/2606.27313"},"observation_digest":"sha256:cb1598284b540f3e711e03112304e1c124c143c19790f0d43d1239c143e1fedf","observation_id":"176b9ed9-c8b7-4caf-99d7-63051936edfa","resolution":{"observed_at":"2026-07-01T09:35:39.773896Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":"2502.14786","doi":"10.48550/arxiv.2502.14786","metadata_source":"pith","pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","venue":"cs.CV","work_id":"50eec732-2d41-432f-9dcf-ac7fff235ea5","year":2025},"citing_paper":{"arxiv_id":"2606.27313","last_updated":"2026-06-30T15:05:33Z","snapshot_observed_at":"2026-07-07T00:01:34.696890Z","submitted_at":"2026-06-25T17:29:27Z","title":"ViQ: Text-Aligned Visual Quantized Representations at Any Resolution","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-01T06:29:01.706006Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2606.27313"},"observation_digest":"sha256:c7e0f266bca9a8340eae04860723b2f118618520b917c521578c662fdf5e103d","observation_id":"3f953edb-c4c1-48be-a023-42c8ed4873be","resolution":{"observed_at":"2026-07-01T09:35:39.824779Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-10T23:49:08.777694+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T23:49:08.777694+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":"2503.20314","doi":"10.1109/19.492748","metadata_source":"pith","pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":"cs.CV","work_id":"ad3ebc3b-4224-46c9-b61d-bcf135da0a7c","year":2025},"citing_paper":{"arxiv_id":"2606.27313","last_updated":"2026-06-30T15:05:33Z","snapshot_observed_at":"2026-07-07T00:01:34.696890Z","submitted_at":"2026-06-25T17:29:27Z","title":"ViQ: Text-Aligned Visual Quantized Representations at Any Resolution","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-01T06:29:01.706006Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2606.27313"},"observation_digest":"sha256:31f000589164163c7a2d806c67edb912892a07f401d35b0b670a36ff148049b4","observation_id":"bcf0f9c9-d93c-4c70-9d33-6ee50d755fe5","resolution":{"observed_at":"2026-07-01T09:35:39.795063Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02324","last_updated":"2025-08-04T11:49:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-04T11:49:20Z","title":"Qwen-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2508.02324","doi":"10.48550/arxiv.2508.02324","metadata_source":"pith","pith_arxiv_id":"2508.02324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-Image Technical Report","venue":"cs.CV","work_id":"d06d7ecc-7579-4f89-a60b-4278a0f3c562","year":2025},"citing_paper":{"arxiv_id":"2606.27313","last_updated":"2026-06-30T15:05:33Z","snapshot_observed_at":"2026-07-07T00:01:34.696890Z","submitted_at":"2026-06-25T17:29:27Z","title":"ViQ: Text-Aligned Visual Quantized Representations at Any Resolution","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-01T06:29:01.706006Z"},"links":{"cited_paper":"/paper/2508.02324","citing_paper":"/paper/2606.27313"},"observation_digest":"sha256:94dd78a86f849193e349c988075740c585b813104a0c75ac2295b25ae97799b5","observation_id":"7379842e-0657-4fa3-b8f7-e82f09528701","resolution":{"observed_at":"2026-07-01T09:35:39.799075Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-21T15:23:05.016381+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T15:23:05.016381+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":"2408.12528","doi":"10.48550/arxiv.2408.12528","metadata_source":"pith","pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","venue":"cs.CV","work_id":"1393dc24-a6b2-44e1-b5d7-7009d1fa4811","year":2024},"citing_paper":{"arxiv_id":"2606.27313","last_updated":"2026-06-30T15:05:33Z","snapshot_observed_at":"2026-07-07T00:01:34.696890Z","submitted_at":"2026-06-25T17:29:27Z","title":"ViQ: Text-Aligned Visual Quantized Representations at Any Resolution","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-01T06:29:01.706006Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2606.27313"},"observation_digest":"sha256:798871e49e70dadb70af46af61ade6fc3888e4e1ceb5278a026922f0a103a411","observation_id":"a3f170df-9fc5-46a5-b0a6-1a16aca0cb78","resolution":{"observed_at":"2026-07-01T09:35:39.768511Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.14033","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T13:09:50.840268Z","title":"Sail-vl2 technical report","venue":null,"work_id":"9462336a-e253-4e72-8d1c-04909178ce85","year":2025},"citing_paper":{"arxiv_id":"2606.27313","last_updated":"2026-06-30T15:05:33Z","snapshot_observed_at":"2026-07-07T00:01:34.696890Z","submitted_at":"2026-06-25T17:29:27Z","title":"ViQ: Text-Aligned Visual Quantized Representations at Any Resolution","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-01T06:29:01.706006Z"},"links":{"citing_paper":"/paper/2606.27313"},"observation_digest":"sha256:a148178ff886a4f369d4edb8e3645823d3759eb9a20acef8a733e01a7927cb9d","observation_id":"3259b063-af9a-419e-bfda-0c4ea5bb1824","resolution":{"observed_at":"2026-07-01T09:35:39.756114Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":"2504.10479","doi":"10.48550/arxiv.2504.10479","metadata_source":"pith","pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","venue":"cs.CV","work_id":"fe8637aa-12bc-4434-8d36-9f57b5eebcbe","year":2025},"citing_paper":{"arxiv_id":"2606.27313","last_updated":"2026-06-30T15:05:33Z","snapshot_observed_at":"2026-07-07T00:01:34.696890Z","submitted_at":"2026-06-25T17:29:27Z","title":"ViQ: Text-Aligned Visual Quantized Representations at Any Resolution","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-01T06:29:01.706006Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2606.27313"},"observation_digest":"sha256:a201a93d0829894ffeeb7a81b8943a4d08daff89dad1c0e6725c9be9f3d596c4","observation_id":"3dfe8624-b133-4ee9-add3-f2b993d7aff9","resolution":{"observed_at":"2026-07-01T09:35:39.821652Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T18:02:46.619025Z","title":null,"venue":null,"work_id":"af8296a7-ae83-47de-bdc6-45a0ba7b6745","year":2024},"citing_paper":{"arxiv_id":"2606.27313","last_updated":"2026-06-30T15:05:33Z","snapshot_observed_at":"2026-07-07T00:01:34.696890Z","submitted_at":"2026-06-25T17:29:27Z","title":"ViQ: Text-Aligned Visual Quantized Representations at Any Resolution","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-01T06:29:01.706006Z"},"links":{"citing_paper":"/paper/2606.27313"},"observation_digest":"sha256:3847fe133580a0db568ad7fafc5083d237188ad800e4041c73021cc8346eab75","observation_id":"26ec2148-0860-4d53-a399-51b11bf23add","resolution":{"observed_at":"2026-07-06T18:02:46.620046Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.27313","last_updated":"2026-06-30T15:05:33Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-07T00:01:34.696890Z","submitted_at":"2026-06-25T17:29:27Z","title":"ViQ: Text-Aligned Visual Quantized Representations at Any Resolution"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":1,"verified_exact":17,"verified_fuzzy":0},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 0 inbound Pith citation observations for arXiv:2606.27313."}