{"as_of":"2026-08-07T07:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:53212da37bec01dd79cf6ad99d59c1412a408f77bcc838fa5440f4dddc2b00cd","coverage":[{"denominator":74,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":74,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:41:57.394029Z","state":"measured"},{"denominator":78,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":78,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T12:10:53.720348Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-10T12:15:01.137692Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"cited_work":{"arxiv_id":"2506.23639","doi":"10.48550/arxiv.2506.23639","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23639","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Unified multimodal understanding via byte-pair visual encoding","venue":null,"work_id":"0549cd61-7abb-47f9-aa9e-9980354f43df","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":218,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2506.23639","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:36c9a7d7e291d380f5e7df13538ed2556ff19e457149cde0333881f9af13ac9f","observation_id":"0e248dc9-df63-4d2e-8dbc-eb43593f295e","resolution":{"observed_at":"2026-05-18T19:21:48.550981Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"cited_work":{"arxiv_id":"2506.23639","doi":"10.48550/arxiv.2506.23639","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23639","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Unified multimodal understanding via byte-pair visual encoding","venue":null,"work_id":"0549cd61-7abb-47f9-aa9e-9980354f43df","year":2025},"citing_paper":{"arxiv_id":"2604.03893","last_updated":"2026-06-01T03:09:36Z","snapshot_observed_at":"2026-07-13T12:10:48.358603Z","submitted_at":"2026-04-04T23:18:58Z","title":"FeynmanBench: Benchmarking Multimodal LLMs on Diagrammatic Physics Reasoning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-13T16:51:48.705876Z"},"links":{"cited_paper":"/paper/2506.23639","citing_paper":"/paper/2604.03893"},"observation_digest":"sha256:35df3e50119061bfc7ca892aa90a32a0e5830f3d77250148d876cd8d87735e9d","observation_id":"6f14d2a7-9d87-4387-94ef-c078c35a3c65","resolution":{"observed_at":"2026-05-13T16:52:59.438120Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23639","snapshot_observed_at":"2026-07-13T12:10:53.720348Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.03893","last_updated":"2026-06-01T03:09:36Z","snapshot_observed_at":"2026-07-13T12:10:48.358603Z","submitted_at":"2026-04-04T23:18:58Z","title":"FeynmanBench: Benchmarking Multimodal LLMs on Diagrammatic Physics Reasoning","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-13T12:10:53.720348Z"},"links":{"cited_paper":"/paper/2506.23639","citing_paper":"/paper/2604.03893"},"observation_digest":"sha256:b1953afcabc64dc152a3ed134fafe03120e8b1cd75077f586bce44cfbcd633f8","observation_id":"33d616b9-24d6-49f7-b3c2-152668849488","resolution":{"observed_at":"2026-07-13T12:10:53.720348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"cited_work":{"arxiv_id":"2506.23639","doi":"10.48550/arxiv.2506.23639","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23639","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Unified multimodal understanding via byte-pair visual encoding","venue":null,"work_id":"0549cd61-7abb-47f9-aa9e-9980354f43df","year":2025},"citing_paper":{"arxiv_id":"2605.00078","last_updated":"2026-04-30T14:16:15Z","snapshot_observed_at":"2026-07-06T23:13:33.799847Z","submitted_at":"2026-04-30T14:16:15Z","title":"Being-H0.7: A Latent World-Action Model from Egocentric Videos","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-09T20:48:01.461993Z"},"links":{"cited_paper":"/paper/2506.23639","citing_paper":"/paper/2605.00078"},"observation_digest":"sha256:2a0f24619c2833cfead654053d8f429c5e9a567fd2f67a4b29221e069f8f2b78","observation_id":"8cb96130-6798-494e-8c20-cfd5a500a861","resolution":{"observed_at":"2026-05-11T15:01:04.671383Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.23639/citation-record","integrity":"/paper/2506.23639/integrity","json":"/paper/2506.23639/citation-record.json","paper":"/paper/2506.23639"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13549","snapshot_observed_at":"2026-08-06T21:41:50.412114Z","title":"A survey on multimodal large language models.arXiv preprint arXiv:2306.13549, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:50.412114Z"},"links":{"cited_paper":"/paper/2306.13549","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:41ee56a5471cb8aa3da384357bee478ae98f19a6a941d7e1db3513cf5f5c57c4","observation_id":"1f10ad92-c19c-4b6d-9332-606a508c5f8a","resolution":{"observed_at":"2026-08-06T21:41:50.412114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:50.528861Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:50.528861Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:22914f4b8de366f690724e32778c3472127e655b42748a022b4dbba7ed6b02c3","observation_id":"ac1ecf7c-2e98-4186-b378-21b5978d53cc","resolution":{"observed_at":"2026-08-06T21:41:50.528861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-06T21:41:50.645391Z","title":"Embodiedbench: Comprehensive benchmarking multi-modal large language models for vision-driven embodied agents.arXiv preprint arXiv:2502.09560, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:50.645391Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:639f3d20669a3010d64d447e03770bdfa0589983dd89a06fdc402f9a6fc64c07","observation_id":"97bfa309-ed67-4035-a364-4fff9c880e7d","resolution":{"observed_at":"2026-08-06T21:41:50.645391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:50.786380Z","title":"Multimodal machine learning: A survey and taxonomy","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:50.786380Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:d2f87e3f9ee8fba66470064a3d8359c6f3d7d1cb52e6fe05595497dc0b5557b4","observation_id":"94ccf16c-1968-4899-ad09-671fccbaec06","resolution":{"observed_at":"2026-08-06T21:41:50.786380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07594","last_updated":"2025-01-08T02:33:37Z","snapshot_observed_at":"2026-07-06T16:46:57.403995Z","submitted_at":"2023-11-10T09:51:24Z","title":"How to Bridge the Gap between Modalities: Survey on Multimodal Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07594","snapshot_observed_at":"2026-08-06T21:41:50.893822Z","title":"How to bridge the gap between modalities: A comprehensive survey on multimodal large language model.arXiv preprint arXiv:2311.07594, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:50.893822Z"},"links":{"cited_paper":"/paper/2311.07594","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:e2d2c64878d345108f7ef985efc5c50dc9204111a51a40956dda124bb5f767fb","observation_id":"60152022-7859-45d1-8304-401b38e3e0be","resolution":{"observed_at":"2026-08-06T21:41:50.893822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01293","last_updated":"2024-07-20T07:52:29Z","snapshot_observed_at":"2026-07-06T17:24:12.659911Z","submitted_at":"2024-02-02T10:30:05Z","title":"Can MLLMs Perform Text-to-Image In-Context Learning?","version":3},"cited_work":{"arxiv_id":"2402.01293","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.01293","snapshot_observed_at":"2026-08-06T21:41:58.173949Z","title":"Can MLLMs Perform Text-to-Image In-Context Learning?","venue":"cs.LG","work_id":"06664973-3e68-428d-b679-be70add2f679","year":2024},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:50.990343Z"},"links":{"cited_paper":"/paper/2402.01293","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:5a82b80f7cda70fb7edbdddc3bfd0be7b1db037dec1fb5efd1b6715ecf318e8a","observation_id":"62a8891b-c809-48cf-b8fa-8d0059b3e8d1","resolution":{"observed_at":"2026-08-06T21:41:58.277662Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:42:00.583595Z","title":"Vision transformer with quadrangle attention.IEEE Transactions on Pattern Analysis and Machine Intelligence, 2024","venue":null,"work_id":"6cd699e1-3a96-418e-9ef5-343aeba564a6","year":2024},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:51.077788Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:f58d0aed4b1f9c8c87e2bd2b7d570d08a27ff5444d1c320366b4b8ebbab11da9","observation_id":"5a1e2ff2-eeb0-438f-a881-2b65ee2bb72e","resolution":{"observed_at":"2026-08-06T21:42:00.700109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:51.188244Z","title":"Unified language-vision pretraining with dynamic discrete visual tokenization.arXiv preprint arXiv:2309.04669, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:51.188244Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:bae2af653799b03900f4eff71b03a8fa5dff4bb27535155021db903b74a652cf","observation_id":"dceb408a-7db8-4a2d-81ec-511e00dab3db","resolution":{"observed_at":"2026-08-06T21:41:51.188244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-07-06T19:56:21.333277Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16156","snapshot_observed_at":"2026-08-06T21:41:51.372359Z","title":"Videoorion: Tokenizing object dynamics in videos.arXiv preprint arXiv:2411.16156, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:51.372359Z"},"links":{"cited_paper":"/paper/2411.16156","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:fa1830c5ae24079448969089b70128bb016f45c08640fc318f3ab7556ae25e81","observation_id":"a2c3ae77-95fe-4fe4-a46a-9825521193aa","resolution":{"observed_at":"2026-08-06T21:41:51.372359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:51.514992Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:51.514992Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:179c265d25918090c29655dc91f5e164108ed886d3edfbca685a032cc2044d72","observation_id":"a3db720f-9570-438f-9fc3-f03e80fbcb8a","resolution":{"observed_at":"2026-08-06T21:41:51.514992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08916","last_updated":"2022-10-04T22:37:32Z","snapshot_observed_at":"2026-07-06T13:22:09.403770Z","submitted_at":"2022-06-17T17:53:47Z","title":"Unified-IO: A Unified Model for Vision, Language, and Multi-Modal Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08916","snapshot_observed_at":"2026-08-06T21:41:51.615891Z","title":"Unified-io: A unified model for vision, language, and multi-modal tasks.arXiv preprint arXiv:2206.08916, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:51.615891Z"},"links":{"cited_paper":"/paper/2206.08916","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:041829bd0109b284d344d287ef6f3c238d50ca6223d2f1d3e1187a77e476e605","observation_id":"40c626f2-5ee3-4f25-95ef-a2428b0320ff","resolution":{"observed_at":"2026-08-06T21:41:51.615891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-06T21:41:51.726124Z","title":"Chameleon: Mixed-modal early-fusion foundation models.arXiv preprint arXiv:2405.09818, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:51.726124Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:7e4db07e1d2d0898b00289534e8beebc4fcd8f1e6a438a85dcf9bfd43db33d2c","observation_id":"14df6c30-c4ee-4b25-8cef-7c9e5cd860f6","resolution":{"observed_at":"2026-08-06T21:41:51.726124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:51.797613Z","title":"Unified-io 2: Scaling autoregressive multimodal models with vision language audio and action","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:51.797613Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:2edf2566719c0403389fffadf746915e8c7c75bfe7085f025ff5007b98dbe0e3","observation_id":"e7959311-e83a-4d77-ab7c-fac51c3246bd","resolution":{"observed_at":"2026-08-06T21:41:51.797613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09072","last_updated":"2024-03-14T03:29:58Z","snapshot_observed_at":"2026-07-06T17:44:21.659847Z","submitted_at":"2024-03-14T03:29:58Z","title":"UniCode: Learning a Unified Codebook for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09072","snapshot_observed_at":"2026-08-06T21:41:51.878757Z","title":"Unicode: Learning a unified codebook for multimodal large language models.arXiv preprint arXiv:2403.09072, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:51.878757Z"},"links":{"cited_paper":"/paper/2403.09072","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:02091e83fead51769d6e68e5cf8921d09482081a600618973073ae3e50591ea6","observation_id":"c05a16ac-6e9d-4f4c-971b-e8f615e5a5c7","resolution":{"observed_at":"2026-08-06T21:41:51.878757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:51.980688Z","title":"From pixels to tokens: Byte-pair encoding on quantized visual modalities","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:51.980688Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:2c3f97780255ecb65603a9f1d22c738a51be1b2a8f0ca8ad05e60b83dbdf6be0","observation_id":"fb917842-eb1b-4b0d-9024-15256782abc8","resolution":{"observed_at":"2026-08-06T21:41:51.980688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1508.07909","last_updated":"2016-06-10T14:45:08Z","snapshot_observed_at":"2026-07-06T04:28:16.222296Z","submitted_at":"2015-08-31T16:37:31Z","title":"Neural Machine Translation of Rare Words with Subword Units","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1508.07909","snapshot_observed_at":"2026-08-06T21:41:52.044917Z","title":"Neural machine translation of rare words with subword units.arXiv preprint arXiv:1508.07909, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:52.044917Z"},"links":{"cited_paper":"/paper/1508.07909","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:687927d82a0b304cc788efd2de109a399dd8304a9569e9765584d132065721d1","observation_id":"dbae2431-b06b-437d-ba45-76293f103156","resolution":{"observed_at":"2026-08-06T21:41:52.044917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:52.179859Z","title":"Language models are unsupervised multitask learners.OpenAI blog, 1(8):9, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:52.179859Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:0f72cd9b30c995220b39e20bc25e6d171dcb7cb715be7d43311188f1ddd4bd42","observation_id":"32554849-e934-45eb-9793-572d81adae65","resolution":{"observed_at":"2026-08-06T21:41:52.179859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08671","last_updated":"2024-11-13T15:04:02Z","snapshot_observed_at":"2026-07-06T19:49:48.427067Z","submitted_at":"2024-11-13T15:04:02Z","title":"Theoretical Analysis of Byte-Pair Encoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.08671","snapshot_observed_at":"2026-08-06T21:41:52.290519Z","title":"Theoretical analysis of byte-pair encoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:52.290519Z"},"links":{"cited_paper":"/paper/2411.08671","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:aa996a281b27dbd8d44cb37d04ecddb9400f7f9c0b0e23aa00a85f8de0fefc9f","observation_id":"3aa4c49d-5a16-4c3d-8688-d66f604f5dc2","resolution":{"observed_at":"2026-08-06T21:41:52.290519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:52.416594Z","title":"Attention is all you need.Advances in Neural Information Processing Systems, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:52.416594Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:13546cd7017d144e2c36bcb49c4cab80ee8b6911e59d57c7f9c9ea5716ab4518","observation_id":"904da95a-eb36-46a0-a7e4-908e7b5f86fb","resolution":{"observed_at":"2026-08-06T21:41:52.416594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:52.581194Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:52.581194Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:e73fdaa8a3b7b2f65cf43e4da223769c694234c4470ac73b5ed843037d31932e","observation_id":"378860cf-f482-455b-8674-b479503e0e1e","resolution":{"observed_at":"2026-08-06T21:41:52.581194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:42:00.281844Z","title":"Vitae: Vision transformer advanced by exploring intrinsic inductive bias","venue":null,"work_id":"d1225c54-a3ba-40bb-a569-9db5473b4761","year":2021},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:52.763886Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:8db4c02ab995b37e9d20e2686b3ee2e807044ba15d96bb0e6959f4596ae7c872","observation_id":"908e3bf0-d01f-4182-8f0c-6fe187982334","resolution":{"observed_at":"2026-08-06T21:42:00.454518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:42:00.049150Z","title":"Vitaev2: Vision transformer advanced by exploring inductive bias for image recognition and beyond.International Journal of Computer Vision, pages 1–22, 2023","venue":null,"work_id":"4c6c200a-59cf-4dc7-8da5-7cd247071f81","year":2023},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:52.846325Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:08c5953e75f2c6c5deb65f6fc2f9456b80917671c99877fcf4100df7e438e378","observation_id":"85e6494a-1958-449a-b4fe-15ba1a6f0e11","resolution":{"observed_at":"2026-08-06T21:42:00.101269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:52.938876Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:52.938876Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:e6ffc8cdf87070148adb53fdc0b874a3aded07432a3f43ec2e5c717da592aafc","observation_id":"3092ac9c-8f69-41a3-8edc-562323d971d7","resolution":{"observed_at":"2026-08-06T21:41:52.938876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05222","last_updated":"2024-05-08T02:46:43Z","snapshot_observed_at":"2026-08-06T07:46:37.713769Z","submitted_at":"2023-07-11T12:45:39Z","title":"Emu: Generative Pretraining in Multimodality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.05222","snapshot_observed_at":"2026-08-06T21:41:53.036347Z","title":"Emu: Generative pretraining in multimodality.arXiv preprint arXiv:2307.05222, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:53.036347Z"},"links":{"cited_paper":"/paper/2307.05222","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:caa6db226636ef2e321efb5333da240b1c69cc5dce58aa96b4e045eaa9e1cab4","observation_id":"3bb0f35c-9ca9-485e-ad51-fb9a0cc4e820","resolution":{"observed_at":"2026-08-06T21:41:53.036347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-06T21:41:53.151460Z","title":"Emu3: Next-token prediction is all you need.arXiv preprint arXiv:2409.18869, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:53.151460Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:cbaf877a8c1ea11db630e9f26dbbce8ae14848f23f815bdf3d959f73175a21f6","observation_id":"4041ed2b-084f-4f77-a239-b461f30b494a","resolution":{"observed_at":"2026-08-06T21:41:53.151460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:53.268525Z","title":"Deepseek-vl: Towards real-world vision-language understanding, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:53.268525Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:5c451893559cffbfec00ab949d37f30026f14949ec826db23405e85f9ae4b7ed","observation_id":"096c485d-06cc-4c21-bcd4-a00f13172303","resolution":{"observed_at":"2026-08-06T21:41:53.268525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-06T21:41:53.387232Z","title":"Deepseek-vl2: Mixture-of-experts vision-language models for advanced multimodal understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:53.387232Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:4bc4bf07e76065d6bdf654cd161065fec0180a0b427d927f24eba85e0c04915e","observation_id":"b3724ed4-3bc6-4ad2-871a-39f8e79c6dce","resolution":{"observed_at":"2026-08-06T21:41:53.387232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T21:41:53.485037Z","title":"Qwen-vl: A versatile vision-language model for understanding, localization, text reading, and beyond","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:53.485037Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:88e31687be35359e040395926f59131f5fcb90a981df8259ba96592f9d165369","observation_id":"f78c38b3-34c1-48ad-8341-62f1348a8be0","resolution":{"observed_at":"2026-08-06T21:41:53.485037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T21:41:53.577296Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:53.577296Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:cd0fa4fe613e8089afb1af70acc54f381f2f7477108b8c6bdccb61bc0a8f92be","observation_id":"727709ad-1e12-44a2-b593-e034d2d5b8ea","resolution":{"observed_at":"2026-08-06T21:41:53.577296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T21:41:53.671687Z","title":"Qwen2.5-vl technical report.arXiv preprint arXiv:2502.13923, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:53.671687Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:a2981f874bfeadeea1154774fa2237b204bebf658cd5236745ff32b848b75bbc","observation_id":"0a063002-233b-4342-ab32-2ea48966291b","resolution":{"observed_at":"2026-08-06T21:41:53.671687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16199","last_updated":"2024-09-18T23:54:36Z","snapshot_observed_at":"2026-08-06T06:36:02.994951Z","submitted_at":"2023-03-28T17:59:12Z","title":"LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16199","snapshot_observed_at":"2026-08-06T21:41:53.737982Z","title":"Llama-adapter: Efficient fine-tuning of language models with zero-init attention.arXiv preprint arXiv:2303.16199, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:53.737982Z"},"links":{"cited_paper":"/paper/2303.16199","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:88fb0fc948bb50b012bc6e2478880a73f85231f12519c8f4b4290cfa4c618724","observation_id":"d60b045a-5505-4938-a6af-2c0fb6f8b28a","resolution":{"observed_at":"2026-08-06T21:41:53.737982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.15010","last_updated":"2023-04-28T17:59:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-28T17:59:25Z","title":"LLaMA-Adapter V2: Parameter-Efficient Visual Instruction Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.15010","snapshot_observed_at":"2026-08-06T21:41:53.815994Z","title":"Llama-adapter v2: Parameter-efficient visual instruction model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:53.815994Z"},"links":{"cited_paper":"/paper/2304.15010","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:99d4fab14172451ac2058830c789551b11a4df84114dadbbefb79a5536c0a4bd","observation_id":"dfa9bd41-838a-417c-8080-dccc295891f5","resolution":{"observed_at":"2026-08-06T21:41:53.815994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.11694","last_updated":"2025-03-04T01:47:20Z","snapshot_observed_at":"2026-07-06T20:07:41.462631Z","submitted_at":"2024-12-16T12:12:45Z","title":"From Specific-MLLMs to Omni-MLLMs: A Survey on MLLMs Aligned with Multi-modalities","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.11694","snapshot_observed_at":"2026-08-06T21:41:53.953513Z","title":"From specific-mllm to omni-mllm: A survey about the mllms alligned with multi-modality.arXiv preprint arXiv:2412.11694, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:53.953513Z"},"links":{"cited_paper":"/paper/2412.11694","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:960584d5dd3944c9307000d896e2064ef2f3ac36f2af6d88aeab49096b295498","observation_id":"df313483-fe6a-4964-a8f7-6a58ae9e0d70","resolution":{"observed_at":"2026-08-06T21:41:53.953513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:59.877365Z","title":"A systematic literature review on multimodal machine learning: Applications, challenges, gaps and future directions.Ieee access, 11:14804–14831, 2023","venue":null,"work_id":"fbf8caaf-33b8-4065-888d-7310dfa92c68","year":2023},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:54.056540Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:e38a1ae3376dd98b32d2ccdc96bb56e280084074ebe381d0ee02e4182197a4b7","observation_id":"e8525320-212f-4275-b23c-269bad6a5898","resolution":{"observed_at":"2026-08-06T21:41:59.945916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:54.165235Z","title":"Vision language models are blind","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:54.165235Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:180a21b037d3697ca0b9888c4e6790671cd18868c3a5787166499e5f01a57863","observation_id":"f975a922-0aaa-4b32-b46c-2f3a787244e7","resolution":{"observed_at":"2026-08-06T21:41:54.165235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18930","last_updated":"2025-04-01T18:36:08Z","snapshot_observed_at":"2026-08-06T19:08:14.800394Z","submitted_at":"2024-04-29T17:59:41Z","title":"Hallucination of Multimodal Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18930","snapshot_observed_at":"2026-08-06T21:41:54.265985Z","title":"Hallucination of multimodal large language models: A survey.arXiv preprint arXiv:2404.18930, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:54.265985Z"},"links":{"cited_paper":"/paper/2404.18930","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:a3d05919552c87fe5b4fc1069f5202c9520845c7d9105b06a2f985d14380f907","observation_id":"dc7a07c4-4dc1-4b6b-971d-e4ca46e75119","resolution":{"observed_at":"2026-08-06T21:41:54.265985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14683","last_updated":"2024-06-16T18:43:50Z","snapshot_observed_at":"2026-07-06T17:34:03.539565Z","submitted_at":"2024-02-22T16:40:33Z","title":"Visual Hallucinations of Multi-modal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14683","snapshot_observed_at":"2026-08-06T21:41:54.374403Z","title":"Visual hallucinations of multi-modal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:54.374403Z"},"links":{"cited_paper":"/paper/2402.14683","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:38d802eedb33364606778f6a3f0fd44b0a30d55d328e42c81c3f38b844456352","observation_id":"490c5c7a-309b-4952-9dd1-f72c7038452c","resolution":{"observed_at":"2026-08-06T21:41:54.374403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06794","last_updated":"2023-09-13T08:33:09Z","snapshot_observed_at":"2026-07-06T16:17:50.837748Z","submitted_at":"2023-09-13T08:33:09Z","title":"Cognitive Mirage: A Review of Hallucinations in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06794","snapshot_observed_at":"2026-08-06T21:41:54.444370Z","title":"Cognitive mirage: A review of hallucinations in large language models.arXiv preprint arXiv:2309.06794, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:54.444370Z"},"links":{"cited_paper":"/paper/2309.06794","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:d59f18472bd67036ce05cbe1eaa3c19fdd616a732aced00a1543207aa3fcf276","observation_id":"ad0bdb8b-76c9-4534-8da4-0fe5fbeff5ad","resolution":{"observed_at":"2026-08-06T21:41:54.444370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:54.525356Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:54.525356Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:bbca82e534d81ccb2b9a91f2682560f1d0c68c819883006b7cbefea3333caa77","observation_id":"7d1c231f-6acf-4df2-a2fd-6eec4c216bde","resolution":{"observed_at":"2026-08-06T21:41:54.525356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:54.592659Z","title":"Neural discrete representation learning.Advancesin neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:54.592659Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:65413f977c1bebedb6ebbc3a7c717edeeab71f0e4b5f3384b8c2ec57935cc590","observation_id":"8cd077cc-ae94-4316-a74c-32b7d553a2a1","resolution":{"observed_at":"2026-08-06T21:41:54.592659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:54.650809Z","title":"Generating diverse high-fidelity images with vq-vae-2","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:54.650809Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:c1d0a1685e3a88cd6b892cb20e11b15fcba55e5d008f27713756bd2f4ecfd97d","observation_id":"5edc9fc9-745c-495d-a8e4-b31378f804c5","resolution":{"observed_at":"2026-08-06T21:41:54.650809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:59.702086Z","title":"Investigating the effectiveness of bpe: The power of shorter sequences","venue":null,"work_id":"66d36906-5000-4b9a-843f-cba1d7feb97c","year":2019},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:54.723510Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:ce80485bee1a6aa0214467ebfc03e79901906232b5f31195ba5c2633c584cf5e","observation_id":"289f6d8b-521d-482b-9a11-6bfb53eb8c6f","resolution":{"observed_at":"2026-08-06T21:41:59.797657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04161","last_updated":"2025-07-21T14:23:40Z","snapshot_observed_at":"2026-08-07T02:03:46.144376Z","submitted_at":"2024-02-06T17:18:59Z","title":"Attention with Markov: A Framework for Principled Analysis of Transformers via Markov Chains","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04161","snapshot_observed_at":"2026-08-06T21:41:54.806449Z","title":"Attention with markov: A framework for principled analysis of transformers via markov chains.arXiv preprint arXiv:2402.04161, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:54.806449Z"},"links":{"cited_paper":"/paper/2402.04161","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:f19f9306be83c09ce44a8745433d7bec35e773ae3e63c8928f6dc8ed2126dbc3","observation_id":"9136c071-c921-468c-b820-01f716a8a1f9","resolution":{"observed_at":"2026-08-06T21:41:54.806449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11757","last_updated":"2024-04-17T21:27:33Z","snapshot_observed_at":"2026-08-05T22:08:42.476061Z","submitted_at":"2024-04-17T21:27:33Z","title":"Language Models Still Struggle to Zero-shot Reason about Time Series","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.11757","snapshot_observed_at":"2026-08-06T21:41:54.902737Z","title":"Language models still struggle to zero-shot reason about time series.arXiv preprint arXiv:2404.11757, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:54.902737Z"},"links":{"cited_paper":"/paper/2404.11757","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:a9193d57fcb576ba91ea7f4d1adb3301751b5eca07ca7fe202745375b4094698","observation_id":"4a4cc56b-1ec5-4cc6-8a9d-a9b0568455fa","resolution":{"observed_at":"2026-08-06T21:41:54.902737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08335","last_updated":"2025-04-10T06:00:58Z","snapshot_observed_at":"2026-07-06T17:59:17.149142Z","submitted_at":"2024-04-12T09:01:14Z","title":"Toward a Theory of Tokenization in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.08335","snapshot_observed_at":"2026-08-06T21:41:54.967902Z","title":"Toward a theory of tokenization in llms.arXiv preprint arXiv:2404.08335, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:54.967902Z"},"links":{"cited_paper":"/paper/2404.08335","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:3b966de0174214075c405c972382b28b6e5830208367313d57fd21d96dfc99fa","observation_id":"7d9971e9-a33c-4ab5-a4fc-725df0b3063d","resolution":{"observed_at":"2026-08-06T21:41:54.967902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:59.518291Z","title":"Pixel-level bpe for auto-regressive image generation","venue":null,"work_id":"06b427f7-d29d-4f70-94e9-36f69905ee35","year":2022},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:55.035413Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:27ee22fd1c93b4790e4df3c4c88cecd3da9ca88c520ea3d074f74c12e7c49efd","observation_id":"99163494-5a32-4d4a-af9d-d3e0e4e63147","resolution":{"observed_at":"2026-08-06T21:41:59.606670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.05001","last_updated":"2024-11-07T18:59:28Z","snapshot_observed_at":"2026-08-01T08:55:09.990991Z","submitted_at":"2024-11-07T18:59:28Z","title":"Analyzing The Language of Visual Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.05001","snapshot_observed_at":"2026-08-06T21:41:55.095533Z","title":"Analyzing the language of visual tokens.arXiv preprint arXiv:2411.05001, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:55.095533Z"},"links":{"cited_paper":"/paper/2411.05001","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:dc6d06cb3d3634f8fa5ef0a8c9b2405c5aab29d648dc0d78f78bafad853157bb","observation_id":"65e2c676-d829-4538-a94d-e73944121cd5","resolution":{"observed_at":"2026-08-06T21:41:55.095533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11753","last_updated":"2025-06-01T16:10:59Z","snapshot_observed_at":"2026-07-06T18:32:19.794373Z","submitted_at":"2024-06-17T17:13:08Z","title":"A Semantic-Aware Layer-Freezing Approach to Computation-Efficient Fine-Tuning of Language Models","version":3},"cited_work":{"arxiv_id":"2406.11753","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.11753","snapshot_observed_at":"2026-08-06T21:41:57.697827Z","title":"A Semantic-Aware Layer-Freezing Approach to Computation-Efficient Fine-Tuning of Language Models","venue":"cs.CL","work_id":"91f02b9d-cf90-4fc9-aa7f-3df496df6823","year":2024},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:55.164896Z"},"links":{"cited_paper":"/paper/2406.11753","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:30c157566a4607aede249af424fd45d2f231475662804346090e281e92625b37","observation_id":"e3fe4b26-24f5-4bad-a652-228daf10189d","resolution":{"observed_at":"2026-08-06T21:41:57.746183Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15600","last_updated":"2024-11-26T07:49:12Z","snapshot_observed_at":"2026-07-06T19:06:58.753073Z","submitted_at":"2024-08-28T07:48:39Z","title":"Exploring Selective Layer Fine-Tuning in Federated Learning","version":3},"cited_work":{"arxiv_id":"2408.15600","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.15600","snapshot_observed_at":"2026-08-06T21:41:57.560071Z","title":"Exploring Selective Layer Fine-Tuning in Federated Learning","venue":"cs.LG","work_id":"7473d323-bb60-461a-af9e-42a67ac96e44","year":2024},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:55.268049Z"},"links":{"cited_paper":"/paper/2408.15600","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:889a8c667e6a6c1aa58663186f3ad0bed3dd9ffc0613aface58eb14da37530d8","observation_id":"077de308-52d3-442a-bc02-bbce26764b6a","resolution":{"observed_at":"2026-08-06T21:41:57.626943Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:59.401379Z","title":"Delving deep into rectifiers: Surpassing human-level performance on imagenet classification","venue":null,"work_id":"a7981e36-b01f-41d5-9caa-7ef36114181c","year":2015},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:55.325277Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:05a608169ca308af186195020e54acba560a4315c3a980507a8f6959e5ff222f","observation_id":"981bc695-6f18-4fbd-8167-9004f152bb67","resolution":{"observed_at":"2026-08-06T21:41:59.442424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18142","last_updated":"2024-09-21T15:22:26Z","snapshot_observed_at":"2026-08-04T13:51:52.964653Z","submitted_at":"2024-09-21T15:22:26Z","title":"A Survey on Multimodal Benchmarks: In the Era of Large AI Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18142","snapshot_observed_at":"2026-08-06T21:41:55.375826Z","title":"A survey on multimodal benchmarks: In the era of large ai models.arXiv preprint arXiv:2409.18142, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:55.375826Z"},"links":{"cited_paper":"/paper/2409.18142","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:90a94045c508a0a57ef61c2e2d96c1c07cb7bc5b8c2de9fefd5add2939771296","observation_id":"12192f30-2fac-4490-97fa-162e39571921","resolution":{"observed_at":"2026-08-06T21:41:55.375826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08632","last_updated":"2024-09-06T11:20:13Z","snapshot_observed_at":"2026-07-06T19:01:27.827878Z","submitted_at":"2024-08-16T09:52:02Z","title":"A Survey on Benchmarks of Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08632","snapshot_observed_at":"2026-08-06T21:41:55.436309Z","title":"A survey on benchmarks of multimodal large language models.arXiv preprint arXiv:2408.08632, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:55.436309Z"},"links":{"cited_paper":"/paper/2408.08632","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:5185ed5f6f05900f44e1d78b82fce3397e64fd139e61a3c67c9bb25f7939fdc7","observation_id":"2bd0f30d-8816-4898-adaf-fc8413a2e385","resolution":{"observed_at":"2026-08-06T21:41:55.436309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:55.516529Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:55.516529Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:b10cbbeb24d1dd0790bc8ac92935b4b85921d49e8d3a042866aefb5e534bbfa5","observation_id":"7d3a3677-1ddb-407e-abe5-0762e4c7c939","resolution":{"observed_at":"2026-08-06T21:41:55.516529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:55.606187Z","title":"Vizwiz grand challenge: Answering visual questions from blind people","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:55.606187Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:d53da21f21a1c636ed57e84c6660e9d5544c2d261fc2504b9711ae7d27d4007a","observation_id":"5bf461eb-40f4-4ff1-b045-c705725af440","resolution":{"observed_at":"2026-08-06T21:41:55.606187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-06T21:41:55.671714Z","title":"Mmbench: Is your multi-modal model an all-around player?arXiv preprint arXiv:2307.06281, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:55.671714Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:6b9680bc6507dcb69846e8e52a3ab952c7079a193e5592064c974f5343336b3a","observation_id":"72cb88e8-64a8-4d22-bd2e-47e4db4b67fc","resolution":{"observed_at":"2026-08-06T21:41:55.671714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-06T21:41:55.809922Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:55.809922Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:af9473b2798350a1f94b296aa95d2881b8b44eaed0aba7d552e5032fe39f5500","observation_id":"81ba791c-6e18-4c35-8f3f-9e6042cd0f98","resolution":{"observed_at":"2026-08-06T21:41:55.809922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:55.904538Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:55.904538Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:1c7fc5e147732ac04296090ee359fc7a205b5447aa5ca3d73ce325cb4eda30ae","observation_id":"5a3742cd-c88d-4525-8100-e84213ff1ae3","resolution":{"observed_at":"2026-08-06T21:41:55.904538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:59.250332Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":"f8dbfd41-08be-4aaa-a042-cac5bf775df2","year":2023},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:56.006889Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:c71722a570adf7b625f5aad9898cd8ca3ab63f68e282fe634070d2a47e625921","observation_id":"d6c8899b-482b-4dc1-8a79-b03640c421f4","resolution":{"observed_at":"2026-08-06T21:41:59.319725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:59.145493Z","title":"Instructblip: towards general-purpose vision-language models with instruction tuning","venue":null,"work_id":"99d9865f-b0b9-4962-863a-5917cedc2a86","year":2023},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:56.146472Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:09894294b4671abc8b6f3316f6573792854a2d7d129c03cd904059ac29307305","observation_id":"38ca8925-6387-4d10-93fb-9a00c8f191f3","resolution":{"observed_at":"2026-08-06T21:41:59.178757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:56.195219Z","title":"Visual instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:56.195219Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:fd3f3d1e7584702a1aaddac12e3205733ee3b5294458061471de1fcf212a4c6c","observation_id":"14b2c4c5-2293-4d61-b0c4-41a22caf16cb","resolution":{"observed_at":"2026-08-06T21:41:56.195219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:59.020222Z","title":"mplug-owl: Modularization empowers large language models with multimodality, 2023","venue":null,"work_id":"2fa184e2-e28e-46a0-be8f-5a05f7bce975","year":2023},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:56.339136Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:421b091f6782a92deb3a9de3db89b3d46bcc48855e81379c27ee6b8a8382c032","observation_id":"b59c49a0-dc63-46cf-967d-66606af31a34","resolution":{"observed_at":"2026-08-06T21:41:59.070947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:56.453016Z","title":"mplug-owl2: Revolutionizing multi-modal large language model with modality collaboration, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:56.453016Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:664edaa23e731ec3f973a606de0f552cc1cd3109404f4df0892340d2c0c3ddba","observation_id":"7497e7c1-2a3d-44d7-a0cf-e234318c7f90","resolution":{"observed_at":"2026-08-06T21:41:56.453016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:58.851408Z","title":"Hyperllava: Dynamic visual and language expert tuning for multimodal large language models, 2024","venue":null,"work_id":"5437d34d-8c71-4a19-9a03-92a10a8e6fcb","year":2024},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:56.541168Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:ebcc45f09371e1e6da6108b2027d738b2e2e3d5206f3882be09d77ed8bf2c198","observation_id":"c35a48af-9d8b-4ec5-8b89-de100a1fd173","resolution":{"observed_at":"2026-08-06T21:41:58.920856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-04T08:17:54.774738Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-06T21:41:56.615410Z","title":"Sharegpt4v: Improving large multi-modal models with better captions.arXiv preprint arXiv:2311.12793, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:56.615410Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:7393b6380aad84eb86a1a40b741cb6cddd23d032a6de7ebed9052f98cb15585f","observation_id":"0bdf722b-94a7-4898-a7a9-10dd7bf76d1d","resolution":{"observed_at":"2026-08-06T21:41:56.615410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:56.711512Z","title":"Vila: On pre-training for visual language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:56.711512Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:20c778088d5313af4875ede1ee9eb638637b11a27c726e038b8032a7ff876e77","observation_id":"0d5f0ccf-bdad-4abd-aa59-8982c2369309","resolution":{"observed_at":"2026-08-06T21:41:56.711512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T21:41:56.795379Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:56.795379Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:60d12ffd8fc699d68d89cef972a7ccf58851af5e21ace729eda4945864f8a566","observation_id":"b6543114-bace-461b-889d-350cb30c3cfe","resolution":{"observed_at":"2026-08-06T21:41:56.795379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:58.716411Z","title":"Conceptual captions: A cleaned, hypernymed, image alt-text dataset for automatic image captioning","venue":null,"work_id":"bab960bd-38ad-4f46-9b30-5d31e74500ed","year":2018},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:56.942368Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:31fe26c3bad6d73765b94ba263ddf48e25c6460f7690673cef569f3d91f73503","observation_id":"b98bea3a-bbb0-48c6-81be-9b3e47a38762","resolution":{"observed_at":"2026-08-06T21:41:58.779225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:58.559210Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models.Advancesin Neural Information Processing Systems, 35:25278–25294, 2022","venue":null,"work_id":"71b1cf8f-1dde-40e8-9500-30015bfa933d","year":2022},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:57.024279Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:962d7e09f5e63082a9f69aa8096fe52fe6b9da163348678fd5e6e5e0c8e59811","observation_id":"e4ee348a-c6c8-4e94-bbd9-24ef3c999c51","resolution":{"observed_at":"2026-08-06T21:41:58.633479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:57.082546Z","title":"Referitgame: Referring to objects in photographs of natural scenes","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:57.082546Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:5f4e1978e177b793bd0b19be47c7831dceb4318c84928b29a90efed26af9d92a","observation_id":"eb35cce0-617a-4291-8d8a-ba3cbe3e9ca5","resolution":{"observed_at":"2026-08-06T21:41:57.082546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:57.138710Z","title":"A-okvqa: A benchmark for visual question answering using world knowledge","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:57.138710Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:c58c6a550e7eb67f3fa5c7b45a33dbcc5d7745e5e72a3533278678934103f857","observation_id":"f070fbc9-7d31-495a-b523-63b483c7784c","resolution":{"observed_at":"2026-08-06T21:41:57.138710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-06T21:41:57.184367Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:57.184367Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:3cbed2ce61be3329c4c3d585c3246f11163f8367832db0c9894324cf465c4e04","observation_id":"01018029-1a25-490c-90db-70a372e72504","resolution":{"observed_at":"2026-08-06T21:41:57.184367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:57.241233Z","title":"Allava: Harnessing gpt4v-synthesized data for a lite vision-language model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:57.241233Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:65cf5c07962f7d1272a3a5cf018baad8b0dc2e90a0576932687783ef42ad6ca6","observation_id":"4af90841-7a56-4b60-89ce-66678354582c","resolution":{"observed_at":"2026-08-06T21:41:57.241233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18558","last_updated":"2025-01-06T12:48:47Z","snapshot_observed_at":"2026-07-06T19:38:57.409491Z","submitted_at":"2024-10-24T09:03:48Z","title":"Infinity-MM: Scaling Multimodal Performance with Large-Scale and High-Quality Instruction Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18558","snapshot_observed_at":"2026-08-06T21:41:57.327402Z","title":"Infinity-mm: Scaling multimodal performance with large-scale and high-quality instruction data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:57.327402Z"},"links":{"cited_paper":"/paper/2410.18558","citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:b2690b082af39645b63e1ef791322a3c80d17c3de5592ab399ec3bef1e1171e9","observation_id":"4cb5fe32-b9e9-42ac-9d5d-df4e41a384bb","resolution":{"observed_at":"2026-08-06T21:41:57.327402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:58.394333Z","title":"• Reasoning Data (RD): We utilize 504K general QA entries and 343K reasoning-focused entries from the LLaVA-OneVision Dataset [71]","venue":null,"work_id":"f555a97d-9990-441d-8ec6-aede6149da7f","year":null},"citing_paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:57.394029Z"},"links":{"citing_paper":"/paper/2506.23639"},"observation_digest":"sha256:11b2f4a64866db817d972b2ef95d6dc21ffcd480ffb36a1f6b6143ebc76edd47","observation_id":"a65df49f-9baf-4d94-89dc-31f0ad9adbc7","resolution":{"observed_at":"2026-08-06T21:41:58.451432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.23639","last_updated":"2025-06-30T09:08:08Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T21:33:31.518732Z","submitted_at":"2025-06-30T09:08:08Z","title":"Unified Multimodal Understanding via Byte-Pair Visual Encoding"},"reference_resolution":{"displayed":74,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":57,"verified_exact":3,"verified_fuzzy":14},"total_outbound_references":74},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 74 of 74 outbound references and 4 inbound Pith citation observations for arXiv:2506.23639."}