{"as_of":"2026-08-12T04:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e3163c45ce762cb636189be76282559d3a04add28f03dea6c5a2db026c6c2f72","coverage":[{"denominator":281,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T07:01:07.362430Z","state":"measured"},{"denominator":102,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":102,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T17:08:56.912092Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T11:55:28.362396Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"cited_work":{"arxiv_id":"2606.13289","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.13289","snapshot_observed_at":"2026-08-06T11:55:28.362396Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","venue":"cs.CV","work_id":"e8332216-69d7-4117-a163-06a0c7ab8b4a","year":2026},"citing_paper":{"arxiv_id":"2608.05000","last_updated":"2026-08-06T17:18:02Z","snapshot_observed_at":"2026-08-09T23:12:27.682802Z","submitted_at":"2026-08-05T16:09:25Z","title":"Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes","version":1},"reference_index":154,"source":"pdf_text","source_observed_at":"2026-08-06T11:55:28.210340Z"},"links":{"cited_paper":"/paper/2606.13289","citing_paper":"/paper/2608.05000"},"observation_digest":"sha256:1f9eb05caa3ef0141cc4e5f274eb33821ea3249d8bd23061bc47057bb8c28ca5","observation_id":"4a166ade-3560-4c34-9537-15b3524dff4e","resolution":{"observed_at":"2026-08-06T11:55:28.368251Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.13289","snapshot_observed_at":"2026-08-08T17:08:56.912092Z","title":"Hydra-x: Native unified multimodal models with holistic visual tokenizers.arXiv preprint arXiv:2606.13289, 2026a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05000","last_updated":"2026-08-06T17:18:02Z","snapshot_observed_at":"2026-08-09T23:12:27.682802Z","submitted_at":"2026-08-05T16:09:25Z","title":"Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes","version":2},"reference_index":154,"source":"pdf_text","source_observed_at":"2026-08-08T17:08:56.912092Z"},"links":{"cited_paper":"/paper/2606.13289","citing_paper":"/paper/2608.05000"},"observation_digest":"sha256:cbc871ebb3802031233300435c36ea9661b2f64b1f542e8eb9b175b9b2aa72d0","observation_id":"a2edc933-347d-4858-8181-67aadbfbbd76","resolution":{"observed_at":"2026-08-08T17:08:56.912092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.13289/citation-record","integrity":"/paper/2606.13289/integrity","json":"/paper/2606.13289/citation-record.json","paper":"/paper/2606.13289"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-08-11T01:34:46.484513Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":"2408.11039","doi":"10.48550/arxiv.2408.11039","metadata_source":"pith","pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","venue":"cs.AI","work_id":"c2bb4d2d-29de-4bf2-9150-3d6373ff358f","year":2024},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:56c9c745fb580ab32e65b28351e151371a6f05d004a7c51e7ebbb278bda2e39a","observation_id":"38bdd4f4-4ae6-4cbc-8a8e-6a8b1096aaa4","resolution":{"observed_at":"2026-07-03T14:28:32.195656Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:01:07.362430Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:a7cd9b75d1267b292d15b57703e85b24ed3bc9b0a0ee7f825a14890fd7ad183a","observation_id":"a99eaeac-f037-4288-b968-bc0c8fbd28f7","resolution":{"observed_at":"2026-06-27T07:01:07.362430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:01:07.362430Z","title":"2023 , url=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:c3f87b113ee4cf25efb5d79ffb09a4b2c0e2867e4c36713146d6a38988dec483","observation_id":"02e5cf2a-28bb-488d-ad08-6f83a9478409","resolution":{"observed_at":"2026-06-27T07:01:07.362430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:01:07.362430Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , month =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:0036206f7612fea9aca3a2bd2aca8fe039f5a4b7df0bd3e487e8d6662b64b431","observation_id":"cdf36153-0d10-429d-b56b-7db745fd1a9e","resolution":{"observed_at":"2026-06-27T07:01:07.362430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:01:07.362430Z","title":"OpenAI technical report , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:334427fc737c04e97a9c7330ba705f6247aec4a7d242010b24dad06f5c336dbf","observation_id":"b1914e40-d6c6-407d-9df5-c0e2b7c05c9a","resolution":{"observed_at":"2026-06-27T07:01:07.362430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":"2010.11929","doi":"10.1175/jcli-d-22-0357.1","metadata_source":"pith","pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","venue":"cs.CV","work_id":"e96730e3-129b-4db6-b981-15ab7932e297","year":2020},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:3e109635777496dc95653ce5cf23360596b50f54d9aa1a47251c393dbe867633","observation_id":"08509cb8-d874-47df-9501-1200f6c3ecf7","resolution":{"observed_at":"2026-07-03T14:28:32.084172Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17425","last_updated":"2023-11-06T02:47:51Z","snapshot_observed_at":"2026-07-06T16:25:38.571377Z","submitted_at":"2023-09-29T17:37:29Z","title":"Data Filtering Networks","version":3},"cited_work":{"arxiv_id":"2309.17425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.17425","snapshot_observed_at":"2026-07-04T20:50:12.674098Z","title":"arXiv preprint arXiv:2309.17425 (2023)","venue":null,"work_id":"9922937e-9c54-4233-8816-d729dfaf746e","year":2023},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"cited_paper":"/paper/2309.17425","citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:c315d27a29136761cdf0b8f905d5176842cd5529386f612718ff5804e481390e","observation_id":"7d0ad57d-079d-4584-8e35-429289c7a6d9","resolution":{"observed_at":"2026-07-03T14:28:32.070663Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:01:07.362430Z","title":"Proceedings of the IEEE/CVF international conference on computer vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:420cc079b9209aa46c1385da740bee20b7e303e48ab0994d25ddb352a09201dd","observation_id":"53ff37cc-e9a1-4912-9182-ffa657609327","resolution":{"observed_at":"2026-06-27T07:01:07.362430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.08254","last_updated":"2022-09-03T14:11:33Z","snapshot_observed_at":"2026-07-06T11:19:34.705520Z","submitted_at":"2021-06-15T16:02:37Z","title":"BEiT: BERT Pre-Training of Image Transformers","version":2},"cited_work":{"arxiv_id":"2106.08254","doi":"10.48550/arxiv.2106.08254","metadata_source":"pith","pith_arxiv_id":"2106.08254","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BEiT: BERT Pre-Training of Image Transformers","venue":"cs.CV","work_id":"d74eda3c-bf7e-45f1-a8f1-a0137ecca3f4","year":2021},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"cited_paper":"/paper/2106.08254","citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:121a9958a1d6406a0a46dd2b167fe195c02dc14254708f58e9f31a9dfd36cec7","observation_id":"dc11bbb2-f9a0-4fad-b741-701085296d1e","resolution":{"observed_at":"2026-07-03T14:28:32.065519Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:01:07.362430Z","title":"Proceedings of the IEEE/CVF international conference on computer vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:a569f6893ae3226116d2c821a7904deac59ccca9e9dc08594508caa690aefdbc","observation_id":"ff37c413-f814-4513-942d-bfb1945f2d36","resolution":{"observed_at":"2026-06-27T07:01:07.362430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.10326","last_updated":"2021-09-23T10:23:51Z","snapshot_observed_at":"2026-08-10T09:47:54.084846Z","submitted_at":"2019-07-24T09:31:24Z","title":"From Big to Small: Multi-Scale Local Planar Guidance for Monocular Depth Estimation","version":6},"cited_work":{"arxiv_id":"1907.10326","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1907.10326","snapshot_observed_at":"2026-07-03T14:28:32.054457Z","title":"From big to small: Multi-scale local planar guidance for monocular depth estimation","venue":null,"work_id":"a87063a0-b722-4757-9cc8-0fd30352539a","year":1907},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"cited_paper":"/paper/1907.10326","citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:fc03e3a77be6442b5edba4aa506187633e841abf9a4dd77b7b52331f28dc7066","observation_id":"78317259-bb70-4afc-9c69-fdc911f8532c","resolution":{"observed_at":"2026-07-03T14:28:32.055745Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:01:07.362430Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:97c5ce15751280f53dc730c31933edeed4d765d7908c189b1d4525586825f834","observation_id":"0d7bb7a9-fab0-4672-9fac-46779c9773a6","resolution":{"observed_at":"2026-06-27T07:01:07.362430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11429","last_updated":"2021-11-22T18:59:15Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:15Z","title":"Benchmarking Detection Transfer Learning with Vision Transformers","version":1},"cited_work":{"arxiv_id":"2111.11429","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.11429","snapshot_observed_at":"2026-07-03T14:28:32.127255Z","title":"Bench- marking detection transfer learning with vision transformers","venue":null,"work_id":"fb035979-c073-4172-b236-f1fd9bac3d6f","year":2021},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"cited_paper":"/paper/2111.11429","citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:d5551e205330b280812d3cef3771abb6c58a07c1eb861a32e259b1e50acf710f","observation_id":"edc35e0a-9445-4d58-bf6f-9bc4420c5c4b","resolution":{"observed_at":"2026-07-03T14:28:32.128646Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:01:07.362430Z","title":"Proceedings of the IEEE international conference on computer vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:6dc32f68d5b95f26b1368896dffb931ab7213a1fdac19cf7d32a13b809ec2ffb","observation_id":"2eebba51-a766-4f17-a24b-dc3f1061cae3","resolution":{"observed_at":"2026-06-27T07:01:07.362430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:01:07.362430Z","title":"ArXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:17cb57a6338ac8c94dcbaf63a3569989f5c82d954a5744f65c910e719a79a76e","observation_id":"381f1b43-cee1-4214-9fbd-71cc8c8626bd","resolution":{"observed_at":"2026-06-27T07:01:07.362430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:01:07.362430Z","title":"ArXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:04cac024317b6192570fb9db4f0fbd4b34940af764943a8fcf88d34c51bf02d1","observation_id":"e653307c-698c-489a-973d-bb1ded75a413","resolution":{"observed_at":"2026-06-27T07:01:07.362430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:01:07.362430Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:656aa86ae792d5697fbc562afc4fe0b8b5cc91ebbc67c5b898781fcba099225b","observation_id":"b1efcd99-a458-4e1a-9a66-5ad02414ec2d","resolution":{"observed_at":"2026-06-27T07:01:07.362430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.10483","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T14:28:32.237292Z","title":"Repa-e: Unlocking vae for end-to-end tuning with latent diffusion transformers","venue":null,"work_id":"4ad471a0-3426-4e98-818c-cb238de280a9","year":2025},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:03ef2ffd6f0ebb729fffc4cc0891448ad420d3d3edf48136e4cfa1b13b3479e2","observation_id":"41549d01-da07-44bf-8fbf-32f8c137c637","resolution":{"observed_at":"2026-07-03T14:28:32.238647Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.05823","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T14:28:29.595703Z","title":"Boosting latent diffusion models via disentangled representation alignment","venue":null,"work_id":"7e501d6f-4206-4852-83d5-6cd2078711cd","year":2026},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:0bcebd378d4d20d5d59f98e9bd57163e5f23a6cd25f71aa7aed0e06575ccddd2","observation_id":"03c4caf3-515c-4b02-b175-1eaa7394f102","resolution":{"observed_at":"2026-07-03T14:28:29.597324Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.13687","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T20:50:11.419311Z","title":"Towards scalable pre-training of visual tokenizers for generation","venue":null,"work_id":"be569ef3-3608-4632-82b4-d96a691a0f6e","year":2025},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:f9caa9652d0a2f00afad72b64bdd79be2367618e93ace8f1d0733ac34b630e74","observation_id":"9d3abfb3-0d72-45f6-a516-78a74ab5dfc3","resolution":{"observed_at":"2026-07-03T14:38:28.907664Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":"2503.20314","doi":"10.1109/19.492748","metadata_source":"pith","pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":"cs.CV","work_id":"ad3ebc3b-4224-46c9-b61d-bcf135da0a7c","year":2025},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:30de7edb3930382a6d5875cfe6ff21406b48c7d3ecfe43c0797f715ecd174ae2","observation_id":"3636ed34-81fc-46cd-be6e-e88d4a862b57","resolution":{"observed_at":"2026-07-03T14:38:28.873847Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.11690","last_updated":"2025-10-13T17:51:39Z","snapshot_observed_at":"2026-07-06T22:32:32.632779Z","submitted_at":"2025-10-13T17:51:39Z","title":"Diffusion Transformers with Representation Autoencoders","version":1},"cited_work":{"arxiv_id":"2510.11690","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.11690","snapshot_observed_at":"2026-07-10T18:47:31.703880Z","title":"Diffusion Transformers with Representation Autoencoders","venue":"cs.CV","work_id":"c1a2d4de-4439-4005-8c56-e0124e4ed5fa","year":2025},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"cited_paper":"/paper/2510.11690","citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:8bffca43904740240d11c6ad8659d25e31cf8eb5cd723bff756d66ba2b02ead1","observation_id":"f7d6ba4f-720c-45ab-9dfc-d85a1f4922e2","resolution":{"observed_at":"2026-07-03T14:28:29.602800Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.19693","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T14:28:29.615040Z","title":"The prism hypothesis: Harmonizing semantic and pixel representations via unified autoencoding","venue":null,"work_id":"d77a406c-aae9-4870-aaeb-521e5ee9fa82","year":2025},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:20f0408accd250d80671abe10579728f9dc0c61ff43cd4a198428b3c67bdc00c","observation_id":"582b5745-87fd-47e3-9de4-c8010932e8a3","resolution":{"observed_at":"2026-07-03T14:28:29.616556Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:01:07.362430Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:e557c0097140d9c37f6ffe85ecd4b48e87b585d156a32dc0f53bea7e9af4d880","observation_id":"38ef4a00-688e-44c8-8d41-719bbf950efe","resolution":{"observed_at":"2026-06-27T07:01:07.362430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":"2307.01952","doi":"10.48500/arxiv.2307.01952","metadata_source":"pith","pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","venue":"cs.CV","work_id":"8034c587-fba6-4941-87ba-c98f2ac962cb","year":2023},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:25f9ff3eb628f365480856bf6d0de34acb1e267665544ad880fc1d15b8ef5a36","observation_id":"8dab6d55-943d-4737-8d4b-44524abb0d83","resolution":{"observed_at":"2026-07-03T14:28:29.647041Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:01:07.362430Z","title":"Proceedings of the IEEE/CVF international conference on computer vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:fb6b66a48ab087ed4f2652f7a914bac367c746bf378c545218c126d027ed7b07","observation_id":"e115c19a-7ec6-487c-a166-d64469dd806d","resolution":{"observed_at":"2026-06-27T07:01:07.362430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:01:07.362430Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:ffec5b3d9ccbc80ade43ad5ca7906153708b88da0dd3fb1b13668775498ced10","observation_id":"4abdca51-3c1d-4f56-bf19-faf3386e173c","resolution":{"observed_at":"2026-06-27T07:01:07.362430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:01:07.362430Z","title":"ArXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:2290727c8fc0b277a08bad5da8343f5b9d2aed61045e971e47d18d42adcb201c","observation_id":"2338cc16-d921-461a-a725-387847b30ac5","resolution":{"observed_at":"2026-06-27T07:01:07.362430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23951","last_updated":"2026-06-26T07:53:46Z","snapshot_observed_at":"2026-08-04T14:42:12.962842Z","submitted_at":"2025-09-28T16:14:10Z","title":"HunyuanImage 3.0 Technical Report","version":3},"cited_work":{"arxiv_id":"2509.23951","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.23951","snapshot_observed_at":"2026-07-04T16:59:57.981208Z","title":"HunyuanImage 3.0 Technical Report","venue":"cs.CV","work_id":"36511e33-8360-43dd-9407-dddf867c1d7c","year":2025},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"cited_paper":"/paper/2509.23951","citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:578be074d3d1857bf9d7da356904907e5f7e4d9d858a2193804c7435601aa6da","observation_id":"be118554-1f50-4082-89ae-df5a631b0461","resolution":{"observed_at":"2026-07-03T14:28:29.579017Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.15301","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:33:54.398527Z","title":"Latent diffusion model without variational autoencoder","venue":null,"work_id":"ab5fd0eb-3300-410d-a690-19e04b2a7770","year":2025},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:cd7e654f90b3fb403e6d26bf885eff97926d25e3f445a66453ecfc7febe43915","observation_id":"b7f1b6ff-2dcc-4560-aacb-430297665062","resolution":{"observed_at":"2026-07-03T14:28:29.587652Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04627","last_updated":"2022-06-05T01:57:58Z","snapshot_observed_at":"2026-07-06T11:56:10.689708Z","submitted_at":"2021-10-09T18:36:00Z","title":"Vector-quantized Image Modeling with Improved VQGAN","version":3},"cited_work":{"arxiv_id":"2110.04627","doi":null,"metadata_source":"pith","pith_arxiv_id":"2110.04627","snapshot_observed_at":"2026-07-04T09:49:44.490632Z","title":"Vector-quantized Image Modeling with Improved VQGAN","venue":"cs.CV","work_id":"8ba56539-4766-42a4-868c-f9bef1281034","year":2021},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"cited_paper":"/paper/2110.04627","citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:844fee085ad3830f31299907a2e27c2a6cdd78772f9f666eb1f3afa42df4301e","observation_id":"d0b9e9da-8cd3-41c8-bef1-7dc9fa1b14e2","resolution":{"observed_at":"2026-07-03T14:28:29.663135Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-10T02:35:35.003821Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"cited_work":{"arxiv_id":"2501.18593","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18593","snapshot_observed_at":"2026-07-03T14:28:29.656526Z","title":"arXiv preprint arXiv:2501.18593 , year=","venue":null,"work_id":"020ac850-eb3b-4d01-81b1-dbdbf4036d8f","year":null},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"cited_paper":"/paper/2501.18593","citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:478dfcfd2b18332f2b1cd5174d27a4547f1e5ebb7a094465e4bbc32239f50cf0","observation_id":"c5f8e4c3-3d5f-4a0d-a217-7affa712167b","resolution":{"observed_at":"2026-07-03T14:28:29.657972Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:01:07.362430Z","title":"generation: Taming optimization dilemma in latent diffusion models , author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:043dde488cf7e4ff903f702b37e5256a52cc93969b7225a4cd7b6c0d205e5ad7","observation_id":"73b856cd-2489-4a98-a6b8-e50d9e6ec436","resolution":{"observed_at":"2026-06-27T07:01:07.362430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:01:07.362430Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:431f65510ccd894d25f5994e960720bfc237d8fe4c66f627f5b84b3c61e7b22b","observation_id":"294fda3b-4030-4564-84ef-2f2d40ecfee9","resolution":{"observed_at":"2026-06-27T07:01:07.362430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:01:07.362430Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:9e444aa997ddea7a46ac82bb87db93581e19c073097286951531601b9b135264","observation_id":"fb04f536-e5c6-4bcc-8909-919f7e7233aa","resolution":{"observed_at":"2026-06-27T07:01:07.362430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.08441","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T14:38:28.915950Z","title":"arXiv preprint arXiv:2507.08441 , year=","venue":null,"work_id":"f438612e-bb10-45c3-8662-4cbe16b00f44","year":2025},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:d8c2a0dfccd847e63029289f7b03003b342fdc8820b7f09a381494605f94ec7b","observation_id":"b47c3c07-ba25-4c7d-a6cb-35c54c83dfce","resolution":{"observed_at":"2026-07-03T14:38:28.917237Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:01:07.362430Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:15578758b690621b623be2f3b115e7595bf3cf17127a1bcf97a6a1ea73b8d27a","observation_id":"23721df6-51e7-48d1-9b31-dcc526261249","resolution":{"observed_at":"2026-06-27T07:01:07.362430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:01:07.362430Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:b3ce05ca96ebd0c10a88913529fde624cfefdf69a913a1dc51f656ff461a0ae2","observation_id":"1929781b-9882-4d01-8de5-f2999afddaa6","resolution":{"observed_at":"2026-06-27T07:01:07.362430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.15856","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T15:43:53.695293Z","title":"Latent denoising makes good visual tokenizers","venue":null,"work_id":"c0eb3488-a20d-4676-bc9c-0f5298fe8207","year":2026},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:b169f151e17535bf04e1db7237ca6d00b09a2761b87f339c1336056bf959b158","observation_id":"7787fef2-8047-4ad3-a8ac-e50abd4f1246","resolution":{"observed_at":"2026-07-03T14:38:28.905282Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:01:07.362430Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:3acc2f0ea892152b8ce685e34efb2285050e6d1c83c26ec90d09fa9ba4ec41d9","observation_id":"49bd37e6-f4be-4269-b367-bccfadf8462f","resolution":{"observed_at":"2026-06-27T07:01:07.362430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:01:07.362430Z","title":"Foundations and Trends","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:c982599e79086c963475ec3f22cbe0e9ad538e829b4dcc29e54b0df54864d3d0","observation_id":"f71baa52-ab77-49c2-b5b6-9e760ef08680","resolution":{"observed_at":"2026-06-27T07:01:07.362430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:01:07.362430Z","title":"Image Processing Algorithms and Techniques II , volume=","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:8edcba2964d4d97fb9b581aa5640907bd45b27bad7bfd00ca9fc28683ced1323","observation_id":"1111e54b-6dcb-417e-b0fd-071e82cd40d2","resolution":{"observed_at":"2026-06-27T07:01:07.362430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:01:07.362430Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:fc5a89fb1373d64f52fc7cdb5e387070f4ed62178e6fae4707a75c2e1880d7b5","observation_id":"54209dcf-d4c5-420a-9e2a-0b3aa6947666","resolution":{"observed_at":"2026-06-27T07:01:07.362430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04410","last_updated":"2025-02-09T08:59:19Z","snapshot_observed_at":"2026-08-06T03:43:29.067278Z","submitted_at":"2024-09-06T17:14:53Z","title":"Open-MAGVIT2: An Open-Source Project Toward Democratizing Auto-regressive Visual Generation","version":3},"cited_work":{"arxiv_id":"2409.04410","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.04410","snapshot_observed_at":"2026-07-04T13:09:50.831210Z","title":"Open-magvit2: An open-source project toward democratizing auto-regressive visual gener- ation","venue":null,"work_id":"a2523977-d17d-43e1-8c06-1f6ba1c28388","year":2025},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"cited_paper":"/paper/2409.04410","citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:12aea83c5331499ca6fe3defa1ec8f4d3fd551661789abcc9caf6a834d2e9fdc","observation_id":"bd2a13e7-4617-4f89-b924-0d3b765139af","resolution":{"observed_at":"2026-07-03T14:38:28.889202Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:431538a8669e319ed5b98fd49e9ed99019636ae7fb8ad89522c5c0d2d20d97f0","observation_id":"e9d36f68-0d8f-4812-9bec-57ab91a2194f","resolution":{"observed_at":"2026-07-03T14:38:28.909903Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:01:07.362430Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:069bbdabd1a49e898c54e5f9cc87a3d95d2022854451061826c9e1724f2ab919","observation_id":"613719cd-5b2a-4053-9b77-3a7047568675","resolution":{"observed_at":"2026-06-27T07:01:07.362430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:01:07.362430Z","title":"Proceedings of the Computer Vision and Pattern Recognition Conference , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:84b808f72158bfe42d45fb388950fa103565a71d9c4242f217029403ae97839a","observation_id":"ecddbb8c-3993-45c6-a945-3b9b2ab7f84d","resolution":{"observed_at":"2026-06-27T07:01:07.362430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01756","last_updated":"2024-12-03T20:32:52Z","snapshot_observed_at":"2026-07-31T17:12:13.287514Z","submitted_at":"2024-10-02T17:06:39Z","title":"ImageFolder: Autoregressive Image Generation with Folded Tokens","version":3},"cited_work":{"arxiv_id":"2410.01756","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.01756","snapshot_observed_at":"2026-07-03T14:38:28.817961Z","title":"Imagefolder: Autoregres- sive image generation with folded tokens","venue":null,"work_id":"31c3d642-f3a7-4326-8674-523c08c24d7c","year":2024},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"cited_paper":"/paper/2410.01756","citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:a4cae14cf9aba8d7edc5041baff444950e7d2ef584a06fca357a8863a2bfc8cd","observation_id":"e3b60c85-bd9d-43fc-9357-5d022a1a207b","resolution":{"observed_at":"2026-07-03T14:38:28.819341Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:01:07.362430Z","title":"Forty-second International Conference on Machine Learning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:f51cb814db9c9ebbde27947dcfa504e479b1e17fa10ff4128d163330a6ac6268","observation_id":"c41b4ef4-93ed-4183-a671-cb9380c5377e","resolution":{"observed_at":"2026-06-27T07:01:07.362430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:01:07.362430Z","title":"2022 , eprint=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:71dce23959eb5c8b98dd8e5eace1e6ba3cf7555fd9746610d01874301912587e","observation_id":"a93c7eb2-26e8-4d8a-9c5a-d0af8fbf165e","resolution":{"observed_at":"2026-06-27T07:01:07.362430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:01:07.362430Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:8501253bccccc227da0869b87aec9a5a990c7f5ec9ce27616755a918a4405cd1","observation_id":"c453ecf6-ccf9-48e1-a982-2321c425de44","resolution":{"observed_at":"2026-06-27T07:01:07.362430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-09T20:05:31.409634Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":"2405.09818","doi":"10.48550/arxiv.2405.09818","metadata_source":"pith","pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","venue":"cs.CL","work_id":"2661b9a6-25cc-41a1-8100-612d2b801289","year":2024},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:468bb4738eae1eb7ec86cf82fc044d2b4ecd9c0f8fade4ae46d3b72714ecb31e","observation_id":"092adf5e-e897-4641-8437-ffafa9b149cf","resolution":{"observed_at":"2026-07-03T14:38:28.816961Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-10T17:49:22.013335+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T17:49:22.013335+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:01:07.362430Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:190a47985a195d287964b3b40a3ba77a772670434efdff28918db2114d4d699d","observation_id":"e6214d90-8861-4a4c-a0f4-2c1b5bfc5f4c","resolution":{"observed_at":"2026-06-27T07:01:07.362430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11499","last_updated":"2024-03-15T19:19:28Z","snapshot_observed_at":"2026-08-07T22:11:51.327954Z","submitted_at":"2023-09-20T17:58:05Z","title":"DreamLLM: Synergistic Multimodal Comprehension and Creation","version":2},"cited_work":{"arxiv_id":"2309.11499","doi":"10.48550/arxiv.2309.11499","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.11499","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dreamllm: Synergistic multimodal comprehension and creation","venue":"arXiv (Cornell University)","work_id":"43128e8d-8204-43b8-9bfc-f0da0b15ed39","year":2023},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"cited_paper":"/paper/2309.11499","citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:e5b7e42d6f834e0bc65705eb745bbf0cbce4835b7d6c39a58aacb9b1abc55aa9","observation_id":"dd51b75a-c007-4e53-b58b-dd6166d1fa01","resolution":{"observed_at":"2026-07-03T14:38:28.883801Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2309.04669","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T14:38:28.854434Z","title":"Unified language-vision pretraining in llm with dynamic discrete visual tokenization","venue":null,"work_id":"30af28b4-c35b-40c0-acbf-085b0d588bfa","year":2023},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:f5a89791ec3e2065fc74e582b0a600b7dea52ef45ba478c780c76d57aaa7aec9","observation_id":"68408783-f0e0-41fd-9149-ca83de540ac1","resolution":{"observed_at":"2026-07-03T14:38:28.855777Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:01:07.362430Z","title":"Proceedings of the Computer Vision and Pattern Recognition Conference , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:5db03a4b0b3b63ce202bb5a697729248caedce78c8225b0cc96394d251995126","observation_id":"9254e3b3-1c2e-4e2b-a23d-dc6f3da66391","resolution":{"observed_at":"2026-06-27T07:01:07.362430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:01:07.362430Z","title":"arXiv preprint , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:3dbceaad993ecbe03d3dd9a5422149a7e42e0b9d91986e50a98ae6dadfaa7a66","observation_id":"d1ce572f-4dd1-41f7-8b27-b0e4f573064b","resolution":{"observed_at":"2026-06-27T07:01:07.362430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01218","last_updated":"2023-10-02T14:03:02Z","snapshot_observed_at":"2026-08-02T03:02:58.907220Z","submitted_at":"2023-10-02T14:03:02Z","title":"Making LLaMA SEE and Draw with SEED Tokenizer","version":1},"cited_work":{"arxiv_id":"2310.01218","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.01218","snapshot_observed_at":"2026-07-09T20:16:29.588718Z","title":"Making llama see and draw with seed tokenizer","venue":"cs.CV","work_id":"9453feaf-a19d-4603-b9de-da50593c5d43","year":2023},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"cited_paper":"/paper/2310.01218","citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:594a50d9bfd239bae458abd7b8c9519e7a7cf25de62748535bfb1480dc796a90","observation_id":"7805d954-f801-4294-a566-f745f9568dd5","resolution":{"observed_at":"2026-07-03T14:38:28.919623Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:01:07.362430Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:6047ffc445516c9cdca529ffd8d235abc368a44dfe1a1758b4a2c269d3dce4a9","observation_id":"0c6aa083-e3d5-41ec-a214-a2276619f066","resolution":{"observed_at":"2026-06-27T07:01:07.362430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":"2409.18869","doi":"10.48550/arxiv.2409.18869","metadata_source":"pith","pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3: Next-Token Prediction is All You Need","venue":"cs.CV","work_id":"720d288e-fac0-464c-9929-19efd9a52afc","year":2024},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:2efa669d687bd25ef05f29754344cbb9f874f4a18aea3490d2966fd75d112db8","observation_id":"0a6b70da-000d-4b30-934e-013547a0b354","resolution":{"observed_at":"2026-07-03T14:38:28.912359Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:01:07.362430Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:d89bc8ba925a7e92e3b1dd8b9420f6186c40508f32ac1fd28bbcbf3d099e7868","observation_id":"65458b22-33de-4bb8-850e-92fe0ca81b9a","resolution":{"observed_at":"2026-06-27T07:01:07.362430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:01:07.362430Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:1907abeee5e0a62ddb8e070f25cbec5c70b206694efc7d726969c0f7d40c3283","observation_id":"977fd9ec-6dd2-431b-a9f4-f3480148eb34","resolution":{"observed_at":"2026-06-27T07:01:07.362430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06673","last_updated":"2024-12-09T17:11:50Z","snapshot_observed_at":"2026-08-11T19:23:16.518889Z","submitted_at":"2024-12-09T17:11:50Z","title":"ILLUME: Illuminating Your LLMs to See, Draw, and Self-Enhance","version":1},"cited_work":{"arxiv_id":"2412.06673","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.06673","snapshot_observed_at":"2026-07-03T17:58:47.404850Z","title":"Illume: Illuminating your llms to see, draw, and self-enhance.arXiv preprint arXiv:2412.06673, 2024a","venue":null,"work_id":"0724bbe6-f375-4b35-a2a3-dc6547cea7ab","year":2024},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"cited_paper":"/paper/2412.06673","citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:feabb66423fcdeac8fb0d09248058f76e1a87f1c0854c365216d22a6fb68d461","observation_id":"3383bfe0-8243-4391-98a0-1699edfd775d","resolution":{"observed_at":"2026-07-03T14:38:28.860881Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00127","last_updated":"2025-04-16T10:04:24Z","snapshot_observed_at":"2026-08-11T15:26:55.090834Z","submitted_at":"2024-11-28T13:00:38Z","title":"Orthus: Autoregressive Interleaved Image-Text Generation with Modality-Specific Heads","version":2},"cited_work":{"arxiv_id":"2412.00127","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.00127","snapshot_observed_at":"2026-07-03T14:38:28.877985Z","title":"Orthus: Autoregressive interleaved image-text generation with modality-specific heads","venue":null,"work_id":"26db0012-a10a-4cc5-b860-df81bb6df3ae","year":2024},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"cited_paper":"/paper/2412.00127","citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:8940f3f5594127c122ca312fb6703e024f36837ec64b935a1664faaed40f45db","observation_id":"0f0ae40e-923c-4008-b8ac-c0f24f7e5690","resolution":{"observed_at":"2026-07-03T14:38:28.879242Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:01:07.362430Z","title":"Proceedings of the Computer Vision and Pattern Recognition Conference , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:fd6b842825f87bd1041bf4fc62aeeaefd8b3f9151d10a3c958db6c07a5f0ccec","observation_id":"f02cbc2a-3ecd-4a24-9410-4721b4f3ccfc","resolution":{"observed_at":"2026-06-27T07:01:07.362430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:01:07.362430Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:d811ea27b3cf17e89775d2cbfe71ed749cb68fa8ddc202f1c693e587a8f19a32","observation_id":"08882222-8ee0-42b4-ae82-e8e2c6eb3999","resolution":{"observed_at":"2026-06-27T07:01:07.362430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:01:07.362430Z","title":"2023 , eprint=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:2112f4d2a8c274ab20b6b4dddcaa5c18e01362117ae2dd4de3b32eb1fe4fd71c","observation_id":"8e32b757-65dd-4f02-a9ef-236b15d8ab85","resolution":{"observed_at":"2026-06-27T07:01:07.362430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:01:07.362430Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:2b27b720d90399d17d5d060a200208eac3aff3c0512b3a767d35864ed9ab8fc5","observation_id":"9b7811ee-fe9d-4474-bfaa-5edb250b0eef","resolution":{"observed_at":"2026-06-27T07:01:07.362430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":"2502.05178","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.05178","snapshot_observed_at":"2026-07-03T20:28:55.819781Z","title":"arXiv preprint arXiv:2502.05178 (2025) 2, 4, 7, 8 WinTok 15","venue":null,"work_id":"dc94ee65-ac1f-4c4d-a6f8-8c9f3bc865e7","year":2025},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"cited_paper":"/paper/2502.05178","citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:6ab8dd9b04de72da0ce6be51a019d92d9980acfcc163f6fdaab674b0d1669af7","observation_id":"6d93c88c-7d14-4a5d-ae65-d42304fbf072","resolution":{"observed_at":"2026-07-03T14:38:28.819010Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":"2505.23661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23661","snapshot_observed_at":"2026-07-04T16:39:58.237442Z","title":"Openuni: A simple baseline for unified multimodal understanding and generation.arXiv preprint arXiv:2505.23661, 2025b","venue":null,"work_id":"74eca3ff-bbe5-492f-ab35-b10bd41e7b5a","year":2025},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"cited_paper":"/paper/2505.23661","citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:91ded45dd6de7306256b085ca723c6b0fcb7e61f64cac9c3624276cd6f0480ff","observation_id":"56505dc3-693d-40eb-bc29-692615926173","resolution":{"observed_at":"2026-07-03T14:38:28.896947Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04332","last_updated":"2025-04-10T18:28:11Z","snapshot_observed_at":"2026-08-11T21:29:31.376249Z","submitted_at":"2024-12-05T16:48:16Z","title":"Liquid: Language Models are Scalable and Unified Multi-modal Generators","version":4},"cited_work":{"arxiv_id":"2412.04332","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.04332","snapshot_observed_at":"2026-07-08T00:04:22.401157Z","title":"arXiv preprint arXiv:2412.04332 (2024) 2, 9, 10","venue":"cs.CV","work_id":"a9ef7688-9d55-4c89-935a-8762165fc75f","year":2024},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"cited_paper":"/paper/2412.04332","citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:578a15aee062b419be3cda8f1aca5bd3b4e383b2ab0e1c2c91775f77d0dd218e","observation_id":"0c738ec6-7764-4a1d-a5fd-22cfe2530c27","resolution":{"observed_at":"2026-07-03T14:38:28.909508Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.20321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T13:09:50.827602Z","title":"Unitok: A unified tokenizer for visual generation and understanding.arXiv preprint arXiv:2502.20321, 2025a","venue":null,"work_id":"31d5c278-398d-4fee-8130-a864fb6b3717","year":2025},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:35c4bc9aa5c438eb6f34bcc25923aa59f5587c7c5bd4a6ac39f92a4ab5f06170","observation_id":"0cebaca9-115c-4a46-9df5-a92158d2c38a","resolution":{"observed_at":"2026-07-03T14:38:28.886403Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.23278","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:36:52.528059Z","title":"Unilip: Adapting clip for unified multimodal understanding, generation and editing","venue":null,"work_id":"a1bad6a0-54ce-45f8-8478-3169a4b3c6e8","year":2025},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:f474d805e2c6da5e3bea29d5c914e3d608cb5d6a891599dca864a7293bc25134","observation_id":"f6597786-6122-437f-9948-ce371a6ddebf","resolution":{"observed_at":"2026-07-03T14:28:32.190086Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:01:07.362430Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:42036c0fa4e371bad7cf2f3f07f4c4de5345f875694b3aca4732af633b39d1a7","observation_id":"0677f3a0-72b9-48e3-9c23-e0e8fa80aea9","resolution":{"observed_at":"2026-06-27T07:01:07.362430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01934","last_updated":"2025-04-03T16:43:14Z","snapshot_observed_at":"2026-08-07T16:13:53.338367Z","submitted_at":"2025-04-02T17:45:00Z","title":"ILLUME+: Illuminating Unified MLLM with Dual Visual Tokenization and Diffusion Refinement","version":2},"cited_work":{"arxiv_id":"2504.01934","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.01934","snapshot_observed_at":"2026-07-04T16:09:57.571267Z","title":"Illume+: Illuminating unified mllm with dual visual tokenization and diffusion refinement","venue":null,"work_id":"f4320ca7-31dd-4c56-9eba-d0556b06956a","year":2025},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"cited_paper":"/paper/2504.01934","citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:fb5f13d7dbe862d6f85cbc65c895481077a16a4553ca76440a4aa18eaf7fa01c","observation_id":"750863bb-62c3-4cdf-815e-4f3281272cf1","resolution":{"observed_at":"2026-07-03T14:28:32.222192Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01762","last_updated":"2024-12-02T17:58:06Z","snapshot_observed_at":"2026-08-12T00:55:20.298827Z","submitted_at":"2024-12-02T17:58:06Z","title":"XQ-GAN: An Open-source Image Tokenization Framework for Autoregressive Generation","version":1},"cited_work":{"arxiv_id":"2412.01762","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.01762","snapshot_observed_at":"2026-07-03T14:28:32.056837Z","title":"arXiv preprint arXiv:2412.01762 , year=","venue":null,"work_id":"3b31a665-24c0-4fc2-9571-10fbfada81c9","year":2024},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"cited_paper":"/paper/2412.01762","citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:78b040bb3f3a5cb223e042e48ef4ee68836ce67ab1df43950de5c951bf692197","observation_id":"802d7e2d-d8dd-44e7-b3de-2ddda65cc6c1","resolution":{"observed_at":"2026-07-03T14:28:32.058282Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15505","last_updated":"2023-10-12T07:55:05Z","snapshot_observed_at":"2026-07-06T16:24:17.829828Z","submitted_at":"2023-09-27T09:13:40Z","title":"Finite Scalar Quantization: VQ-VAE Made Simple","version":2},"cited_work":{"arxiv_id":"2309.15505","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.15505","snapshot_observed_at":"2026-07-10T02:16:42.481403Z","title":"Finite Scalar Quantization: VQ-VAE Made Simple","venue":"cs.CV","work_id":"34dd22bc-0de9-4e11-9a1b-1358e10fbfe1","year":2023},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"cited_paper":"/paper/2309.15505","citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:599cdb269de66c0b90cd0d00c11ac77a2ba74c565884e48d5e4c57feb2730f37","observation_id":"7eb61c66-8c0d-41de-8f2e-6b6208abac1b","resolution":{"observed_at":"2026-07-03T14:28:32.053215Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08354","last_updated":"2025-03-17T17:54:40Z","snapshot_observed_at":"2026-08-07T17:13:12.649046Z","submitted_at":"2025-03-11T12:09:11Z","title":"Robust Latent Matters: Boosting Image Generation with Sampling Error Synthesis","version":2},"cited_work":{"arxiv_id":"2503.08354","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.08354","snapshot_observed_at":"2026-07-03T14:28:32.059399Z","title":"arXiv preprint arXiv:2503.08354 , year=","venue":null,"work_id":"f010e5f4-d695-4f8b-8c33-1f03355d5dca","year":2025},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"cited_paper":"/paper/2503.08354","citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:506221df622430f1011c121457647455525095513bcb63f3119ea6d07823c3ae","observation_id":"2f200e47-713e-4aa5-beb2-522225c5c174","resolution":{"observed_at":"2026-07-03T14:28:32.060656Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:01:07.362430Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:097d62e4177f517d58ae1fb7735b3b4320d02b01ee2c348bad525b9892c20b5f","observation_id":"2702eb36-e7e9-45bf-a32f-d60ad9f63b47","resolution":{"observed_at":"2026-06-27T07:01:07.362430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-09T03:16:49.369471Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"cited_work":{"arxiv_id":"2505.07538","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.07538","snapshot_observed_at":"2026-07-03T14:28:32.067048Z","title":"Selftok: Discrete visual tokens of autoregression, by diffusion, and for reasoning","venue":null,"work_id":"721b5fec-f82b-4d07-9c23-852bd1b2838a","year":2025},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"cited_paper":"/paper/2505.07538","citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:ce176b878b912a472e0600e9f1744273bcf2a5493a36b286d6c02d3a1cca0462","observation_id":"4cb9248f-9406-4295-ad51-3e7438e6479f","resolution":{"observed_at":"2026-07-03T14:28:32.068307Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:01:07.362430Z","title":"Forty-second International Conference on Machine Learning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:b01985bbfda38f6af9ba183ac2f55b4dd2a3d0c67e30f50e7a5fd0a1295867fb","observation_id":"17636725-4e5a-4026-b180-1e1a1c2987e4","resolution":{"observed_at":"2026-06-27T07:01:07.362430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-08T03:31:37.699253Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":"2308.02490","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-07-10T09:37:00.827227Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","venue":"cs.AI","work_id":"7f3bac41-a0a5-4a7a-bfd2-526b616db745","year":2023},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:8f7aaf898d81ebf02339ee56c445e429ea886584068f2bb293857c83aa8d6c6c","observation_id":"b2f6432a-7602-4fae-ae8c-d99b66e7788e","resolution":{"observed_at":"2026-07-03T14:28:32.043849Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:01:07.362430Z","title":"Proceedings of the IEEE conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:3300234fe740844f66397ba1accadf544fc34524fd5f5d8b1c310f8f23165c74","observation_id":"1be63069-928f-4b15-8b98-f36a20dfec22","resolution":{"observed_at":"2026-06-27T07:01:07.362430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:01:07.362430Z","title":"2025 , url=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:dc5159e4900b483d26cc13c0d6748d90649e9c9f0b610866b6235f44110749b7","observation_id":"84b5e0b9-3509-4e9d-bca9-9d2a67a885eb","resolution":{"observed_at":"2026-06-27T07:01:07.362430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:01:07.362430Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:a7a3e6ec287fd5909cc6c2dc142fe67b65a4b564d937819cf16416930872964c","observation_id":"7221f5a7-2264-4f00-8acf-956dbc3cc119","resolution":{"observed_at":"2026-06-27T07:01:07.362430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:01:07.362430Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:5f8b1424b3cc3a0f0a5f2a8800abdcbe1fb2e091aab1157ac2fbf0605177e5d8","observation_id":"d0032e54-cc03-4315-9e48-79806020c9e8","resolution":{"observed_at":"2026-06-27T07:01:07.362430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:01:07.362430Z","title":"European conference on computer vision , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:67d9232c0cc3c223f26d3f5353e141baa59bd7521580149d630174e2f6fe8123","observation_id":"13c1b387-1eb9-41e9-b899-4dab3c353bb0","resolution":{"observed_at":"2026-06-27T07:01:07.362430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":"2305.10355","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-07-10T11:37:03.198858Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","venue":"cs.CV","work_id":"66d8ac3e-c134-4995-b528-550afa17586f","year":2023},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:1da043234abbad5872b07b988241f321c8a48f048085520276b1538c49c340aa","observation_id":"c50e2deb-5af4-4a25-a40d-015970efef42","resolution":{"observed_at":"2026-07-03T14:28:32.046198Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:01:07.362430Z","title":"nature , volume=","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:855c606108749985c7fbc17d86eb8e70457270d69015b479db607f7afd552ff8","observation_id":"cd070a70-ef08-4dfa-924b-ca50fadc5394","resolution":{"observed_at":"2026-06-27T07:01:07.362430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:01:07.362430Z","title":"Proceedings of the European conference on computer vision (ECCV) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:d248f69232a9ee1f589fb8bc91a959ac225ec2305a04cf56b9253084ecacf774","observation_id":"2bb8a214-b480-438d-8ad8-f116101d8372","resolution":{"observed_at":"2026-06-27T07:01:07.362430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:01:07.362430Z","title":"Proceedings of the Computer Vision and Pattern Recognition Conference , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:c68b6221299f25515cc60d9fac18111f66d048524025c46f4d24211b553ffba5","observation_id":"afc4c253-6112-4d28-911f-b7793737ffa0","resolution":{"observed_at":"2026-06-27T07:01:07.362430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:01:07.362430Z","title":"European conference on computer vision , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:041638474b24b6357115bdaa306fe662e7ac335c90d0a6ecbb5463fecefac6c8","observation_id":"fc4ef71f-64a8-4405-8b4f-590c9b026413","resolution":{"observed_at":"2026-06-27T07:01:07.362430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:01:07.362430Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:d0c1dde8836966a1fb377a345aaa6d9247486685b9e4df19240bcacbf3af76ad","observation_id":"f1e95262-2d95-41aa-a8c3-8d0ace513f77","resolution":{"observed_at":"2026-06-27T07:01:07.362430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-08-10T15:05:25.558818Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"cited_work":{"arxiv_id":"2205.01917","doi":"10.48550/arxiv.2205.01917","metadata_source":"pith","pith_arxiv_id":"2205.01917","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","venue":"cs.CV","work_id":"5dd5bf10-d548-40ff-9b6c-6735129b27ee","year":2022},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"cited_paper":"/paper/2205.01917","citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:2111fa3897831f30ab71d6bf60788d920d0b132629b0e4a6defcf93bfe01367c","observation_id":"e683a672-62fb-4d26-b850-ea2426fbc961","resolution":{"observed_at":"2026-07-03T14:28:32.048574Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T13:22:43.398968+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T13:22:43.398968+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.01342","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T14:28:32.049805Z","title":"Internvideo-next: Towards general video foundation models without video-text supervision","venue":null,"work_id":"d65f61ad-e3f7-4e3f-9b08-da7a6e8b0595","year":2025},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:c435a21adb5259afa0f4a328289a006aa70508f7098da5d2fd36100a78174760","observation_id":"64630893-3eba-400a-ba49-bb6c866a70ea","resolution":{"observed_at":"2026-07-03T14:28:32.051049Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-11T10:12:11.384939Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:accd11ae893d4c9f745d58869188a051f2b228ac478964dda0758ac5f237b756","observation_id":"36fac3a4-3f89-4464-afef-b3b4c1f6c9bc","resolution":{"observed_at":"2026-07-03T14:38:28.922207Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:01:07.362430Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":103,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:f9d235608c93c6f0a2a43892d4ce7bc936eada225dc01fb5b8165944c14d924f","observation_id":"24e8eaff-199f-4922-a142-f9ee555bd31b","resolution":{"observed_at":"2026-06-27T07:01:07.362430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:01:07.362430Z","title":"Proceedings of the IEEE/CVF international conference on computer vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":104,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:e25653e8da07fae1b948848e71397fccb6aec6c31ec7c77332d5ff27bbc12373","observation_id":"fd201d84-672c-4b9e-bd3f-8edb0fb4ad87","resolution":{"observed_at":"2026-06-27T07:01:07.362430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14324","last_updated":"2026-04-20T17:55:12Z","snapshot_observed_at":"2026-08-02T12:34:37.994590Z","submitted_at":"2025-03-18T14:56:46Z","title":"DualToken: Towards Unifying Visual Understanding and Generation with Dual Visual Vocabularies","version":3},"cited_work":{"arxiv_id":"2503.14324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.14324","snapshot_observed_at":"2026-07-04T10:09:44.696076Z","title":"DualToken: Towards Unifying Visual Understanding and Generation with Dual Visual Vocabularies","venue":"cs.CV","work_id":"b7011dfc-3583-42ce-94ec-4dc9a84c02df","year":2025},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":105,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"cited_paper":"/paper/2503.14324","citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:0d6b20b073be7320ffd4a9c9162451cff2ac314823bb6bbd187b6c66abd6b2e4","observation_id":"6948834e-a774-4b49-8d4d-7ada40ba6c8b","resolution":{"observed_at":"2026-07-03T14:28:32.073325Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.06764","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T10:09:44.905860Z","title":"arXiv preprint arXiv:2503.06764 (2025) 4, 7, 9, 10, 1","venue":null,"work_id":"794f98aa-54fe-4908-99cf-78ae777b91b6","year":2025},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":106,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:bcb6a0f907a9a9a0b8a0bbede9091377e99cddaa948134ee5db3f09eb927e2d6","observation_id":"470607fd-e8a9-4ccc-bfa1-82f4ba8a0c71","resolution":{"observed_at":"2026-07-03T14:28:32.098762Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":35,"parse_uncertain":0,"unresolved":54,"verified_exact":11,"verified_fuzzy":0},"total_outbound_references":281},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 100 of 281 outbound references and 2 inbound Pith citation observations for arXiv:2606.13289."}