{"as_of":"2026-08-11T12:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:14e8a4a4ef8e90bc739904cf0366b8438daf5007a19071354267f87787498486","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-16T08:09:19.209759Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2602.01554/citation-record","integrity":"/paper/2602.01554/integrity","json":"/paper/2602.01554/citation-record.json","paper":"/paper/2602.01554"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Janus: Decoupling visual encoding for unified multimodal understanding and generation","venue":null,"work_id":"7bfb7ac7-6e95-4977-bfd9-e35d846f42ae","year":2025},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:8bdc3317f6862f27c6d802969cbdffa7c23fd507da16c0481810e6a1a465e786","observation_id":"58ce4b98-3151-403e-8678-b5cb699491c3","resolution":{"observed_at":"2026-05-16T08:10:45.804597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-08-11T10:16:40.394612Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":"2505.14683","doi":"10.48550/arxiv.2505.14683","metadata_source":"pith","pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emerging Properties in Unified Multimodal Pretraining","venue":"cs.CV","work_id":"e0cfd82c-f5d4-44fd-b531-ec73ab0a805b","year":2025},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:b2b7f50a46a1ebbf819e8e7b2515a26ee68b78005bfab09ff6fc51f950ce5d24","observation_id":"8fd7f759-33e7-475c-9192-79f74b909354","resolution":{"observed_at":"2026-05-16T08:10:45.471135Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"VILA-U: a unified foundation model integrating visual understanding and generation","venue":null,"work_id":"496b3da1-b91a-41c3-b7ea-6852d8e8cc04","year":2025},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:cad6f139c0f6a12aea22500f97746f215a83ef6970903ffec38dd809cc6565c5","observation_id":"a87d0b9f-bee2-4c42-8203-bd23922d0974","resolution":{"observed_at":"2026-05-16T08:10:45.802514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Harmonizing visual representations for unified multimodal understanding and generation","venue":null,"work_id":"6b96fdca-6867-4aa1-bbfd-a059725e4481","year":2025},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:b022514af8d54a6f8a586842fdefe57694aed8b98cb1a4f61a1a716e46fa2d1f","observation_id":"6b2134b2-ea71-4322-a8bd-a6ba1af188b7","resolution":{"observed_at":"2026-05-16T08:10:45.791680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.06590","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T14:28:32.106180Z","title":"Ming-univision: Joint image understanding and generation with a unified continuous tokenizer.arXiv preprint arXiv:2510.06590, 2025a","venue":null,"work_id":"27f83b26-431a-430b-82c3-1c56eccec44d","year":2025},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:6cdb0aa6d0059f65cd8de5f8a4d4373e70807daa3f37647138443f77a0ec4ed8","observation_id":"a93ba93a-5f62-4594-ac70-4734fdbff175","resolution":{"observed_at":"2026-05-16T08:10:45.442284Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.20321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T13:09:50.827602Z","title":"Unitok: A unified tokenizer for visual generation and understanding.arXiv preprint arXiv:2502.20321, 2025a","venue":null,"work_id":"31d5c278-398d-4fee-8130-a864fb6b3717","year":2025},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:7736c6c45baa0f4875025077d64fad1cf6a3ff9d63b56d7db7f048ab18c1cf15","observation_id":"bce5ebb7-6b17-4854-9c77-0b558575a297","resolution":{"observed_at":"2026-05-16T08:10:45.429366Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18898","last_updated":"2025-06-23T17:59:14Z","snapshot_observed_at":"2026-08-06T23:12:29.776991Z","submitted_at":"2025-06-23T17:59:14Z","title":"Vision as a Dialect: Unifying Visual Understanding and Generation via Text-Aligned Representations","version":1},"cited_work":{"arxiv_id":"2506.18898","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18898","snapshot_observed_at":"2026-07-04T10:09:44.750475Z","title":"Vision as a dialect: Unifying visual understanding and generation via text-aligned representations.arXiv preprint arXiv:2506.18898","venue":null,"work_id":"eeaabcd0-b12e-4324-88d6-d54239671f08","year":2025},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"cited_paper":"/paper/2506.18898","citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:d2c62f5b4451e2d71462e47ad576259dea3399d323ae8e7b981465bdd092dde3","observation_id":"16d3aa9f-6f7b-4885-a065-99e9b5a2a79f","resolution":{"observed_at":"2026-05-16T08:10:45.419989Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":"2505.23661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23661","snapshot_observed_at":"2026-07-04T16:39:58.237442Z","title":"Openuni: A simple baseline for unified multimodal understanding and generation.arXiv preprint arXiv:2505.23661, 2025b","venue":null,"work_id":"74eca3ff-bbe5-492f-ab35-b10bd41e7b5a","year":2025},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"cited_paper":"/paper/2505.23661","citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:4bf0dc69b98d309b467d81a76b62f5c67b4b3eb5e3c4ca5d57afa3c9b3ba53f6","observation_id":"21aa7041-6a31-430c-b826-375928f15e2f","resolution":{"observed_at":"2026-05-16T08:10:45.393690Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03147","last_updated":"2025-06-18T18:00:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-03T17:59:33Z","title":"UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation","version":4},"cited_work":{"arxiv_id":"2506.03147","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03147","snapshot_observed_at":"2026-07-05T16:51:14.197597Z","title":"UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation","venue":"cs.CV","work_id":"488a273e-95d8-46f1-87c7-2244068d00d0","year":2025},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"cited_paper":"/paper/2506.03147","citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:67588a45a1c2861e8efdf8aab0b0a93602186fc95231d5063ac80ca972f1dcf8","observation_id":"34d74abe-0497-4b11-98c8-41dec6369d04","resolution":{"observed_at":"2026-05-16T08:10:45.460863Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Show-o2: Improved native unified multimodal models","venue":null,"work_id":"df8a1452-5106-4aeb-924e-b2832b05fade","year":2025},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:5762d2c3149cca3f76178a30ac2617dccdb2937d8674b0cdf9a781bd6c63dbbc","observation_id":"668b7147-1e13-4c54-9923-d88565289cde","resolution":{"observed_at":"2026-05-16T08:10:45.787432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10483","last_updated":"2025-05-15T16:34:50Z","snapshot_observed_at":"2026-08-07T15:44:59.844883Z","submitted_at":"2025-05-15T16:34:50Z","title":"UniEval: Unified Holistic Evaluation for Unified Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":"2505.10483","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.10483","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unieval: Unified holistic evaluation for unified multimodal understanding and generation","venue":null,"work_id":"c32e1ef8-d09f-481b-8e5f-64b6c1786e5b","year":2025},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"cited_paper":"/paper/2505.10483","citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:e290bfe12f41e0817469ba93f52394deada41aa66c4e1439907ca0fc82f77147","observation_id":"6e7991a9-3bd4-4bd2-a89c-3acd107ba0c1","resolution":{"observed_at":"2026-05-16T08:10:45.390395Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GQA: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":"70f8ad50-a2c2-4c53-8895-b91c2f8f2bcd","year":2019},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:3d1a53f5d5afb2a765a7cda152428cccb24f54575d4eaddcf3cfd22e53d90a44","observation_id":"81f9b42e-26d5-4a11-9a60-2812f2d2863b","resolution":{"observed_at":"2026-05-16T08:10:45.783435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":"2307.16125","doi":"10.48550/arxiv.2307.16125","metadata_source":"pith","pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","venue":"cs.CL","work_id":"23881ff0-b851-474c-8712-90744cc07a3a","year":2023},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:e19e1dd3dcaa23e120826cf4416b9b2df41fafd09827c0b98ca5c11a1849baf8","observation_id":"d0261ed9-428e-4761-a745-e34cadb8a499","resolution":{"observed_at":"2026-05-16T08:10:45.432288Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":"65df5deb-f8b6-44e6-958e-c89fe535698a","year":2023},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:d8724e938d26c6d5a72d20e9bb16767e9643d191892f73988f2f2491614f06fa","observation_id":"2766ebe7-d804-4519-8ceb-57a85d2c874c","resolution":{"observed_at":"2026-05-16T08:10:45.793651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":"2306.13394","doi":"10.48550/arxiv.2306.13394","metadata_source":"pith","pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-07-10T13:27:05.561984Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","venue":"cs.CV","work_id":"806d2e73-71b3-4d56-87e0-39d571cc15d6","year":2023},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:119f6ea8a67925df51e1831f348341d9cb4d1ad5b5a2e41bfc0605bc2249266e","observation_id":"03658430-ab94-4bfe-a54a-5941d7bbec70","resolution":{"observed_at":"2026-05-16T08:10:45.464350Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:17.033703+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:17.033703+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities","venue":null,"work_id":"133dcd9b-d0b1-4af6-8c3a-a34f2067013e","year":2024},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:0dd8b58d2851f1954d48ff35a491af65bd368028c48e2028dc366847ec8f8e0a","observation_id":"1bdb6ec7-6418-4641-8b43-ca29e325fd60","resolution":{"observed_at":"2026-05-16T08:10:45.789390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":"d58d24a1-bf4d-4528-a7ec-a13744080c94","year":2024},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:d910113216e502fbcd8cd7fe9970bd17f1b1cfd20c4281fffbf292ee836713a4","observation_id":"f2d72a31-ca80-4701-8aa3-cd41697ea66e","resolution":{"observed_at":"2026-05-16T08:10:45.736202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Geneval: An object-focused framework for evaluating text-to-image alignment","venue":null,"work_id":"69d9d123-a7d2-4507-8215-52585cda8983","year":2023},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:fe80188960481eaae8c38cb87a8a6c7b5cf56dc33e3b8ac99f02624fec4bd789","observation_id":"929f172a-908a-4279-b0b6-c6542b092d9a","resolution":{"observed_at":"2026-05-16T08:10:45.738791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":"2508.09987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-07-04T21:10:09.706550Z","title":"Echo-4o: Harnessing the power of gpt- 4o synthetic images for improved image generation","venue":null,"work_id":"03495384-0569-439e-a1d4-067ad2d077a1","year":2025},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:28ecf5b8b4090caa0f56960034d078b903d6e39210e4ade751cf220e9ced4f7a","observation_id":"ee11affc-1452-4348-b2b3-13d6e7e85949","resolution":{"observed_at":"2026-05-16T08:10:45.467647Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07265","last_updated":"2026-06-02T17:11:50Z","snapshot_observed_at":"2026-08-07T17:17:00.060047Z","submitted_at":"2025-03-10T12:47:53Z","title":"WISE: A World Knowledge-Informed Semantic Evaluation for Text-to-Image Generation","version":4},"cited_work":{"arxiv_id":"2503.07265","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.07265","snapshot_observed_at":"2026-07-04T13:19:50.710913Z","title":"WISE: A World Knowledge-Informed Semantic Evaluation for Text-to-Image Generation","venue":"cs.CV","work_id":"604c1ae0-368d-49bf-8117-d688ac59f305","year":2025},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"cited_paper":"/paper/2503.07265","citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:cde07fa1dbbe7714e1ddb91e3957406d1ab97c26d0c9d378e829b8963c5c6fdc","observation_id":"9c2aa275-6840-49f1-90e7-785eb62e1f75","resolution":{"observed_at":"2026-05-16T08:10:45.411067Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"physics/0004057","last_updated":"2000-04-24T15:22:30Z","snapshot_observed_at":"2026-08-07T10:46:08.274157Z","submitted_at":"2000-04-24T15:22:30Z","title":"The information bottleneck method","version":1},"cited_work":{"arxiv_id":"physics/0004057","doi":"10.48550/arxiv.physics/0004057","metadata_source":"pith","pith_arxiv_id":"physics/0004057","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The information bottleneck method","venue":"physics.data-an","work_id":"72655a80-0724-45ad-a330-1f4ed7aa613b","year":2000},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"cited_paper":"/paper/physics/0004057","citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:af759b7d2d0a407b028d43cf1b83a5c962dc6520e36231fc29af3d4a56a08bc3","observation_id":"a53038e8-c08c-4504-a691-32bedb2fb814","resolution":{"observed_at":"2026-05-16T08:10:45.396288Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-10T23:49:06.793856+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T23:49:06.793856+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep learning and the information bottleneck principle","venue":null,"work_id":"6923d995-9308-4b0b-bfa9-e436fb49d1de","year":2015},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:e7f66eeba661d62e577525e5eb52314a1e63c184db07cc045b921d3446677319","observation_id":"f1dae431-31f9-43d3-b9d3-86beda9ed022","resolution":{"observed_at":"2026-05-16T08:10:45.785420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep variational information bottleneck","venue":null,"work_id":"550b9825-0685-4c74-8060-750e3e5072f5","year":2017},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:ecf413c36944043ec41df9bf255a743b70e04398969ce1846b8cc9c9ef4a9c90","observation_id":"5f270857-db46-4691-b3cd-05e95079b6c2","resolution":{"observed_at":"2026-05-16T08:10:45.797983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Revisiting hilbert-schmidt information bottleneck for adversarial robustness","venue":null,"work_id":"e4adc678-169e-4620-b5d1-a8a65106c07b","year":2021},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:03e7fa34d4084c36b4ba527318f02f56ad87b842b4526c65cede1fe0adf62733","observation_id":"6d2af541-7330-4959-86cd-3ef4665d954e","resolution":{"observed_at":"2026-05-16T08:10:45.778435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey on multimodal large language models","venue":null,"work_id":"deea587a-bb84-40ec-84db-fccfee203a2e","year":2024},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:2c3ced4a05fcda8c6eb509e1976ad3763ee155b1809a7d13e983b0d8cdd02647","observation_id":"dd344693-43cb-4877-8981-26a61d400178","resolution":{"observed_at":"2026-05-16T08:10:45.774354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey of multimodal learning: Methods, applications, and future","venue":null,"work_id":"ef7118b6-a7de-4881-b422-3fc1f5c85ece","year":2025},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:ffa8b9afe89db1951a64bf144df3a91af10ed8ae33546d4d7b8254c026499513","observation_id":"aa14fd1f-e248-4680-8992-01f9c3587c10","resolution":{"observed_at":"2026-05-16T08:10:45.746935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual instruction tuning","venue":null,"work_id":"27220318-386f-417a-82b7-2f858cd61518","year":2023},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:5c15325c1d9bf27ddf2a0a739afb8990f00403cb9091c03d5ad2be5a1da615fc","observation_id":"cf934318-b89e-4d22-b114-ca0794ed1192","resolution":{"observed_at":"2026-05-16T08:10:45.740783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":"401c55ba-5998-4f6b-b117-328e97572b60","year":2024},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:0c78cc54890c2b1f7b58ec0af7b0b335b979cafe3adedd7daa5d4b89c16e6409","observation_id":"fddb9239-9cc8-4a17-bd6b-46eed9030fc5","resolution":{"observed_at":"2026-05-16T08:10:45.776534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning","venue":null,"work_id":"6bbf5077-59f9-46f6-b139-c232fe785f75","year":2023},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:363133574b03917f4ddc5fd86f1145003aabceefb21ad60725f6f99074967a2a","observation_id":"8193229d-05ee-4515-b296-442f52f70349","resolution":{"observed_at":"2026-05-16T08:10:45.772232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"BLIP-2: bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"846fdf1d-11c0-43d4-98bc-ab6c55db5fd3","year":2023},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:6066d4a55d8d22e9f223f1eae8cbdd629949002bc296a86d9e7a0db052af2a7f","observation_id":"2ba4ec7f-9de0-4ef6-b083-86933d59ea7b","resolution":{"observed_at":"2026-05-16T08:10:45.766406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":"9b58bcb9-9f48-4558-a7ed-204d8c83f735","year":2022},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:7e854ef87c24a22e887206068bd6ad48a4293b841baac9566324e30c3dae3a7a","observation_id":"927d64dc-afd7-4b8a-ac62-8e4309b7a1b5","resolution":{"observed_at":"2026-05-16T08:10:45.770343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Querying as prompt: Parameter-efficient learning for multimodal language model","venue":null,"work_id":"b111881a-9ed0-400f-a24b-1cec9572bc41","year":2024},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:5be3c0dff418075b863ba35a0e59888b5a1e1b7a769d6eb7895a6425816ad6b4","observation_id":"2fecd58e-8f7b-43bc-9af0-6c7c104f465a","resolution":{"observed_at":"2026-05-16T08:10:45.763905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"High- resolution image synthesis with latent diffusion models","venue":null,"work_id":"99ef818d-843b-48dc-9fc7-4fa566339350","year":2022},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:64c38bfaa5bfcda084271d4424adf7bf0a3449da6e2e49d423f4b1a6336d59ad","observation_id":"8da7d960-e4cb-4eaf-8c4e-894884976619","resolution":{"observed_at":"2026-05-16T08:10:45.762022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":"d3d58f5f-4b77-41c0-824b-ecd963300f6a","year":2023},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:87f2a6da4e7fd024b8e821ed461d0818eb3c0f39b7ed3b04d7b925966c9cf342","observation_id":"96f3a5a0-a04d-4527-a82f-c758e20b5081","resolution":{"observed_at":"2026-05-16T08:10:45.768350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.07909","last_updated":"2024-11-08T06:19:33Z","snapshot_observed_at":"2026-08-09T15:37:28.200871Z","submitted_at":"2023-03-14T13:49:54Z","title":"Text-to-image Diffusion Models in Generative AI: A Survey","version":3},"cited_work":{"arxiv_id":"2303.07909","doi":"10.48550/arxiv.2303.07909","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.07909","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2303.07909 (2024) https: //doi.org/10.48550/arXiv.2303.07909","venue":"arXiv (Cornell University)","work_id":"5dc8e135-6ddf-45f1-a674-2ec971ddd442","year":2023},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"cited_paper":"/paper/2303.07909","citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:752a2656a1657527efcb30a58d1f1bfc81cac0ea19d5953af321231310d7997f","observation_id":"a1cea758-471d-4a47-ab00-4f94eb9e6cc7","resolution":{"observed_at":"2026-05-16T08:10:45.445484Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffusion-4k: Ultra- high-resolution image synthesis with latent diffusion models","venue":null,"work_id":"2ce67f53-66aa-4aca-9dd4-3ea39602cc05","year":2025},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:bceef649d4482c7704192b7f84ae765729582253ba003fae1db6646d4039f454","observation_id":"a5ac7940-a0d4-41ff-b608-f50d1645afd1","resolution":{"observed_at":"2026-05-16T08:10:45.780830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":"2204.06125","doi":"10.48550/arxiv.2204.06125","metadata_source":"pith","pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","venue":"cs.CV","work_id":"0c6a768b-70b8-4242-bb0e-459f1008c9fc","year":2022},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:05a5fc5e7f8e5ba920e12045def176485225f33ac2b4d9059487a6dbc40caa05","observation_id":"bbb82042-0c04-4499-b489-258e7ed117b3","resolution":{"observed_at":"2026-05-16T08:10:45.405370Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:50:02.412412+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:50:02.412412+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Editar: Unified conditional generation with autoregressive models","venue":null,"work_id":"657d56cb-a68c-4cf6-833f-28c2c3fc6bd7","year":2025},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:59b78aae4869f1f95abaea6d2f051c359f687091cbc2732aae80e83bb7871efa","observation_id":"c74b4f1c-bf74-4b2a-9e7b-fb2557d0ca09","resolution":{"observed_at":"2026-05-16T08:10:45.755586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dreamllm: Synergistic multimodal comprehension and creation","venue":null,"work_id":"1a210231-7c18-44be-bd99-7f7fde0ee68f","year":2024},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:3b016fce73cfbab03290440fda3c724459569f151d9421da214a6da4d9364588","observation_id":"162561b8-e3bc-4dc0-9713-cf16e2e016ae","resolution":{"observed_at":"2026-05-16T08:10:45.757683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Making llama SEE and draw with SEED tokenizer","venue":null,"work_id":"94843149-0f27-4291-b7b6-3072c2fdcd01","year":2024},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:cf39354ad5d27b9ad2b55deaf21406562d8d3446913893e7dd952a8c730df9e1","observation_id":"f8c49b79-879b-4924-8937-811ff85de83f","resolution":{"observed_at":"2026-05-16T08:10:45.753465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generative multimodal models are in-context learners","venue":null,"work_id":"a7a9745c-edbe-430b-8907-e07be2fbef41","year":2024},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:8ef934be30322f44f02a323dce184ea10ac8ee27464437ba2979a0bc15d68ab6","observation_id":"0811652f-8afe-46d0-8b30-a277f7896ff6","resolution":{"observed_at":"2026-05-16T08:10:45.759650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-09T20:05:31.409634Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":"2405.09818","doi":"10.48550/arxiv.2405.09818","metadata_source":"pith","pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","venue":"cs.CL","work_id":"2661b9a6-25cc-41a1-8100-612d2b801289","year":2024},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:542a5ce384a0f231601cd79c4c261713ecadd2cc0aa00233dcb645f2e29a2c6c","observation_id":"dd5d5985-839d-4291-93b7-1e67630c33c1","resolution":{"observed_at":"2026-05-16T08:10:45.438190Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-10T17:49:22.013335+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T17:49:22.013335+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.18391","last_updated":"2025-04-24T13:57:08Z","snapshot_observed_at":"2026-08-07T15:59:29.854852Z","submitted_at":"2025-04-24T13:57:08Z","title":"Fast Autoregressive Models for Continuous Latent Generation","version":1},"cited_work":{"arxiv_id":"2504.18391","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.18391","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fast autoregressive models for continuous latent generation","venue":null,"work_id":"61ab3312-1a28-4b61-8409-3f4678724b6d","year":2025},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"cited_paper":"/paper/2504.18391","citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:0dbe0647dd734baef28f26077075e89667f8344fd5c83f1679a17967907c30a9","observation_id":"71341f95-6b0e-4021-8355-fc1a89ee0e1d","resolution":{"observed_at":"2026-05-16T08:10:45.400026Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":"2409.18869","doi":"10.48550/arxiv.2409.18869","metadata_source":"pith","pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3: Next-Token Prediction is All You Need","venue":"cs.CV","work_id":"720d288e-fac0-464c-9929-19efd9a52afc","year":2024},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:fc551505424401459f49041e65e651da17c3a25f75b42b0ffbde08799eb08ae8","observation_id":"c73ac3a2-42b1-45da-becf-909d8e3220b9","resolution":{"observed_at":"2026-05-16T08:10:45.453837Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17762","last_updated":"2025-07-28T09:54:49Z","snapshot_observed_at":"2026-08-09T02:10:05.773976Z","submitted_at":"2024-11-26T03:33:52Z","title":"MUSE-VL: Modeling Unified VLM through Semantic Discrete Encoding","version":4},"cited_work":{"arxiv_id":"2411.17762","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.17762","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Muse- vl: Modeling unified vlm through semantic discrete encod- ing","venue":null,"work_id":"a34771da-5f50-4f35-89d6-0469541add33","year":2024},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"cited_paper":"/paper/2411.17762","citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:5c0deae0ab8b1c2f4c3e93e9d1835674d1c9be4716e90eb3ba6f039a908c0bbd","observation_id":"bac26ac1-be08-415c-9dd1-0396a829c3e6","resolution":{"observed_at":"2026-05-16T08:10:45.435592Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.01546","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T05:07:38.522042Z","title":"Growing visual generative capacity for pre-trained mllms","venue":null,"work_id":"f1e6e7a0-e385-4c7e-aaec-4b5f89e724a3","year":2025},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:080f47e02d4a176ffb7dd1b136b6c97dcb671a8ffdd51745086c46afddbf3574","observation_id":"9ce7f5c3-b503-4397-8d88-24575dcd997c","resolution":{"observed_at":"2026-05-16T08:10:45.423109Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05422","last_updated":"2025-08-15T08:56:27Z","snapshot_observed_at":"2026-08-07T15:48:42.775075Z","submitted_at":"2025-05-08T17:12:19Z","title":"TokLIP: Marry Visual Tokens to CLIP for Multimodal Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2505.05422","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.05422","snapshot_observed_at":"2026-07-04T16:39:58.252935Z","title":"arXiv preprint arXiv:2505.05422 (2025) 2, 4, 7, 9, 1","venue":null,"work_id":"0a372e74-f91a-42a7-b9c6-ec5dde3054f0","year":2025},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"cited_paper":"/paper/2505.05422","citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:ccd06e5f770eb117937dd1de8644584bbc3749f190aa33b5070f1308b2782ca1","observation_id":"96348008-d968-42c8-8185-94a74ee37817","resolution":{"observed_at":"2026-05-16T08:10:45.426729Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09568","last_updated":"2025-05-14T17:11:07Z","snapshot_observed_at":"2026-07-06T21:23:57.084147Z","submitted_at":"2025-05-14T17:11:07Z","title":"BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset","version":1},"cited_work":{"arxiv_id":"2505.09568","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.09568","snapshot_observed_at":"2026-07-08T00:04:22.585543Z","title":"BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset","venue":"cs.CV","work_id":"86d896d2-592f-4d9b-938e-dfeb11f9388f","year":2025},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"cited_paper":"/paper/2505.09568","citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:220bc9669965667cfc7eb8fc96ea463e6e61d8180608a8a6edccd17c1b24c1da","observation_id":"ce74419a-cfe0-465d-bdc3-0d5c16ebb065","resolution":{"observed_at":"2026-05-16T08:10:45.402600Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.15115","doi":"10.1145/3581783.3612503","metadata_source":"pith","pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5 Technical Report","venue":"cs.CL","work_id":"d8432992-4980-4a81-85c7-9fa2c2b87f85","year":2024},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:1f315beac7a24419bb91534b6407962b3a3988e22f1561b35b8f405affefcbd1","observation_id":"9564809d-8d73-4090-86f8-aff930f992f4","resolution":{"observed_at":"2026-05-16T08:10:45.383518Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05139","last_updated":"2025-03-10T14:21:21Z","snapshot_observed_at":"2026-08-07T23:26:41.225259Z","submitted_at":"2025-03-07T04:43:39Z","title":"Every FLOP Counts: Scaling a 300B Mixture-of-Experts LING LLM without Premium GPUs","version":2},"cited_work":{"arxiv_id":"2503.05139","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.05139","snapshot_observed_at":"2026-07-02T22:17:25.611807Z","title":"Every FLOP counts: Scaling a 300b mixture-of-experts LING LLM without premium gpus","venue":null,"work_id":"2c13c2fd-f905-4cc6-bf50-5eae1a041450","year":2025},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"cited_paper":"/paper/2503.05139","citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:bc81a2782f926df49b0551d2766c3addabffe813a922fd6c6c000b6b4898819c","observation_id":"1b850180-1e66-439a-bdf5-77e147eef537","resolution":{"observed_at":"2026-05-16T08:10:45.387048Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:c7bd68b4222a127656799b362833ad48af87d9f89db399a2cde95707cabc60de","observation_id":"7647c093-2e30-4c30-9f63-723d791a198c","resolution":{"observed_at":"2026-05-16T08:10:45.457354Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:17.350515+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:17.350515+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Show-o: One single transformer to unify multimodal understanding and generation","venue":null,"work_id":"d9c1ec06-af4b-4b99-964e-4b13fc42e32f","year":2025},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:0b3b511f0449b758b10a2a9caf3f7e0c3f63282087fab796a267bc04720c9ddd","observation_id":"8b9f8907-0f25-46dc-a9a2-5c41beab01f6","resolution":{"observed_at":"2026-05-16T08:10:45.799979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":"2501.17811","doi":"10.48550/arxiv.2501.17811","metadata_source":"pith","pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","venue":"cs.AI","work_id":"67d9e391-26d1-459e-ab56-07e60511c886","year":2025},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:59f7b93e40be4e28d4f4d57f91fbe08dcb41c084a12fbcc6369e2c468ea6d677","observation_id":"4e99df32-0fe6-4ef7-946f-5a06718290ea","resolution":{"observed_at":"2026-05-16T08:10:45.408310Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transfusion: Predict the next token and diffuse images with one multi-modal model","venue":null,"work_id":"bf194835-0c98-4453-98e4-a54120aa9d62","year":2025},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:e2f61b55168d2e6689c8db8a7e1beb0f56e71e3b5d7b373e18a763678023ce2c","observation_id":"6cac06bd-8777-46db-b8de-10d3e71de603","resolution":{"observed_at":"2026-05-16T08:10:45.795676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On variational bounds of mutual information","venue":null,"work_id":"7408336c-22ce-4c65-b7ad-70b3504a8ced","year":2019},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:3ad092c28c12478ce7609d8577ea60d8f007f0af0b287c2c0099356abf4c1df1","observation_id":"4812055c-79b7-4188-82ca-1604e579d2d9","resolution":{"observed_at":"2026-05-16T08:10:45.749404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Auto-encoding variational bayes","venue":null,"work_id":"39211457-08f6-4725-a42c-5bbc7b494223","year":2014},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:2c430655ee2168f0747afe19adc4dff9bbf9d2b2e5d60f79cf8229ada71d074a","observation_id":"a3d8fa67-8548-42b5-a608-00604d9ea937","resolution":{"observed_at":"2026-05-16T08:10:45.751544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":"1807.03748","doi":"10.1609/aaai.v36i10.21390","metadata_source":"pith","pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Representation Learning with Contrastive Predictive Coding","venue":"cs.LG","work_id":"7b08a1d4-d565-424e-9c86-6ef244b7b90a","year":2018},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:09d298e036a5dc807be6f41012d0d22f4f727334296755ecd9ea5768ae439905","observation_id":"5e83a1f2-e6a0-4416-bfc0-3efcd66b233b","resolution":{"observed_at":"2026-05-16T08:10:45.416560Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":"96cb7c94-4633-4333-a741-00ec90601c6b","year":2009},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:ab927d80022518fceb8ce85182edc97ff29f44033c5e89665ea6ec1cb2c9195c","observation_id":"301102f7-0ed1-4c7a-9843-725a2aef8112","resolution":{"observed_at":"2026-05-16T08:10:45.745019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Densefusion- 1m: Merging vision experts for comprehensive multimodal perception","venue":null,"work_id":"47e765cc-970c-4998-9117-7817bf268501","year":2024},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:bb142343ada60bb66af8fb275a244bfebbeebde1b0d572258fe7dc41dea10422","observation_id":"1418c44d-ca66-42ac-90b4-96d8302f9c50","resolution":{"observed_at":"2026-05-16T08:10:45.742991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"cited_work":{"arxiv_id":"2506.23044","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.23044","snapshot_observed_at":"2026-07-05T16:51:14.255860Z","title":"Ovis-u1 technical report","venue":"cs.CV","work_id":"1c86f77c-ccaa-442a-a1a1-951ddd663c61","year":2025},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"cited_paper":"/paper/2506.23044","citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:aeeea79690debbb6fc1803bd18a2e63ebd5de1df1bae97fc7df7e6f9ba028133","observation_id":"388417b9-e942-4903-b2e5-7420ab00a381","resolution":{"observed_at":"2026-05-16T08:10:45.413995Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":"2504.10479","doi":"10.48550/arxiv.2504.10479","metadata_source":"pith","pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","venue":"cs.CV","work_id":"fe8637aa-12bc-4434-8d36-9f57b5eebcbe","year":2025},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:a8bb68c0f72a386c8ba946acd1d896e09e12ff766b549783df50e39c317efa4c","observation_id":"61790730-dd59-45b0-b2ef-d2984ff3aae1","resolution":{"observed_at":"2026-05-16T08:10:45.449189Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":0,"verified_exact":26,"verified_fuzzy":33},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 0 inbound Pith citation observations for arXiv:2602.01554."}