{"as_of":"2026-07-23T14:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a590a26024f30d056748bd7716504dff97f447d5a83a684ba9e822618ac89691","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-16T12:48:53.670343Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-07-23T06:31:01.910684+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2602.12286/citation-record","integrity":"/paper/2602.12286/integrity","json":"/paper/2602.12286/citation-record.json","paper":"/paper/2602.12286"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flamingo: a visual language model for few-shot learning.Advances in neural information pro- cessing systems, 35:23716–23736","venue":null,"work_id":"e8701dea-8ad8-4b3e-9afb-4fb8783ce174","year":2022},"citing_paper":{"arxiv_id":"2602.12286","last_updated":"2026-05-08T11:20:50Z","snapshot_observed_at":"2026-07-06T22:45:39.557598Z","submitted_at":"2026-01-21T07:46:36Z","title":"Mind the Gap No More: Achieving Zero-Gap Multimodal Integration via One Tokenizer","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T12:48:53.670343Z"},"links":{"citing_paper":"/paper/2602.12286"},"observation_digest":"sha256:6a9b6fc647e5b01309d4f2fdb671b1dbc100d8d5b22422df954a0a625a8d9a50","observation_id":"cede7ccc-c9cd-4fb5-9ce2-25ec1532e5e8","resolution":{"observed_at":"2026-05-16T12:50:55.543957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04160","last_updated":"2023-05-22T02:37:02Z","snapshot_observed_at":"2026-07-06T15:24:11.368819Z","submitted_at":"2023-05-07T02:25:42Z","title":"X-LLM: Bootstrapping Advanced Large Language Models by Treating Multi-Modalities as Foreign Languages","version":3},"cited_work":{"arxiv_id":"2305.04160","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.04160","snapshot_observed_at":"2026-07-04T08:39:42.124794Z","title":"X-LLM: Bootstrapping advanced large language models by treating multi-modalities as foreign languages.arXiv preprint arXiv:2305.04160","venue":null,"work_id":"c6e0ca26-c27e-4cd1-9f47-b567668fd136","year":2023},"citing_paper":{"arxiv_id":"2602.12286","last_updated":"2026-05-08T11:20:50Z","snapshot_observed_at":"2026-07-06T22:45:39.557598Z","submitted_at":"2026-01-21T07:46:36Z","title":"Mind the Gap No More: Achieving Zero-Gap Multimodal Integration via One Tokenizer","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-16T12:48:53.670343Z"},"links":{"cited_paper":"/paper/2305.04160","citing_paper":"/paper/2602.12286"},"observation_digest":"sha256:92a420aaef8d2375a262188d6b648216adb463463b8e94b5edbe19026d984fc1","observation_id":"bc4966ec-5a15-456b-afd5-a32aa1e27991","resolution":{"observed_at":"2026-05-16T12:50:54.974623Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual- linguistic tasks","venue":null,"work_id":"083a3a56-57c4-49a6-b592-a7d8a41f3016","year":2024},"citing_paper":{"arxiv_id":"2602.12286","last_updated":"2026-05-08T11:20:50Z","snapshot_observed_at":"2026-07-06T22:45:39.557598Z","submitted_at":"2026-01-21T07:46:36Z","title":"Mind the Gap No More: Achieving Zero-Gap Multimodal Integration via One Tokenizer","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-16T12:48:53.670343Z"},"links":{"citing_paper":"/paper/2602.12286"},"observation_digest":"sha256:529ffe2c38436d82c7492040066d491fa5c2ab0db0904c1a51f75bf8bda3907f","observation_id":"030af5b8-e917-48e0-9908-63318f1f32d2","resolution":{"observed_at":"2026-05-16T12:50:55.563985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nucleotide transformer: building and evaluating robust foundation models for human genomics","venue":null,"work_id":"6e32ade3-4e6f-4809-9f0c-42563e36ce72","year":2025},"citing_paper":{"arxiv_id":"2602.12286","last_updated":"2026-05-08T11:20:50Z","snapshot_observed_at":"2026-07-06T22:45:39.557598Z","submitted_at":"2026-01-21T07:46:36Z","title":"Mind the Gap No More: Achieving Zero-Gap Multimodal Integration via One Tokenizer","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-16T12:48:53.670343Z"},"links":{"citing_paper":"/paper/2602.12286"},"observation_digest":"sha256:4b6c035ba34b804c37d85aeef162154cb004978f9dfd69097614226cb696e88e","observation_id":"5bd06aca-5da9-45c9-8ba0-09b7034d1941","resolution":{"observed_at":"2026-05-16T12:50:55.554839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A multimodal conversational agent for dna, rna and protein tasks.Nature Machine Intelligence, pages 1–14","venue":null,"work_id":"2c795211-acb4-435f-96c3-72d5b3ddfe55","year":2025},"citing_paper":{"arxiv_id":"2602.12286","last_updated":"2026-05-08T11:20:50Z","snapshot_observed_at":"2026-07-06T22:45:39.557598Z","submitted_at":"2026-01-21T07:46:36Z","title":"Mind the Gap No More: Achieving Zero-Gap Multimodal Integration via One Tokenizer","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T12:48:53.670343Z"},"links":{"citing_paper":"/paper/2602.12286"},"observation_digest":"sha256:94ec7868ffe502be2024e7e03ea8e127c674b25372a3ab545721ca6c24f884d5","observation_id":"e32f8657-889e-4a48-8fe6-1670b1733959","resolution":{"observed_at":"2026-05-16T12:50:55.541510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Genechat: A multi-modal large language model for gene function prediction","venue":null,"work_id":"e8c7c3c6-3485-46cb-b1cd-1841d66875e4","year":2025},"citing_paper":{"arxiv_id":"2602.12286","last_updated":"2026-05-08T11:20:50Z","snapshot_observed_at":"2026-07-06T22:45:39.557598Z","submitted_at":"2026-01-21T07:46:36Z","title":"Mind the Gap No More: Achieving Zero-Gap Multimodal Integration via One Tokenizer","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-16T12:48:53.670343Z"},"links":{"citing_paper":"/paper/2602.12286"},"observation_digest":"sha256:f2f971a8882a972b5ef618dd7f6946831cb8202f3d6982dd5df8ad4e483a0332","observation_id":"efd767d6-fae2-4828-8581-a401a3e03812","resolution":{"observed_at":"2026-05-16T12:50:55.536982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.17257","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T08:16:47.444956Z","title":"Janusdna: A powerful bi-directional hybrid dna foundation model.arXiv preprint arXiv:2505.17257","venue":null,"work_id":"85279ff7-18bd-4b08-9f1b-17d1d8e78485","year":2025},"citing_paper":{"arxiv_id":"2602.12286","last_updated":"2026-05-08T11:20:50Z","snapshot_observed_at":"2026-07-06T22:45:39.557598Z","submitted_at":"2026-01-21T07:46:36Z","title":"Mind the Gap No More: Achieving Zero-Gap Multimodal Integration via One Tokenizer","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-16T12:48:53.670343Z"},"links":{"citing_paper":"/paper/2602.12286"},"observation_digest":"sha256:cf2eed45838c578d3792a94199ac8e21fce1b48947751a0fb4d1360646aef4bf","observation_id":"3aa576ab-78f7-4dd9-9242-b9e0a8814869","resolution":{"observed_at":"2026-05-16T12:50:54.986933Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.23579","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T22:17:26.256553Z","title":"Bioreason: Incentivizing multi- modal biological reasoning within a dna-llm model.arXiv preprint arXiv:2505.23579","venue":null,"work_id":"8861aafe-4d29-48a0-9583-61217d78044d","year":2025},"citing_paper":{"arxiv_id":"2602.12286","last_updated":"2026-05-08T11:20:50Z","snapshot_observed_at":"2026-07-06T22:45:39.557598Z","submitted_at":"2026-01-21T07:46:36Z","title":"Mind the Gap No More: Achieving Zero-Gap Multimodal Integration via One Tokenizer","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T12:48:53.670343Z"},"links":{"citing_paper":"/paper/2602.12286"},"observation_digest":"sha256:d9618d64bb2a19618ffdf326a67116692a0b63ba6cd371707563866c9f70d86c","observation_id":"074a0ee9-6299-4fbc-bfe6-ce8a59c5a8d5","resolution":{"observed_at":"2026-05-16T12:50:55.004072Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dnabert: pre-trained bidirectional en- coder representations from transformers model for dna- language in genome.Bioinformatics, 37(15):2112–2120","venue":null,"work_id":"59aa80ce-a8f8-49aa-aa94-d070baeb33ea","year":2021},"citing_paper":{"arxiv_id":"2602.12286","last_updated":"2026-05-08T11:20:50Z","snapshot_observed_at":"2026-07-06T22:45:39.557598Z","submitted_at":"2026-01-21T07:46:36Z","title":"Mind the Gap No More: Achieving Zero-Gap Multimodal Integration via One Tokenizer","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-16T12:48:53.670343Z"},"links":{"citing_paper":"/paper/2602.12286"},"observation_digest":"sha256:a81e52366a48e6748b7ed4fc7147a93880e1e19f725c8cc517543967988e6c24","observation_id":"83ac525d-d89a-4dc5-ad46-42fdde1b8c14","resolution":{"observed_at":"2026-05-16T12:50:55.546053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Blip-2: Bootstrapping language-image pre- training with frozen image encoders and large language models","venue":null,"work_id":"f9cdeac3-2b4d-4874-a0f7-13c9a89e095c","year":2023},"citing_paper":{"arxiv_id":"2602.12286","last_updated":"2026-05-08T11:20:50Z","snapshot_observed_at":"2026-07-06T22:45:39.557598Z","submitted_at":"2026-01-21T07:46:36Z","title":"Mind the Gap No More: Achieving Zero-Gap Multimodal Integration via One Tokenizer","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T12:48:53.670343Z"},"links":{"citing_paper":"/paper/2602.12286"},"observation_digest":"sha256:0ebdc944eb894eb83da3c1b7ba2532a8836a7dd0a04cccb1846d685d7979b739","observation_id":"88b86379-46da-429f-b762-734533c4d46b","resolution":{"observed_at":"2026-05-16T12:50:55.539165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916","venue":null,"work_id":"796cba48-96d7-4bec-b6c7-353c2bf0e29e","year":2023},"citing_paper":{"arxiv_id":"2602.12286","last_updated":"2026-05-08T11:20:50Z","snapshot_observed_at":"2026-07-06T22:45:39.557598Z","submitted_at":"2026-01-21T07:46:36Z","title":"Mind the Gap No More: Achieving Zero-Gap Multimodal Integration via One Tokenizer","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T12:48:53.670343Z"},"links":{"citing_paper":"/paper/2602.12286"},"observation_digest":"sha256:9275a063f078b60225d9a1def09c258ef1d346f88ce90e8aaf418aa9c86aef98","observation_id":"91db1013-ff92-41f0-b6db-f489661d4d6c","resolution":{"observed_at":"2026-05-16T12:50:55.571839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"b89ce06f-4c3c-44d0-8e56-437d233574e0","year":2024},"citing_paper":{"arxiv_id":"2602.12286","last_updated":"2026-05-08T11:20:50Z","snapshot_observed_at":"2026-07-06T22:45:39.557598Z","submitted_at":"2026-01-21T07:46:36Z","title":"Mind the Gap No More: Achieving Zero-Gap Multimodal Integration via One Tokenizer","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-16T12:48:53.670343Z"},"links":{"citing_paper":"/paper/2602.12286"},"observation_digest":"sha256:fcc22b8c264ee1d31ae1c19fb6cc3fbb8dda7fcfb23616c65b0ba52a82bf793c","observation_id":"1cc5ccb8-20b8-4079-9d23-61ec287a0e8f","resolution":{"observed_at":"2026-05-16T12:50:55.534861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.03426","last_updated":"2020-09-18T01:56:41Z","snapshot_observed_at":"2026-07-06T06:22:38.694078Z","submitted_at":"2018-02-09T19:39:33Z","title":"UMAP: Uniform Manifold Approximation and Projection for Dimension Reduction","version":3},"cited_work":{"arxiv_id":"1802.03426","doi":"10.1037/adb0001138","metadata_source":"pith","pith_arxiv_id":"1802.03426","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"UMAP: Uniform Manifold Approximation and Projection for Dimension Reduction","venue":"stat.ML","work_id":"54c15172-6304-4008-a3b6-c4cc0803c054","year":2018},"citing_paper":{"arxiv_id":"2602.12286","last_updated":"2026-05-08T11:20:50Z","snapshot_observed_at":"2026-07-06T22:45:39.557598Z","submitted_at":"2026-01-21T07:46:36Z","title":"Mind the Gap No More: Achieving Zero-Gap Multimodal Integration via One Tokenizer","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-16T12:48:53.670343Z"},"links":{"cited_paper":"/paper/1802.03426","citing_paper":"/paper/2602.12286"},"observation_digest":"sha256:90f12f1e4059e5ab3ea1e9295a5c76c92672d2defd1ae332112cbbec90643fb5","observation_id":"50c45b3b-825e-402f-98fe-6a7de3dd960d","resolution":{"observed_at":"2026-05-16T12:50:54.993382Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-05-25T15:24:07.856203+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T15:24:07.856203+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A comprehensive overview of large language models","venue":null,"work_id":"2e091605-0026-4337-951e-cbbbfa4126c2","year":2025},"citing_paper":{"arxiv_id":"2602.12286","last_updated":"2026-05-08T11:20:50Z","snapshot_observed_at":"2026-07-06T22:45:39.557598Z","submitted_at":"2026-01-21T07:46:36Z","title":"Mind the Gap No More: Achieving Zero-Gap Multimodal Integration via One Tokenizer","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-16T12:48:53.670343Z"},"links":{"citing_paper":"/paper/2602.12286"},"observation_digest":"sha256:b59567b737133af66ca419eeb39d6f8153ec9a17ee9dc8379e6445a8cb644dae","observation_id":"992fbedf-4b7e-4fc3-bf17-5a091041fa30","resolution":{"observed_at":"2026-05-16T12:50:55.558836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generative ar- tificial intelligence for advancing discovery and design in biomateriomics.Intelligent Computing, 4:0117","venue":null,"work_id":"7628a586-c490-4519-a2d8-8f2a09273388","year":2025},"citing_paper":{"arxiv_id":"2602.12286","last_updated":"2026-05-08T11:20:50Z","snapshot_observed_at":"2026-07-06T22:45:39.557598Z","submitted_at":"2026-01-21T07:46:36Z","title":"Mind the Gap No More: Achieving Zero-Gap Multimodal Integration via One Tokenizer","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-16T12:48:53.670343Z"},"links":{"citing_paper":"/paper/2602.12286"},"observation_digest":"sha256:ea89c2115fc22f005e4f42e35a0ff000d8d4af11cbb3734b06b2ee94590a2e43","observation_id":"1e3e42e1-237d-410f-9276-92f32f005cd2","resolution":{"observed_at":"2026-05-16T12:50:55.548088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T17:34:01.596157Z","title":"Learning transferable visual models from nat- ural language supervision","venue":null,"work_id":"5b239317-3e4d-4221-9f81-44cbfe713221","year":2021},"citing_paper":{"arxiv_id":"2602.12286","last_updated":"2026-05-08T11:20:50Z","snapshot_observed_at":"2026-07-06T22:45:39.557598Z","submitted_at":"2026-01-21T07:46:36Z","title":"Mind the Gap No More: Achieving Zero-Gap Multimodal Integration via One Tokenizer","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-16T12:48:53.670343Z"},"links":{"citing_paper":"/paper/2602.12286"},"observation_digest":"sha256:705d0d41cd7599f937d2b65079d3b8bee0500060ed897b2a522ae9e506516305","observation_id":"63d18fe9-bd9a-4a27-a07c-edc9a37d5d2b","resolution":{"observed_at":"2026-05-16T12:50:55.552698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.09378","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Context-aware regularization with markovian in- tegration for attention-based nucleotide analysis.arXiv preprint arXiv:2507.09378","venue":null,"work_id":"b7a30d26-e9bc-4ad8-899d-e0be5eba3d4d","year":2025},"citing_paper":{"arxiv_id":"2602.12286","last_updated":"2026-05-08T11:20:50Z","snapshot_observed_at":"2026-07-06T22:45:39.557598Z","submitted_at":"2026-01-21T07:46:36Z","title":"Mind the Gap No More: Achieving Zero-Gap Multimodal Integration via One Tokenizer","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-16T12:48:53.670343Z"},"links":{"citing_paper":"/paper/2602.12286"},"observation_digest":"sha256:470e45d27c267d948efde1058a65fa497ea4210096fb1de68bf717be832b4fcc","observation_id":"8f330759-e874-4fdc-beb7-1f063f459661","resolution":{"observed_at":"2026-05-16T12:50:54.975971Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Caduceus: Bi-directional equivariant long-range dna se- quence modeling.Proceedings of machine learning re- search, 235:43632","venue":null,"work_id":"baea337b-54c1-4217-9e96-602b6b790e7f","year":2024},"citing_paper":{"arxiv_id":"2602.12286","last_updated":"2026-05-08T11:20:50Z","snapshot_observed_at":"2026-07-06T22:45:39.557598Z","submitted_at":"2026-01-21T07:46:36Z","title":"Mind the Gap No More: Achieving Zero-Gap Multimodal Integration via One Tokenizer","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T12:48:53.670343Z"},"links":{"citing_paper":"/paper/2602.12286"},"observation_digest":"sha256:51bbdc1a85601e1abc7093c567c2aeae88e77de1133d62195913179e752647af","observation_id":"39a22a3c-849d-437f-a6c1-9e3054f90f36","resolution":{"observed_at":"2026-05-16T12:50:55.569516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chatgpt: Optimizing language models for dialogue.OpenAI blog, 2(4)","venue":null,"work_id":"f2cacd95-ca7d-4cb3-aa81-6a776e7cc356","year":2022},"citing_paper":{"arxiv_id":"2602.12286","last_updated":"2026-05-08T11:20:50Z","snapshot_observed_at":"2026-07-06T22:45:39.557598Z","submitted_at":"2026-01-21T07:46:36Z","title":"Mind the Gap No More: Achieving Zero-Gap Multimodal Integration via One Tokenizer","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-16T12:48:53.670343Z"},"links":{"citing_paper":"/paper/2602.12286"},"observation_digest":"sha256:db8d0c0d65ef63cc006c537d334724a6116931d1685aa9d750c04b5c14bdcf8b","observation_id":"c7f39d7b-c367-466f-832d-a4b2584f7d91","resolution":{"observed_at":"2026-05-16T12:50:55.556865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Neural machine translation of rare words with subword units","venue":null,"work_id":"6f359119-7396-467b-9059-85a9c913f7c9","year":2016},"citing_paper":{"arxiv_id":"2602.12286","last_updated":"2026-05-08T11:20:50Z","snapshot_observed_at":"2026-07-06T22:45:39.557598Z","submitted_at":"2026-01-21T07:46:36Z","title":"Mind the Gap No More: Achieving Zero-Gap Multimodal Integration via One Tokenizer","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-16T12:48:53.670343Z"},"links":{"citing_paper":"/paper/2602.12286"},"observation_digest":"sha256:8c60751aad4535445bbc9c1f85bec4f2faea8dac5cc38d4656fb160d43e30372","observation_id":"7c91389a-7dae-40df-a81f-9730bfca157e","resolution":{"observed_at":"2026-05-16T12:50:55.550304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16355","last_updated":"2023-05-25T04:16:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-25T04:16:07Z","title":"PandaGPT: One Model To Instruction-Follow Them All","version":1},"cited_work":{"arxiv_id":"2305.16355","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.16355","snapshot_observed_at":"2026-07-04T01:19:20.316187Z","title":"PandaGPT: One Model To Instruction-Follow Them All","venue":"cs.CL","work_id":"b3689b4d-65c2-45ae-84da-01b291742486","year":2023},"citing_paper":{"arxiv_id":"2602.12286","last_updated":"2026-05-08T11:20:50Z","snapshot_observed_at":"2026-07-06T22:45:39.557598Z","submitted_at":"2026-01-21T07:46:36Z","title":"Mind the Gap No More: Achieving Zero-Gap Multimodal Integration via One Tokenizer","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-16T12:48:53.670343Z"},"links":{"cited_paper":"/paper/2305.16355","citing_paper":"/paper/2602.12286"},"observation_digest":"sha256:d898ecb6548a426a376dbb492aee3cb1ddeaa8d9a3a1782826f7a1df9b64b261","observation_id":"bba3e6f3-554a-478e-ba37-a5ca803aed9f","resolution":{"observed_at":"2026-05-16T12:50:54.983126Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05222","last_updated":"2024-05-08T02:46:43Z","snapshot_observed_at":"2026-07-06T15:52:36.416440Z","submitted_at":"2023-07-11T12:45:39Z","title":"Emu: Generative Pretraining in Multimodality","version":2},"cited_work":{"arxiv_id":"2307.05222","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.05222","snapshot_observed_at":"2026-07-04T10:09:44.721463Z","title":"Emu: Generative Pretraining in Multimodality","venue":"cs.CV","work_id":"d20ff802-68ef-4783-943f-7bf17acb6a68","year":2023},"citing_paper":{"arxiv_id":"2602.12286","last_updated":"2026-05-08T11:20:50Z","snapshot_observed_at":"2026-07-06T22:45:39.557598Z","submitted_at":"2026-01-21T07:46:36Z","title":"Mind the Gap No More: Achieving Zero-Gap Multimodal Integration via One Tokenizer","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-16T12:48:53.670343Z"},"links":{"cited_paper":"/paper/2307.05222","citing_paper":"/paper/2602.12286"},"observation_digest":"sha256:0e26788b0a041dcd53fa865006b526c5c7aef049a419f40b6cf7df7358c8e398","observation_id":"c6b5cc46-2869-4679-a03a-b10f9ad36b3d","resolution":{"observed_at":"2026-05-16T20:22:11.462164Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":"2405.09818","doi":"10.48550/arxiv.2405.09818","metadata_source":"pith","pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-07-10T07:36:58.000502Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","venue":"cs.CL","work_id":"2661b9a6-25cc-41a1-8100-612d2b801289","year":2024},"citing_paper":{"arxiv_id":"2602.12286","last_updated":"2026-05-08T11:20:50Z","snapshot_observed_at":"2026-07-06T22:45:39.557598Z","submitted_at":"2026-01-21T07:46:36Z","title":"Mind the Gap No More: Achieving Zero-Gap Multimodal Integration via One Tokenizer","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-16T12:48:53.670343Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2602.12286"},"observation_digest":"sha256:3968d2d94084fb59dece41a34d3fa544445eb0a257fe2c0cb0c9814a9f9ede29","observation_id":"9f93216d-3c3a-494a-ba12-6a9063e84991","resolution":{"observed_at":"2026-05-16T12:50:55.015355Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-10T17:49:22.013335+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T17:49:22.013335+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T10:13:40.911049Z","title":"Attention is all you need.Advances in neural information processing systems, 30","venue":null,"work_id":"ce925c33-3953-4a3a-bec2-824c6d3446fe","year":2017},"citing_paper":{"arxiv_id":"2602.12286","last_updated":"2026-05-08T11:20:50Z","snapshot_observed_at":"2026-07-06T22:45:39.557598Z","submitted_at":"2026-01-21T07:46:36Z","title":"Mind the Gap No More: Achieving Zero-Gap Multimodal Integration via One Tokenizer","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-16T12:48:53.670343Z"},"links":{"citing_paper":"/paper/2602.12286"},"observation_digest":"sha256:c457ee80499d48deb3b68c4a09dd26c7c2557405f3bd19ff9e252316cd00aef8","observation_id":"d8db81ea-dea5-4161-8fbb-ad3b7326192e","resolution":{"observed_at":"2026-05-16T12:50:55.574248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":"2409.18869","doi":"10.48550/arxiv.2409.18869","metadata_source":"pith","pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-07-10T06:36:52.573462Z","title":"Emu3: Next-Token Prediction is All You Need","venue":"cs.CV","work_id":"720d288e-fac0-464c-9929-19efd9a52afc","year":2024},"citing_paper":{"arxiv_id":"2602.12286","last_updated":"2026-05-08T11:20:50Z","snapshot_observed_at":"2026-07-06T22:45:39.557598Z","submitted_at":"2026-01-21T07:46:36Z","title":"Mind the Gap No More: Achieving Zero-Gap Multimodal Integration via One Tokenizer","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-16T12:48:53.670343Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2602.12286"},"observation_digest":"sha256:0d0dd6d210811ae5e07d7239534948ae5e010b862de5b619698f3d31c0916b66","observation_id":"f47d4f76-1805-49e3-9c3f-295f98117fea","resolution":{"observed_at":"2026-05-16T12:50:54.990106Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Omnireg-gpt: a high-efficiency foundation model for comprehensive genomic sequence understanding.Na- ture Communications, 16(1):10139","venue":null,"work_id":"e93a32ea-bf66-4634-afd1-4bd0c1ddc3ac","year":2025},"citing_paper":{"arxiv_id":"2602.12286","last_updated":"2026-05-08T11:20:50Z","snapshot_observed_at":"2026-07-06T22:45:39.557598Z","submitted_at":"2026-01-21T07:46:36Z","title":"Mind the Gap No More: Achieving Zero-Gap Multimodal Integration via One Tokenizer","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-16T12:48:53.670343Z"},"links":{"citing_paper":"/paper/2602.12286"},"observation_digest":"sha256:565ed2295a687a447ac4988af15cc5b4b2ee3bf0bc57d781942fc0a7d311c800","observation_id":"f59862fc-9abe-43b0-83f2-877f582d861a","resolution":{"observed_at":"2026-05-16T12:50:55.576518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Genecom- pass: deciphering universal gene regulatory mecha- nisms with a knowledge-informed cross-species founda- tion model.Cell Research, 34(12):830–845","venue":null,"work_id":"4e36ec7b-3e83-4f0b-a4f6-03bd1dd3eb6d","year":2024},"citing_paper":{"arxiv_id":"2602.12286","last_updated":"2026-05-08T11:20:50Z","snapshot_observed_at":"2026-07-06T22:45:39.557598Z","submitted_at":"2026-01-21T07:46:36Z","title":"Mind the Gap No More: Achieving Zero-Gap Multimodal Integration via One Tokenizer","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-16T12:48:53.670343Z"},"links":{"citing_paper":"/paper/2602.12286"},"observation_digest":"sha256:80f47ac442d1390436c4cc63463c5d6ab18afe736dda698585e60ba5e582fc58","observation_id":"e031e524-0914-40b0-b861-658ab8f078c3","resolution":{"observed_at":"2026-05-16T12:50:55.561421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2602.12286","last_updated":"2026-05-08T11:20:50Z","snapshot_observed_at":"2026-07-06T22:45:39.557598Z","submitted_at":"2026-01-21T07:46:36Z","title":"Mind the Gap No More: Achieving Zero-Gap Multimodal Integration via One Tokenizer","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-16T12:48:53.670343Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2602.12286"},"observation_digest":"sha256:98b2b1d8483a741308fdfaa36f2cbf284e3e0d087be5a7ca03772be938711283","observation_id":"f03b4a70-2cbf-49ac-8a85-fb9e6a19f43e","resolution":{"observed_at":"2026-05-16T12:50:54.996941Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"f622973b-fbe8-49fb-b882-2787a2a3f1f6","year":2023},"citing_paper":{"arxiv_id":"2602.12286","last_updated":"2026-05-08T11:20:50Z","snapshot_observed_at":"2026-07-06T22:45:39.557598Z","submitted_at":"2026-01-21T07:46:36Z","title":"Mind the Gap No More: Achieving Zero-Gap Multimodal Integration via One Tokenizer","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-16T12:48:53.670343Z"},"links":{"citing_paper":"/paper/2602.12286"},"observation_digest":"sha256:6e3afde07543cccc8af0ac9de43dcae5d6cd31789d528ce01f87454660d307ff","observation_id":"fb97339c-b57e-42ac-9e75-6dd7ce1648d2","resolution":{"observed_at":"2026-05-16T12:50:55.566781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":"2306.02858","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-07-04T16:29:57.761121Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","venue":"cs.CL","work_id":"555cf04a-49a7-44b8-9019-a83ce85ace95","year":2023},"citing_paper":{"arxiv_id":"2602.12286","last_updated":"2026-05-08T11:20:50Z","snapshot_observed_at":"2026-07-06T22:45:39.557598Z","submitted_at":"2026-01-21T07:46:36Z","title":"Mind the Gap No More: Achieving Zero-Gap Multimodal Integration via One Tokenizer","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-16T12:48:53.670343Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2602.12286"},"observation_digest":"sha256:3c19475b230080cd496be23c2943eda093a5af93ab90e46e7ac0a3f4d50f37b8","observation_id":"2a999c83-d40c-4fb3-b8c7-86768ed8ce66","resolution":{"observed_at":"2026-05-16T12:50:55.000096Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10415","last_updated":"2024-09-08T01:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T17:50:16Z","title":"PMC-VQA: Visual Instruction Tuning for Medical Visual Question Answering","version":6},"cited_work":{"arxiv_id":"2305.10415","doi":"10.48550/arxiv.2305.10415","metadata_source":"pith","pith_arxiv_id":"2305.10415","snapshot_observed_at":"2026-07-10T18:57:31.556061Z","title":"PMC-VQA: Visual Instruction Tuning for Medical Visual Question Answering","venue":"cs.CV","work_id":"c8726e94-2bdf-4008-9942-e5228fc1fa64","year":2023},"citing_paper":{"arxiv_id":"2602.12286","last_updated":"2026-05-08T11:20:50Z","snapshot_observed_at":"2026-07-06T22:45:39.557598Z","submitted_at":"2026-01-21T07:46:36Z","title":"Mind the Gap No More: Achieving Zero-Gap Multimodal Integration via One Tokenizer","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-16T12:48:53.670343Z"},"links":{"cited_paper":"/paper/2305.10415","citing_paper":"/paper/2602.12286"},"observation_digest":"sha256:edacc5f98e1d7a79ad5e40dd0163d0d90851a065bd5c6398d076eb0d6385f4eb","observation_id":"ad21b9e0-6614-4731-9d1d-4c7867a4de31","resolution":{"observed_at":"2026-05-16T12:50:55.011715Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.02567","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:36:58.031623Z","title":"Unified multimodal understanding and generation models: Advances, challenges, and opportunities.arXiv preprint arXiv:2505.02567","venue":null,"work_id":"b2e70f99-2155-4021-82c3-540574140c6a","year":2025},"citing_paper":{"arxiv_id":"2602.12286","last_updated":"2026-05-08T11:20:50Z","snapshot_observed_at":"2026-07-06T22:45:39.557598Z","submitted_at":"2026-01-21T07:46:36Z","title":"Mind the Gap No More: Achieving Zero-Gap Multimodal Integration via One Tokenizer","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-16T12:48:53.670343Z"},"links":{"citing_paper":"/paper/2602.12286"},"observation_digest":"sha256:a99e6766f9a99b59e6fdc830ceb125723b2ddc643e61846ffcad99bd828b1876","observation_id":"6123afe3-c387-4df9-a7b7-d7a179826be7","resolution":{"observed_at":"2026-05-16T12:50:54.979634Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2602.12286","last_updated":"2026-05-08T11:20:50Z","latest_version":2,"primary_category":"q-bio.GN","snapshot_observed_at":"2026-07-06T22:45:39.557598Z","submitted_at":"2026-01-21T07:46:36Z","title":"Mind the Gap No More: Achieving Zero-Gap Multimodal Integration via One Tokenizer"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":13,"verified_fuzzy":19},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"thesis":"As of 23 July 2026, this Paper Citation Record lists 32 of 32 outbound references and 0 inbound Pith citation observations for arXiv:2602.12286."}