{"as_of":"2026-08-07T00:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c13faa4b8d4e69c74b64c1ae60e794c5a41d7fe374e1f51d70ba790548652e50","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T23:41:25.275207Z","state":"measured"},{"denominator":75,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":75,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":17,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T11:55:27.994286Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T13:37:06.881254Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2604.24763","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.24763","snapshot_observed_at":"2026-07-10T13:37:06.881254Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"6d1815d2-46f1-4217-a874-f25ae24be85c","year":2026},"citing_paper":{"arxiv_id":"2605.08029","last_updated":"2026-05-08T17:14:43Z","snapshot_observed_at":"2026-07-06T23:20:19.821342Z","submitted_at":"2026-05-08T17:14:43Z","title":"STARFlow2: Bridging Language Models and Normalizing Flows for Unified Multimodal Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-11T02:44:59.644215Z"},"links":{"cited_paper":"/paper/2604.24763","citing_paper":"/paper/2605.08029"},"observation_digest":"sha256:6fda0218e634ea055200bb5fc15057804f1376d2903fb3682af6e9431231ae6c","observation_id":"5cd4c18f-214b-4a12-8456-b454291dc81c","resolution":{"observed_at":"2026-05-11T02:45:57.023589Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2604.24763","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.24763","snapshot_observed_at":"2026-07-10T13:37:06.881254Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"6d1815d2-46f1-4217-a874-f25ae24be85c","year":2026},"citing_paper":{"arxiv_id":"2605.12271","last_updated":"2026-05-26T13:34:33Z","snapshot_observed_at":"2026-08-03T01:41:22.691646Z","submitted_at":"2026-05-12T15:35:34Z","title":"Beyond Text Prompts: Visual-to-Visual Generation as A Unified Paradigm","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-13T06:02:39.114660Z"},"links":{"cited_paper":"/paper/2604.24763","citing_paper":"/paper/2605.12271"},"observation_digest":"sha256:879feeeab971407360be5bc13e1875e98c2149959982831decb0ebd6aa78a6c8","observation_id":"79cb73b9-d6e8-4043-be91-48f40f65f8aa","resolution":{"observed_at":"2026-05-13T06:07:22.907523Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2604.24763","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.24763","snapshot_observed_at":"2026-07-10T13:37:06.881254Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"6d1815d2-46f1-4217-a874-f25ae24be85c","year":2026},"citing_paper":{"arxiv_id":"2605.12271","last_updated":"2026-05-26T13:34:33Z","snapshot_observed_at":"2026-08-03T01:41:22.691646Z","submitted_at":"2026-05-12T15:35:34Z","title":"Beyond Text Prompts: Visual-to-Visual Generation as A Unified Paradigm","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-30T22:18:55.933311Z"},"links":{"cited_paper":"/paper/2604.24763","citing_paper":"/paper/2605.12271"},"observation_digest":"sha256:465c7291b52ca484e81e4506220bb3693b0a02531d42d4a453127a250c029e37","observation_id":"f919d687-9f33-4bbc-91b7-f97d15e76730","resolution":{"observed_at":"2026-07-01T14:05:46.658675Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2604.24763","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.24763","snapshot_observed_at":"2026-07-10T13:37:06.881254Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"6d1815d2-46f1-4217-a874-f25ae24be85c","year":2026},"citing_paper":{"arxiv_id":"2605.12500","last_updated":"2026-05-12T17:59:58Z","snapshot_observed_at":"2026-07-06T23:24:13.851504Z","submitted_at":"2026-05-12T17:59:58Z","title":"SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-13T05:12:37.339084Z"},"links":{"cited_paper":"/paper/2604.24763","citing_paper":"/paper/2605.12500"},"observation_digest":"sha256:273b55cfe03ac9e9f11e40fea7c65533879be3865f65561f35faa300978d42e6","observation_id":"7e87a0de-826d-44e1-b9fd-4df531930344","resolution":{"observed_at":"2026-05-13T05:17:18.656071Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2604.24763","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.24763","snapshot_observed_at":"2026-07-10T13:37:06.881254Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"6d1815d2-46f1-4217-a874-f25ae24be85c","year":2026},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-04T16:01:22.114748Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-20T11:46:52.658984Z"},"links":{"cited_paper":"/paper/2604.24763","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:54e6828157cb38173f6165e17dfb7a40176aaf501213aa13c4e454cafa1954a4","observation_id":"eecd669e-9280-4a33-9e24-cb7ad660f112","resolution":{"observed_at":"2026-05-20T11:48:14.832936Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2604.24763","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.24763","snapshot_observed_at":"2026-07-10T13:37:06.881254Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"6d1815d2-46f1-4217-a874-f25ae24be85c","year":2026},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-04T16:01:22.114748Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"cited_paper":"/paper/2604.24763","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:56cb8cd760bd597477c09b7223d9bb042ca7009581f6a95986aec0308fc31fc6","observation_id":"1841f1f9-3efe-45ae-ad77-4ed7a70d1b87","resolution":{"observed_at":"2026-05-21T07:59:50.672370Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2604.24763","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.24763","snapshot_observed_at":"2026-07-10T13:37:06.881254Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"6d1815d2-46f1-4217-a874-f25ae24be85c","year":2026},"citing_paper":{"arxiv_id":"2605.25343","last_updated":"2026-05-25T01:57:43Z","snapshot_observed_at":"2026-07-06T23:35:16.647496Z","submitted_at":"2026-05-25T01:57:43Z","title":"Toward Native Multimodal Modeling: A Roadmap","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-29T22:58:38.610609Z"},"links":{"cited_paper":"/paper/2604.24763","citing_paper":"/paper/2605.25343"},"observation_digest":"sha256:652fcbd412c0a20d49322304e668a9d58e3be58b351a407f971664cff225904d","observation_id":"ecb394ca-831f-4321-9ff1-79a7ca9d4c73","resolution":{"observed_at":"2026-06-29T23:04:01.807470Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2604.24763","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.24763","snapshot_observed_at":"2026-07-10T13:37:06.881254Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"6d1815d2-46f1-4217-a874-f25ae24be85c","year":2026},"citing_paper":{"arxiv_id":"2605.27310","last_updated":"2026-05-26T17:20:05Z","snapshot_observed_at":"2026-08-06T11:42:28.294635Z","submitted_at":"2026-05-26T17:20:05Z","title":"How and What to Imagine? Visual Thinking in Unified Multimodal Models for Cross-View Spatial Reasoning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-29T18:19:40.323661Z"},"links":{"cited_paper":"/paper/2604.24763","citing_paper":"/paper/2605.27310"},"observation_digest":"sha256:09c451fbda0834577f4b32847a72d0466104015e72ed5da7ff5375322321fdb3","observation_id":"aaae50c0-09d6-4294-91d0-c03f773b6f88","resolution":{"observed_at":"2026-06-29T18:23:50.680893Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2604.24763","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.24763","snapshot_observed_at":"2026-07-10T13:37:06.881254Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"6d1815d2-46f1-4217-a874-f25ae24be85c","year":2026},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T22:54:10.460872Z"},"links":{"cited_paper":"/paper/2604.24763","citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:c3650ab9417fda2fc579d47e38cd9646498e24f50163adacd8797b054c631c80","observation_id":"057076fe-1fe7-45c2-b07d-830f1064b729","resolution":{"observed_at":"2026-07-01T19:16:00.974604Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.24763","snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"Tuna-2: Pixel embeddings beat vision encoders for multimodal understanding and generation.arXiv preprint arXiv:2604.24763, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"cited_paper":"/paper/2604.24763","citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:c949addd07df26d8f17676c088b3389a38c84a1f034cccff2c122714cf9a1794","observation_id":"3fd2ec9a-f921-45db-a224-2f68be5cd6e7","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2604.24763","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.24763","snapshot_observed_at":"2026-07-10T13:37:06.881254Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"6d1815d2-46f1-4217-a874-f25ae24be85c","year":2026},"citing_paper":{"arxiv_id":"2606.10231","last_updated":"2026-07-02T05:30:19Z","snapshot_observed_at":"2026-08-05T20:35:27.953841Z","submitted_at":"2026-06-08T22:44:04Z","title":"LLM can Read Spectrogram: Encoder-free Speech-Language Modeling","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T14:40:40.673091Z"},"links":{"cited_paper":"/paper/2604.24763","citing_paper":"/paper/2606.10231"},"observation_digest":"sha256:4ac86388803f24ea1b1433f69c8861bf8f7cb726e3414e9936fcd222ad9592e6","observation_id":"ce8add9b-090a-4cf1-9c68-236101331b6c","resolution":{"observed_at":"2026-07-03T03:47:35.738546Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2604.24763","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.24763","snapshot_observed_at":"2026-07-10T13:37:06.881254Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"6d1815d2-46f1-4217-a874-f25ae24be85c","year":2026},"citing_paper":{"arxiv_id":"2606.10231","last_updated":"2026-07-02T05:30:19Z","snapshot_observed_at":"2026-08-05T20:35:27.953841Z","submitted_at":"2026-06-08T22:44:04Z","title":"LLM can Read Spectrogram: Encoder-free Speech-Language Modeling","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-03T23:55:11.698728Z"},"links":{"cited_paper":"/paper/2604.24763","citing_paper":"/paper/2606.10231"},"observation_digest":"sha256:f3f13248e951ec254bbebc38be57d83accab499ec9d53468589ce90b4e77e6ec","observation_id":"b55fc75b-67a4-49dd-a29b-6a47fc00ccde","resolution":{"observed_at":"2026-07-03T23:59:06.141726Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2604.24763","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.24763","snapshot_observed_at":"2026-07-10T13:37:06.881254Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"6d1815d2-46f1-4217-a874-f25ae24be85c","year":2026},"citing_paper":{"arxiv_id":"2606.24849","last_updated":"2026-06-23T17:28:00Z","snapshot_observed_at":"2026-08-03T11:30:36.402988Z","submitted_at":"2026-06-23T17:28:00Z","title":"IV-CoT: Implicit Visual Chain-of-Thought for Structure-Aware Text-to-Image Generation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-26T00:19:49.071495Z"},"links":{"cited_paper":"/paper/2604.24763","citing_paper":"/paper/2606.24849"},"observation_digest":"sha256:fd784ea63dca1d1d01af1ca6d587fecd2b6cdae1eba3b1ede60487e9d1a31b93","observation_id":"8c24bcf8-cb8a-4126-9c27-970d8c9c3642","resolution":{"observed_at":"2026-07-04T16:39:58.204439Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2604.24763","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.24763","snapshot_observed_at":"2026-07-10T13:37:06.881254Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"6d1815d2-46f1-4217-a874-f25ae24be85c","year":2026},"citing_paper":{"arxiv_id":"2606.32039","last_updated":"2026-06-30T17:59:57Z","snapshot_observed_at":"2026-07-07T00:05:41.920778Z","submitted_at":"2026-06-30T17:59:57Z","title":"GEAR: Guided End-to-End AutoRegression for Image Synthesis","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-01T05:19:21.647714Z"},"links":{"cited_paper":"/paper/2604.24763","citing_paper":"/paper/2606.32039"},"observation_digest":"sha256:3821dae4ab910ff5f538091d2735889702b047fecf80024c2ef6ab09442f500b","observation_id":"08c59d78-89a3-47f3-89a3-027c525b7e77","resolution":{"observed_at":"2026-07-01T10:35:42.603436Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2604.24763","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.24763","snapshot_observed_at":"2026-07-10T13:37:06.881254Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"6d1815d2-46f1-4217-a874-f25ae24be85c","year":2026},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-06T07:19:16.030350Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"cited_paper":"/paper/2604.24763","citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:2eeb3a97130cd8eddf7a723dea24012ec55094103da4b9df9381f60944c85fc7","observation_id":"10f0d88f-3a7f-4a92-9a22-8170a221360b","resolution":{"observed_at":"2026-07-10T13:37:06.882491Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.24763","snapshot_observed_at":"2026-08-01T18:56:57.561814Z","title":"Tuna-2: Pixel embeddings beat vision encoders for multimodal understanding and generation.arXiv preprint arXiv:2604.24763, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17140","last_updated":"2026-07-19T08:53:01Z","snapshot_observed_at":"2026-08-06T18:34:52.117943Z","submitted_at":"2026-07-19T08:53:01Z","title":"STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T18:56:57.561814Z"},"links":{"cited_paper":"/paper/2604.24763","citing_paper":"/paper/2607.17140"},"observation_digest":"sha256:b0e05d6b36fd73b7bfb7451284e2b9de2e55ddd9235ad1ce3ff857706875606c","observation_id":"e72af9cb-8b76-4ba0-9cf0-57fbbfa3ebad","resolution":{"observed_at":"2026-08-01T18:56:57.561814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.24763","snapshot_observed_at":"2026-08-06T11:55:27.994286Z","title":"Tuna-2: Pixel embeddings beat vision encoders for multimodal understanding and generation.arXiv preprint arXiv:2604.24763, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05000","last_updated":"2026-08-05T16:09:25Z","snapshot_observed_at":"2026-08-06T23:58:00.614692Z","submitted_at":"2026-08-05T16:09:25Z","title":"Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T11:55:27.994286Z"},"links":{"cited_paper":"/paper/2604.24763","citing_paper":"/paper/2608.05000"},"observation_digest":"sha256:2b81b048c515974011df00ff6ee383646902f4f4c76bdb0cf9df300bf3d9f3be","observation_id":"376e13c2-d6df-4e2b-b34a-86dc7b3a7e44","resolution":{"observed_at":"2026-08-06T11:55:27.994286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2604.24763/citation-record","integrity":"/paper/2604.24763/integrity","json":"/paper/2604.24763/citation-record.json","paper":"/paper/2604.24763"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.24821","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T11:59:50.586824Z","title":"Ming-flash-omni: A sparse, unified architecture for multimodal perception and generation.arXiv preprint arXiv:2510.24821","venue":null,"work_id":"dc96d2bc-4780-4f97-a01b-a0e222c97b16","year":2025},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:68853c56eed91c11bc806416769a83457924d6ad2f3a6f7a8813898c35d06733","observation_id":"f10e9c16-da04-44bd-a042-8b7609c692a2","resolution":{"observed_at":"2026-05-20T23:43:51.165136Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:6451aa11eb9f085c0c5e9afcb4398ac72e47e5134a4c57ecf511c17ac144ec00","observation_id":"aa21ed8b-d792-4f37-8981-a01aba58df48","resolution":{"observed_at":"2026-05-20T23:43:51.182896Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.26599","last_updated":"2026-07-11T20:08:28Z","snapshot_observed_at":"2026-08-06T02:17:15.078741Z","submitted_at":"2026-03-27T16:57:51Z","title":"VGGRPO: Towards World-Consistent Video Generation with 4D Latent Reward","version":2},"cited_work":{"arxiv_id":"2603.26599","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2603.26599","snapshot_observed_at":"2026-07-14T02:20:26.920520Z","title":"Vggrpo: Towards world-consistent video generation with 4d latent reward","venue":null,"work_id":"ee10761b-dd39-441e-9b68-159d0bbbf0c0","year":2026},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"cited_paper":"/paper/2603.26599","citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:6a5b634d9d38da67dad935246746bed04b9f121657ee3116c5c0ab0a14d8d353","observation_id":"bbb8a7cf-805c-42e0-ab18-994621a85522","resolution":{"observed_at":"2026-07-14T02:20:26.920520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":"2309.16609","doi":"10.48550/arxiv.2309.16609","metadata_source":"pith","pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen Technical Report","venue":"cs.CL","work_id":"bb1fd52f-6b2f-437c-9516-37bdf6eb9be8","year":2023},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:3a5c6bdfcb6c1af92cb59c4e02840e9f2e107d3c5a6790c12fe7d705c63ea35f","observation_id":"d4a23b81-b675-474e-9942-5ea3b1ebd1f7","resolution":{"observed_at":"2026-05-20T23:43:51.123112Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:15.620681+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:15.620681+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:9bc8aeb46b7ff8b768d530e9583118e32f196a8f151ef93cc0058247cbbe3c68","observation_id":"003d9e10-1d2d-4967-ac36-9fab5437f7a8","resolution":{"observed_at":"2026-05-20T23:43:51.224063Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.00949","doi":"10.48550/arxiv.2505.00949","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Bie, T., Cao, M., Chen, K., Du, L., Gong, M., Gong, Z., Gu, Y ., Hu, J., Huang, Z., Lan, Z., et al","venue":"ArXiv.org","work_id":"863f4416-1708-46c1-b8f9-c894351db269","year":2025},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:e9ba129cc2b5cb2e9e06da5a02ba8e7ced131a8981c11cf69574a0d88c871c42","observation_id":"72626697-3026-439a-bd03-6981120e3144","resolution":{"observed_at":"2026-05-20T23:43:51.088011Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-25T17:53:22.063501+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T17:53:22.063501+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:4883c941ee39f0357457359674637a92e917d9bb369fff04efec24cc205c9033","observation_id":"a95c9959-6841-4ac8-b32b-bcfbbdf71840","resolution":{"observed_at":"2026-05-20T23:43:51.133147Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09568","last_updated":"2025-05-14T17:11:07Z","snapshot_observed_at":"2026-07-06T21:23:57.084147Z","submitted_at":"2025-05-14T17:11:07Z","title":"BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset","version":1},"cited_work":{"arxiv_id":"2505.09568","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.09568","snapshot_observed_at":"2026-07-08T00:04:22.585543Z","title":"BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset","venue":"cs.CV","work_id":"86d896d2-592f-4d9b-938e-dfeb11f9388f","year":2025},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"cited_paper":"/paper/2505.09568","citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:6a1a8b0a514729188c41a0f5a3e3afee6bc9ff94a97dca10f7653f834c350025","observation_id":"34dbc408-464e-4870-a933-076b1d57bfd0","resolution":{"observed_at":"2026-05-20T23:43:51.126327Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07963","last_updated":"2025-04-10T17:59:56Z","snapshot_observed_at":"2026-08-04T06:26:36.498042Z","submitted_at":"2025-04-10T17:59:56Z","title":"PixelFlow: Pixel-Space Generative Models with Flow","version":1},"cited_work":{"arxiv_id":"2504.07963","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.07963","snapshot_observed_at":"2026-07-04T20:50:11.498748Z","title":"arXiv preprint arXiv:2504.07963 (2025)","venue":null,"work_id":"1beb1a44-0887-4a87-93c8-5dca148563bd","year":2025},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"cited_paper":"/paper/2504.07963","citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:d0e69bdebb17a0ebc38e29b5b1109ae99d0ac488674a4abbf8f81a825e7cc672","observation_id":"02e8942e-6abf-4af7-a3b9-2e719e2aa46e","resolution":{"observed_at":"2026-05-20T23:43:51.084701Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-07-31T17:39:49.561332Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":"2510.26583","doi":"10.48550/arxiv.2510.26583","metadata_source":"pith","pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3.5: Native Multimodal Models are World Learners","venue":"cs.CV","work_id":"518b061e-87a3-45f9-8419-30a14d89b122","year":2025},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:21935751b917767bb14d2d1c4c49c59b770c6a1c3bc1caf1e03d057dfd140619","observation_id":"43c9d681-bb25-43b8-b687-61e13146f13c","resolution":{"observed_at":"2026-05-20T23:43:51.071493Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":"2505.14683","doi":"10.48550/arxiv.2505.14683","metadata_source":"pith","pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emerging Properties in Unified Multimodal Pretraining","venue":"cs.CV","work_id":"e0cfd82c-f5d4-44fd-b531-ec73ab0a805b","year":2025},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:30b05aeb9e3d9d24fa9caae1fa1ed21cf0ae60f7c52e6a6ec5d7a198a2182a88","observation_id":"72fdccde-a861-4c3e-9420-90339c50ded2","resolution":{"observed_at":"2026-05-20T23:43:51.115609Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.14979","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T07:35:28.718163Z","title":"From pixels to words–towards native vision-language primitives at scale.arXiv preprint arXiv:2510.14979, 2025a","venue":null,"work_id":"73f6fd43-0cd3-49fc-afac-14eda2b1a95f","year":2025},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:f37f0f8eb401c19b8691851f8919e45d46b0198adc49311f9f993dfd1c78466a","observation_id":"721f847d-105d-4625-abbd-92c9c73210f1","resolution":{"observed_at":"2026-05-20T23:43:51.063724Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13436","last_updated":"2025-03-17T17:58:30Z","snapshot_observed_at":"2026-07-06T20:54:04.912422Z","submitted_at":"2025-03-17T17:58:30Z","title":"Unified Autoregressive Visual Generation and Understanding with Continuous Tokens","version":1},"cited_work":{"arxiv_id":"2503.13436","doi":"10.48550/arxiv.2503.13436","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.13436","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Unified autoregressive visual generation and understanding with continuous tokens","venue":"arXiv (Cornell University)","work_id":"873a4565-755a-433c-9cdb-43d528548dd2","year":2025},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"cited_paper":"/paper/2503.13436","citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:566ea32a4b230621b0a33af8c54d1c648794d49a791188d4050499b16efd724c","observation_id":"1683cb3c-e9e0-4994-9a8a-409e6b24e763","resolution":{"observed_at":"2026-05-20T23:43:51.078460Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22058","last_updated":"2025-07-29T17:59:04Z","snapshot_observed_at":"2026-08-06T15:57:37.748671Z","submitted_at":"2025-07-29T17:59:04Z","title":"X-Omni: Reinforcement Learning Makes Discrete Autoregressive Image Generative Models Great Again","version":1},"cited_work":{"arxiv_id":"2507.22058","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.22058","snapshot_observed_at":"2026-07-04T13:39:51.493261Z","title":"X-omni: Reinforcement learning makes discrete autoregressive image generative models great again","venue":null,"work_id":"3ee0ee57-31b9-49d4-98fc-c12c499a14b9","year":2025},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"cited_paper":"/paper/2507.22058","citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:29288b68eeadbef53e555398a7e5b411d8316f1bec22361d332c26c4c527005c","observation_id":"a2363116-a38e-4124-9544-8abb6ebdbed1","resolution":{"observed_at":"2026-05-20T23:43:51.185958Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:cd4e118a72f5c15f92d1cc4c9915e8b9c099468a5dcb80021d249ed31c4cb0ae","observation_id":"47986ce8-2cf0-4917-ad52-e37215bcd7c2","resolution":{"observed_at":"2026-05-20T23:43:51.198204Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18898","last_updated":"2025-06-23T17:59:14Z","snapshot_observed_at":"2026-08-06T23:12:29.776991Z","submitted_at":"2025-06-23T17:59:14Z","title":"Vision as a Dialect: Unifying Visual Understanding and Generation via Text-Aligned Representations","version":1},"cited_work":{"arxiv_id":"2506.18898","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18898","snapshot_observed_at":"2026-07-04T10:09:44.750475Z","title":"Vision as a dialect: Unifying visual understanding and generation via text-aligned representations.arXiv preprint arXiv:2506.18898","venue":null,"work_id":"eeaabcd0-b12e-4324-88d6-d54239671f08","year":2025},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"cited_paper":"/paper/2506.18898","citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:59bd7333fcadedf1f7af8ec9ce6ab7798eab373df46e82becd20304389eb7fce","observation_id":"d48b7176-f7d3-438e-aec4-f7d2d4da5b79","resolution":{"observed_at":"2026-05-20T23:43:51.091129Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.24365","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T22:36:17.640410Z","title":"Uni-x: Mitigating modality conflict with a two-end- separated architecture for unified multimodal models.arXiv preprint arXiv:2509.24365","venue":null,"work_id":"d05554bf-3fcd-475e-b83e-007eccfecbd8","year":2025},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:60b188a6867cc868e8dc4e397dbc7c03a68445d3669c11fee96bea616b7d29c6","observation_id":"f1b3d296-1dcc-417c-9045-60c6cfc9b2d4","resolution":{"observed_at":"2026-05-20T23:43:51.059913Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.04810","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:04:20.895613Z","title":"Emma: Efficient multimodal understanding, generation, and editing with a unified architecture","venue":null,"work_id":"e4ea8fa3-ab7d-43ce-811e-4031c8d93ec0","year":2025},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:06cf3f8cd9ce2024f9fcf9c60ff95834244c1a5969e1f6289dd86cc66cf1c294","observation_id":"dd250552-955d-4a8b-a4a5-47a1ff54fc22","resolution":{"observed_at":"2026-05-20T23:43:51.204198Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-04T23:51:18.339338Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"cited_work":{"arxiv_id":"2403.05135","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.05135","snapshot_observed_at":"2026-07-04T16:59:58.040795Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","venue":"cs.CV","work_id":"94248955-4bc5-4517-98a0-66224a36d865","year":2024},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"cited_paper":"/paper/2403.05135","citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:18e59b212d5f4b21f53103a675b68290b9675fc510701dfeaf2adfcf4b73ac44","observation_id":"05581f8c-820e-4922-8863-1bbc53f66c78","resolution":{"observed_at":"2026-05-20T23:43:51.081493Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.06590","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T14:28:32.106180Z","title":"Ming-univision: Joint image understanding and generation with a unified continuous tokenizer.arXiv preprint arXiv:2510.06590, 2025a","venue":null,"work_id":"27f83b26-431a-430b-82c3-1c56eccec44d","year":2025},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:043bdbb8cb6720b3e24a7c665cc02f48a28438f0c7538b2986765e689c5a602c","observation_id":"86b12f4f-653a-482f-b4f1-a599f959860e","resolution":{"observed_at":"2026-05-20T23:43:51.221343Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:aed3a631c5e28c481d5b86f5a7d849d1c74bef0b337e99ff89596a80f62ff191","observation_id":"ba1c9eb7-70df-43e6-8237-b274202c8ade","resolution":{"observed_at":"2026-05-20T23:43:51.201029Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.13720","last_updated":"2026-01-07T05:36:57Z","snapshot_observed_at":"2026-07-06T22:36:08.495952Z","submitted_at":"2025-11-17T18:59:57Z","title":"Back to Basics: Let Denoising Generative Models Denoise","version":2},"cited_work":{"arxiv_id":"2511.13720","doi":"10.48550/arxiv.2511.13720","metadata_source":"pith","pith_arxiv_id":"2511.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Back to Basics: Let Denoising Generative Models Denoise","venue":"cs.CV","work_id":"37973de8-a5e6-4d92-897b-a98fa9f7f2f3","year":2025},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"cited_paper":"/paper/2511.13720","citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:fd56e7e1ac297a2264699f2fb7242a11f1adfc548edf4ecc71322f82b93e015b","observation_id":"b8e1917f-cc1f-4dec-b203-0b3bf18af1c9","resolution":{"observed_at":"2026-05-20T23:43:51.230376Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00574","last_updated":"2025-07-13T16:21:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-31T18:01:23Z","title":"VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling","version":4},"cited_work":{"arxiv_id":"2501.00574","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.00574","snapshot_observed_at":"2026-07-04T16:49:57.265026Z","title":"VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling","venue":"cs.CV","work_id":"52ec7cb6-1ef6-4366-a43f-d4c13fce23ad","year":2024},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"cited_paper":"/paper/2501.00574","citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:b167fbf4152f434100c879eb0ba94430267819c8b2cb073a87ab5cc13781c9c4","observation_id":"d3a281b8-a4c6-4ec7-9e22-7b5e6f809ea1","resolution":{"observed_at":"2026-05-20T23:43:51.161913Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03147","last_updated":"2025-06-18T18:00:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-03T17:59:33Z","title":"UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation","version":4},"cited_work":{"arxiv_id":"2506.03147","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03147","snapshot_observed_at":"2026-07-05T16:51:14.197597Z","title":"UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation","venue":"cs.CV","work_id":"488a273e-95d8-46f1-87c7-2244068d00d0","year":2025},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"cited_paper":"/paper/2506.03147","citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:cdf91575fd45bb1ba5a140031285c6b6741b640b81607c15bb4f6dd89b1259b8","observation_id":"a5036c6b-1a90-4e68-a26d-226ec35f09c4","resolution":{"observed_at":"2026-05-20T23:43:51.215328Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.02014","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:37:06.868333Z","title":"Tuna: Taming unified visual representations for native unified multimodal models","venue":null,"work_id":"caa100a4-03f6-4ad6-8461-4d3a89233486","year":2025},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:84356c456deef1ae283bb1b7e3d42557a7c48048555c96bbd59ed9f088fc60cc","observation_id":"6fa77aed-f707-4f87-9e84-f8485345517d","resolution":{"observed_at":"2026-05-20T23:43:51.207144Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":"1711.05101","doi":"10.1137/1.9781611972825.47","metadata_source":"pith","pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Decoupled Weight Decay Regularization","venue":"cs.LG","work_id":"07ef7360-d385-4033-83f7-8384a6325204","year":2017},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:0356eeb6d20cd62b466d3d7d01716846762515bcbbd081ea48a0f48c43032b3f","observation_id":"e885048b-1347-4ffe-96a9-dcf1154235a3","resolution":{"observed_at":"2026-05-20T23:43:51.209927Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.20321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T13:09:50.827602Z","title":"Unitok: A unified tokenizer for visual generation and understanding.arXiv preprint arXiv:2502.20321, 2025a","venue":null,"work_id":"31d5c278-398d-4fee-8130-a864fb6b3717","year":2025},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:df1099748b44a806a1bac8dfdd2957696781a6995e794d1078c7d98db9ca7992","observation_id":"f82ec47e-2cdb-4108-8ad9-40949b9471f4","resolution":{"observed_at":"2026-05-20T23:43:51.094637Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.20561","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T08:16:48.469589Z","title":"Does understanding inform generation in unified multimodal models? from analysis to path forward.arXiv preprint arXiv:2511.20561","venue":null,"work_id":"971b8d8c-0d5e-4205-bcd2-044212db8aa2","year":2025},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:5a6856209f5ed4b3bc4732e4ac2020391e4f270d6fa8bf3a4292b0911c18aba8","observation_id":"c41ea23d-ac1f-4cae-bca3-3a3b1838ce8d","resolution":{"observed_at":"2026-05-20T23:43:51.098439Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Roni Paiss, Ariel Ephrat, Omer Tov, Shiran Zada, Inbar Mosseri, Michal Irani, and Tali Dekel","venue":null,"work_id":"c14a4c2d-a511-4f2e-be30-766686c60372","year":2026},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:fe1e358ed7f0f11d022a116112a49c6f9e965cb3d0802f4944501fd3535e76fc","observation_id":"cee7d3ff-0c0d-4d00-bf20-3d8ed4726065","resolution":{"observed_at":"2026-05-20T23:43:51.767832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.21338","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:34:02.299028Z","title":"Histream: Efficient high-resolution video generation via redundancy-eliminated streaming.arXiv preprint arXiv:2512.21338","venue":null,"work_id":"47c91a2f-f78f-4db1-bec9-018787d4f62c","year":2025},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:7ad53d8c0b73fa6ae06a71a6e36841bb5039ea46d89b90e970aeb5e0d7233f39","observation_id":"d46546bf-b744-497b-9b7a-abbb50206e52","resolution":{"observed_at":"2026-05-20T23:43:51.158464Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.18262","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mammothmoda2: A unified ar-diffusion framework for multimodal understanding and generation","venue":null,"work_id":"3d5ea54e-bf4c-4259-8c94-c2cff09a4627","year":2025},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:082eae9943f009cffc7eb84952447e45488eea95717ef1ec87c5b63a8580765b","observation_id":"542a1cf9-2fe7-4fa3-a9b7-0c64c5f89c55","resolution":{"observed_at":"2026-05-20T23:43:51.115596Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23606","last_updated":"2026-04-13T07:14:16Z","snapshot_observed_at":"2026-07-06T21:33:02.686798Z","submitted_at":"2025-05-29T16:15:48Z","title":"Muddit: Liberating Generation Beyond Text-to-Image with a Unified Discrete Diffusion Model","version":4},"cited_work":{"arxiv_id":"2505.23606","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23606","snapshot_observed_at":"2026-07-04T16:09:57.601747Z","title":"Muddit: Liberating Generation Beyond Text-to-Image with a Unified Discrete Diffusion Model","venue":"cs.LG","work_id":"d9362ac2-4e03-4696-ab0c-aa7f2419766a","year":2025},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"cited_paper":"/paper/2505.23606","citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:00cb0806d1e36bc76e2a9b640718fd69d5babaa22aa71db01ebae0dc5f11e200","observation_id":"7b303691-2cef-4775-90ec-5adcbc8b568d","resolution":{"observed_at":"2026-05-20T23:43:51.168069Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":"2406.06525","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-07-10T11:37:03.266757Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","venue":"cs.CV","work_id":"41efe203-9377-4c63-b1d6-e499cd6e46f6","year":2024},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:c72808cdf10ffa9ddf775cff883ebe16fbd7838b657355a2b55f707b3339c149","observation_id":"f466b11f-5c7c-44ea-9f02-f15502eb6161","resolution":{"observed_at":"2026-05-20T23:43:51.180253Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.23278","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:36:52.528059Z","title":"Unilip: Adapting clip for unified multimodal understanding, generation and editing","venue":null,"work_id":"a1bad6a0-54ce-45f8-8478-3169a4b3c6e8","year":2025},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:397892c9820fc5ae3c0fa4bf974267d86fa754ce749242865a6986a54a822013","observation_id":"d467844e-d54c-44a3-bdc1-36a6dbb2340a","resolution":{"observed_at":"2026-05-20T23:43:51.108996Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":"2405.09818","doi":"10.48550/arxiv.2405.09818","metadata_source":"pith","pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","venue":"cs.CL","work_id":"2661b9a6-25cc-41a1-8100-612d2b801289","year":2024},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:f2f30e9bfc3efca0c1c9feb7f80182af08f035203526125c5acd17b3c5da93f0","observation_id":"a446c5a9-1e2f-4cf8-b6dc-531f51947ee5","resolution":{"observed_at":"2026-05-20T23:43:51.177504Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-10T17:49:22.013335+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T17:49:22.013335+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2512.07584","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-07-04T16:09:57.573753Z","title":"LongCat-Image Technical Report","venue":"cs.CV","work_id":"648d9514-ca31-4ba0-983a-1aba1057a97e","year":2025},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:b4b2ef3bf18ac8034563957dad26f5016a50f43e4cbfe3855c58e6d0f1d2edfc","observation_id":"0454ea17-2581-470b-a4cf-6ed4919cf638","resolution":{"observed_at":"2026-05-20T23:43:51.192137Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.09877","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T15:48:35.100341Z","title":"Internvl-u: Democratizing unified multimodal models for understanding, reasoning, generation and editing","venue":null,"work_id":"d8de0ab3-1c49-444f-8d9e-a88cf0fb0c22","year":2026},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:c4e5ab6ab425bbd2f1d4e0707421c4b9730f4ac3cf40bc5afdbbda19f093edf2","observation_id":"7768f308-46d6-429a-84bb-f3be31651339","resolution":{"observed_at":"2026-05-20T23:43:51.052384Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.03276","doi":"10.48550/arxiv.2603.03276","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Beyond language modeling: An exploration of multimodal pretraining","venue":"arXiv (Cornell University)","work_id":"d972314c-446c-43b5-9de5-4bb7c5f1cdcf","year":2026},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:efa55c4fdb2459dc169673feffcdd567549ff76556860ab251ad568504db0f8c","observation_id":"2f5c6bb5-4b09-495a-979c-3596d0ab9730","resolution":{"observed_at":"2026-05-20T23:43:51.218228Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":"2502.14786","doi":"10.48550/arxiv.2502.14786","metadata_source":"pith","pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","venue":"cs.CV","work_id":"50eec732-2d41-432f-9dcf-ac7fff235ea5","year":2025},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:83a89ce7d6aac905bfeb1518ad6e2910af9ad77250eeb0f213871a6b0dc346b4","observation_id":"9f938dcc-30c8-454c-a350-3808e2b5e8b5","resolution":{"observed_at":"2026-05-20T23:43:51.119286Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-10T23:49:08.777694+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T23:49:08.777694+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":"2503.20314","doi":"10.1109/19.492748","metadata_source":"pith","pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":"cs.CV","work_id":"ad3ebc3b-4224-46c9-b61d-bcf135da0a7c","year":2025},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:403c5c482305dfd040b3124b09b412aa69a169f909b6c38a3b88754acc0e8738","observation_id":"4fdd0d68-d172-4b47-aca6-75aba365f915","resolution":{"observed_at":"2026-05-20T23:43:51.136076Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"cited_work":{"arxiv_id":"2506.23044","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.23044","snapshot_observed_at":"2026-07-05T16:51:14.255860Z","title":"Ovis-u1 technical report","venue":"cs.CV","work_id":"1c86f77c-ccaa-442a-a1a1-951ddd663c61","year":2025},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"cited_paper":"/paper/2506.23044","citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:ced8b03bb33f8145b7065b08a9e7b72f8019a321517dc864c05f998e13ce0fca","observation_id":"ed7f43f2-3360-479d-bc81-2260ec90bc9f","resolution":{"observed_at":"2026-05-20T23:43:51.147802Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-04T10:49:46.339959Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"cited_work":{"arxiv_id":"2510.08377","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.08377","snapshot_observed_at":"2026-07-07T03:17:13.018030Z","title":"Univideo: Unified understanding, generation, and editing for videos","venue":null,"work_id":"c6b943b5-97f1-4afc-bf4e-16761043ecac","year":2025},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"cited_paper":"/paper/2510.08377","citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:10e11d58b1693ec597581667e5086f267f97f05cffe12fd73c85aba8937d56e3","observation_id":"334ecb48-2067-4346-91be-f1a6d78d489f","resolution":{"observed_at":"2026-07-07T03:17:13.018030Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02324","last_updated":"2025-08-04T11:49:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-04T11:49:20Z","title":"Qwen-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2508.02324","doi":"10.48550/arxiv.2508.02324","metadata_source":"pith","pith_arxiv_id":"2508.02324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-Image Technical Report","venue":"cs.CV","work_id":"d06d7ecc-7579-4f89-a60b-4278a0f3c562","year":2025},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"cited_paper":"/paper/2508.02324","citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:a18b2834976737038eb6778044b2b458d7c3e56bad1c12f997a9fab3aaed708d","observation_id":"89c604ab-8f2a-4aab-8fee-696b595a2204","resolution":{"observed_at":"2026-05-20T23:43:51.101640Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-21T15:23:05.016381+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T15:23:05.016381+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-07-06T21:33:02.686798Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":"2505.23661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23661","snapshot_observed_at":"2026-07-04T16:39:58.237442Z","title":"Openuni: A simple baseline for unified multimodal understanding and generation.arXiv preprint arXiv:2505.23661, 2025b","venue":null,"work_id":"74eca3ff-bbe5-492f-ab35-b10bd41e7b5a","year":2025},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"cited_paper":"/paper/2505.23661","citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:8d18e03a35d019a0eb3b91da78bf5730bfd022cc4f2fa0fa49f0a0409c194b9f","observation_id":"921dab5b-a36c-4778-adfb-20bfbf7fbcb0","resolution":{"observed_at":"2026-05-20T23:43:51.195508Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.07295","last_updated":"2026-06-25T06:17:40Z","snapshot_observed_at":"2026-08-04T22:36:03.033298Z","submitted_at":"2025-09-08T23:59:32Z","title":"Reconstruction Alignment Improves Unified Multimodal Models","version":4},"cited_work":{"arxiv_id":"2509.07295","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.07295","snapshot_observed_at":"2026-07-02T08:16:48.433525Z","title":"\"Your output must be a single JSON object.\\n\\n","venue":"cs.CV","work_id":"49fe4943-80e8-4f4e-b253-05cf57244f19","year":2025},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"cited_paper":"/paper/2509.07295","citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:5eea59da03c58cfbd581cf923b74f10f444879a28f50fcd35bec497bfe34ca63","observation_id":"5c35c0d9-e5c1-416d-b475-ff16dc69a0a5","resolution":{"observed_at":"2026-06-26T02:15:36.738364Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15564","last_updated":"2025-09-22T01:24:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-18T15:39:15Z","title":"Show-o2: Improved Native Unified Multimodal Models","version":3},"cited_work":{"arxiv_id":"2506.15564","doi":"10.48550/arxiv.2506.15564","metadata_source":"pith","pith_arxiv_id":"2506.15564","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Show-o2: Improved Native Unified Multimodal Models","venue":"cs.CV","work_id":"77f00563-1ce6-4fba-9d4e-c8ce83f716ac","year":2025},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"cited_paper":"/paper/2506.15564","citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:8e78d0db0e7672e08d14ecb9077b6d37d07a3372571779ac67a2309133403c02","observation_id":"2d4ec96d-b77a-4d76-ac64-d13e0329d4fb","resolution":{"observed_at":"2026-05-20T23:43:51.113006Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15279","last_updated":"2025-04-21T17:59:53Z","snapshot_observed_at":"2026-08-04T21:46:45.619744Z","submitted_at":"2025-04-21T17:59:53Z","title":"VisuLogic: A Benchmark for Evaluating Visual Reasoning in Multi-modal Large Language Models","version":1},"cited_work":{"arxiv_id":"2504.15279","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.15279","snapshot_observed_at":"2026-07-08T23:55:43.050247Z","title":"Visulogic: A benchmark for evaluating visual reasoning in multi-modal large language models","venue":"cs.CV","work_id":"a380ccb5-e994-4933-b73d-d8df0105e038","year":2025},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"cited_paper":"/paper/2504.15279","citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:bb6f9b9b02b6d6deffb7b657c4dd241ebd66c6f7baa48ed2b6436fd72859b3ad","observation_id":"a0811705-ddff-44b3-bd81-7a3f14c18916","resolution":{"observed_at":"2026-05-20T23:43:51.138864Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-08-05T05:27:10.277230Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2505.15809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-11T03:07:51.413936Z","title":"MMaDA: Multimodal Large Diffusion Language Models","venue":"cs.CV","work_id":"9d626cf3-094e-4960-9e71-a00a47158639","year":2025},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:0b5cff8218c5771362bf0a0d7707e67ccf5eabf48655aca4ce6c2ddae5dcbb26","observation_id":"9e3482fc-0701-46c0-8218-8693526b6cbe","resolution":{"observed_at":"2026-05-20T23:43:51.129679Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20275","last_updated":"2025-05-26T17:53:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:53:33Z","title":"ImgEdit: A Unified Image Editing Dataset and Benchmark","version":1},"cited_work":{"arxiv_id":"2505.20275","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.20275","snapshot_observed_at":"2026-07-10T13:27:05.927875Z","title":"ImgEdit: A Unified Image Editing Dataset and Benchmark","venue":"cs.CV","work_id":"059b5c3a-404c-4d30-a631-68c1d88a08a7","year":2025},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"cited_paper":"/paper/2505.20275","citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:fa11091d5e7136797fe877cd8ad58ed5f44bed3a62f8a5409a37325a84d4eab6","observation_id":"1dd6f632-2917-4b90-9e78-3438c90654cb","resolution":{"observed_at":"2026-05-20T23:43:51.154165Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.01068","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T19:20:05.616450Z","title":"Llada-o: An effective and length-adaptive omni diffusion model.arXiv preprint arXiv:2603.01068","venue":null,"work_id":"21d98ed1-fe76-43cc-8aae-a74fbb79bcf9","year":2026},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:79406aaaa58e328399e5e3fe4933fb7a194fb60e393a0280712d188336b4c6de","observation_id":"e54215e6-0e04-43d0-937d-becee4f02a46","resolution":{"observed_at":"2026-05-20T23:43:51.189154Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06940","last_updated":"2025-06-18T04:35:42Z","snapshot_observed_at":"2026-07-06T19:30:26.233621Z","submitted_at":"2024-10-09T14:34:53Z","title":"Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think","version":4},"cited_work":{"arxiv_id":"2410.06940","doi":"10.48550/arxiv.2410.06940","metadata_source":"pith","pith_arxiv_id":"2410.06940","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think","venue":"cs.CV","work_id":"1aff8ef8-079b-4afe-9e6a-148e6fd08e6a","year":2024},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"cited_paper":"/paper/2410.06940","citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:51619f10e83c775b00a947c25452f46920d2c089049febf20d7a8475691909b2","observation_id":"0d4639ad-a10a-4ed7-bc50-b533bc33d46a","resolution":{"observed_at":"2026-05-20T23:43:51.150877Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-06T13:03:19.727877Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":"2308.02490","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-07-10T09:37:00.827227Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","venue":"cs.AI","work_id":"7f3bac41-a0a5-4a7a-bfd2-526b616db745","year":2023},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:c9a52d943fd7be3c4bdd55d4951583a3a1c2d445601bb47f5dc0b5deaa2c7633","observation_id":"1a465710-521a-472a-8533-a8a4f9e8c82f","resolution":{"observed_at":"2026-05-20T23:43:51.111865Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.20645","last_updated":"2026-04-16T17:04:25Z","snapshot_observed_at":"2026-08-03T04:32:54.764263Z","submitted_at":"2025-11-25T18:59:25Z","title":"PixelDiT: Pixel Diffusion Transformers for Image Generation","version":2},"cited_work":{"arxiv_id":"2511.20645","doi":"10.48550/arxiv.2511.20645","metadata_source":"pith","pith_arxiv_id":"2511.20645","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"PixelDiT: Pixel Diffusion Transformers for Image Generation","venue":"cs.CV","work_id":"7d675dc1-dc0d-4f02-81fc-aba652d0753a","year":2025},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"cited_paper":"/paper/2511.20645","citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:ef882ff70436ea6444b29b60b5bf605f97def13bff4a6b54f31c4d57facf9f9f","observation_id":"cf1e5e24-eef8-46fd-9f45-268c9e4766cd","resolution":{"observed_at":"2026-05-20T23:43:51.212501Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.10575","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T10:09:44.693306Z","title":"Uniflow: A unified pixel flow tokenizer for visual understanding and generation.arXiv preprint arXiv:2510.10575","venue":null,"work_id":"f6bf8232-a606-4413-831f-07867275a7ee","year":2025},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:32cad31e36c1bb3949cb131816e23a9eabd01f1f561a5e6ded3a35fab07d3c11","observation_id":"dce48e95-9d8f-475e-95de-a077b01672f5","resolution":{"observed_at":"2026-05-20T23:43:51.144460Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.06569","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:32:44.688946Z","title":"Penguin-vl: Exploring the efficiency limits of vlm with llm-based vision encoders.arXiv preprint arXiv:2603.06569, 2026a","venue":null,"work_id":"8a405052-efa2-4e66-936f-00f133654731","year":2024},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:6207c4b3bd1bf5fef6c767577c0e51a1d93f41e4e7aeafbbb7d4e766a91a6870","observation_id":"6e715181-b3df-4444-bf5c-054d92fbe1bd","resolution":{"observed_at":"2026-05-20T23:43:51.122848Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.11690","last_updated":"2025-10-13T17:51:39Z","snapshot_observed_at":"2026-07-06T22:32:32.632779Z","submitted_at":"2025-10-13T17:51:39Z","title":"Diffusion Transformers with Representation Autoencoders","version":1},"cited_work":{"arxiv_id":"2510.11690","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.11690","snapshot_observed_at":"2026-07-10T18:47:31.703880Z","title":"Diffusion Transformers with Representation Autoencoders","venue":"cs.CV","work_id":"c1a2d4de-4439-4005-8c56-e0124e4ed5fa","year":2025},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"cited_paper":"/paper/2510.11690","citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:adcf641df6e0e150ab45d26cd002411491dea62c71d74239149ff63eb367d729","observation_id":"a4cd0c68-afba-4977-9d8b-f5f60c3df444","resolution":{"observed_at":"2026-05-20T23:43:51.141634Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":"2408.11039","doi":"10.48550/arxiv.2408.11039","metadata_source":"pith","pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","venue":"cs.AI","work_id":"c2bb4d2d-29de-4bf2-9150-3d6373ff358f","year":2024},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:82ab6598fa7267dc117d9d13b3db84153151ce12fde0e9b07841301a1cafa3b1","observation_id":"8c462b17-eef0-4708-bb87-b3f03c431587","resolution":{"observed_at":"2026-05-20T23:43:51.227568Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.06905","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling zero-shot reference-to-video generation.arXiv preprint arXiv:2512.06905","venue":null,"work_id":"b80f3719-9914-4bfe-b1d4-b10a36215e38","year":2025},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:45a5d02be400aa28223ab4cfd32a35b809c5b0ffcd7f007b4660454ed9216af2","observation_id":"c276a854-1ceb-4b4a-9443-5f50ba344815","resolution":{"observed_at":"2026-05-20T23:43:51.174771Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":0,"verified_exact":54,"verified_fuzzy":1},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 17 inbound Pith citation observations for arXiv:2604.24763."}