{"as_of":"2026-08-09T15:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fd152521c2d034a9594f9d4d2efb20113539d54d5e47ef61004c1244fabfa2b4","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T15:31:57.426559Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T05:45:51.915796Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T23:59:06.123206Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"cited_work":{"arxiv_id":"2605.31604","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.31604","snapshot_observed_at":"2026-07-03T23:59:06.123206Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","venue":"cs.CV","work_id":"77c93eb3-c0d0-4332-8fc3-941057695dde","year":2026},"citing_paper":{"arxiv_id":"2606.10231","last_updated":"2026-07-02T05:30:19Z","snapshot_observed_at":"2026-08-05T20:35:27.953841Z","submitted_at":"2026-06-08T22:44:04Z","title":"LLM can Read Spectrogram: Encoder-free Speech-Language Modeling","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T14:40:40.673091Z"},"links":{"cited_paper":"/paper/2605.31604","citing_paper":"/paper/2606.10231"},"observation_digest":"sha256:a44a5d5bde07a390e61af13af2815f6752fc0fc5655097b28d834af25420858e","observation_id":"b7656482-5415-4733-9a24-0c270ba24f6f","resolution":{"observed_at":"2026-07-03T03:47:35.731856Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"cited_work":{"arxiv_id":"2605.31604","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.31604","snapshot_observed_at":"2026-07-03T23:59:06.123206Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","venue":"cs.CV","work_id":"77c93eb3-c0d0-4332-8fc3-941057695dde","year":2026},"citing_paper":{"arxiv_id":"2606.10231","last_updated":"2026-07-02T05:30:19Z","snapshot_observed_at":"2026-08-05T20:35:27.953841Z","submitted_at":"2026-06-08T22:44:04Z","title":"LLM can Read Spectrogram: Encoder-free Speech-Language Modeling","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-03T23:55:11.698728Z"},"links":{"cited_paper":"/paper/2605.31604","citing_paper":"/paper/2606.10231"},"observation_digest":"sha256:bb6dff5a7342c0312a564e5ef3952d3260a7bb7544da0c74b94b23f25406abed","observation_id":"921868c2-f87e-478e-92ee-4b377756fa90","resolution":{"observed_at":"2026-07-03T23:59:06.125682Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.31604","snapshot_observed_at":"2026-08-01T05:45:51.915796Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models.arXiv preprint arXiv:2605.31604, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-07T04:11:15.831910Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:51.915796Z"},"links":{"cited_paper":"/paper/2605.31604","citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:3b6dc052644dcf3206f5dd9eb8bb01d25ecae97ba152f57384b38e693b0c8f7f","observation_id":"b199c5fd-609f-490d-93d7-a54484d3769d","resolution":{"observed_at":"2026-08-01T05:45:51.915796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.31604/citation-record","integrity":"/paper/2605.31604/integrity","json":"/paper/2605.31604/citation-record.json","paper":"/paper/2605.31604"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"Latent forcing: Reordering the diffusion trajectory for pixel-space image generation.arXiv preprint arXiv:2602.11401, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:81af0d661ede331bd0d2196d9236658da4eb2382931edaac643e3acd453ad9df","observation_id":"ee98f9b5-ddb5-4680-8fd8-3fb7b7d0803a","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"Improving image generation with better captions.OpenAI Technical Report,https: // cdn","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:255c20e512f1d4b982b8355ea01a20cd91189d757d1b9a0773a351ac33b08f86","observation_id":"cf14e559-e5a4-4189-b7be-946ff2e5f16e","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"FLUX.https://github.com/black-forest-labs/flux, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:058bf8a2a9a20233b7ed4af85dd6046f68a7202b96266db21853c225bee3b9db","observation_id":"cf610772-11ae-44d0-bbc5-116cb59b4169","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"Unsupervised learning of visual features by contrasting cluster assignments","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:00c883ee87c90aa58581d410b4be2589343f642d762c554a1e0cb7fda7c5e110","observation_id":"79f71b40-2ea1-4a39-8f84-a480ba44c8ef","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-07T22:11:30.869700Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"Chameleon: Mixed-modal early-fusion foundation models.arXiv preprint arXiv:2405.09818, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:a8670b3d26e519743adb02165691c885d19135347b4eb7f039ff16a2535618ce","observation_id":"56d802b2-668a-405c-ad12-93d97afc94b1","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09568","last_updated":"2025-05-14T17:11:07Z","snapshot_observed_at":"2026-07-06T21:23:57.084147Z","submitted_at":"2025-05-14T17:11:07Z","title":"BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09568","snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"Blip3-o: A family of fully open unified multimodal models-architecture, training and dataset.arXiv preprint arXiv:2505.09568, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"cited_paper":"/paper/2505.09568","citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:2aee6f48c234d8925b284102b8181c4686964b68bd20c4e5d184796eaf2229ad","observation_id":"25fa5aff-909c-428d-b74a-cb1e89301b66","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"PixArt-α: Fast training of diffusion transformer for photorealistic text-to-image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:a2f517ae50b0ec39ba202a2a5ac8ad18d113b33770f902f1ca49c27a9028de78","observation_id":"447b46f2-0f61-4bf4-98bd-b11066588b35","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07963","last_updated":"2025-04-10T17:59:56Z","snapshot_observed_at":"2026-08-08T06:46:29.564428Z","submitted_at":"2025-04-10T17:59:56Z","title":"PixelFlow: Pixel-Space Generative Models with Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07963","snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"PixelFlow: Pixel-space generative models with flow.arXiv preprint arXiv:2504.07963, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"cited_paper":"/paper/2504.07963","citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:1139048cb3520c9c4d6b56daa1228de640ebbe0a31178446152e91f2e916afc4","observation_id":"5d53b2b8-b652-48ba-9a3d-45cb3819a60d","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"Janus-Pro: Unified multimodal understanding and generation with data and model scaling.arXiv preprint arXiv:2501.17811, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:34728a7fd333b31cfe4fec9657dddf482c47beb3d3822e6fe6b1c0a646ab0add","observation_id":"0db96706-1a79-4764-93cd-539fa656f5d0","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"Patch n’ Pack: NaViT, a vision transformer for any aspect ratio and resolution","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:3a595c2bfe3496e7b387155ade5d975465a46d72b11ecfb20a2a16e5401aa3b1","observation_id":"d335398d-8371-4596-bf76-40b3d80154dd","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"Emerging properties in unified multimodal pretraining.arXiv preprint arXiv:2505.14683, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:6348959cdc2623806bcc048159f6e8db6a69f13b8ee0e1c69fe4b1ca8a25a76a","observation_id":"30a5e4ab-0b1a-46a2-a73a-bc2569e16f6c","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:9b58ee133641dbc50ed2486b91550615419aadd432dd8b703837e1088a4bb195","observation_id":"b4f94780-4672-4075-936e-3be7658574c4","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"Diffusion models beat gans on image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:57b26265b020337beb9a840c0f3ff715df8a2928736301ae9154753c37bca735","observation_id":"d8b9f36a-4054-4cf4-b61f-51706c7d3227","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12500","last_updated":"2026-05-12T17:59:58Z","snapshot_observed_at":"2026-07-06T23:24:13.851504Z","submitted_at":"2026-05-12T17:59:58Z","title":"SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.12500","snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"Sensenova-u1: Unifying multimodal understanding and generation with neo-unify architecture.arXiv preprint arXiv:2605.12500, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"cited_paper":"/paper/2605.12500","citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:c00bd90f314eed6d2b9cce0edf33193392b962717193ebdb17663b70d9330676","observation_id":"eec1c095-5b55-49ab-8e4e-e111cafe4944","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:5d1601fb492656391677a268d37959f76cfe4ba918898c31163bb5611aa70580","observation_id":"a21bc18c-463d-4e49-bcd4-b73badce8fc5","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:a6cb76eb9d1a1d7d729499986e2f91bbf928980cc652d9ace507762e7a4f77d4","observation_id":"de88a2e8-26ff-40b1-9ccf-c70a500b27e8","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models.arXiv preprint arXiv:2306.13394, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:36b73742081e6d8d3e946a0fee071b0475c1c17a08aad1a60c9e65d595d8e3b4","observation_id":"e14f7bf3-8f66-4a5b-85b2-2ce0bb697474","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"Smith, Wei-Chiu Ma, and Ranjay Krishna","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:6dc4480fa7bc343787c465ceab0220725426121df7bf44cd8975075b0b52173a","observation_id":"eb484af2-cfc6-42d6-9414-5fafe928d9c4","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11346","last_updated":"2025-06-28T11:46:35Z","snapshot_observed_at":"2026-07-06T21:09:50.780345Z","submitted_at":"2025-04-15T16:19:07Z","title":"Seedream 3.0 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11346","snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"Seedream 3.0 technical report.arXiv preprint arXiv:2504.11346, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"cited_paper":"/paper/2504.11346","citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:3f030971f09e2a9472e9f06a673a83481d9a551dee6a2be0ad99c3d1f1b356fb","observation_id":"718affd4-fede-46e9-bdcc-0e395725a9a3","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"SEED-X: Multimodal models with unified multi-granularity comprehension and generation.arXiv preprint arXiv:2404.14396, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:d093b7d468437dad89181fe0a4a5fec82896f9217576634662e41cafd7a8fd1d","observation_id":"ac8fcb53-ab2b-476c-bab2-ffa7d099b020","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"GenEval: An object-focused framework for evaluating text-to-image alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:6ace14a16ac1dc9cf63c29601995bb7c5d4c9e8175deba57b5d179866211f96c","observation_id":"6a601bf0-b870-4cfc-b0e4-8e260a6ddac7","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"HallusionBench: An advanced diagnostic suite for entangled language hallucination and visual illusion in large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:1287716f236fe4af65c39c4af3951b50c25f6a2a27de865619be141e3a04c87b","observation_id":"a814cb94-4f9f-4d2f-b4ba-5aeac8e4843d","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:bca9addb6c2ad64f023c4e0f24c715ea0a6642343f22f66de6e6cf8f1288f72d","observation_id":"6a7d2f00-d00b-47bb-8e01-b8369cc96e3a","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"Simpler diffusion (SiD2): 1.5 FID on ImageNet512 with pixel-space diffusion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:80b728c79f44d0dc95f6c4c6d745fce8cae837b28b6d2e4e9a6c191348bbdac5","observation_id":"a4636529-06f0-4b30-82be-b768c435c7ca","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-04T23:51:18.339338Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05135","snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"ELLA: Equip diffusion models with LLM for enhanced semantic alignment.arXiv preprint arXiv:2403.05135, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"cited_paper":"/paper/2403.05135","citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:bc0fff969c2c70d6d0606c8fa9332b3adee492c3526c34e9531cb6a2c2605d8a","observation_id":"c01d60d0-3499-421c-a9b4-401464a2dd2d","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"A diagram is worth a dozen images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:e636105d0a72e1d528d4cf129e4047cd6482970e9ce27174573b1782aef0e5fc","observation_id":"9fb6db5a-f2d2-4a8f-89a8-d34761787717","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"Auto-encoding variational bayes.arXiv preprint arXiv:1312.6114, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:7fd317d6316c50dbe68047427509dde2ca51bef8be87ed194cda17178bb8d56b","observation_id":"4811a82a-5758-450f-a856-b6b93d408c76","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.13720","last_updated":"2026-01-07T05:36:57Z","snapshot_observed_at":"2026-07-06T22:36:08.495952Z","submitted_at":"2025-11-17T18:59:57Z","title":"Back to Basics: Let Denoising Generative Models Denoise","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.13720","snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"Back to basics: Let denoising generative models denoise.arXiv preprint arXiv:2511.13720, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"cited_paper":"/paper/2511.13720","citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:32c5289ce77469d901ed159df5cef5ac56d1c59c190ed758c242b9d2c98f50c7","observation_id":"67c35343-616c-4e20-9071-2d5de573cb16","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03147","last_updated":"2025-06-18T18:00:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-03T17:59:33Z","title":"UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03147","snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"UniWorld-V1: High-resolution semantic encoders for unified visual understanding and generation.arXiv preprint arXiv:2506.03147, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"cited_paper":"/paper/2506.03147","citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:e132c448e60bdcda14e2a46ba30f2235140c3fdcad85e74a06138a803cd61986","observation_id":"9a6fff01-7a55-423e-ac93-0548897990aa","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08268","last_updated":"2025-02-03T21:47:31Z","snapshot_observed_at":"2026-08-05T16:01:06.026395Z","submitted_at":"2024-02-13T07:47:36Z","title":"World Model on Million-Length Video And Language With Blockwise RingAttention","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08268","snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"World model on million-length video and language with blockwise RingAttention.arXiv preprint arXiv:2402.08268, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"cited_paper":"/paper/2402.08268","citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:606c731c5c756377e27cd90f00926e10b611696be9a4518a0d77765babeaf837","observation_id":"9ba1cf97-7cc6-4897-9298-0e9016bd9db9","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.24763","snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"Tuna-2: Pixel embeddings beat vision encoders for multimodal understanding and generation.arXiv preprint arXiv:2604.24763, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"cited_paper":"/paper/2604.24763","citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:c949addd07df26d8f17676c088b3389a38c84a1f034cccff2c122714cf9a1794","observation_id":"3fd2ec9a-f921-45db-a224-2f68be5cd6e7","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:1740cb56fee9522a263ea28d525d8febfff2516b69ca350ca7fb34212064ca87","observation_id":"0e76227a-78c1-416b-82bc-04b4366fe459","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"JanusFlow: Harmonizing autoregression and rectified flow for unified multimodal understanding and generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:0a92e38c4074eceee9b5e564dfb6e1bc99d59742700d2a80659682bdfd8b13e5","observation_id":"eeeff4de-3610-4171-b3a1-0c16591adb5a","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"ChartQA: A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:c051a19e64fe706a4a26e2ca31b4b124beb53f750832d1a7c6bf3ad56f85da11","observation_id":"91b641b2-8468-4a4b-a317-9af22353db9e","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.00398","last_updated":"2021-01-05T05:39:39Z","snapshot_observed_at":"2026-08-09T03:04:05.322043Z","submitted_at":"2020-07-01T11:37:40Z","title":"DocVQA: A Dataset for VQA on Document Images","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.00398","snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":null,"venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"cited_paper":"/paper/2007.00398","citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:366721961fc1a3573b5bb0b8d08c63ef339824d2943e858d8ca64e2ae204238f","observation_id":"4c9a5c00-a365-4c3e-89fc-85f4d9e504a0","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:72ea62be6b694dae981b805b1ccead616dd4a5d8d894ce9bb90fb8624bf672f9","observation_id":"37c5734d-1b23-4b88-aa57-a2b6e51cc4ac","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06256","last_updated":"2025-04-08T17:58:47Z","snapshot_observed_at":"2026-08-03T00:43:33.310493Z","submitted_at":"2025-04-08T17:58:47Z","title":"Transfer between Modalities with MetaQueries","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06256","snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"Transfer between modalities with MetaQueries.arXiv preprint arXiv:2504.06256, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"cited_paper":"/paper/2504.06256","citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:8f91bda22094723caff959808cac84f55107822772da6f8ad447624fd2d60f09","observation_id":"7ea7e89a-6461-42b2-a2ef-8686c26b6ca3","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"SDXL: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:c2808f6dfa2ba1d481017c7dcbaa4cbc318a2d6a3f0556e4046004cbbbadb5dc","observation_id":"67dcfd7d-4c5d-4302-a93e-d42d9bc1a14d","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"Du, Zehuan Yuan, and Xinglong Wu","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:aa742c94e5e65a01849ab9bf7a6f95d09d8be5ff1c8bda683767eb35bf88bb14","observation_id":"b2952c8b-a3dd-46e8-8661-f7d6ecac24fd","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"Hierarchical text-conditional image generation with CLIP latents.arXiv preprint arXiv:2204.06125, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:b6d03528c5890836315ac5932c2bf35471bc650eb626e988481efdf8f9c3c189","observation_id":"7c2ba7e0-ee72-4f80-b79f-6154a7ac1ace","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:ea7e5eeedc3a2379c02bc743e4f0862faa996b795e716a137a359824a51de60c","observation_id":"3a187d1e-824f-4c04-b8ac-fee29126b089","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"Latent diffusion model without variational autoencoder.arxiv: 2510.15301, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:21855df2c26d3ed1945d6d9fef6c7c3072d9fb5a4e2ebc13951cb331ccae0b3d","observation_id":"d6f43eeb-99ce-4e5a-8ad5-2266efe89ae6","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10104","last_updated":"2025-08-13T18:00:55Z","snapshot_observed_at":"2026-07-06T22:12:35.584339Z","submitted_at":"2025-08-13T18:00:55Z","title":"DINOv3","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10104","snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"cited_paper":"/paper/2508.10104","citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:eb307071e66e5401a3928978f0cadb6de2c5d7bb8f18b176f5492e07050ab74f","observation_id":"b414f980-526f-4589-83dc-c9fd71210dbb","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"Generative multimodal models are in-context learners","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:630ee01158d11d2c8a68700d2170a92d608b5d5aa4e4de708e4c30f9137e551c","observation_id":"0c96917a-63ba-45b4-b2bb-433680bbc4f1","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"Siglip 2: Multilingual vision-language encoders with improved semantic understanding, localization, and dense features.arXiv preprint arXiv:2502.14786, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:f2d6acd89accfa9360f4896cc8d248b2665a1da6e07753e0b80bd3df50c757a5","observation_id":"5109de35-9c1f-482e-88e6-7ff8e1a1b3da","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"Neural discrete representation learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:41c394244c343beff418885575979e91e788bec13f679f1cdfa63b60d1a6e28c","observation_id":"6bf52a3e-9c07-4463-ad59-885d32286853","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"ILLUME: Illuminating your LLMs to see, draw, and self-enhance","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:7aa477bb5e8f7eea76eea60842e41423915bf0bd0d2aa2edf7c65f4462ca572f","observation_id":"b5cc0082-fe85-46ef-9135-196aa48d17aa","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.23268","last_updated":"2025-08-04T02:46:11Z","snapshot_observed_at":"2026-08-09T02:04:57.127931Z","submitted_at":"2025-07-31T06:07:20Z","title":"PixNerd: Pixel Neural Field Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.23268","snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"PixNerd: Pixel neural field diffusion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"cited_paper":"/paper/2507.23268","citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:34202a29495c9c3952926c494f33a471b4accfa961d6736bcda5f6c2b40c83cd","observation_id":"3963e05a-db2e-43bd-9c65-33860daaead3","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"Emu3: Next-token prediction is all you need.arXiv preprint arXiv:2409.18869, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:94d9d8baf0fef9cc482552334b01fa8e81a40b2cb6358446833def37679ce370","observation_id":"b1cadfe5-22f6-4d5e-bd6b-b46cf8b75fdd","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"Cubic discrete diffusion: Discrete visual generation on high-dimensional representation tokens","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:c5ceab3a5790e4e4dacee4c005aa3c9f59d705159b79c603a9c0f458edc7bacd","observation_id":"1f76f380-4e7a-4895-b126-660d9eb3c36a","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"Wan: Open and advanced large-scale video generative models.arXiv preprint arXiv:2503.20314, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:23d5e9cb4f614ff9b2c417f4593e20c7fd6cef7d308f6c2ee6a12480fca8960a","observation_id":"1a48579d-3f14-4131-9451-fec5fa3acfdc","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02324","last_updated":"2025-08-04T11:49:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-04T11:49:20Z","title":"Qwen-Image Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.02324","snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"Qwen-image technical report.arXiv preprint arXiv:2508.02324, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"cited_paper":"/paper/2508.02324","citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:1a775e7791e9a367745c70dcbaca4646c2748f9dd8d9d6828aab0a68e37e55cc","observation_id":"df4b6c76-3515-4b4c-9fa5-74e03582d2c2","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"Janus: Decoupling visual encoding for unified multimodal understanding and generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:baff90ecd641933f2135ddb0b115df91d642dc6e8ab61d2e74375a97429b562a","observation_id":"ae0397fa-b5f3-465a-a96c-f989e40ee16d","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"OmniGen2: Towards instruction-aligned multimodal generation.arXiv preprint arXiv:2506.18871, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:9d013e0759eb474b116e7763f2fd5459419dd9739e11893d3688549dbd0e4502","observation_id":"bead864d-e8cf-4f43-97e8-96de1d0b857a","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"RealWorldQA.https://huggingface.co/datasets/xai-org/RealworldQA, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:95a668cf7e66587b4f97d42ff6ec019a6b86e4ffc86db15eaf123a3ef953940c","observation_id":"a8d0f5fe-c403-4420-bd67-7b0e4a4102be","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"Show-o: One single transformer to unify multimodal understanding and generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:b29f50f0b0f2b9162a647137f42d3521e0a0c818a4ec5988d122e501420e0906","observation_id":"1302f11a-3c2e-4776-9e08-48ca82a1c58b","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"Show-o2: Improved native unified multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:420d6e173e846e71af19ca5d71361b25a9eb6289a2cc886a7b3806c664aea9da","observation_id":"d952adf4-9e74-4cae-865f-abd790f17f38","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:bae2de1ecf1f81fb2a230cad37c6af102735623b177aacef3afe00c291e2bf33","observation_id":"6da44f9a-1181-4959-9684-c3f56eb86c31","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.21921","last_updated":"2026-04-23T17:58:38Z","snapshot_observed_at":"2026-07-06T23:08:23.939574Z","submitted_at":"2026-04-23T17:58:38Z","title":"Context Unrolling in Omni Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.21921","snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"Context unrolling in omni models.arXiv preprint arXiv:2604.21921, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"cited_paper":"/paper/2604.21921","citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:ddd276856d06e2745b4ba84a0478f8f5b242791a9b571eaae09dbe90faa24c2b","observation_id":"24966641-45da-4f6d-8c10-5b702c88dc4f","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"Representation alignment for generation: Training diffusion transformers is easier than you think","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:9c7e5c1957c8ed17e2856123fd02e6e535502170333148ff87999d2d27e6b11f","observation_id":"e7509791-14da-459b-a708-57f8acfdcbd4","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"MMMU: A massive multi-discipline multimodal understanding and reasoning benchmark for expert AGI","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:641b79d14af174eff1198ff05bcefb88f2cb7dfd73176731029e73a681b76560","observation_id":"2bdf6708-a946-430a-ab16-e1b28be01d33","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"Z-Image: An efficient image generation foundation model with single-stream diffusion transformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:17c43d8ba55bda2c4070f5a4cb38e1e7605949805db6be844924d0bc8ef1fe5a","observation_id":"1ea2d78c-ba30-4fbc-9249-11a3c2607b33","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:0e160226cca7eca189b2c2a07a76209d96e016249a61493e5daa8475283f6214","observation_id":"46e97e8e-bb93-4246-86e7-a13d4615fb6e","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.11690","last_updated":"2025-10-13T17:51:39Z","snapshot_observed_at":"2026-07-06T22:32:32.632779Z","submitted_at":"2025-10-13T17:51:39Z","title":"Diffusion Transformers with Representation Autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.11690","snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"Diffusion transformers with representation autoencoders.arXiv preprint arXiv:2510.11690, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"cited_paper":"/paper/2510.11690","citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:ee588d235e9f850784deec195a40f9e9b679d1c6e355d1adfe5f738a40fa443d","observation_id":"0336a190-c260-48d3-ad0b-83799df53e93","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"Transfusion: Predict the next token and diffuse images with one multi-modal model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:b6bf74f3bdb508b29faa083c9d5c09de9c4aafc81577548902c6ed6f91409e24","observation_id":"c6409544-364c-48c5-bb68-87be1b19612b","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":65,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 3 inbound Pith citation observations for arXiv:2605.31604."}