{"as_of":"2026-08-16T14:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7c33b946d48bec899dfde8820d6e5f2cfe409f86338a4972a69818f4e42966be","coverage":[{"denominator":83,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":83,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:17:33.970322Z","state":"measured"},{"denominator":83,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":83,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.12209/citation-record","integrity":"/paper/2608.12209/integrity","json":"/paper/2608.12209/citation-record.json","paper":"/paper/2608.12209"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-16T00:17:33.494370Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.494370Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:1928b6426781a0d4ad040f0bfdc1f9b70b4f6ec128414243567dd89ff768ceba","observation_id":"e27eee67-71f9-4100-8bcb-157b5ef51e24","resolution":{"observed_at":"2026-08-16T00:17:33.494370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-11T14:42:37.584016Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-16T00:17:33.499723Z","title":"Qwen3-VL Technical Report, November 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.499723Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:fdbef77b7d3d6657b99e82d1912d62f6a1d20612ac9ca72f60798d729f917292","observation_id":"73daf702-45dc-4ba5-9b8c-c00c0f426859","resolution":{"observed_at":"2026-08-16T00:17:33.499723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-16T11:21:33.397874Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-16T00:17:33.503957Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.503957Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:bd2967194ca44028366877d26f2e270dbf2e6188c7862930900a229035848e38","observation_id":"581d4fef-c86b-4679-892c-e199b0988514","resolution":{"observed_at":"2026-08-16T00:17:33.503957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-16T00:17:33.508431Z","title":"Visual Instruction Tuning, December 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.508431Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:929eed1abb6e1817e34b73a8a95cf33ddfa5befb5c86b7efa4e780e14d3caad8","observation_id":"690036a4-7e49-4628-8a91-54aefacf29ac","resolution":{"observed_at":"2026-08-16T00:17:33.508431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:33.513081Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.513081Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:9be462ff458f9f5d0520c1aa0d85a014f379efb8c1ba7e5ea9411b0c8211f020","observation_id":"073cf827-4cbb-4837-ab8f-b899bd3e0298","resolution":{"observed_at":"2026-08-16T00:17:33.513081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:33.517459Z","title":"Visual cot: Advancing multi-modal language models with a comprehensive dataset and benchmark for chain-of-thought reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.517459Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:68deb72684992e160c2dbdd722b5dd9b1fa0639324452482f8783faf8b87fd77","observation_id":"66e1153a-e3fe-4ab7-a84d-c0a1ec0e8aba","resolution":{"observed_at":"2026-08-16T00:17:33.517459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:33.522320Z","title":"An empirical anal- ysis on spatial reasoning capabilities of large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.522320Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:ae82db2e7d557d66ae048dcdbe89b2bf922302b61903416c6b9753a9e7e7fdd8","observation_id":"48223edc-b902-4f01-9d60-bb73da0595d2","resolution":{"observed_at":"2026-08-16T00:17:33.522320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:35.532490Z","title":"Why are visually-grounded language models bad at image classification? Advances in Neural Information Processing Systems, 37:51727–51753, 2024","venue":null,"work_id":"cf5b83f0-8b11-4e86-bf76-dcb751e2ea22","year":2024},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.526218Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:06fb713b6ba834dafd6f15e528978791e39ab163a5bf4a7f037e93ee49c2ff45","observation_id":"9dcd2796-7c6f-470c-b83f-a84dce81d3b9","resolution":{"observed_at":"2026-08-16T00:17:35.537516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:35.516720Z","title":"Question aware vision transformer for multimodal reasoning","venue":null,"work_id":"e1f75f44-0ecb-4c7a-a4cf-87726d8120fc","year":2024},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.529994Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:38f3e78a1a81c3e38f809f7b4995d1e19770f8bb7cb9e082cf2d77ed4af61292","observation_id":"56769107-c26a-4d69-8ea9-0a62b49efece","resolution":{"observed_at":"2026-08-16T00:17:35.521970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-16T00:17:33.534077Z","title":"Chameleon: Mixed-modal early-fusion foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.534077Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:2b772c6a2b93120e6b168f94d7b98ae433d01b9627519a4a0e489e73407f7fde","observation_id":"d29ae9be-8ff3-4050-9b9a-60a890622529","resolution":{"observed_at":"2026-08-16T00:17:33.534077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:35.500596Z","title":"Show-o: One single transformer to unify multimodal understanding and generation","venue":null,"work_id":"561a08ea-3ab8-471d-b016-2664f397d8dd","year":2025},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.539092Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:3b2c3d1948f96a97d73f04b10d1df60fd8e988def83c8a42451988bf527e1d55","observation_id":"8111b51c-97ea-491e-bf8a-5ac7e5ac0c30","resolution":{"observed_at":"2026-08-16T00:17:35.505930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:35.485062Z","title":"Transfusion: Predict the next token and diffuse images with one multi-modal model","venue":null,"work_id":"1819d2f6-3fb8-4501-b41b-e384cbe0dbe8","year":null},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.544262Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:b10b0fdd73519ccdc563086cd3121d77cc55e32800992e7819cbab9d4a7aa448","observation_id":"1b064072-c6b8-46a6-a37c-2e788fcd5d72","resolution":{"observed_at":"2026-08-16T00:17:35.490249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-08-16T02:50:09.905402Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-08-16T00:17:33.553581Z","title":"Emerging properties in unified multimodal pretraining","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.553581Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:0935d1b98d9067dc1e7f99c3c13239648a051ffabe0e10e402b625eb94260381","observation_id":"5357a682-5d79-41d5-9b67-aa6be7d681e1","resolution":{"observed_at":"2026-08-16T00:17:33.553581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:33.558435Z","title":"Mammothmoda2: A unified ar-diffusion framework for multimodal understanding and generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.558435Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:4d2c80f01c78a6216b548b5bf5e4bda03c5f026917db678f587f76383de24652","observation_id":"3f0b369f-d2e4-4afc-9563-01b08ee21b37","resolution":{"observed_at":"2026-08-16T00:17:33.558435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.18678","snapshot_observed_at":"2026-08-16T00:17:33.562911Z","title":"Lance: Unified multimodal modeling by multi-task synergy","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.562911Z"},"links":{"cited_paper":"/paper/2605.18678","citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:9d9241da4187a8f9b19b569796b68e7deb57f00123ec8ce95e32fe31b1b04de6","observation_id":"569f7263-26fc-45b3-8025-46d8129b94ac","resolution":{"observed_at":"2026-08-16T00:17:33.562911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:33.567839Z","title":"Multimodal learning with next-token prediction for large multimodal models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.567839Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:b5c88b3b0f2121c164b2b42dd5782f8f6f1d0c1cd657f4606a9bc4e2b84eaa93","observation_id":"63003f27-2aa1-4654-9c49-363a64cad2c1","resolution":{"observed_at":"2026-08-16T00:17:33.567839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:33.572476Z","title":"Janus: Decoupling visual encoding for unified multimodal understanding and generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.572476Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:8ca7f4dc898e203833925ecafb283921a47196e8cbd998ab4e468b3291b2b3b3","observation_id":"84770594-92dd-4d11-8867-6f6eccdd453c","resolution":{"observed_at":"2026-08-16T00:17:33.572476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:35.442240Z","title":"Mmada: Multimodal large diffusion language models","venue":null,"work_id":"2d84f799-a774-4986-8499-5a2ba6a7d45f","year":2026},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.577175Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:ed82a351785fab3b6a6608957e64fa0335741e6cb2376795c8ed6296fc952b6b","observation_id":"5da4b6b3-7fb0-4f5a-befe-3a99babd2c83","resolution":{"observed_at":"2026-08-16T00:17:35.447949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:33.581554Z","title":"Longcat-next: Lexicalizing modalities as discrete tokens","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.581554Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:e273dd951a487d9b83ccad67acfc4bc911b4f85fc0f2f4ce964e5c428d4d6118","observation_id":"75ccea02-af2c-4f5b-a6b5-5904a0f2c0b2","resolution":{"observed_at":"2026-08-16T00:17:33.581554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:33.585968Z","title":"Next-embedding prediction makes strong vision learners","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.585968Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:a84132d600c01790873a80116096f2b4fecd27369edf9d614b3c77b34f9a80f3","observation_id":"64c0448f-797f-402e-b382-d4c47a23a458","resolution":{"observed_at":"2026-08-16T00:17:33.585968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:33.590538Z","title":"Unihetero: Could generation enhance understanding for vision-language-model at large data scale? arXiv preprint arXiv:2512.23512, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.590538Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:493d28edc5c00ba4eae2c804e36bfb3e20ec95b1bc36fad3f27a2d3f9e000798","observation_id":"37c21e1c-d592-4b6d-ab4d-9da81a50ac3f","resolution":{"observed_at":"2026-08-16T00:17:33.590538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17202","last_updated":"2025-06-20T17:52:31Z","snapshot_observed_at":"2026-08-15T19:07:33.152948Z","submitted_at":"2025-06-20T17:52:31Z","title":"UniFork: Exploring Modality Alignment for Unified Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":"2506.17202","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.17202","snapshot_observed_at":"2026-08-16T00:17:34.441930Z","title":"UniFork: Exploring Modality Alignment for Unified Multimodal Understanding and Generation","venue":"cs.CV","work_id":"566bea5b-418a-473f-9d62-0d3370607e76","year":2025},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.594876Z"},"links":{"cited_paper":"/paper/2506.17202","citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:a82347ae50a07c2cc7624386e8c2626a9c887bd1fdf24a3034fb6a21bb263c44","observation_id":"942b4361-6ee5-44ce-ba8e-a87358e57908","resolution":{"observed_at":"2026-08-16T00:17:34.447253Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:33.599748Z","title":"Uni-x: Mitigating modality conflict with a two-end-separated architecture for unified multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.599748Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:2d01beb0228f8b2ce8a7261f59b52f40127f8d9b753e521319423e17b36c06e4","observation_id":"0c30f67c-517b-4927-81ba-45a7ce43b7b8","resolution":{"observed_at":"2026-08-16T00:17:33.599748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:35.426326Z","title":"Mixture-of-transformers: A sparse and scalable architecture for multi-modal foundation models","venue":null,"work_id":"55c9b6b3-76a0-411b-ad97-fb99ae1a33d7","year":2025},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.604319Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:dabb7f7fa9d5fd67fb6541c53443cb35d84a3e9c91e217e7b6f17bd9f118b130","observation_id":"6985abff-97f7-4ef9-9bb6-0f31241ac41d","resolution":{"observed_at":"2026-08-16T00:17:35.431635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-16T00:17:33.608967Z","title":"Qwen3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.608967Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:089bd673304d58792e0888523b2032f14ac918c43aa97a3dc1f7e17afd617bc6","observation_id":"1dfc456c-42b0-4591-ae33-cf1c8703e850","resolution":{"observed_at":"2026-08-16T00:17:33.608967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-14T18:51:16.666127Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-16T00:17:33.613869Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.613869Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:77dd3f551a3290bab96225d4ab1019fcd03ac1930e8a63804e9b54d727e0a314","observation_id":"7ef9f9ac-56f1-4129-9351-ddfa7291dc70","resolution":{"observed_at":"2026-08-16T00:17:33.613869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:35.410411Z","title":"Zero: Memory optimizations toward training trillion parameter models","venue":null,"work_id":"f5a6ff53-ed43-452e-b573-4392bfdc0d22","year":2020},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.618475Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:e433e71b6bc4d09db744b01ed6ee8fc2439e61321e2433dadf9ec12a4914e289","observation_id":"d32e69c6-17cd-44c4-abf9-8a2e7f63c81b","resolution":{"observed_at":"2026-08-16T00:17:35.415500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:35.394585Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models","venue":null,"work_id":"d22ad165-49a8-4bc1-9d2c-930e0640f4ae","year":2026},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.622968Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:26c0db3ba8710052838cf2fa7d87d4ce2b988f6422d01b8e4b0b520ce370286c","observation_id":"41ae2848-0ec8-47b1-90a8-5f6a04382004","resolution":{"observed_at":"2026-08-16T00:17:35.399745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:35.378942Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":"617243a9-9146-4f19-8583-af752a35aa76","year":2024},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.627474Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:9d8be9c0d39b2561e078e981ca9e637987bf5a7309540bd43aa786dd2608108b","observation_id":"183cc7c9-3aab-49f4-9be4-b059d9ce5cfd","resolution":{"observed_at":"2026-08-16T00:17:35.384039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:33.632306Z","title":"Blink: Multimodal large language models can see but not perceive","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.632306Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:2854cecae3bb04f1e541aadaf4d5ec8855a6fa7127c00c27e556072f93f2d63b","observation_id":"f66b54ef-2f8e-4fa1-b366-dae59ce38d49","resolution":{"observed_at":"2026-08-16T00:17:33.632306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:33.636732Z","title":"Charxiv: Charting gaps in realistic chart understanding in multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.636732Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:80a34f7801061bfd2c5372daf85f4963493ce3cb61c6e99e497a319b992dd3dd","observation_id":"d1930387-009c-43db-90c4-b86a88be5003","resolution":{"observed_at":"2026-08-16T00:17:33.636732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:33.641183Z","title":"Dynamath: A dynamic visual benchmark for evaluating mathematical reasoning robustness of vision language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.641183Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:b2bc8e5dbc2a9b55f653cd4207d5a99238e49376235fbceb4b35601b15c9d09e","observation_id":"39e60b28-eb04-4718-9a89-3abff8768d58","resolution":{"observed_at":"2026-08-16T00:17:33.641183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:33.645477Z","title":"Measuring multimodal mathematical reasoning with math-vision dataset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.645477Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:d872fa61b16db84e8017f018875c1a3027f6c96da40b17a7ba3486d8f6c2f87b","observation_id":"a74c4a37-3aca-4d5d-94d0-28c8a50ffbdb","resolution":{"observed_at":"2026-08-16T00:17:33.645477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:35.322033Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":"7d2d9611-bdfd-4e8e-9528-67b10cb8f958","year":2024},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.650019Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:a73baaed5d7df9f15a4d2f3feecc6a433a1fc175bd9b84728c28c63102d8c0ca","observation_id":"320d399e-1b4b-4016-ac2b-82b8f1efb5be","resolution":{"observed_at":"2026-08-16T00:17:35.326990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04973","last_updated":"2024-07-06T06:48:16Z","snapshot_observed_at":"2026-07-06T18:42:18.289966Z","submitted_at":"2024-07-06T06:48:16Z","title":"LogicVista: Multimodal LLM Logical Reasoning Benchmark in Visual Contexts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04973","snapshot_observed_at":"2026-08-16T00:17:33.654244Z","title":"Logicvista: Multimodal llm logical reasoning benchmark in visual contexts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.654244Z"},"links":{"cited_paper":"/paper/2407.04973","citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:b863b3302020555d9750af39f1faf78583b1f0071c1e5047cf6eb4a037b49d5b","observation_id":"f06d5710-f9c5-4b5f-a98d-e20707970c57","resolution":{"observed_at":"2026-08-16T00:17:33.654244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:35.306885Z","title":"Visulogic: A benchmark for evalu- ating visual reasoning in multi-modal large language models","venue":null,"work_id":"f08aedf5-2123-490d-9d48-39c92d7cbad1","year":2026},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.658494Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:49a74030910516a87250706a1313229f752ada282e8f88ac27c46ddc503d36ed","observation_id":"02f09eb4-7996-4dfb-af6e-2b535747e291","resolution":{"observed_at":"2026-08-16T00:17:35.311942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12066","last_updated":"2023-02-23T14:43:53Z","snapshot_observed_at":"2026-08-13T12:38:46.501250Z","submitted_at":"2023-02-23T14:43:53Z","title":"Teaching CLIP to Count to Ten","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12066","snapshot_observed_at":"2026-08-16T00:17:33.662073Z","title":"Teaching CLIP to Count to Ten","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.662073Z"},"links":{"cited_paper":"/paper/2302.12066","citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:8c202e741c34d189d7c377c1f63c0582aa9835ef7bde6b638daf27fb427ef947","observation_id":"26c84fe8-d53e-442a-a4e8-85a94ad09106","resolution":{"observed_at":"2026-08-16T00:17:33.662073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-16T00:17:33.665902Z","title":"PaliGemma: A versatile 3B VLM for transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.665902Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:fed5a259165c719f3654d74fd07355d4bffa6f8e554c56a85ae1354eb5547050","observation_id":"1804ee86-6b67-4b94-947f-7787318f7452","resolution":{"observed_at":"2026-08-16T00:17:33.665902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:35.291246Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms","venue":null,"work_id":"7979c4e0-53a6-455e-af8d-01ba4e9b211a","year":2024},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.670137Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:da8e9a2c9688ef15fc5ca406dcfd73b1226f93d8a2183a564cbae6a180dab6db","observation_id":"def81ece-2147-47a0-bae5-2907a8f1f1a4","resolution":{"observed_at":"2026-08-16T00:17:35.296526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:35.275089Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":"2ae8816f-0c24-4488-9d71-6f71a2dbec19","year":2025},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.674031Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:3102f7f583b4b187d39a015ac533b4d49da7f3267813a26bc61f1756d56a8f51","observation_id":"40f3269a-697b-44c9-a810-275fa14c1ae3","resolution":{"observed_at":"2026-08-16T00:17:35.280336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:33.677995Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.677995Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:d3cb2c8dfb90b3c8429bee1fe2ddd147d277f7907e7bea591173a0c61c2d4454","observation_id":"314f5c6e-7cb5-418f-b2df-3c51bcb1741d","resolution":{"observed_at":"2026-08-16T00:17:33.677995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15279","last_updated":"2025-04-21T17:59:53Z","snapshot_observed_at":"2026-08-16T11:26:50.664277Z","submitted_at":"2025-04-21T17:59:53Z","title":"VisuLogic: A Benchmark for Evaluating Visual Reasoning in Multi-modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15279","snapshot_observed_at":"2026-08-16T00:17:33.682022Z","title":"Visulogic: A benchmark for evaluating visual reasoning in multi-modal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.682022Z"},"links":{"cited_paper":"/paper/2504.15279","citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:6d812ccfc4d9c011acbefcfc5686d5addae2d187ae322190d03f0d7441ce26c0","observation_id":"2cbd7d36-a227-4539-97e0-6a8033974b9a","resolution":{"observed_at":"2026-08-16T00:17:33.682022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:35.249628Z","title":"Thyme: Think beyond images","venue":null,"work_id":"bc8bff89-c377-46ae-9bf9-92aa27f4508d","year":2026},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.686813Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:ff53bbb84846d88ec3985ca3a203f14a6820886af2b2ddfa9e415d4d67d9ff59","observation_id":"cd0019bf-cc06-4fde-a865-57ac6f7ea711","resolution":{"observed_at":"2026-08-16T00:17:35.254442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:33.691642Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.691642Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:fa32463d801dc17a12c48d7bb64658f3a424f0b75274897b48cb07648b6e4cac","observation_id":"523eabbf-f825-472c-b160-5d5f89a617c0","resolution":{"observed_at":"2026-08-16T00:17:33.691642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:35.223752Z","title":"Qwen2.5-VL Technical Report, February 2025","venue":null,"work_id":"c8c99bbb-3749-40eb-b6ec-085790d7b0ad","year":2025},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.695959Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:5b09a87494fa01aa0b53daa114031c1a0fb91d6a644903fc3bf7278f5eb2939c","observation_id":"83854f49-131d-44c5-bbf6-29f72bce05df","resolution":{"observed_at":"2026-08-16T00:17:35.229128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:35.207686Z","title":"Metamorph: Multimodal understanding and generation via instruction tuning","venue":null,"work_id":"85681e59-bc78-4334-abf9-fd2928e6e145","year":2025},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.700366Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:2c2af19e66e13f88308c0124a5c7acec0a481e67c6e46d5ac2264319e1caff4c","observation_id":"e64aa5f8-a4cc-45e2-8d69-c4de94a0fee5","resolution":{"observed_at":"2026-08-16T00:17:35.212857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-08-12T12:44:22.350068Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-16T00:17:33.704691Z","title":"Janus-pro: Unified multimodal understanding and generation with data and model scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.704691Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:d5fba76e15c7bb15be7e65a1b0966e0984a13bebffaf7c48adefd7878bfd5e2a","observation_id":"6a154796-6cdf-4c11-a87a-e2d00e90aabb","resolution":{"observed_at":"2026-08-16T00:17:33.704691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:35.191700Z","title":"Show-o2: Improved native unified multimodal models","venue":null,"work_id":"a164bf39-c05e-4276-83f4-aa4404fd52b6","year":2026},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.709277Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:e77d278204fe5c6e15a93e9a90ef0898732e0cd89bd7926c6642a9eb3efd7b97","observation_id":"c858fa4b-9750-475f-82ff-832482d94d18","resolution":{"observed_at":"2026-08-16T00:17:35.196673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:33.713410Z","title":"Cheers: Decoupling patch details from semantic representations enables unified multimodal comprehension and generation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.713410Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:fa5169d69e95e0a552e4675c7fc4739290187262897131db14bb3aab9e555b8a","observation_id":"afd85e1c-5dd4-4d8f-8ef3-6c2d91e10f02","resolution":{"observed_at":"2026-08-16T00:17:33.713410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:33.718062Z","title":"Coyo-700m: Image-text pair dataset.https://github.com/kakaobrain/coyo-dataset, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.718062Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:71a86ac8abe7c6b1140cf3dcebbb088e91d48df2647009641d6137e56c5f002c","observation_id":"50dfeed4-2f57-42eb-a738-4a3adbb969c6","resolution":{"observed_at":"2026-08-16T00:17:33.718062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:33.722979Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.722979Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:3ef8644fef80290ddad587a11c9f804d04b3aa47e803ad321df09c3e914bd004","observation_id":"48670c1e-7796-4337-84f5-53a46388c1c1","resolution":{"observed_at":"2026-08-16T00:17:33.722979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:35.156478Z","title":"Gen- eration and comprehension of unambiguous object descriptions","venue":null,"work_id":"7315f74a-2231-48c2-93b1-da05c7736f4f","year":2016},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.727985Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:2f5e9a9bf4b3f20790fa8354c5934ccfa0f4b58492f47e3ad13acac72a37ddf8","observation_id":"5ecf47df-c7d9-4053-b9f6-444cd7a69bcc","resolution":{"observed_at":"2026-08-16T00:17:35.161417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:35.140495Z","title":"Referitgame: Referring to objects 23 in photographs of natural scenes","venue":null,"work_id":"8e262f84-ecfd-4ee5-ab1d-f8f308fcc4c4","year":2014},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.732783Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:2f7ee47a0b0fccf4cc6e224f6fc21159474245067b9bcfebc67fbab464c169cc","observation_id":"3091c69c-ee9c-4e96-a108-d3f6d8b20ad8","resolution":{"observed_at":"2026-08-16T00:17:35.145538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01100","last_updated":"2025-07-15T01:14:25Z","snapshot_observed_at":"2026-08-15T18:38:02.815401Z","submitted_at":"2025-02-03T06:44:49Z","title":"ZebraLogic: On the Scaling Limits of LLMs for Logical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01100","snapshot_observed_at":"2026-08-16T00:17:33.737344Z","title":"Zebralogic: On the scaling limits of llms for logical reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.737344Z"},"links":{"cited_paper":"/paper/2502.01100","citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:39b0ceb6407307a19bc4824e75fe0013ce36ebbda53427560ccca0c284f95ef4","observation_id":"26584f7a-e5c5-430d-8e1e-9bb1d93aa0af","resolution":{"observed_at":"2026-08-16T00:17:33.737344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:33.742241Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.742241Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:b3c4faa8a679569e3fc9e7c924a2d63f4a6ae1c021e9532bd7c179f1cb1f05d7","observation_id":"c70cbff7-5db0-4c6d-b223-3480478740f4","resolution":{"observed_at":"2026-08-16T00:17:33.742241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:33.747386Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.747386Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:d3907ab575136cb48e27d1d0e4570698d4437c3e9fb7d391de156cebfadfa170","observation_id":"905e03c1-049e-4f64-a7bc-241d4ddf8505","resolution":{"observed_at":"2026-08-16T00:17:33.747386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:35.107723Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning","venue":null,"work_id":"9ab8fb0c-4a58-406e-b0bf-058c18478407","year":2023},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.752571Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:ba5750208474b3a3577146aae7da16b192765a46dd8bf3dc8b56cd03ab7cd57b","observation_id":"9268cac0-a2b7-4868-b137-d12d81434bcb","resolution":{"observed_at":"2026-08-16T00:17:35.111944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-08-13T00:09:23.835117Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-16T00:17:33.758009Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.758009Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:83e794885119e1b495ba55c49b63b2bbf0f95a747371884bbec5712f57e2297c","observation_id":"84d506e9-63f8-4616-8f32-61a9a384bdfe","resolution":{"observed_at":"2026-08-16T00:17:33.758009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-16T00:17:33.762555Z","title":"Siglip 2: Multilingual vision-language encoders with improved semantic understanding, localization, and dense features","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.762555Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:76367c58d63b098940a2e9e7ef5b6c3c3ddf621c26837443e3bc2a82f86a9f84","observation_id":"806d6f5a-3a59-438d-b1ec-c1e99e70adca","resolution":{"observed_at":"2026-08-16T00:17:33.762555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:35.092480Z","title":"gpt-5-system-card, 2025","venue":null,"work_id":"7d7bbb6e-d474-423c-aac9-2d97a1496143","year":2025},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.767368Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:c9474740e6bc16a6394beb060c051b2bf5a6c715549552d3c36cc411db5d4ae2","observation_id":"bd887cbb-d5da-4d59-9661-9de455213db5","resolution":{"observed_at":"2026-08-16T00:17:35.097932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:35.077368Z","title":"URL https://blog","venue":null,"work_id":"627a2bed-409e-46d9-94d6-eefebbe9a863","year":2024},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.771718Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:f8d1e3a5f37aa37a79993f1828675a550532d4b251ebee536884e2642dbd3983","observation_id":"aacebb07-2ed8-446c-91cb-8ecf55737892","resolution":{"observed_at":"2026-08-16T00:17:35.082321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:35.062886Z","title":"Gemini 3 flash: frontier intelligence built for speed, 2025","venue":null,"work_id":"2e4604bb-0daa-4818-92dd-e546bebf6224","year":2025},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.776922Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:b1885a8c8d08082b36475edd51c89896ccec02ea092fd3026a15673341f48224","observation_id":"53b7ce97-9450-476f-be32-e5a9b92933bf","resolution":{"observed_at":"2026-08-16T00:17:35.067638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:35.046614Z","title":"VGR: Visual grounded reasoning","venue":null,"work_id":"669efc22-07cb-4ce9-b068-3ac5816b1110","year":2026},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.781312Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:dbbee36c39ee8a5a7470aad2c23a4f54c97ea1492cca7ae1b8bc73c05bb26a52","observation_id":"fd929ecf-1804-4e14-a388-44982ba0013b","resolution":{"observed_at":"2026-08-16T00:17:35.052990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.17298","snapshot_observed_at":"2026-08-16T00:17:33.785540Z","title":"Explain before you answer: A survey on compositional visual reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.785540Z"},"links":{"cited_paper":"/paper/2508.17298","citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:aab0532014c413b0145f8ba7828fa5d1411556da6b3a2238d04b1c1a3aad0cd9","observation_id":"e58da99f-15e6-4f75-ae40-28dbe6609a75","resolution":{"observed_at":"2026-08-16T00:17:33.785540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18478","last_updated":"2025-04-27T10:39:51Z","snapshot_observed_at":"2026-08-16T12:47:26.715094Z","submitted_at":"2025-03-24T09:21:48Z","title":"Video-XL-Pro: Reconstructive Token Compression for Extremely Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18478","snapshot_observed_at":"2026-08-16T00:17:33.789852Z","title":"Video-xl-pro: Reconstructive token compression for extremely long video understanding, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.789852Z"},"links":{"cited_paper":"/paper/2503.18478","citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:353c3e4b0fc19bf9fa12c1e17333c5db5c40afc750a3471e5be6132a8cb15884","observation_id":"8f707088-def0-4a1a-9541-a31fde45abf9","resolution":{"observed_at":"2026-08-16T00:17:33.789852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:35.030932Z","title":"Video-xl: Extra-long vision language model for hour-scale video understanding","venue":null,"work_id":"4111057c-f65a-4868-95bc-004438917df0","year":2025},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.892662Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:c59566d7e1b35fbe28fd10405d45c3e13af3cdc432907ff86e61e71bf2a2ef96","observation_id":"ac6385c7-46e4-4ff2-ae91-b502cbe09e08","resolution":{"observed_at":"2026-08-16T00:17:35.036455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:35.015630Z","title":"Videochat-flash: Hierarchical compression for long-context video modeling","venue":null,"work_id":"2a5bf34a-b20a-4740-9864-218ff6140158","year":2026},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.897426Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:6bd0bb6d3b3a3edc20b6d4001324449829cf01a0e019d5ed8523a0836bfc7143","observation_id":"a929b0c3-f6b3-4cd3-b19b-0091995455d4","resolution":{"observed_at":"2026-08-16T00:17:35.020711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:34.999753Z","title":"Reconstructive visual instruction tuning","venue":null,"work_id":"fc545ca4-e0e4-465b-82bf-f12fa5082a34","year":2025},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.902010Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:899b286e7df74dca0db118356fcce00aaef82f10e156359aaa46ef2d3254a77d","observation_id":"a4a286f7-2de5-4dce-8344-2dd178faa383","resolution":{"observed_at":"2026-08-16T00:17:35.004875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:34.984824Z","title":"Autoregressive semantic visual reconstruction helps vlms understand better","venue":null,"work_id":"3dd6b114-d879-4f58-a54b-318a8bedbbdf","year":2026},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.906676Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:1d1f114edb5b5c20206304d2cc8759b83fa798b13f0165c04a93a86e335d42b0","observation_id":"e779dc83-cfa0-4390-b4fb-f2934a771cda","resolution":{"observed_at":"2026-08-16T00:17:34.989707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:34.970510Z","title":"Generation enhances understanding in unified multimodal models via multi-representation generation","venue":null,"work_id":"2fb5bbe2-b076-41d2-acce-d9c76301f682","year":2026},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.911508Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:b21bb498fac0eaa7c8fc59e072456eee78f84fc130280010071b4829fa6c0cae","observation_id":"0dae9be8-18b4-462f-aedf-d247e85fa217","resolution":{"observed_at":"2026-08-16T00:17:34.975035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09568","last_updated":"2025-05-14T17:11:07Z","snapshot_observed_at":"2026-08-16T09:34:56.272667Z","submitted_at":"2025-05-14T17:11:07Z","title":"BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09568","snapshot_observed_at":"2026-08-16T00:17:33.916989Z","title":"Blip3-o: A family of fully open unified multimodal models-architecture, training and dataset","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.916989Z"},"links":{"cited_paper":"/paper/2505.09568","citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:ed249933d6af8579b83e7722cec4a526eaa04cf5388c64c6020e2658ac5c0b43","observation_id":"b8ab97a0-4659-420f-bbd2-40479f921270","resolution":{"observed_at":"2026-08-16T00:17:33.916989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"3876.9246","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:34.075919Z","title":"LMFusion: Adapting pretrained language models for multimodal generation","venue":null,"work_id":"ffe4cd15-3f9f-47b9-91f9-8d280c97241c","year":2026},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.921910Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:e4e45f13ad5a3efdcf0b6e18eb9b7bf807b9d4202bba302ac48b61c910d3ead2","observation_id":"f820c2a0-3031-4f0e-87b8-b377bd0734ae","resolution":{"observed_at":"2026-08-16T00:17:34.087176Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:34.956552Z","title":"- Row 1, Fig","venue":null,"work_id":"2b1b9797-afa7-4fce-9771-535514d56257","year":null},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.926801Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:69b9edf6a191d0fd54541e53a55b92809cd9595137fa1bbaf15677a1dbcb869a","observation_id":"95c572ab-905d-4dd6-bc6f-629fc15d2719","resolution":{"observed_at":"2026-08-16T00:17:34.960789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:34.942038Z","title":"All figures share the same two-shape overlapping composition with consistent contour and inner-line connectivity","venue":null,"work_id":"2cfffba8-72ac-4da5-bf3e-7fe8c4a644bc","year":null},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.931751Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:d033dd36b237a6a423e41802ff5dd73b9e7f7165edc38cf2ba7b248f7cbb9163","observation_id":"3b16e616-1bc7-4869-aa16-07fc00ab01c8","resolution":{"observed_at":"2026-08-16T00:17:34.947379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:34.926578Z","title":"Option A is a triangle pair with a mismatched shape; Option B is a triangle pair with inconsistent line count; Option C is a quadrilateral but with a different stacking style","venue":null,"work_id":"7f9b096a-ed5f-47fe-966f-9f91d511e519","year":null},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.935730Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:75c0c868be4618fa1d689fb99ee1fc3166fd111a1d52586bb87fe832ae7d90d5","observation_id":"2c55ad56-d9a3-48ba-9d36-a7298d51ff94","resolution":{"observed_at":"2026-08-16T00:17:34.931691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:34.910726Z","title":"A bipartite graph is a graph whose vertices can be divided into two disjoint sets such that every edge connects a vertex in one set to a vertex in the other set","venue":null,"work_id":"41f215e3-4eca-45e2-b096-9fd69c65e04f","year":null},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.940312Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:900350965612194cbb0336a11e1a92ac0e6f060fd83e0b561ac81fbabe4d448d","observation_id":"64359b35-023e-4c33-8ad6-d23ce8ab9a83","resolution":{"observed_at":"2026-08-16T00:17:34.915799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:34.894496Z","title":"If there are no odd-length cycles, the graph is bipartite","venue":null,"work_id":"6741f625-5e43-4546-852f-30279d0fc161","year":null},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.946065Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:afbd1278c600a690701ca945a007e2fd50f8819d9af382c41118f9d92456a20d","observation_id":"ace91903-90da-48b4-8a18-a0dfcaaadbf3","resolution":{"observed_at":"2026-08-16T00:17:34.899750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:34.877979Z","title":"This is because we can color one set of vertices with one color and the other set with a different color, ensuring that no two adjacent vertices share the same color","venue":null,"work_id":"6a35008b-1940-488d-9199-d9d3ad36940c","year":null},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.950502Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:701f7d19eb1b1ef1bd22c211360b1f35716150323fb597641622b2172d8a5a1c","observation_id":"fed92e39-9f71-4eb9-b408-a516c7389120","resolution":{"observed_at":"2026-08-16T00:17:34.883082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:34.862004Z","title":"</think> The final answer is2","venue":null,"work_id":"16ceb705-eed5-411d-bad2-f3c77e7a75c1","year":null},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.955074Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:77b67372a4657364e76a06d747b780cb55102beb0dae8f5d368f538f554653dc","observation_id":"7a933e72-25a3-440a-84da-7f5ef6be6931","resolution":{"observed_at":"2026-08-16T00:17:34.866845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:34.845554Z","title":"There are two visible wooden poles supporting the tree","venue":null,"work_id":"08aa839a-bb7d-4d1b-b605-686d3c971586","year":null},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.959994Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:c4993e450516936c2c4617e4b27a21e7a6b6af3870e94230422c874afd727ef0","observation_id":"1cb9d5ad-aa2a-48ce-adbc-690eaec86790","resolution":{"observed_at":"2026-08-16T00:17:34.850621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:34.828103Z","title":"There are no additional wooden poles visible in the background or elsewhere in the image","venue":null,"work_id":"6e846591-c925-4e1e-9e6e-8ac1b02a1e92","year":null},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.964690Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:06c15218150d7d1f3a357a8986eaeecd5d60b7c7cfbd47dffcaf1a2b45951587","observation_id":"349c59f0-13ea-4c7c-ab7d-5e1d5209b7af","resolution":{"observed_at":"2026-08-16T00:17:34.833597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:34.813021Z","title":"Given this analysis, the correct answer is: **C","venue":null,"work_id":"46cd641b-66db-49b1-98ff-cb857b86fea4","year":null},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.970322Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:be50910b97fe94ba76d05c63ddd6702280eab49b81886ca702cde360f67ab082","observation_id":"efe688c9-dee5-47cf-8bef-abf21d9a764e","resolution":{"observed_at":"2026-08-16T00:17:34.817360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:35.469379Z","title":null,"venue":null,"work_id":"afc8146e-6f4d-4e20-aed8-c6590eb83b5f","year":null},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.548992Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:22ae94ba30eaefb06834524cb91f192a9885db9ff02c6ca8690f9c5d2356238b","observation_id":"ff1816c0-e15b-4c2c-99e6-b95510212187","resolution":{"observed_at":"2026-08-16T00:17:35.474150Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction"},"reference_resolution":{"displayed":83,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":2,"verified_fuzzy":39},"total_outbound_references":83},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 83 of 83 outbound references and 0 inbound Pith citation observations for arXiv:2608.12209."}