{"as_of":"2026-08-12T22:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f7f5b808a89eaec2101ea8a7016b66a99e3502fa855e1b812faadca9f29de4a4","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:16:21.519000Z","state":"measured"},{"denominator":75,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":75,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-01T05:57:54.653504Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T14:38:28.862952Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"cited_work":{"arxiv_id":"2506.02975","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02975","snapshot_observed_at":"2026-07-03T14:38:28.862952Z","title":"Haploomni: Unified single transformer for multimodal video understanding and generation","venue":null,"work_id":"7ba17053-5d5b-4aa1-bf40-e1f696995a7e","year":2025},"citing_paper":{"arxiv_id":"2506.15564","last_updated":"2025-09-22T01:24:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-18T15:39:15Z","title":"Show-o2: Improved Native Unified Multimodal Models","version":3},"reference_index":124,"source":"pdf_text","source_observed_at":"2026-05-12T18:51:15.428692Z"},"links":{"cited_paper":"/paper/2506.02975","citing_paper":"/paper/2506.15564"},"observation_digest":"sha256:88097b525488c7d0be9b9df76b3a24bdf64bf7c5682b8b8153665bdca4323616","observation_id":"965001ce-327d-438c-9039-a5e6a168f8e6","resolution":{"observed_at":"2026-05-12T18:51:15.840730Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"cited_work":{"arxiv_id":"2506.02975","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02975","snapshot_observed_at":"2026-07-03T14:38:28.862952Z","title":"Haploomni: Unified single transformer for multimodal video understanding and generation","venue":null,"work_id":"7ba17053-5d5b-4aa1-bf40-e1f696995a7e","year":2025},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-04T16:01:22.114748Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":1},"reference_index":133,"source":"pdf_text","source_observed_at":"2026-05-20T11:46:52.658984Z"},"links":{"cited_paper":"/paper/2506.02975","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:5d7c9ec803193b365eed2254babba30bfaee87de99842ca7adfd43de29a6c052","observation_id":"457ff10f-9cbf-418a-bfb6-e055bc7015f5","resolution":{"observed_at":"2026-05-20T11:48:14.984218Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"cited_work":{"arxiv_id":"2506.02975","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02975","snapshot_observed_at":"2026-07-03T14:38:28.862952Z","title":"Haploomni: Unified single transformer for multimodal video understanding and generation","venue":null,"work_id":"7ba17053-5d5b-4aa1-bf40-e1f696995a7e","year":2025},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-04T16:01:22.114748Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":134,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"cited_paper":"/paper/2506.02975","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:0303e268d28464acbeec972b14a818a6f2c8bbd16f8fc999e2da7ee6a298fccc","observation_id":"0ccd6c77-5403-4c12-897d-a4c838967cf7","resolution":{"observed_at":"2026-05-21T07:59:50.484062Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"cited_work":{"arxiv_id":"2506.02975","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02975","snapshot_observed_at":"2026-07-03T14:38:28.862952Z","title":"Haploomni: Unified single transformer for multimodal video understanding and generation","venue":null,"work_id":"7ba17053-5d5b-4aa1-bf40-e1f696995a7e","year":2025},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-12T18:02:55.540174Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":206,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"cited_paper":"/paper/2506.02975","citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:d9d077ac745adfdf2013033ed8f4cceef595d352828ea0a5c02f87ba99aa8236","observation_id":"b7a9c49b-0821-4690-9c9f-c2d70ad77567","resolution":{"observed_at":"2026-07-03T14:38:28.864384Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"cited_work":{"arxiv_id":"2506.02975","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02975","snapshot_observed_at":"2026-07-03T14:38:28.862952Z","title":"Haploomni: Unified single transformer for multimodal video understanding and generation","venue":null,"work_id":"7ba17053-5d5b-4aa1-bf40-e1f696995a7e","year":2025},"citing_paper":{"arxiv_id":"2606.31326","last_updated":"2026-06-30T08:29:29Z","snapshot_observed_at":"2026-07-07T00:05:02.977105Z","submitted_at":"2026-06-30T08:29:29Z","title":"Bridging Video Understanding and Generation in a Unified Framework","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-01T05:57:54.653504Z"},"links":{"cited_paper":"/paper/2506.02975","citing_paper":"/paper/2606.31326"},"observation_digest":"sha256:6fbf36af4ad567cbb93ff3f410db0156a32dc053d79056984fa700e6466ccc56","observation_id":"ed9aaa69-983e-4bc4-91c5-f14b6ab72a28","resolution":{"observed_at":"2026-07-01T10:05:40.316917Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.02975/citation-record","integrity":"/paper/2506.02975/integrity","json":"/paper/2506.02975/citation-record.json","paper":"/paper/2506.02975"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T11:16:14.506946Z","title":"arXiv:2303.08774 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:14.506946Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:597e384d6de140ac7cb0d7e7bcfb43e613a1c65eb5cd98e82e01da8747a0f62e","observation_id":"a13f4005-cb86-45a2-a717-72beb0583d9a","resolution":{"observed_at":"2026-08-07T11:16:14.506946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-07T11:16:14.572299Z","title":"arXiv preprint arXiv:2308.12966 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:14.572299Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:e380432a8ed0546b4510f462631b2d06a26edd5cf0ae88628850ca9390d549a0","observation_id":"79264a30-30f2-4191-9e39-c409ab5016f2","resolution":{"observed_at":"2026-08-07T11:16:14.572299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:16:14.659832Z","title":"In: IEEE International Conference on Computer Vision (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:14.659832Z"},"links":{"citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:c7220be6cb9979931bc6821fb9accdc19e420f4ff33f388e43ae1eb719fbf29d","observation_id":"1f3a5d2b-7a8e-4831-b203-41a29c957e94","resolution":{"observed_at":"2026-08-07T11:16:14.659832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:16:26.941179Z","title":null,"venue":null,"work_id":"c5b42dca-fca3-4a0f-b5ae-bcf7c340abb8","year":2023},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:14.784115Z"},"links":{"citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:57608aaae525cea9255cfaab80c6586f754607967c8fef6ff987caa6b14d6c5c","observation_id":"afc1382b-fb08-467a-9ef1-24cacf15ea8d","resolution":{"observed_at":"2026-08-07T11:16:27.013945Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19512","last_updated":"2023-10-30T13:12:40Z","snapshot_observed_at":"2026-08-10T20:17:19.785772Z","submitted_at":"2023-10-30T13:12:40Z","title":"VideoCrafter1: Open Diffusion Models for High-Quality Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19512","snapshot_observed_at":"2026-08-07T11:16:14.922831Z","title":"arXiv preprint arXiv:2310.19512 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:14.922831Z"},"links":{"cited_paper":"/paper/2310.19512","citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:3055cf716b2803e235e8c0a12890d2556e01f78204627e98c30608a0c8345a27","observation_id":"fa59cb0f-beef-4c50-a460-976dbf4e9bdf","resolution":{"observed_at":"2026-08-07T11:16:14.922831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-04T08:17:54.774738Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-07T11:16:15.006996Z","title":"arXiv:2311.12793 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:15.006996Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:9414582de9176cebef39e541ada1b19b28b8c6c86eb46865d135b1ad780a960b","observation_id":"b7be0a79-3ea8-415c-aefb-68673c5eedbf","resolution":{"observed_at":"2026-08-07T11:16:15.006996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-07T11:16:15.089684Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:15.089684Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:0d614a0d394681ecd6c994fc48d2c0e2f306e46d176c9b5c85bbb5df4ca92ce6","observation_id":"b32ebac2-456b-43ad-be0c-e6e28bd0992e","resolution":{"observed_at":"2026-08-07T11:16:15.089684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:16:26.779443Z","title":null,"venue":null,"work_id":"97df3c6a-f5a7-48b0-a2ea-1f8da9857a42","year":2025},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:15.228633Z"},"links":{"citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:d0dce0543bccd81f71fd8e2a80da4891308209f8afcb1463735fe49c28decfc2","observation_id":"d5fc3d08-eb27-4049-9d88-beff913c26ce","resolution":{"observed_at":"2026-08-07T11:16:26.856003Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:16:15.334960Z","title":"In: CVPR (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:15.334960Z"},"links":{"citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:88907bbd3299d35fb7d3f09b30d16a8b45a7994630aa1ff6d5b05754b4bcf8e1","observation_id":"44b6df66-8a4a-4019-963a-265169d7be78","resolution":{"observed_at":"2026-08-07T11:16:15.334960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-08-09T19:28:34.281681Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-08-07T11:16:15.447091Z","title":"arXiv preprint arXiv:2402.03766 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:15.447091Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:c4ce9b9cc8878ede952fa73ad043522d5bcada58415c27055b413040e0572cbb","observation_id":"e38fb6ad-af18-409c-8cd7-4b9980fb91f2","resolution":{"observed_at":"2026-08-07T11:16:15.447091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:16:26.585293Z","title":"In: NeurIPS (2023)","venue":null,"work_id":"0f8b9c99-f2b8-49f5-8656-7d1a20c01eb0","year":2023},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:15.578839Z"},"links":{"citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:020240d68db15a6cfdf182d3ce9638baac3dfe5667fcc5f95ac0f2704e96323c","observation_id":"0e6550da-6808-44b6-b291-a2efcd82aa39","resolution":{"observed_at":"2026-08-07T11:16:26.696605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-07-06T18:32:23.999019Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-07T11:16:15.700721Z","title":"arXiv:2406.11832 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:15.700721Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:08a5df8a51c19a5d19a194b5663a8fa1e0052c21ff5663adb657eba9ebeb07ea","observation_id":"9713abf4-f732-4f4c-9f1b-cdedf42b3fbf","resolution":{"observed_at":"2026-08-07T11:16:15.700721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11499","last_updated":"2024-03-15T19:19:28Z","snapshot_observed_at":"2026-08-07T22:11:51.327954Z","submitted_at":"2023-09-20T17:58:05Z","title":"DreamLLM: Synergistic Multimodal Comprehension and Creation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11499","snapshot_observed_at":"2026-08-07T11:16:15.792420Z","title":"arXiv preprint arXiv:2309.11499 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:15.792420Z"},"links":{"cited_paper":"/paper/2309.11499","citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:be9e4d6bf574602937df0b8325c0fa001e4c14d2c8b4d0d1d00d1515a3bf0f64","observation_id":"83d4e62d-1993-41be-9d4e-f41215657048","resolution":{"observed_at":"2026-08-07T11:16:15.792420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T11:16:16.069504Z","title":"arXiv preprint arXiv:2010.11929 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:16.069504Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:6d9921353cbce24779a276a03ab65814be32743937232d062d4cceea74b4f500","observation_id":"25abc879-463d-47f7-9273-9f48f651a92b","resolution":{"observed_at":"2026-08-07T11:16:16.069504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T11:16:16.243885Z","title":"arXiv:2407.21783 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:16.243885Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:0d068c15cf223754f2c7d4605bf10529091ae30308e1c3e89ef61653e65dfd25","observation_id":"a391fc56-3afb-4c82-85ca-037994c666d1","resolution":{"observed_at":"2026-08-07T11:16:16.243885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-08-12T19:12:43.246639Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-08-07T11:16:16.395393Z","title":"arXiv preprint arXiv:2404.14396 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:16.395393Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:5dba3ffe1220b6c230825d4a3edb387e759eea6f21db42f0f8a3568ac6dea177","observation_id":"d56cd85d-821c-4c2a-ab6e-384756e61da4","resolution":{"observed_at":"2026-08-07T11:16:16.395393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:16:26.439620Z","title":"In: Proceedings of the IEEE conference on computer vision and pattern recognition","venue":null,"work_id":"7c59098d-2312-4029-914d-275dc806f8e2","year":2017},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:16.536886Z"},"links":{"citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:5f6be1063eedaa44bc0e28a786a66e3172f9733411fc691ea5d6f6be03144b01","observation_id":"0976f8d8-0e68-4cb6-92a5-4d4f8be446cc","resolution":{"observed_at":"2026-08-07T11:16:26.505291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-08-12T14:50:50.360929Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-07T11:16:16.636718Z","title":"arXiv preprint arXiv:2307.04725 (2023) 12","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:16.636718Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:d5153a3d31322c2c7b60e9769affddfcd4b4d820dce7be71021e6c94f6ca0cbe","observation_id":"b7e2b992-0987-43d9-850d-72b70be437e9","resolution":{"observed_at":"2026-08-07T11:16:16.636718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-08-12T12:48:31.714281Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-08-07T11:16:16.736485Z","title":"arXiv preprint arXiv:2211.13221 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:16.736485Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:fd4ffa7e56c954ab993960ce4ff13cb33ccd938da8a5fb2cff2cdffa3bf78c39","observation_id":"8ea726f6-3011-4dcc-9cf2-46f5dfc35b3e","resolution":{"observed_at":"2026-08-07T11:16:16.736485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:16:16.864103Z","title":"Advances in Neural Information Processing Systems35, 8633–8646 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:16.864103Z"},"links":{"citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:eab90b22b09c6ec2c963b15b16d954afb2d2df120a50e02b7c0f86a5d4a801fd","observation_id":"a6dc66f1-3ea0-4975-8326-04d175955325","resolution":{"observed_at":"2026-08-07T11:16:16.864103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15868","last_updated":"2022-05-29T19:02:15Z","snapshot_observed_at":"2026-08-12T19:21:15.526321Z","submitted_at":"2022-05-29T19:02:15Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15868","snapshot_observed_at":"2026-08-07T11:16:17.002270Z","title":"arXiv preprint arXiv:2205.15868 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:17.002270Z"},"links":{"cited_paper":"/paper/2205.15868","citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:58e63d955371f9e01f983a786a1dbb848969da241affda399bc85f4777f7e9c5","observation_id":"bea976c4-af4f-48e1-bc3d-914e52d7c605","resolution":{"observed_at":"2026-08-07T11:16:17.002270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:16:26.183842Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"378a45d1-b5d6-4a73-96eb-f2a6816ec6f6","year":2024},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:17.079127Z"},"links":{"citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:4c57a55f09e1537376b0267331499dc9419b3697d2dc2b8826096c7c4958e90c","observation_id":"8237ec16-8a61-4426-9b6b-9ed4d31c10f6","resolution":{"observed_at":"2026-08-07T11:16:26.290481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:16:26.000673Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":"bfd5fd24-6892-4216-b4b4-02e0ca150933","year":2019},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:17.176950Z"},"links":{"citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:22c56b2e2ad460e6b0afd81246ffc910c311c471a4f9cd75c581da5dbcaf7700","observation_id":"52fc6de1-7fce-4994-95ac-e888d8261ee7","resolution":{"observed_at":"2026-08-07T11:16:26.068827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:16:17.282827Z","title":"arXiv preprint arXiv:2402.03161 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:17.282827Z"},"links":{"citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:326eb56c33b992ff73f854d903f8090e91635e31e57a26e5fd6f91ba5ffafa94","observation_id":"aa920d3a-5679-4c4f-a214-4711302fe5e6","resolution":{"observed_at":"2026-08-07T11:16:17.282827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:16:25.786912Z","title":"In: Computer Vision–ECCV 2016: 14th European Conference, Amsterdam, The Netherlands, October 11–14, 2016, Proceedings, Part IV 14","venue":null,"work_id":"8511412e-bb4b-4227-bb26-8c5cffc0c65b","year":2016},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:17.420701Z"},"links":{"citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:baec84ea93943c8777edb071d589d73543650e43c41241ecaffa2bb26666daa5","observation_id":"092f870b-41a7-4c8f-9949-328d1eafa47d","resolution":{"observed_at":"2026-08-07T11:16:25.902895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:16:25.589862Z","title":"https://klingai.com/ (2024)","venue":null,"work_id":"b39a3f76-a967-48b3-8599-393fdbe8404d","year":2024},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:17.575158Z"},"links":{"citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:35513b5c640dce97b2c4dc9d528a577cd80a4e79b89110a38750a9a854edce29","observation_id":"c0e42125-a9d0-4ca7-9443-6c089dcdadfd","resolution":{"observed_at":"2026-08-07T11:16:25.683493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T11:16:17.717095Z","title":"arXiv:2408.03326 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:17.717095Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:8624ce524f64195c2d370d31b1cf73566552c72f1bff1249f7fc695dfc22aef5","observation_id":"32e5afa7-020c-484e-bbc9-a13bd6dfb8be","resolution":{"observed_at":"2026-08-07T11:16:17.717095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-07T11:16:17.940410Z","title":"arXiv preprint arXiv:2307.16125 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:17.940410Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:d8c69c4a7f7b107c22aa3925b9e8eea461eb1982f95a45aa48c504e52a5104ae","observation_id":"180e0478-7161-47f9-94a3-1f6d0ac71469","resolution":{"observed_at":"2026-08-07T11:16:17.940410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:16:25.418757Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"1553f92b-d1ab-4155-826b-4def05ac7bba","year":2024},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:18.034666Z"},"links":{"citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:7071d8e016d0035442336defc1a341dd60abf279d46919731fe8b1a53a3c38d0","observation_id":"cea17f4b-ab73-427e-bddc-12dcdbe5bc59","resolution":{"observed_at":"2026-08-07T11:16:25.494808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:16:25.252054Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":"0f828b8e-2b59-4398-acae-3e298b1e9915","year":2025},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:18.131456Z"},"links":{"citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:96ec05dd6b2c58f220c77ac756b88ded3c06573f6512eb78a89f986189c89bdd","observation_id":"2eb70775-e30e-4e55-9c11-d5faa1b38a0e","resolution":{"observed_at":"2026-08-07T11:16:25.351624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-08-12T18:48:30.326248Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-07T11:16:18.221076Z","title":"arXiv preprint arXiv:2305.10355 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:18.221076Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:8f885569aec02a7247bd8e50981f527027414b17b6fc6dcc6f1357060d8e1a7a","observation_id":"7642fe84-a521-4794-a55e-d0ab25927c10","resolution":{"observed_at":"2026-08-07T11:16:18.221076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00131","last_updated":"2024-11-28T14:07:45Z","snapshot_observed_at":"2026-08-11T04:49:22.222888Z","submitted_at":"2024-11-28T14:07:45Z","title":"Open-Sora Plan: Open-Source Large Video Generation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00131","snapshot_observed_at":"2026-08-07T11:16:18.284392Z","title":"arXiv preprint arXiv:2412.00131 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:18.284392Z"},"links":{"cited_paper":"/paper/2412.00131","citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:fbd9e9987e4bd2052fd5ba524698a27e3c9f65b10cb29b7a6ab66100e91eb3f8","observation_id":"ca173804-0844-4389-9719-ce8ec513b164","resolution":{"observed_at":"2026-08-07T11:16:18.284392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-07T11:16:18.380392Z","title":"arXiv preprint arXiv:2311.10122 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:18.380392Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:9f9404ff5227e3242a9eb9708d2ae782abcc07f2f57b38dc0ffe66986be2a2f2","observation_id":"e7bbd53c-99a3-4dcc-8578-8cf3b081f682","resolution":{"observed_at":"2026-08-07T11:16:18.380392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:16:25.060411Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"d408fa24-6fe5-4d69-9269-8277cf12ee67","year":2024},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:18.454646Z"},"links":{"citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:1731f9591a5fda75b65d0ff174be0e47eb4190ce7e691ac34693fad12590ec21","observation_id":"2489a54f-585c-4fc0-9818-7f6660f54ee1","resolution":{"observed_at":"2026-08-07T11:16:25.163273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:16:24.847848Z","title":"arXiv preprint (2024)","venue":null,"work_id":"4caf8cf8-d284-412c-833c-0fc88f00bab2","year":2024},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:18.559489Z"},"links":{"citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:3085c8cc6ce02013c1c6a87d1548928352b3d5953ccc888c52d5cb6a18bd1f66","observation_id":"b18aed56-303a-4aa4-8578-05fca8648344","resolution":{"observed_at":"2026-08-07T11:16:24.939398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:16:24.666963Z","title":"In: CVPR (2024) 13","venue":null,"work_id":"9ff370c3-f7cd-4dbf-8b14-29e4777d756e","year":2024},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:18.629428Z"},"links":{"citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:46e43f9e2ea94758ada31d5f3b67a54029b7ff55a927e289cc18a1d1b38a8b7e","observation_id":"a476b683-fe59-4762-85af-ee9bcdb361f8","resolution":{"observed_at":"2026-08-07T11:16:24.743289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:16:24.438991Z","title":null,"venue":null,"work_id":"d06eed9f-3060-4f23-b6ed-60640881c911","year":2024},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:18.714499Z"},"links":{"citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:8e78ec2b8c9a594cc781079f50cd4adc64e621b24c5fedb9042d3f1943d8e0ef","observation_id":"0e461a0e-472b-44d6-a8d5-62d4c0cc5a83","resolution":{"observed_at":"2026-08-07T11:16:24.547264Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:16:24.206424Z","title":"In: NeurIPS (2024)","venue":null,"work_id":"aa1e4afe-cdb3-4a90-b509-2f7855ad0c30","year":2024},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:18.841664Z"},"links":{"citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:fe5e28662fc75967b92d306cf9278c52903b083ed264f1d66fce4da984339a92","observation_id":"a13691e4-453e-487d-ba56-7438da341eeb","resolution":{"observed_at":"2026-08-07T11:16:24.317407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T11:16:18.935298Z","title":"arXiv preprint arXiv:1711.05101 (2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:18.935298Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:1755b3603087d9014e098bf8df0a417789133089d907d61a31c12081177cae3d","observation_id":"b2d9467b-2076-4c4a-8f5c-6afb0dd7a594","resolution":{"observed_at":"2026-08-07T11:16:18.935298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:16:23.987669Z","title":"Advances in Neural Information Processing Systems 36, 46212–46244 (2023)","venue":null,"work_id":"109c6e03-4d5e-4cbb-b62d-20166eb9d652","year":2023},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:19.027439Z"},"links":{"citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:6150b7475d8479b667f8e48416b27046862994c46c4b838074b50d2f14ff5319","observation_id":"168f2578-0999-4167-a20c-7dc6c21f0002","resolution":{"observed_at":"2026-08-07T11:16:24.118268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:16:23.807471Z","title":null,"venue":null,"work_id":"9ddb828d-0ebc-4959-b318-b4ad6ba93ad4","year":2024},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:19.118945Z"},"links":{"citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:daabf1fa9966af5349ae0aab78e34f135005992e8c9d107472fbec5edcd14371","observation_id":"03947037-f2dd-4076-9ce9-0b9e7098a129","resolution":{"observed_at":"2026-08-07T11:16:23.882413Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:16:19.211614Z","title":"Advances in neural information processing systems35, 27730–27744 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:19.211614Z"},"links":{"citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:a5f77f0f4decfde936fc6609e6bed170a5612522974db355c853104966293bd4","observation_id":"789c8f16-7dce-45b8-aa24-df7044f9d3f0","resolution":{"observed_at":"2026-08-07T11:16:19.211614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:16:19.276511Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:19.276511Z"},"links":{"citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:9e07391169c9510fc586d965ade1eb5559309fc89ccbd241fd39b3c2d7e966f9","observation_id":"c1a4ad03-ae42-422d-9f49-35f5d75f7aad","resolution":{"observed_at":"2026-08-07T11:16:19.276511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:16:23.580020Z","title":"https://pika.art/home/ (2023)","venue":null,"work_id":"ef300c90-9afc-4387-aa98-b160e9c837c4","year":2023},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:19.360988Z"},"links":{"citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:f294a5b7055a7d96d3e044285df1bdd31e6696cfb5f6a4bc8b7ce60af066fb41","observation_id":"6c4ba381-1719-471b-b545-5aeae0ccb0cb","resolution":{"observed_at":"2026-08-07T11:16:23.695032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-07T11:16:19.466351Z","title":"arXiv preprint arXiv:2307.01952 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:19.466351Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:977de7b601ff16d6834625646bea1912bd65d2bcd2d30fa274466810b0dc91fe","observation_id":"7bdd302f-5511-4610-8466-56f2b6827031","resolution":{"observed_at":"2026-08-07T11:16:19.466351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03069","last_updated":"2025-08-07T09:08:33Z","snapshot_observed_at":"2026-08-11T22:45:59.824084Z","submitted_at":"2024-12-04T06:46:55Z","title":"TokenFlow: Unified Image Tokenizer for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03069","snapshot_observed_at":"2026-08-07T11:16:19.588611Z","title":"arXiv preprint arXiv:2412.03069 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:19.588611Z"},"links":{"cited_paper":"/paper/2412.03069","citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:7ab3f8d703258497895026796ff9856eb306becf03bd2171b27f9d2436609b77","observation_id":"deba6181-a615-42f0-841b-d0ff73d2e289","resolution":{"observed_at":"2026-08-07T11:16:19.588611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:16:23.383168Z","title":"https://runwayml.com/research/introducing-gen-3-alpha/ (2024)","venue":null,"work_id":"100c90c1-8e06-4d4b-b44e-32d0feaf367c","year":2024},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:19.654917Z"},"links":{"citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:77acc075d47cd29be279a8818b746030894961340bf5bfdd82595b639f8ec9c6","observation_id":"f80f9974-b276-4976-a819-7aea019853a1","resolution":{"observed_at":"2026-08-07T11:16:23.482110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:16:23.175415Z","title":"Advances in Neural Information Processing Systems36 (2024)","venue":null,"work_id":"2a5395cb-39fe-4e68-b872-21ea4d59109a","year":2024},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:19.741402Z"},"links":{"citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:475c8d2a8f6b07709cb2f9b25b8b4505869c77f919e9941d6b5c717353fff636","observation_id":"6f6a0211-05a8-4d32-92f6-9f6446e0342f","resolution":{"observed_at":"2026-08-07T11:16:23.295844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-07T11:16:19.828951Z","title":"arXiv preprint arXiv:2010.02502 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:19.828951Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:32c5c3dd9f6c8acddbc933023308a1219b35c1aee07b5c31546f144a460ab4f6","observation_id":"3aae1503-de1f-4f03-ba0e-9a56b5dba7b6","resolution":{"observed_at":"2026-08-07T11:16:19.828951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:16:22.966034Z","title":"Advances in Neural Information Processing Systems36(2024)","venue":null,"work_id":"b54195c4-1f90-462b-9d4f-0c28c5919446","year":2024},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:19.939119Z"},"links":{"citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:38d62d6778369fec3eef9349287c7c2019e43885c454579197bfe8225943094f","observation_id":"56294852-2b48-4862-9837-13a766e2e86e","resolution":{"observed_at":"2026-08-07T11:16:23.074955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:16:22.782373Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"c916fbba-54ec-4c3e-9014-7ae158203b6c","year":2024},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:20.033243Z"},"links":{"citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:fcd8a80a6593cdaa7aed296afc7ed7f38d459917a7218f2cc0910efd754d3172","observation_id":"407cd4e8-149f-4c23-a819-f973fd0cf18f","resolution":{"observed_at":"2026-08-07T11:16:22.863884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-07T11:16:20.114731Z","title":"arXiv preprint arXiv:2405.09818 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:20.114731Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:b105640771ef4122d365fbaa5eb9dee4b6920f35f7aa93b187912aeafa1ad146","observation_id":"05833d42-5a6a-400a-88d8-e531f700e712","resolution":{"observed_at":"2026-08-07T11:16:20.114731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-07T11:16:20.206272Z","title":"arXiv preprint arXiv:2409.18869 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:20.206272Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:fc0e2c47c82eae69881f26d437dac795594d5f0ddb74bac3d1e3592ea9b17205","observation_id":"4ce96e01-6308-4b66-bd01-e4a105341fdd","resolution":{"observed_at":"2026-08-07T11:16:20.206272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13848","last_updated":"2024-10-17T17:58:37Z","snapshot_observed_at":"2026-08-03T03:16:45.693966Z","submitted_at":"2024-10-17T17:58:37Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13848","snapshot_observed_at":"2026-08-07T11:16:20.271828Z","title":"arXiv preprint arXiv:2410.13848 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:20.271828Z"},"links":{"cited_paper":"/paper/2410.13848","citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:c7e18df547255f1796b2fb1efdfe41b6f2864e98a5ac9a966fb2ce888ca5fe12","observation_id":"09b87698-aeaa-4141-b4d2-80968a4d8457","resolution":{"observed_at":"2026-08-07T11:16:20.271828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-09T22:04:45.837713Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-08-07T11:16:20.351944Z","title":"arXiv preprint arXiv:2309.05519 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:20.351944Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:59c5ac430a3a8c0e25cc1e6affe25e833b54efe7f20cc3f2443c86fc7176d169","observation_id":"461ee106-6d4a-4934-8cdb-427e0f7fba8f","resolution":{"observed_at":"2026-08-07T11:16:20.351944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04429","last_updated":"2025-03-04T16:31:57Z","snapshot_observed_at":"2026-08-01T23:38:04.510222Z","submitted_at":"2024-09-06T17:49:56Z","title":"VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04429","snapshot_observed_at":"2026-08-07T11:16:20.415168Z","title":"arXiv preprint arXiv:2409.04429 (2024) 14","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:20.415168Z"},"links":{"cited_paper":"/paper/2409.04429","citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:1e30cadfed32b47b89a6dcab72d29c32fa5d4769d87429cbb91ea6362fc99571","observation_id":"dc9f6bf1-9567-4db4-b3a9-4b3b70ef090d","resolution":{"observed_at":"2026-08-07T11:16:20.415168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11340","last_updated":"2024-11-21T14:09:12Z","snapshot_observed_at":"2026-08-10T11:21:08.205918Z","submitted_at":"2024-09-17T16:42:46Z","title":"OmniGen: Unified Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11340","snapshot_observed_at":"2026-08-07T11:16:20.505845Z","title":"arXiv preprint arXiv:2409.11340 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:20.505845Z"},"links":{"cited_paper":"/paper/2409.11340","citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:2a7b9b24a2ffc580df3724c8d9b680c0d051122b46d3993feb76ee38c6f3dc0b","observation_id":"a1cae4a7-b6dd-41d1-b017-3f8e3b2bbce5","resolution":{"observed_at":"2026-08-07T11:16:20.505845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:16:22.607412Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"2bd0db13-b38d-4975-b2f9-ba786eb3c076","year":2024},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:20.562045Z"},"links":{"citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:3c83445e10ceaa59264d0ea60420184ba6c6200977f1aa163e5bcabfbbb24c37","observation_id":"55738e0d-c946-4f45-88b5-97084329bb43","resolution":{"observed_at":"2026-08-07T11:16:22.678176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-08T10:01:09.646573Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13031","snapshot_observed_at":"2026-08-07T11:16:20.624099Z","title":"arXiv preprint arXiv:2505.13031 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:20.624099Z"},"links":{"cited_paper":"/paper/2505.13031","citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:be02bd56c92397db2e5bc79e816fdd501eac3bd17ca572f427d587b550bb2e6d","observation_id":"1b66d188-aedf-42e4-9b63-f192e703d310","resolution":{"observed_at":"2026-08-07T11:16:20.624099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:16:22.450782Z","title":"Advances in Neural Information Processing Systems37, 75329–75354 (2024)","venue":null,"work_id":"63d6165c-f090-42c6-b9e3-3c508a3a5ecc","year":2024},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:20.685023Z"},"links":{"citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:a7758fa7282872d9af6ce9a4691869f1e0214378046b7ec64529f7181412abb2","observation_id":"ebe99975-196b-4298-881d-08125ddea5b5","resolution":{"observed_at":"2026-08-07T11:16:22.536374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-07T11:16:20.794156Z","title":"arXiv preprint arXiv:2408.12528 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:20.794156Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:ddcdbf225ddfa182b6cb70fd8303fa9be626df2fc68bee831612f7af01670e50","observation_id":"ba7731e0-5a26-4d91-a2bf-54d9b040e728","resolution":{"observed_at":"2026-08-07T11:16:20.794156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-07T11:16:20.859051Z","title":"arXiv:2407.10671 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:20.859051Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:f0698c8d502f021031d577c8051729e053df195f80fbec50012b34df84aa12e9","observation_id":"8b3c9276-4fe7-490c-8ff4-69da8e1198d5","resolution":{"observed_at":"2026-08-07T11:16:20.859051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T11:16:20.936715Z","title":"5 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:20.936715Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:15018eccac39e049dd90c33e415d4aa587fcf2a225d80c02a786a5aef8074717","observation_id":"cda4bc13-1d3f-49b5-a92e-af949630442a","resolution":{"observed_at":"2026-08-07T11:16:20.936715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14694","last_updated":"2025-03-12T06:01:05Z","snapshot_observed_at":"2026-08-07T17:11:01.815885Z","submitted_at":"2025-03-12T06:01:05Z","title":"HaploVL: A Single-Transformer Baseline for Multi-Modal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14694","snapshot_observed_at":"2026-08-07T11:16:21.023602Z","title":"arXiv preprint arXiv:2503.14694 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:21.023602Z"},"links":{"cited_paper":"/paper/2503.14694","citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:c104102cc882a6ddb68ee86c42bbeed2fea3801bbe7496a41a5475e123099c0f","observation_id":"9c9854a8-3074-4a3b-9afa-01ab99df80f4","resolution":{"observed_at":"2026-08-07T11:16:21.023602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-07T11:16:21.110375Z","title":"arXiv preprint arXiv:2408.06072 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:21.110375Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:22afe233293ab5132d8cdfe6ea6f6152468b39524d696f46a86044bfeb37c25a","observation_id":"43715fe0-ce7c-4853-afe7-a83dde80beaf","resolution":{"observed_at":"2026-08-07T11:16:21.110375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:16:22.274679Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"456d46ab-9a4a-434b-8694-6841f277eb8c","year":2024},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:21.194750Z"},"links":{"citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:fcd3cffbbe89e45f67aa5e4873c6d28b8fa536c59ac5dfab3b4814430cbd433c","observation_id":"65eca0ba-72b5-4989-9cff-db240952f1ab","resolution":{"observed_at":"2026-08-07T11:16:22.348993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:16:22.088871Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"0e4d4aa8-a63b-4650-b723-aea0b772cc9e","year":2024},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:21.267984Z"},"links":{"citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:f468873a16aa81522f864a79010ba729605bb9b28c0c63ab3352e79f4182add1","observation_id":"d2090dbf-d07f-4626-8914-5e8024d52412","resolution":{"observed_at":"2026-08-07T11:16:22.168992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01258","last_updated":"2024-04-02T12:47:49Z","snapshot_observed_at":"2026-08-08T06:22:53.769876Z","submitted_at":"2024-04-01T17:28:16Z","title":"Direct Preference Optimization of Video Large Multimodal Models from Language Model Reward","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01258","snapshot_observed_at":"2026-08-07T11:16:21.341077Z","title":"arXiv preprint arXiv:2404.01258 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:21.341077Z"},"links":{"cited_paper":"/paper/2404.01258","citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:739dbc4c05ea8cb89defebdabc5158025ab9eef5c01ed2e24a67f2d6fe5445bb","observation_id":"379e6b75-2222-4fe3-b221-6e2c9c7a5844","resolution":{"observed_at":"2026-08-07T11:16:21.341077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-08-11T01:34:46.484513Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-08-07T11:16:21.439643Z","title":"arXiv preprint arXiv:2408.11039 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:21.439643Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:f6caf2655d7acc6f68d76c10f31ee0664219cac41bfc6ee4346bd7f28f978719","observation_id":"05d6bf8d-edad-4a8c-ae4b-ed5e8185b22f","resolution":{"observed_at":"2026-08-07T11:16:21.439643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-07T11:16:21.519000Z","title":"arXiv:2304.10592 (2023) 15","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:21.519000Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:dc50fef71db542da6a047284a758082ce00a339b8e7bf6a084990218266bbc09","observation_id":"7fb1e717-4b06-4838-a2d0-2521d0f7bfa3","resolution":{"observed_at":"2026-08-07T11:16:21.519000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":48,"verified_exact":0,"verified_fuzzy":22},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 5 inbound Pith citation observations for arXiv:2506.02975."}