{"as_of":"2026-08-05T16:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b07b3235b13efcc6fc637e2d2ee9d8cff78b1baabe54c8fe2aefbca7aba8f8ab","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T03:57:32.398916Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T07:56:34.034047Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-21T07:59:50.522621Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-03T03:57:29.747868Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"cited_work":{"arxiv_id":"2602.06442","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2602.06442","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chatumm: Robust context tracking for conversational interleaved generation","venue":null,"work_id":"6c1fcebd-1fe2-4179-b518-3b6bcf72241f","year":2026},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"cited_paper":"/paper/2602.06442","citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:76d326e15adc11031182cb08497374cdae6c0b97e606ff191f9c454fc387d642","observation_id":"38fdb81e-6299-4b00-bdb2-00d92e0fe034","resolution":{"observed_at":"2026-06-02T04:04:28.060339Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-03T03:57:29.747868Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"cited_work":{"arxiv_id":"2602.06442","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2602.06442","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chatumm: Robust context tracking for conversational interleaved generation","venue":null,"work_id":"6c1fcebd-1fe2-4179-b518-3b6bcf72241f","year":2026},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-04T16:01:22.114748Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-20T11:46:52.658984Z"},"links":{"cited_paper":"/paper/2602.06442","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:4341bbb8d04011609736ae80a02d127fbc2fa41606afb103fb7a27bd05dd8604","observation_id":"0568b999-1e95-4f48-aee1-1049582a42c6","resolution":{"observed_at":"2026-06-02T04:04:28.060339Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-03T03:57:29.747868Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"cited_work":{"arxiv_id":"2602.06442","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2602.06442","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chatumm: Robust context tracking for conversational interleaved generation","venue":null,"work_id":"6c1fcebd-1fe2-4179-b518-3b6bcf72241f","year":2026},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-04T16:01:22.114748Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"cited_paper":"/paper/2602.06442","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:d38ceca188cb23366db2d0eec85f92d2d027d52a36e654d59489949c05dceaa4","observation_id":"02508724-e637-43cf-b990-f1efea13a798","resolution":{"observed_at":"2026-06-02T04:04:28.060339Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2602.06442/citation-record","integrity":"/paper/2602.06442/integrity","json":"/paper/2602.06442/citation-record.json","paper":"/paper/2602.06442"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-03T03:57:30.811900Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-03T03:57:29.747868Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T03:57:30.811900Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2602.06442"},"observation_digest":"sha256:a9c9e1d8475857d5fc9de9c29209c0107c88bd6e7d617c4d3797d72dd880a08f","observation_id":"2907d4be-e570-4d53-9ef7-a282d5ab61ae","resolution":{"observed_at":"2026-08-03T03:57:30.811900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09568","last_updated":"2025-05-14T17:11:07Z","snapshot_observed_at":"2026-07-06T21:23:57.084147Z","submitted_at":"2025-05-14T17:11:07Z","title":"BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09568","snapshot_observed_at":"2026-08-03T03:57:31.101636Z","title":"Blip3-o: A family of fully open unified multimodal models-architecture, training and dataset.arXiv preprint arXiv:2505.09568, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-03T03:57:29.747868Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T03:57:31.101636Z"},"links":{"cited_paper":"/paper/2505.09568","citing_paper":"/paper/2602.06442"},"observation_digest":"sha256:bd008c7c3f5ebd75ca395e2317defec341605e24d5053b955520d9c40c4565b8","observation_id":"ef345832-07bb-482c-a011-3bf70c7ad677","resolution":{"observed_at":"2026-08-03T03:57:31.101636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-08-03T03:57:31.225142Z","title":"Emerging properties in unified multimodal pretraining","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-03T03:57:29.747868Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T03:57:31.225142Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2602.06442"},"observation_digest":"sha256:68a7eb2b07cf65f5c5b99f94d77be5d0d23f7f22eb49768bcd638ecd2dadd062","observation_id":"20f3229a-bad8-4d1f-be56-23be805287e4","resolution":{"observed_at":"2026-08-03T03:57:31.225142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01218","last_updated":"2023-10-02T14:03:02Z","snapshot_observed_at":"2026-08-02T03:02:58.907220Z","submitted_at":"2023-10-02T14:03:02Z","title":"Making LLaMA SEE and Draw with SEED Tokenizer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01218","snapshot_observed_at":"2026-08-03T03:57:31.361767Z","title":"Making llama see and draw with seed tokenizer.arXiv preprint arXiv:2310.01218,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-03T03:57:29.747868Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T03:57:31.361767Z"},"links":{"cited_paper":"/paper/2310.01218","citing_paper":"/paper/2602.06442"},"observation_digest":"sha256:90be38b08a3e878d429db356e3c8fdc8b701e26254a4fc64ed873c8d8edef4d1","observation_id":"05cd402b-5186-48e7-9b3e-bded583af4b3","resolution":{"observed_at":"2026-08-03T03:57:31.361767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-03T03:57:31.571665Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-03T03:57:29.747868Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T03:57:31.571665Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2602.06442"},"observation_digest":"sha256:e85e76a92595a85d48198031660a2f6ef52226f5e7c138269576f1b01a24e04e","observation_id":"ef0865f9-b12b-490f-bff0-48fe7b014036","resolution":{"observed_at":"2026-08-03T03:57:31.571665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20534","last_updated":"2026-02-03T04:57:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-28T05:35:43Z","title":"Kimi K2: Open Agentic Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20534","snapshot_observed_at":"2026-08-03T03:57:31.603641Z","title":"Kimi k2: Open agentic intelligence.arXiv preprint arXiv:2507.20534, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-03T03:57:29.747868Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T03:57:31.603641Z"},"links":{"cited_paper":"/paper/2507.20534","citing_paper":"/paper/2602.06442"},"observation_digest":"sha256:6291bed2650819718e1fd49335f2802d1c2b2b413ab739ac6f66d60b3f00d6a3","observation_id":"7e475d0b-2024-49f8-83b7-f4f35ba4c980","resolution":{"observed_at":"2026-08-03T03:57:31.603641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05472","last_updated":"2025-05-11T18:47:18Z","snapshot_observed_at":"2026-08-04T22:02:38.792513Z","submitted_at":"2025-05-08T17:58:57Z","title":"Mogao: An Omni Foundation Model for Interleaved Multi-Modal Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05472","snapshot_observed_at":"2026-08-03T03:57:31.714604Z","title":"Mogao: An omni foundation model for interleaved multi-modal generation.arXiv preprint arXiv:2505.05472,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-03T03:57:29.747868Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T03:57:31.714604Z"},"links":{"cited_paper":"/paper/2505.05472","citing_paper":"/paper/2602.06442"},"observation_digest":"sha256:ff8a0b1449f1fa4c097a2613afdeffbdc48919351576a55b913ffeae49a91b44","observation_id":"150451ff-f20c-4385-8020-d5fd9b445ce3","resolution":{"observed_at":"2026-08-03T03:57:31.714604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03147","last_updated":"2025-06-18T18:00:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-03T17:59:33Z","title":"UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03147","snapshot_observed_at":"2026-08-03T03:57:31.746659Z","title":"Uniworld: High-resolution semantic encoders for unified visual understanding and generation.arXiv preprint arXiv:2506.03147,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-03T03:57:29.747868Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T03:57:31.746659Z"},"links":{"cited_paper":"/paper/2506.03147","citing_paper":"/paper/2602.06442"},"observation_digest":"sha256:5b11d452c0426f35b24b86c99b767f4fd562008ea2f03a0ec81ec2defcba23e2","observation_id":"360fbe7a-fbaa-41c4-917b-6ea53d0d5214","resolution":{"observed_at":"2026-08-03T03:57:31.746659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-03T03:57:31.778476Z","title":"Flow matching for generative modeling.arXiv preprint arXiv:2210.02747,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-03T03:57:29.747868Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T03:57:31.778476Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2602.06442"},"observation_digest":"sha256:c3bbdf665eb32f0ce377ae71d5b02828e265f264296b660ea908835340d29a02","observation_id":"b310d75e-d630-4110-aadd-ba18a0631ed2","resolution":{"observed_at":"2026-08-03T03:57:31.778476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06256","last_updated":"2025-04-08T17:58:47Z","snapshot_observed_at":"2026-08-03T00:43:33.310493Z","submitted_at":"2025-04-08T17:58:47Z","title":"Transfer between Modalities with MetaQueries","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06256","snapshot_observed_at":"2026-08-03T03:57:31.903060Z","title":"Transfer between modalities with metaqueries.arXiv preprint arXiv:2504.06256,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-03T03:57:29.747868Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T03:57:31.903060Z"},"links":{"cited_paper":"/paper/2504.06256","citing_paper":"/paper/2602.06442"},"observation_digest":"sha256:37fe744b868f772cf5f2b3cad909954e59c35dc6ec0d061c8fe8784acc298d51","observation_id":"e45b428e-7aef-49e4-8149-7bb639a84684","resolution":{"observed_at":"2026-08-03T03:57:31.903060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-03T03:57:31.963242Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis.arXiv preprint arXiv:2307.01952,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-03T03:57:29.747868Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T03:57:31.963242Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2602.06442"},"observation_digest":"sha256:9f8b3b4b345910b87adbcc6399b61338b520963acd7d8b70fe1674313c84b022","observation_id":"6a850956-3c6d-40e9-9cd6-ff6b79593112","resolution":{"observed_at":"2026-08-03T03:57:31.963242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-03T03:57:32.004110Z","title":"Hierarchical text- conditional image generation with clip latents.arXiv preprint arXiv:2204.06125,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-03T03:57:29.747868Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T03:57:32.004110Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2602.06442"},"observation_digest":"sha256:ac02203eb8252c7d1ba12db838af34a3e9de3e7c41f63fce42a5ff7285610b2c","observation_id":"abeb05d0-d4e9-48ea-8191-0be8fb91b434","resolution":{"observed_at":"2026-08-03T03:57:32.004110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-02T19:18:33.010410Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-03T03:57:32.062558Z","title":"Lmfusion: Adapting pretrained language models for multimodal generation.arXiv preprint arXiv:2412.15188,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-03T03:57:29.747868Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T03:57:32.062558Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2602.06442"},"observation_digest":"sha256:bd66505a7d007f62d3092d9e637fbc476cf35b18e13c5a7615367ddc42c209be","observation_id":"8854c87b-93c1-45fc-926c-f848d8caded8","resolution":{"observed_at":"2026-08-03T03:57:32.062558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05222","last_updated":"2024-05-08T02:46:43Z","snapshot_observed_at":"2026-07-06T15:52:36.416440Z","submitted_at":"2023-07-11T12:45:39Z","title":"Emu: Generative Pretraining in Multimodality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.05222","snapshot_observed_at":"2026-08-03T03:57:32.091846Z","title":"Emu: Generative pretraining in multimodality","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-03T03:57:29.747868Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T03:57:32.091846Z"},"links":{"cited_paper":"/paper/2307.05222","citing_paper":"/paper/2602.06442"},"observation_digest":"sha256:a8e4cf4ba9e0a6fc3e91ec42bc6f65325193139cf66e3480335c93e4eade835c","observation_id":"70a2320a-4766-4f16-bc25-36940e3df089","resolution":{"observed_at":"2026-08-03T03:57:32.091846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14164","last_updated":"2024-12-18T18:58:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:58:50Z","title":"MetaMorph: Multimodal Understanding and Generation via Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14164","snapshot_observed_at":"2026-08-03T03:57:32.139758Z","title":"Metamorph: Multimodal understanding and generation via instruction tuning.arXiv preprint arXiv:2412.14164, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-03T03:57:29.747868Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T03:57:32.139758Z"},"links":{"cited_paper":"/paper/2412.14164","citing_paper":"/paper/2602.06442"},"observation_digest":"sha256:a5a51f3af5b502f14234515ba89ae15138d6dc3e5d96c64b7220b6a64edae540","observation_id":"2c8263df-b1d4-4b31-b4ae-6c37c2b39d35","resolution":{"observed_at":"2026-08-03T03:57:32.139758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06673","last_updated":"2024-12-09T17:11:50Z","snapshot_observed_at":"2026-07-06T20:04:01.034597Z","submitted_at":"2024-12-09T17:11:50Z","title":"ILLUME: Illuminating Your LLMs to See, Draw, and Self-Enhance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06673","snapshot_observed_at":"2026-08-03T03:57:32.187422Z","title":"Illume: Illuminating your llms to see, draw, and self-enhance.arXiv preprint arXiv:2412.06673, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-03T03:57:29.747868Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T03:57:32.187422Z"},"links":{"cited_paper":"/paper/2412.06673","citing_paper":"/paper/2602.06442"},"observation_digest":"sha256:79da79977873e1b8ca4d4d4e07ea038074825bf7bc8974b3c7b971ab46af7c10","observation_id":"2fe808b7-d894-4cdd-a37e-c15a761e98e2","resolution":{"observed_at":"2026-08-03T03:57:32.187422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-03T03:57:32.251379Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-03T03:57:29.747868Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T03:57:32.251379Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2602.06442"},"observation_digest":"sha256:092389383b089bf741d380f24e49d82cd45785f0d5c591bba95f6742705515bc","observation_id":"db5753a8-095a-4b55-b1ee-ccbdbc7c3197","resolution":{"observed_at":"2026-08-03T03:57:32.251379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-03T03:57:32.281430Z","title":"Show-o: One single transformer to unify multimodal understanding and generation.arXiv preprint arXiv:2408.12528, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-03T03:57:29.747868Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T03:57:32.281430Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2602.06442"},"observation_digest":"sha256:96c05af2401c993caf36bdd8737d79a92662f95b9b9694b75d0125f7f147b3a3","observation_id":"e2361bb0-b0ae-485e-8c1b-78343abbc5aa","resolution":{"observed_at":"2026-08-03T03:57:32.281430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17762","last_updated":"2025-07-28T09:54:49Z","snapshot_observed_at":"2026-07-06T19:57:33.013839Z","submitted_at":"2024-11-26T03:33:52Z","title":"MUSE-VL: Modeling Unified VLM through Semantic Discrete Encoding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17762","snapshot_observed_at":"2026-08-03T03:57:32.313692Z","title":"Muse-vl: Modeling unified vlm through semantic discrete encoding.arXiv preprint arXiv:2411.17762, 2024b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-03T03:57:29.747868Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T03:57:32.313692Z"},"links":{"cited_paper":"/paper/2411.17762","citing_paper":"/paper/2602.06442"},"observation_digest":"sha256:fc0f59c78b7889831d67178d10f6b30347bd29b5cbc03cf5a23b494e677a7de2","observation_id":"f2053d36-e18c-4b43-9566-42a2ccfc4c53","resolution":{"observed_at":"2026-08-03T03:57:32.313692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-03T03:57:32.341809Z","title":"Qwen2.5 technical report.arXiv preprint arXiv:2412.15115,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-03T03:57:29.747868Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T03:57:32.341809Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2602.06442"},"observation_digest":"sha256:52c77456e0e9e76410b0d98313de52da1dbb64a1cd7cf993699ffcca50ba476d","observation_id":"ca0abd6c-d774-40a8-b0ef-2d5656a2f60d","resolution":{"observed_at":"2026-08-03T03:57:32.341809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-08-05T05:27:10.277230Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-08-03T03:57:32.391604Z","title":"Mmada: Multimodal large diffusion language models.arXiv preprint arXiv:2505.15809,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-03T03:57:29.747868Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T03:57:32.391604Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2602.06442"},"observation_digest":"sha256:cc95be29d9f30a5879452ffc4896d1a94b3bb709eea5aaa240376c1bc1a714f7","observation_id":"3c3f005f-105c-4236-a0e2-1d02d5f23d12","resolution":{"observed_at":"2026-08-03T03:57:32.391604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-07-06T16:02:39.154387Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-03T03:57:32.394391Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities.arXiv preprint arXiv:2308.02490,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-03T03:57:29.747868Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T03:57:32.394391Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2602.06442"},"observation_digest":"sha256:a5875f441dc9ecb39e9be4a009a6f00c9b227be21e48badbb82104de367a6fb9","observation_id":"6eb90171-2c19-491d-a7a4-8f669af613f5","resolution":{"observed_at":"2026-08-03T03:57:32.394391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11277","snapshot_observed_at":"2026-08-03T03:57:32.396743Z","title":"Pytorch fsdp: experiences on scaling fully sharded data parallel.arXiv preprint arXiv:2304.11277,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-03T03:57:29.747868Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T03:57:32.396743Z"},"links":{"cited_paper":"/paper/2304.11277","citing_paper":"/paper/2602.06442"},"observation_digest":"sha256:6c4e3b9be3d3dc232d2c882a793feeede2e8bd356d03f2b5384f031e02b0e990","observation_id":"be1acf60-4fa2-4e23-b65b-843ccb443109","resolution":{"observed_at":"2026-08-03T03:57:32.396743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-08-03T03:57:32.398916Z","title":"Transfusion: Predict the next token and diffuse images with one multi-modal model.arXiv preprint arXiv:2408.11039,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-03T03:57:29.747868Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T03:57:32.398916Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2602.06442"},"observation_digest":"sha256:e942606cc5819184e9d661d92703d05b0ec8d6287be7fa0baaaac3f5bb2fd8f3","observation_id":"83f8ce4c-3982-4480-99c2-50b04e0364fc","resolution":{"observed_at":"2026-08-03T03:57:32.398916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-03T03:57:31.841665Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts.arXiv preprint arXiv:2310.02255,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-03T03:57:29.747868Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-03T03:57:31.841665Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2602.06442"},"observation_digest":"sha256:5ced532bea3098a50b6ea135ffb8797a8ea82e94be84d278ca87311310551f7c","observation_id":"68ba6f10-bb0e-4033-aa1f-93991c4745d0","resolution":{"observed_at":"2026-08-03T03:57:31.841665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08268","last_updated":"2025-02-03T21:47:31Z","snapshot_observed_at":"2026-08-05T16:01:06.026395Z","submitted_at":"2024-02-13T07:47:36Z","title":"World Model on Million-Length Video And Language With Blockwise RingAttention","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08268","snapshot_observed_at":"2026-08-03T03:57:31.810711Z","title":"World model on million-length video and language with blockwise ringattention.arXiv preprint arXiv:2402.08268, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-03T03:57:29.747868Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-03T03:57:31.810711Z"},"links":{"cited_paper":"/paper/2402.08268","citing_paper":"/paper/2602.06442"},"observation_digest":"sha256:e6236248016e554d0b76335acc504def420b98fd728ad2733351cc90ba18590e","observation_id":"98cecb5d-a55f-4bae-8366-16434ed774b6","resolution":{"observed_at":"2026-08-03T03:57:31.810711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-08-03T03:57:31.509265Z","title":"Seed-x: Multimodal models with unified multi-granularity comprehension and generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-03T03:57:29.747868Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T03:57:31.509265Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2602.06442"},"observation_digest":"sha256:43ef0d2b415f402d0ffa674230e8a3fcebba770b7c68ce59b8de38512d830b4c","observation_id":"f47e244c-4af5-41cd-940d-71392046a618","resolution":{"observed_at":"2026-08-03T03:57:31.509265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-03T03:57:30.931086Z","title":"Chameleon: Mixed-modal early-fusion foundation models.arXiv preprint arXiv:2405.09818,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-03T03:57:29.747868Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T03:57:30.931086Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2602.06442"},"observation_digest":"sha256:b1f48f261cbdb88158d07dfb499fa6e6eddc9dc79da8d92192ec1a5fafc452ab","observation_id":"1dd2ceb7-962a-4614-94e6-c625e89e68c6","resolution":{"observed_at":"2026-08-03T03:57:30.931086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11499","last_updated":"2024-03-15T19:19:28Z","snapshot_observed_at":"2026-07-06T16:21:25.401345Z","submitted_at":"2023-09-20T17:58:05Z","title":"DreamLLM: Synergistic Multimodal Comprehension and Creation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11499","snapshot_observed_at":"2026-08-03T03:57:31.307713Z","title":"Dreamllm: Synergistic multimodal comprehension and creation.arXiv preprint arXiv:2309.11499,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-03T03:57:29.747868Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T03:57:31.307713Z"},"links":{"cited_paper":"/paper/2309.11499","citing_paper":"/paper/2602.06442"},"observation_digest":"sha256:378c50ee7325be9ac62726719d1e7fe54d70d22f74112e4292bae6e559e099c6","observation_id":"71627a80-7ae3-4956-b9e9-a5e4cd7a5fb8","resolution":{"observed_at":"2026-08-03T03:57:31.307713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-03T03:57:29.747868Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 3 inbound Pith citation observations for arXiv:2602.06442."}