{"as_of":"2026-08-08T09:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:700d6900f10846499a45376959eef99a24eafe57f63ef4e0dd5d1408b209b7ce","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":16,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":16,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":16,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T05:54:16.066474Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T03:06:29.513473Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2401.10208","last_updated":"2024-04-02T09:20:50Z","snapshot_observed_at":"2026-07-06T17:17:31.008185Z","submitted_at":"2024-01-18T18:50:16Z","title":"MM-Interleaved: Interleaved Image-Text Generative Modeling via Multi-modal Feature Synchronizer","version":2},"cited_work":{"arxiv_id":"2401.10208","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.10208","snapshot_observed_at":"2026-07-02T03:06:29.513473Z","title":"Mm-interleaved: Interleaved image-text generative modeling via multi-modal feature synchronizer","venue":null,"work_id":"e1e87b1d-1e77-40b8-b606-a74fd08a4f4c","year":2024},"citing_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"reference_index":110,"source":"pdf_text","source_observed_at":"2026-05-12T20:58:58.849040Z"},"links":{"cited_paper":"/paper/2401.10208","citing_paper":"/paper/2404.16821"},"observation_digest":"sha256:ff35a4d517c7b5e5b9b24db0010382b7456520a49e22fcc6ce8d1882a7789e14","observation_id":"98a2334a-cf06-4364-af42-296063cbbfd7","resolution":{"observed_at":"2026-05-12T20:58:59.201739Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10208","last_updated":"2024-04-02T09:20:50Z","snapshot_observed_at":"2026-07-06T17:17:31.008185Z","submitted_at":"2024-01-18T18:50:16Z","title":"MM-Interleaved: Interleaved Image-Text Generative Modeling via Multi-modal Feature Synchronizer","version":2},"cited_work":{"arxiv_id":"2401.10208","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.10208","snapshot_observed_at":"2026-07-02T03:06:29.513473Z","title":"Mm-interleaved: Interleaved image-text generative modeling via multi-modal feature synchronizer","venue":null,"work_id":"e1e87b1d-1e77-40b8-b606-a74fd08a4f4c","year":2024},"citing_paper":{"arxiv_id":"2409.04429","last_updated":"2025-03-04T16:31:57Z","snapshot_observed_at":"2026-08-01T23:38:04.510222Z","submitted_at":"2024-09-06T17:49:56Z","title":"VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T00:26:21.313005Z"},"links":{"cited_paper":"/paper/2401.10208","citing_paper":"/paper/2409.04429"},"observation_digest":"sha256:e35942cf61dfcaee026f3fd22d5de9de3ead06b9161a820dc72dffb469020ae1","observation_id":"1c98850d-a7fe-41a4-9556-f6a53875d133","resolution":{"observed_at":"2026-05-16T00:26:21.351669Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10208","last_updated":"2024-04-02T09:20:50Z","snapshot_observed_at":"2026-07-06T17:17:31.008185Z","submitted_at":"2024-01-18T18:50:16Z","title":"MM-Interleaved: Interleaved Image-Text Generative Modeling via Multi-modal Feature Synchronizer","version":2},"cited_work":{"arxiv_id":"2401.10208","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.10208","snapshot_observed_at":"2026-07-02T03:06:29.513473Z","title":"Mm-interleaved: Interleaved image-text generative modeling via multi-modal feature synchronizer","venue":null,"work_id":"e1e87b1d-1e77-40b8-b606-a74fd08a4f4c","year":2024},"citing_paper":{"arxiv_id":"2411.10442","last_updated":"2025-04-07T09:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-15T18:59:27Z","title":"Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-16T09:16:17.150383Z"},"links":{"cited_paper":"/paper/2401.10208","citing_paper":"/paper/2411.10442"},"observation_digest":"sha256:d45bca56a638bca2e88df05895cc6860614d9d933cc62ebfbc73f87face0ffdf","observation_id":"24a52d64-fd6e-4f69-9517-97939cbfac75","resolution":{"observed_at":"2026-05-16T09:16:17.469378Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10208","last_updated":"2024-04-02T09:20:50Z","snapshot_observed_at":"2026-07-06T17:17:31.008185Z","submitted_at":"2024-01-18T18:50:16Z","title":"MM-Interleaved: Interleaved Image-Text Generative Modeling via Multi-modal Feature Synchronizer","version":2},"cited_work":{"arxiv_id":"2401.10208","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.10208","snapshot_observed_at":"2026-07-02T03:06:29.513473Z","title":"Mm-interleaved: Interleaved image-text generative modeling via multi-modal feature synchronizer","venue":null,"work_id":"e1e87b1d-1e77-40b8-b606-a74fd08a4f4c","year":2024},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":233,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2401.10208","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:0405216d09285c1392b02d107a66626fe51518799c1d8e4f94226a252cb80c2e","observation_id":"d97dc6ea-97a8-40d8-8afb-2bf195061525","resolution":{"observed_at":"2026-05-10T13:23:58.054486Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10208","last_updated":"2024-04-02T09:20:50Z","snapshot_observed_at":"2026-07-06T17:17:31.008185Z","submitted_at":"2024-01-18T18:50:16Z","title":"MM-Interleaved: Interleaved Image-Text Generative Modeling via Multi-modal Feature Synchronizer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10208","snapshot_observed_at":"2026-08-08T05:54:16.066474Z","title":"Mm-interleaved: Interleaved image-text generative model- ing via multi-modal feature synchronizer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-08T05:46:51.015561Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.066474Z"},"links":{"cited_paper":"/paper/2401.10208","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:2720c679a4ccbf05f2631f376ad4421bab2dc22cf9666dda2d279b36509c54dd","observation_id":"918b30d8-a3b9-4390-9cec-7a5a6d442a61","resolution":{"observed_at":"2026-08-08T05:54:16.066474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10208","last_updated":"2024-04-02T09:20:50Z","snapshot_observed_at":"2026-07-06T17:17:31.008185Z","submitted_at":"2024-01-18T18:50:16Z","title":"MM-Interleaved: Interleaved Image-Text Generative Modeling via Multi-modal Feature Synchronizer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10208","snapshot_observed_at":"2026-08-07T13:00:58.779890Z","title":"Mm-interleaved: Interleaved image-text generative modeling via multi-modal feature synchronizer.arXiv preprint arXiv:2401.10208, 2024b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23043","last_updated":"2025-05-29T03:40:21Z","snapshot_observed_at":"2026-08-07T12:52:49.331015Z","submitted_at":"2025-05-29T03:40:21Z","title":"Are Unified Vision-Language Models Necessary: Generalization Across Understanding and Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:58.779890Z"},"links":{"cited_paper":"/paper/2401.10208","citing_paper":"/paper/2505.23043"},"observation_digest":"sha256:51676f2325ca73c684ba5b75221ff7ab1cb7de38dbeae0563a84ae213bdf9f09","observation_id":"f5a6238d-09c5-477c-81d2-1735344b6635","resolution":{"observed_at":"2026-08-07T13:00:58.779890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10208","last_updated":"2024-04-02T09:20:50Z","snapshot_observed_at":"2026-07-06T17:17:31.008185Z","submitted_at":"2024-01-18T18:50:16Z","title":"MM-Interleaved: Interleaved Image-Text Generative Modeling via Multi-modal Feature Synchronizer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10208","snapshot_observed_at":"2026-08-07T04:34:08.000903Z","title":"Mm-interleaved: Interleaved image-text generative modeling via multi-modal feature synchronizer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-07T04:25:14.940851Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:08.000903Z"},"links":{"cited_paper":"/paper/2401.10208","citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:70b2ff239e964e296ceccd1210ecf63398aa0c335c453e56143c1e51f36bde94","observation_id":"ff2de168-136a-4a9c-a1e1-8385b4d6a2fe","resolution":{"observed_at":"2026-08-07T04:34:08.000903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10208","last_updated":"2024-04-02T09:20:50Z","snapshot_observed_at":"2026-07-06T17:17:31.008185Z","submitted_at":"2024-01-18T18:50:16Z","title":"MM-Interleaved: Interleaved Image-Text Generative Modeling via Multi-modal Feature Synchronizer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10208","snapshot_observed_at":"2026-08-06T15:57:04.889019Z","title":"Mm-interleaved: Interleaved image-text generative modeling via multi-modal feature synchronizer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14675","last_updated":"2025-07-19T16:03:34Z","snapshot_observed_at":"2026-08-06T15:47:53.180347Z","submitted_at":"2025-07-19T16:03:34Z","title":"Docopilot: Improving Multimodal Models for Document-Level Understanding","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T15:57:04.889019Z"},"links":{"cited_paper":"/paper/2401.10208","citing_paper":"/paper/2507.14675"},"observation_digest":"sha256:53416c660195a1b3880b466a8dd22e0da33f4f05af8370f4788993450658ba64","observation_id":"7ba7869c-a5ef-4fbd-a92c-bc0b43b26f56","resolution":{"observed_at":"2026-08-06T15:57:04.889019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10208","last_updated":"2024-04-02T09:20:50Z","snapshot_observed_at":"2026-07-06T17:17:31.008185Z","submitted_at":"2024-01-18T18:50:16Z","title":"MM-Interleaved: Interleaved Image-Text Generative Modeling via Multi-modal Feature Synchronizer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10208","snapshot_observed_at":"2026-08-06T00:59:53.302281Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.04088","last_updated":"2025-08-07T03:52:48Z","snapshot_observed_at":"2026-08-06T11:50:51.532315Z","submitted_at":"2025-08-06T05:10:29Z","title":"GM-PRM: A Generative Multimodal Process Reward Model for Multimodal Mathematical Reasoning","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T00:59:53.302281Z"},"links":{"cited_paper":"/paper/2401.10208","citing_paper":"/paper/2508.04088"},"observation_digest":"sha256:d38a9004c0ad2990b837e704c5d9a4d9bfb751076c2c2dc4ac98018e73d3beb6","observation_id":"5af9e593-4c5d-4bad-856e-be4f135da908","resolution":{"observed_at":"2026-08-06T00:59:53.302281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10208","last_updated":"2024-04-02T09:20:50Z","snapshot_observed_at":"2026-07-06T17:17:31.008185Z","submitted_at":"2024-01-18T18:50:16Z","title":"MM-Interleaved: Interleaved Image-Text Generative Modeling via Multi-modal Feature Synchronizer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10208","snapshot_observed_at":"2026-08-05T22:52:00.252799Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06328","last_updated":"2025-08-08T14:00:19Z","snapshot_observed_at":"2026-08-07T04:03:29.651506Z","submitted_at":"2025-08-08T14:00:19Z","title":"M2IO-R1: An Efficient RL-Enhanced Reasoning Framework for Multimodal Retrieval Augmented Multimodal Generation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T22:52:00.252799Z"},"links":{"cited_paper":"/paper/2401.10208","citing_paper":"/paper/2508.06328"},"observation_digest":"sha256:c815b5fd5c707dbba6159fb645e45d74cd12724d934d271dd0e9b94b2b1cb802","observation_id":"14846974-58bb-4205-a8e3-e899a064fda3","resolution":{"observed_at":"2026-08-05T22:52:00.252799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10208","last_updated":"2024-04-02T09:20:50Z","snapshot_observed_at":"2026-07-06T17:17:31.008185Z","submitted_at":"2024-01-18T18:50:16Z","title":"MM-Interleaved: Interleaved Image-Text Generative Modeling via Multi-modal Feature Synchronizer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10208","snapshot_observed_at":"2026-08-04T13:22:34.683325Z","title":"Mm- interleaved: Interleaved image-text generative modeling via multi-modal feature synchronizer.ArXiv, abs/2401.10208,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.01009","last_updated":"2026-03-30T19:53:43Z","snapshot_observed_at":"2026-08-06T16:42:01.247661Z","submitted_at":"2025-10-01T15:15:36Z","title":"POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T13:22:34.683325Z"},"links":{"cited_paper":"/paper/2401.10208","citing_paper":"/paper/2510.01009"},"observation_digest":"sha256:94796b47ac6859d7d91d9db3c60521762e210986f31b38e88c7318a23e8a106c","observation_id":"02b5ffba-2c35-4879-a1f6-5f492720c4b7","resolution":{"observed_at":"2026-08-04T13:22:34.683325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10208","last_updated":"2024-04-02T09:20:50Z","snapshot_observed_at":"2026-07-06T17:17:31.008185Z","submitted_at":"2024-01-18T18:50:16Z","title":"MM-Interleaved: Interleaved Image-Text Generative Modeling via Multi-modal Feature Synchronizer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10208","snapshot_observed_at":"2026-08-03T08:15:32.762182Z","title":"Mm-interleaved: Interleaved image-text generative modeling via multi-modal feature synchronizer, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.17717","last_updated":"2026-06-09T20:25:14Z","snapshot_observed_at":"2026-08-03T08:15:07.553014Z","submitted_at":"2026-01-25T06:40:25Z","title":"A Survey on Evaluating Quality and Trustworthiness in LLM-Generated Data","version":3},"reference_index":212,"source":"arxiv_source","source_observed_at":"2026-08-03T08:15:32.762182Z"},"links":{"cited_paper":"/paper/2401.10208","citing_paper":"/paper/2601.17717"},"observation_digest":"sha256:5866c3a4605cb123ec8ad4520dde1925510470460213e7037da3e9082efcba50","observation_id":"f4616ead-35c1-4cad-9733-9ffe35ef9b98","resolution":{"observed_at":"2026-08-03T08:15:32.762182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10208","last_updated":"2024-04-02T09:20:50Z","snapshot_observed_at":"2026-07-06T17:17:31.008185Z","submitted_at":"2024-01-18T18:50:16Z","title":"MM-Interleaved: Interleaved Image-Text Generative Modeling via Multi-modal Feature Synchronizer","version":2},"cited_work":{"arxiv_id":"2401.10208","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.10208","snapshot_observed_at":"2026-07-02T03:06:29.513473Z","title":"Mm-interleaved: Interleaved image-text generative modeling via multi-modal feature synchronizer","venue":null,"work_id":"e1e87b1d-1e77-40b8-b606-a74fd08a4f4c","year":2024},"citing_paper":{"arxiv_id":"2602.12370","last_updated":"2026-04-16T20:43:03Z","snapshot_observed_at":"2026-08-02T07:45:27.779427Z","submitted_at":"2026-02-12T20:02:21Z","title":"LLaMo: Scaling Pretrained Language Models for Unified Motion Understanding and Generation with Continuous Autoregressive Tokens","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-16T05:01:11.880003Z"},"links":{"cited_paper":"/paper/2401.10208","citing_paper":"/paper/2602.12370"},"observation_digest":"sha256:0c5b4d1592f84f8ceeab446a7ffd44a44e60d5bd27fe023aa63771cce3689ee1","observation_id":"4cddccd3-67d4-432c-99b7-b7934cdb1a20","resolution":{"observed_at":"2026-05-16T05:02:19.813516Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10208","last_updated":"2024-04-02T09:20:50Z","snapshot_observed_at":"2026-07-06T17:17:31.008185Z","submitted_at":"2024-01-18T18:50:16Z","title":"MM-Interleaved: Interleaved Image-Text Generative Modeling via Multi-modal Feature Synchronizer","version":2},"cited_work":{"arxiv_id":"2401.10208","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.10208","snapshot_observed_at":"2026-07-02T03:06:29.513473Z","title":"Mm-interleaved: Interleaved image-text generative modeling via multi-modal feature synchronizer","venue":null,"work_id":"e1e87b1d-1e77-40b8-b606-a74fd08a4f4c","year":2024},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"cited_paper":"/paper/2401.10208","citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:cb878aa6dfe1e416310d95a2d35d43282c7965e46949fd166370d006bcebbaff","observation_id":"3bff77f8-fabd-4154-9dd9-2c0556a56736","resolution":{"observed_at":"2026-07-02T03:06:29.515827Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10208","last_updated":"2024-04-02T09:20:50Z","snapshot_observed_at":"2026-07-06T17:17:31.008185Z","submitted_at":"2024-01-18T18:50:16Z","title":"MM-Interleaved: Interleaved Image-Text Generative Modeling via Multi-modal Feature Synchronizer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10208","snapshot_observed_at":"2026-07-11T21:36:42.378149Z","title":"arXiv preprint arXiv:2401.10208 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04112","last_updated":"2026-07-05T04:44:59Z","snapshot_observed_at":"2026-08-06T06:14:56.755180Z","submitted_at":"2026-07-05T04:44:59Z","title":"DynaVieW: Schema-Guided World Modeling for Understanding Hierarchical Visual Dynamics","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-07-11T21:36:42.378149Z"},"links":{"cited_paper":"/paper/2401.10208","citing_paper":"/paper/2607.04112"},"observation_digest":"sha256:4f8deaf6a40980a7e8cc4eba637353578009636796a914878c0f6a30bbab4e0e","observation_id":"fa84a67e-14cd-4877-a2fe-8d14ff08be06","resolution":{"observed_at":"2026-07-11T21:36:42.378149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10208","last_updated":"2024-04-02T09:20:50Z","snapshot_observed_at":"2026-07-06T17:17:31.008185Z","submitted_at":"2024-01-18T18:50:16Z","title":"MM-Interleaved: Interleaved Image-Text Generative Modeling via Multi-modal Feature Synchronizer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10208","snapshot_observed_at":"2026-07-31T19:16:58.520210Z","title":"arXiv preprint arXiv:2401.10208 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28055","last_updated":"2026-07-30T11:34:55Z","snapshot_observed_at":"2026-08-05T20:01:13.896714Z","submitted_at":"2026-07-30T11:34:55Z","title":"VIG-RL: Learning to Search and Insert for Verified Image Grounding","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-07-31T19:16:58.520210Z"},"links":{"cited_paper":"/paper/2401.10208","citing_paper":"/paper/2607.28055"},"observation_digest":"sha256:061acc7610cd338540bd81c2e3e57c48b7b8aa311f699ac96098937852e6e4c6","observation_id":"6bdf76df-c86b-47da-a336-704c311ec056","resolution":{"observed_at":"2026-07-31T19:16:58.520210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2401.10208/citation-record","integrity":"/paper/2401.10208/integrity","json":"/paper/2401.10208/citation-record.json","paper":"/paper/2401.10208"},"outbound":[],"paper":{"arxiv_id":"2401.10208","last_updated":"2024-04-02T09:20:50Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T17:17:31.008185Z","submitted_at":"2024-01-18T18:50:16Z","title":"MM-Interleaved: Interleaved Image-Text Generative Modeling via Multi-modal Feature Synchronizer"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 16 inbound Pith citation observations for arXiv:2401.10208."}