{"as_of":"2026-08-07T06:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:da9f82e791bb9baf92bda7b61a70a60514f1bc18e03453b0b8e5e54cc49f39d1","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T00:14:19.104498Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.03748/citation-record","integrity":"/paper/2607.03748/integrity","json":"/paper/2607.03748/citation-record.json","paper":"/paper/2607.03748"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-07-12T00:14:19.104498Z","title":"Chameleon: Mixed-modal early-fusion foundation models.arXiv preprint arXiv:2405.09818, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03748","last_updated":"2026-07-04T07:40:43Z","snapshot_observed_at":"2026-08-02T09:22:47.161760Z","submitted_at":"2026-07-04T07:40:43Z","title":"Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-12T00:14:19.104498Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2607.03748"},"observation_digest":"sha256:607d6b13cec4a4c3aa98514c2df9f438a385fe29e88eaba180c1f3957cc9286d","observation_id":"fc033bf2-8332-4f7b-877b-f06e1dc1bbba","resolution":{"observed_at":"2026-07-12T00:14:19.104498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-07-12T00:14:19.104498Z","title":"Emerging properties in unified multimodal pretraining.arXiv preprint arXiv:2505.14683, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03748","last_updated":"2026-07-04T07:40:43Z","snapshot_observed_at":"2026-08-02T09:22:47.161760Z","submitted_at":"2026-07-04T07:40:43Z","title":"Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-12T00:14:19.104498Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2607.03748"},"observation_digest":"sha256:b6a6ef9865f18c89a4cfce30d60b34e6a1a65fa10f0f19c693ce5fe0f177ced4","observation_id":"509247ff-4494-48e3-90f2-69e777aff38e","resolution":{"observed_at":"2026-07-12T00:14:19.104498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19488","last_updated":"2025-03-17T09:01:38Z","snapshot_observed_at":"2026-07-06T19:58:44.149533Z","submitted_at":"2024-11-29T06:06:35Z","title":"Interleaved-Modal Chain-of-Thought","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19488","snapshot_observed_at":"2026-07-12T00:14:19.104498Z","title":"Interleaved-modal chain-of-thought.arXiv preprint arXiv:2411.19488, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03748","last_updated":"2026-07-04T07:40:43Z","snapshot_observed_at":"2026-08-02T09:22:47.161760Z","submitted_at":"2026-07-04T07:40:43Z","title":"Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-12T00:14:19.104498Z"},"links":{"cited_paper":"/paper/2411.19488","citing_paper":"/paper/2607.03748"},"observation_digest":"sha256:32b9d02dee1df64a65f200a247a59ec3a31bb6ff8e55aeeae44540e6a6601816","observation_id":"4cb4461a-e2cb-4d58-9746-9099114a909e","resolution":{"observed_at":"2026-07-12T00:14:19.104498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-07-12T00:14:19.104498Z","title":"Emu3: Next-token prediction is all you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03748","last_updated":"2026-07-04T07:40:43Z","snapshot_observed_at":"2026-08-02T09:22:47.161760Z","submitted_at":"2026-07-04T07:40:43Z","title":"Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-12T00:14:19.104498Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2607.03748"},"observation_digest":"sha256:4b96ad4e69b3e1428e88f2e4f4996cc131d98e8dc10d950eda46e61ce9f72c92","observation_id":"0751aae1-5be6-4b36-8062-d6893c564e75","resolution":{"observed_at":"2026-07-12T00:14:19.104498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-07-31T17:39:49.561332Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-07-12T00:14:19.104498Z","title":"Emu3.5: Native multimodal models are world learners.arXiv preprint arXiv:2510.26583, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03748","last_updated":"2026-07-04T07:40:43Z","snapshot_observed_at":"2026-08-02T09:22:47.161760Z","submitted_at":"2026-07-04T07:40:43Z","title":"Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-12T00:14:19.104498Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2607.03748"},"observation_digest":"sha256:5cb6a0a6f7b70d67068508353942a29d93d7406d2c0b285fa8a6bc5a673f7cf9","observation_id":"cc9f7a43-ac6f-474c-b24a-723647ad2864","resolution":{"observed_at":"2026-07-12T00:14:19.104498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:14:19.104498Z","title":"Visual generation unlocks human-like reasoning through multimodal world models.arXiv preprint arXiv:2601.19834, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03748","last_updated":"2026-07-04T07:40:43Z","snapshot_observed_at":"2026-08-02T09:22:47.161760Z","submitted_at":"2026-07-04T07:40:43Z","title":"Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-12T00:14:19.104498Z"},"links":{"citing_paper":"/paper/2607.03748"},"observation_digest":"sha256:cb60db81d3e7494e75956284fe854ee02e837918adce0aa75c9daaf91b7d7632","observation_id":"3c6754de-6f43-4309-b20a-1dd4f9dba579","resolution":{"observed_at":"2026-07-12T00:14:19.104498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:14:19.104498Z","title":"Thinkmorph: Emergent properties in multimodal interleaved chain-of-thought reasoning.arXiv preprint arXiv:2510.27492, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03748","last_updated":"2026-07-04T07:40:43Z","snapshot_observed_at":"2026-08-02T09:22:47.161760Z","submitted_at":"2026-07-04T07:40:43Z","title":"Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-12T00:14:19.104498Z"},"links":{"citing_paper":"/paper/2607.03748"},"observation_digest":"sha256:44225c4568bea4f929dbd2c4b75c95e2a2829d594efd9920195dd5088d686916","observation_id":"37e1f2a2-9c70-456e-9eef-a26a29f51f63","resolution":{"observed_at":"2026-07-12T00:14:19.104498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22525","last_updated":"2025-05-28T16:12:45Z","snapshot_observed_at":"2026-08-06T00:55:25.635698Z","submitted_at":"2025-05-28T16:12:45Z","title":"Thinking with Generated Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22525","snapshot_observed_at":"2026-07-12T00:14:19.104498Z","title":"Thinking with generated images.arXiv preprint arXiv:2505.22525, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03748","last_updated":"2026-07-04T07:40:43Z","snapshot_observed_at":"2026-08-02T09:22:47.161760Z","submitted_at":"2026-07-04T07:40:43Z","title":"Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-12T00:14:19.104498Z"},"links":{"cited_paper":"/paper/2505.22525","citing_paper":"/paper/2607.03748"},"observation_digest":"sha256:8bea31dc6677eb81986d4de00fa7204c8d6bf35747f6405517872e0b103e2057","observation_id":"f7c47963-7d2c-47f7-ad85-3b8d8bc5a317","resolution":{"observed_at":"2026-07-12T00:14:19.104498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-07-12T00:14:19.104498Z","title":"Deepseek-r1: Incentivizing reasoning capability in LLMs via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03748","last_updated":"2026-07-04T07:40:43Z","snapshot_observed_at":"2026-08-02T09:22:47.161760Z","submitted_at":"2026-07-04T07:40:43Z","title":"Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-12T00:14:19.104498Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.03748"},"observation_digest":"sha256:e4ced566c813eccf37b30813c447e3a110e89ab7305f5ce68b797546009d9191","observation_id":"6628cf26-1f88-4567-9a90-674150194e20","resolution":{"observed_at":"2026-07-12T00:14:19.104498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-12T00:14:19.104498Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03748","last_updated":"2026-07-04T07:40:43Z","snapshot_observed_at":"2026-08-02T09:22:47.161760Z","submitted_at":"2026-07-04T07:40:43Z","title":"Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-12T00:14:19.104498Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.03748"},"observation_digest":"sha256:09e7982c186b08600c0a88a105f54e7a8345a93a5cbe235bc05c83294a3916b8","observation_id":"92002a3b-ad01-4677-a68e-91fc0a7988ee","resolution":{"observed_at":"2026-07-12T00:14:19.104498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-07-06T20:49:56.018809Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-07-12T00:14:19.104498Z","title":"Mm-eureka: Exploring the frontiers of multimodal reasoning with rule-based reinforcement learning.arXiv preprint arXiv:2503.07365, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03748","last_updated":"2026-07-04T07:40:43Z","snapshot_observed_at":"2026-08-02T09:22:47.161760Z","submitted_at":"2026-07-04T07:40:43Z","title":"Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-12T00:14:19.104498Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2607.03748"},"observation_digest":"sha256:58a2e1a27d353c7b972ccc22186fb59d563d075dc5265b2a7ab4da5b2783758a","observation_id":"a97e6e85-043e-48ea-b7ae-ff42b99c110d","resolution":{"observed_at":"2026-07-12T00:14:19.104498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10615","last_updated":"2025-03-18T08:52:34Z","snapshot_observed_at":"2026-07-06T20:52:09.743730Z","submitted_at":"2025-03-13T17:56:05Z","title":"R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10615","snapshot_observed_at":"2026-07-12T00:14:19.104498Z","title":"R1-onevision: Advancing generalized multimodal reasoning through cross-modal formalization.arXiv preprint arXiv:2503.10615, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03748","last_updated":"2026-07-04T07:40:43Z","snapshot_observed_at":"2026-08-02T09:22:47.161760Z","submitted_at":"2026-07-04T07:40:43Z","title":"Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-12T00:14:19.104498Z"},"links":{"cited_paper":"/paper/2503.10615","citing_paper":"/paper/2607.03748"},"observation_digest":"sha256:3480af1a9a37f3389bd3cc4bce145d97db503cf5b1cab97b6d27a9559f0acc58","observation_id":"2313ce82-36f0-411b-b8e8-78a6708b480d","resolution":{"observed_at":"2026-07-12T00:14:19.104498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:14:19.104498Z","title":"COOPER: A unified model for cooperative perception and reasoning in spatial intelligence.arXiv preprint arXiv:2512.04563, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03748","last_updated":"2026-07-04T07:40:43Z","snapshot_observed_at":"2026-08-02T09:22:47.161760Z","submitted_at":"2026-07-04T07:40:43Z","title":"Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-12T00:14:19.104498Z"},"links":{"citing_paper":"/paper/2607.03748"},"observation_digest":"sha256:22846ac810dddcd2376375d9b125eb4c8be053de9d47ec87ca603a50d1fa2958","observation_id":"a9decdf4-1f97-4115-8d15-20b578a6450b","resolution":{"observed_at":"2026-07-12T00:14:19.104498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14362","last_updated":"2026-03-01T04:59:56Z","snapshot_observed_at":"2026-08-02T12:23:34.946873Z","submitted_at":"2025-05-20T13:48:11Z","title":"DeepEyes: Incentivizing \"Thinking with Images\" via Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14362","snapshot_observed_at":"2026-07-12T00:14:19.104498Z","title":"thinking with images","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03748","last_updated":"2026-07-04T07:40:43Z","snapshot_observed_at":"2026-08-02T09:22:47.161760Z","submitted_at":"2026-07-04T07:40:43Z","title":"Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-12T00:14:19.104498Z"},"links":{"cited_paper":"/paper/2505.14362","citing_paper":"/paper/2607.03748"},"observation_digest":"sha256:aca5c4f66272a8dd23a7a5150ae4c28c9800f28a0746869961ab2904f26db0c5","observation_id":"f7733d03-99ec-4435-aef0-4c049ab647cc","resolution":{"observed_at":"2026-07-12T00:14:19.104498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13301","last_updated":"2024-01-04T19:11:25Z","snapshot_observed_at":"2026-08-01T15:43:51.739518Z","submitted_at":"2023-05-22T17:57:41Z","title":"Training Diffusion Models with Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13301","snapshot_observed_at":"2026-07-12T00:14:19.104498Z","title":"Training diffusion models with reinforcement learning.arXiv preprint arXiv:2305.13301, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03748","last_updated":"2026-07-04T07:40:43Z","snapshot_observed_at":"2026-08-02T09:22:47.161760Z","submitted_at":"2026-07-04T07:40:43Z","title":"Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-12T00:14:19.104498Z"},"links":{"cited_paper":"/paper/2305.13301","citing_paper":"/paper/2607.03748"},"observation_digest":"sha256:e79aae30a4d00b8e1d6c668bcbd41e61a6fc4cacf9df87d22867e8383ceb39e2","observation_id":"20258d66-b09e-49b9-93da-10f525498f12","resolution":{"observed_at":"2026-07-12T00:14:19.104498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:14:19.104498Z","title":"Dpok: Reinforcement learning for fine-tuning text-to-image diffusion models.Advances in Neural Information Processing Systems, 36:79858–79885, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03748","last_updated":"2026-07-04T07:40:43Z","snapshot_observed_at":"2026-08-02T09:22:47.161760Z","submitted_at":"2026-07-04T07:40:43Z","title":"Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-12T00:14:19.104498Z"},"links":{"citing_paper":"/paper/2607.03748"},"observation_digest":"sha256:5a346f97f5bc25b80cc1af6e3b0205c1071115411b8cdd2c0dfb784fdbf3af8f","observation_id":"20053311-8cd7-4546-a838-4850cfd59c41","resolution":{"observed_at":"2026-07-12T00:14:19.104498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05470","last_updated":"2025-10-27T09:57:02Z","snapshot_observed_at":"2026-08-06T11:11:00.378627Z","submitted_at":"2025-05-08T17:58:45Z","title":"Flow-GRPO: Training Flow Matching Models via Online RL","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05470","snapshot_observed_at":"2026-07-12T00:14:19.104498Z","title":"Flow-grpo: Training flow matching models via online RL.arXiv preprint arXiv:2505.05470, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03748","last_updated":"2026-07-04T07:40:43Z","snapshot_observed_at":"2026-08-02T09:22:47.161760Z","submitted_at":"2026-07-04T07:40:43Z","title":"Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-12T00:14:19.104498Z"},"links":{"cited_paper":"/paper/2505.05470","citing_paper":"/paper/2607.03748"},"observation_digest":"sha256:cb5f993005568f90fd0753a3d567e798401aec7363198f43bd382175ab8fa24b","observation_id":"c1a655ea-0e0d-4139-badd-a64ed9170c2f","resolution":{"observed_at":"2026-07-12T00:14:19.104498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.16117","last_updated":"2026-02-16T17:14:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-19T16:09:33Z","title":"DiffusionNFT: Online Diffusion Reinforcement with Forward Process","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.16117","snapshot_observed_at":"2026-07-12T00:14:19.104498Z","title":"Diffusionnft: Online diffusion reinforcement with forward process.arXiv preprint arXiv:2509.16117, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03748","last_updated":"2026-07-04T07:40:43Z","snapshot_observed_at":"2026-08-02T09:22:47.161760Z","submitted_at":"2026-07-04T07:40:43Z","title":"Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-12T00:14:19.104498Z"},"links":{"cited_paper":"/paper/2509.16117","citing_paper":"/paper/2607.03748"},"observation_digest":"sha256:387a911b79e4d4c53ca54cf3d509978dd77f29eb9b6af2a04b7c6925ab3119e7","observation_id":"498cfbbd-2378-43ff-8236-bd4292643df9","resolution":{"observed_at":"2026-07-12T00:14:19.104498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:14:19.104498Z","title":"UniGRPO: Unified policy optimization for reasoning-driven visual generation.arXiv preprint arXiv:2603.23500, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03748","last_updated":"2026-07-04T07:40:43Z","snapshot_observed_at":"2026-08-02T09:22:47.161760Z","submitted_at":"2026-07-04T07:40:43Z","title":"Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-12T00:14:19.104498Z"},"links":{"citing_paper":"/paper/2607.03748"},"observation_digest":"sha256:0d8a031111b923cdec0f6b953d277d1ef0338f9bca3b73d2b2c239792b48ccdc","observation_id":"8cfb06db-5802-4573-bab2-8268fc6b9739","resolution":{"observed_at":"2026-07-12T00:14:19.104498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:14:19.104498Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03748","last_updated":"2026-07-04T07:40:43Z","snapshot_observed_at":"2026-08-02T09:22:47.161760Z","submitted_at":"2026-07-04T07:40:43Z","title":"Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-12T00:14:19.104498Z"},"links":{"citing_paper":"/paper/2607.03748"},"observation_digest":"sha256:12a6a18db6fddf2a1135e8a71eba9825f24d52b301a40fc2d71b9bfe32596f23","observation_id":"8bcf1028-ab65-40a7-b49d-51321d493bdf","resolution":{"observed_at":"2026-07-12T00:14:19.104498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:14:19.104498Z","title":"Large language models are zero-shot reasoners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03748","last_updated":"2026-07-04T07:40:43Z","snapshot_observed_at":"2026-08-02T09:22:47.161760Z","submitted_at":"2026-07-04T07:40:43Z","title":"Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-12T00:14:19.104498Z"},"links":{"citing_paper":"/paper/2607.03748"},"observation_digest":"sha256:c50d659c89651cb25c9cc2a97aa8c550e7d11d7098d0e45fd8469ceeef9724b6","observation_id":"02d5a121-d705-4590-ad5f-c622b8cc142d","resolution":{"observed_at":"2026-07-12T00:14:19.104498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:14:19.104498Z","title":"Visual sketchpad: Sketching as a visual chain of thought for multimodal language models.Advances in Neural Information Processing Systems, 37:139348–139379, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03748","last_updated":"2026-07-04T07:40:43Z","snapshot_observed_at":"2026-08-02T09:22:47.161760Z","submitted_at":"2026-07-04T07:40:43Z","title":"Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-12T00:14:19.104498Z"},"links":{"citing_paper":"/paper/2607.03748"},"observation_digest":"sha256:e435f3f6481d3ea53f52c112c934dee6302215b96c6648dea194e5fe3deae165","observation_id":"a95e276d-9232-4eb4-b115-64099a679182","resolution":{"observed_at":"2026-07-12T00:14:19.104498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:14:19.104498Z","title":"Whiteboard-of-thought: Thinking step-by- step across modalities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03748","last_updated":"2026-07-04T07:40:43Z","snapshot_observed_at":"2026-08-02T09:22:47.161760Z","submitted_at":"2026-07-04T07:40:43Z","title":"Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-12T00:14:19.104498Z"},"links":{"citing_paper":"/paper/2607.03748"},"observation_digest":"sha256:4eeb7be6fa817d70cf3268b53503b6db43b7169b7be8b857f83231a2abc904d4","observation_id":"48759ba4-a5f5-45fc-96ed-d68b569b0228","resolution":{"observed_at":"2026-07-12T00:14:19.104498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09241","last_updated":"2023-11-09T11:14:51Z","snapshot_observed_at":"2026-07-06T16:48:09.248740Z","submitted_at":"2023-11-09T11:14:51Z","title":"Chain of Images for Intuitively Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09241","snapshot_observed_at":"2026-07-12T00:14:19.104498Z","title":"Chain of images for intuitively reasoning.arXiv preprint arXiv:2311.09241, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03748","last_updated":"2026-07-04T07:40:43Z","snapshot_observed_at":"2026-08-02T09:22:47.161760Z","submitted_at":"2026-07-04T07:40:43Z","title":"Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-12T00:14:19.104498Z"},"links":{"cited_paper":"/paper/2311.09241","citing_paper":"/paper/2607.03748"},"observation_digest":"sha256:d35d110743fe6e05d63b642271166c16391fd9d151155dfc12d3b3b0c0f89227","observation_id":"47f11876-d9dd-4268-b78e-c28abc8917ad","resolution":{"observed_at":"2026-07-12T00:14:19.104498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:14:19.104498Z","title":"Visual thoughts: A unified perspective of understanding multimodal chain-of-thought","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03748","last_updated":"2026-07-04T07:40:43Z","snapshot_observed_at":"2026-08-02T09:22:47.161760Z","submitted_at":"2026-07-04T07:40:43Z","title":"Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-12T00:14:19.104498Z"},"links":{"citing_paper":"/paper/2607.03748"},"observation_digest":"sha256:5198e5b5480e816d1f4513c20a79279bb0c27e4e038b675d12695a9b51e54369","observation_id":"6164a184-c150-4df6-9db2-60ca9e4abe23","resolution":{"observed_at":"2026-07-12T00:14:19.104498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-07-12T00:14:19.104498Z","title":"Show-o: One single transformer to unify multimodal understanding and generation.arXiv preprint arXiv:2408.12528, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03748","last_updated":"2026-07-04T07:40:43Z","snapshot_observed_at":"2026-08-02T09:22:47.161760Z","submitted_at":"2026-07-04T07:40:43Z","title":"Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-12T00:14:19.104498Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2607.03748"},"observation_digest":"sha256:b849e168ef2943ca61ffa0233c1ee8a8b287a7f5e4c06152fa3e834985575f35","observation_id":"913b890e-d198-47ee-919d-2b694a4d1093","resolution":{"observed_at":"2026-07-12T00:14:19.104498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:14:19.104498Z","title":"Zebra-cot: A dataset for interleaved vision language reasoning.arXiv preprint arXiv:2507.16746, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03748","last_updated":"2026-07-04T07:40:43Z","snapshot_observed_at":"2026-08-02T09:22:47.161760Z","submitted_at":"2026-07-04T07:40:43Z","title":"Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-12T00:14:19.104498Z"},"links":{"citing_paper":"/paper/2607.03748"},"observation_digest":"sha256:e8b3eb5ff6c6b9db069a25b47632478d6070cf0a90114756d674b8c80e81ce9f","observation_id":"603f2d29-ab75-4a98-83cc-cf5f4609d846","resolution":{"observed_at":"2026-07-12T00:14:19.104498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07542","last_updated":"2025-01-13T18:23:57Z","snapshot_observed_at":"2026-08-02T11:23:33.987927Z","submitted_at":"2025-01-13T18:23:57Z","title":"Imagine while Reasoning in Space: Multimodal Visualization-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07542","snapshot_observed_at":"2026-07-12T00:14:19.104498Z","title":"Imagine while reasoning in space: Multimodal visualization-of-thought.arXiv preprint arXiv:2501.07542, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03748","last_updated":"2026-07-04T07:40:43Z","snapshot_observed_at":"2026-08-02T09:22:47.161760Z","submitted_at":"2026-07-04T07:40:43Z","title":"Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-12T00:14:19.104498Z"},"links":{"cited_paper":"/paper/2501.07542","citing_paper":"/paper/2607.03748"},"observation_digest":"sha256:796aca7cbea08fd503a5613430fbb75856817c1c8b3892bfe9102f8b57f734c7","observation_id":"d911676b-2063-4f75-8328-be091c3b8d60","resolution":{"observed_at":"2026-07-12T00:14:19.104498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:14:19.104498Z","title":"Metamorph: Multimodal understanding and generation via instruction tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03748","last_updated":"2026-07-04T07:40:43Z","snapshot_observed_at":"2026-08-02T09:22:47.161760Z","submitted_at":"2026-07-04T07:40:43Z","title":"Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-12T00:14:19.104498Z"},"links":{"citing_paper":"/paper/2607.03748"},"observation_digest":"sha256:c4873e80262cf2d8ef87ac512d4a4e569c745d0096b1ad6f67163e251bcb4b7d","observation_id":"02f5f62c-432d-4b10-a4cb-2eb45d4599e4","resolution":{"observed_at":"2026-07-12T00:14:19.104498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13848","last_updated":"2024-10-17T17:58:37Z","snapshot_observed_at":"2026-08-03T03:16:45.693966Z","submitted_at":"2024-10-17T17:58:37Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13848","snapshot_observed_at":"2026-07-12T00:14:19.104498Z","title":"Janus: Decoupling visual encoding for unified multimodal understanding and generation.arXiv preprint arXiv:2410.13848, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03748","last_updated":"2026-07-04T07:40:43Z","snapshot_observed_at":"2026-08-02T09:22:47.161760Z","submitted_at":"2026-07-04T07:40:43Z","title":"Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-12T00:14:19.104498Z"},"links":{"cited_paper":"/paper/2410.13848","citing_paper":"/paper/2607.03748"},"observation_digest":"sha256:d1e4f936fc7be2c57d1922dae33b5ccda3121ba22576225cf829b9f7e33c196f","observation_id":"6d4fbd7e-b5eb-4865-8933-eab73070ea78","resolution":{"observed_at":"2026-07-12T00:14:19.104498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-07-12T00:14:19.104498Z","title":"Transfusion: Predict the next token and diffuse images with one multi-modal model.arXiv preprint arXiv:2408.11039, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03748","last_updated":"2026-07-04T07:40:43Z","snapshot_observed_at":"2026-08-02T09:22:47.161760Z","submitted_at":"2026-07-04T07:40:43Z","title":"Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-12T00:14:19.104498Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2607.03748"},"observation_digest":"sha256:34ab372bf5893153404a2c4194b96067d1fd5e605bb6d5929cccdee3b0611cd1","observation_id":"9b84ec9f-91b8-49ce-99b7-b7c94131aa19","resolution":{"observed_at":"2026-07-12T00:14:19.104498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:14:19.104498Z","title":"DreamLLM: Synergistic multimodal comprehension and creation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03748","last_updated":"2026-07-04T07:40:43Z","snapshot_observed_at":"2026-08-02T09:22:47.161760Z","submitted_at":"2026-07-04T07:40:43Z","title":"Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-12T00:14:19.104498Z"},"links":{"citing_paper":"/paper/2607.03748"},"observation_digest":"sha256:cc2c639b180ed94c8e017c9a6657a25d206637fc93c2faefabfb2f4d03824274","observation_id":"c6c5c690-e725-46f8-b277-9f7c7d7e45bf","resolution":{"observed_at":"2026-07-12T00:14:19.104498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-07-06T20:49:27.466064Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-07-12T00:14:19.104498Z","title":"Vision-r1: Incentivizing reasoning capability in multimodal large language models.arXiv preprint arXiv:2503.06749, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03748","last_updated":"2026-07-04T07:40:43Z","snapshot_observed_at":"2026-08-02T09:22:47.161760Z","submitted_at":"2026-07-04T07:40:43Z","title":"Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-12T00:14:19.104498Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2607.03748"},"observation_digest":"sha256:94331887aab424b86a1e922fa00d0547cdd093cca781e0d03d7d0cae96baac26","observation_id":"3258f8f7-5581-42d4-840e-095b0cf9623c","resolution":{"observed_at":"2026-07-12T00:14:19.104498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:14:19.104498Z","title":"Beyond the Dirac Delta: Mitigating diversity collapse in reinforcement fine-tuning for versatile image generation.arXiv preprint arXiv:2601.12401, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03748","last_updated":"2026-07-04T07:40:43Z","snapshot_observed_at":"2026-08-02T09:22:47.161760Z","submitted_at":"2026-07-04T07:40:43Z","title":"Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-12T00:14:19.104498Z"},"links":{"citing_paper":"/paper/2607.03748"},"observation_digest":"sha256:7cf3b5c8f87def3dcb5770419d3816f4f7957948ee2bb3ee308518d40b7bf64b","observation_id":"f9d5ccd7-1dab-45c5-83e7-8f6c861ae33a","resolution":{"observed_at":"2026-07-12T00:14:19.104498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07818","last_updated":"2025-08-28T17:19:45Z","snapshot_observed_at":"2026-07-31T14:51:03.625964Z","submitted_at":"2025-05-12T17:59:34Z","title":"DanceGRPO: Unleashing GRPO on Visual Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07818","snapshot_observed_at":"2026-07-12T00:14:19.104498Z","title":"Dancegrpo: Unleashing grpo on visual generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03748","last_updated":"2026-07-04T07:40:43Z","snapshot_observed_at":"2026-08-02T09:22:47.161760Z","submitted_at":"2026-07-04T07:40:43Z","title":"Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-12T00:14:19.104498Z"},"links":{"cited_paper":"/paper/2505.07818","citing_paper":"/paper/2607.03748"},"observation_digest":"sha256:b2ad6098ef60648cd3f5f0776ef34bd3b6b1aa01484379423e526bee71322c14","observation_id":"cdea3bd5-b3ab-481c-8f2d-e36aadf73324","resolution":{"observed_at":"2026-07-12T00:14:19.104498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22058","last_updated":"2025-07-29T17:59:04Z","snapshot_observed_at":"2026-08-06T15:57:37.748671Z","submitted_at":"2025-07-29T17:59:04Z","title":"X-Omni: Reinforcement Learning Makes Discrete Autoregressive Image Generative Models Great Again","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.22058","snapshot_observed_at":"2026-07-12T00:14:19.104498Z","title":"X-omni: Reinforcement learning makes discrete autoregressive image generative models great again.arXiv preprint arXiv:2507.22058, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03748","last_updated":"2026-07-04T07:40:43Z","snapshot_observed_at":"2026-08-02T09:22:47.161760Z","submitted_at":"2026-07-04T07:40:43Z","title":"Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-12T00:14:19.104498Z"},"links":{"cited_paper":"/paper/2507.22058","citing_paper":"/paper/2607.03748"},"observation_digest":"sha256:241ce2e636803657425cdd5e59837d977f2f3e2f2facb16aaefb824da707c70c","observation_id":"180a33c5-91cc-4fa9-9349-837e8376163c","resolution":{"observed_at":"2026-07-12T00:14:19.104498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:14:19.104498Z","title":"Towards unified multimodal interleaved generation via group relative policy optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03748","last_updated":"2026-07-04T07:40:43Z","snapshot_observed_at":"2026-08-02T09:22:47.161760Z","submitted_at":"2026-07-04T07:40:43Z","title":"Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-12T00:14:19.104498Z"},"links":{"citing_paper":"/paper/2607.03748"},"observation_digest":"sha256:37442090f90d7bafe3dd80df0291e5516395efde53c7407f4a91feaf1d02d9b5","observation_id":"f6a01d24-5d0d-48d3-bff9-eacbd88c9287","resolution":{"observed_at":"2026-07-12T00:14:19.104498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-07-12T00:14:19.104498Z","title":"Flow matching for generative modeling.arXiv preprint arXiv:2210.02747, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03748","last_updated":"2026-07-04T07:40:43Z","snapshot_observed_at":"2026-08-02T09:22:47.161760Z","submitted_at":"2026-07-04T07:40:43Z","title":"Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-12T00:14:19.104498Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2607.03748"},"observation_digest":"sha256:3cea9c8ceb25e27afd79374f5a706fb7f66caac2ba6d567fe657bb903df41dd2","observation_id":"30555a9d-adb1-4966-b864-63c162d0a397","resolution":{"observed_at":"2026-07-12T00:14:19.104498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1709.06158","last_updated":"2017-09-18T20:34:48Z","snapshot_observed_at":"2026-08-02T16:47:23.623541Z","submitted_at":"2017-09-18T20:34:48Z","title":"Matterport3D: Learning from RGB-D Data in Indoor Environments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1709.06158","snapshot_observed_at":"2026-07-12T00:14:19.104498Z","title":"Matterport3d: Learning from rgb-d data in indoor environments.arXiv preprint arXiv:1709.06158, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.03748","last_updated":"2026-07-04T07:40:43Z","snapshot_observed_at":"2026-08-02T09:22:47.161760Z","submitted_at":"2026-07-04T07:40:43Z","title":"Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-12T00:14:19.104498Z"},"links":{"cited_paper":"/paper/1709.06158","citing_paper":"/paper/2607.03748"},"observation_digest":"sha256:f35261f996aeaf38dfe6711778c5f515cf2345bf58ecf460064bd96b7b902162","observation_id":"ba961b12-1bcb-4859-999f-f2caa0eba7e6","resolution":{"observed_at":"2026-07-12T00:14:19.104498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:14:19.104498Z","title":"Realsee3d: A large-scale multi-view rgb-d dataset of indoor scenes (version 1.0), 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03748","last_updated":"2026-07-04T07:40:43Z","snapshot_observed_at":"2026-08-02T09:22:47.161760Z","submitted_at":"2026-07-04T07:40:43Z","title":"Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-12T00:14:19.104498Z"},"links":{"citing_paper":"/paper/2607.03748"},"observation_digest":"sha256:b8467113182b676eaad4174402e0f7ec1448ca25a1ebcaa94593ab39ccf05b25","observation_id":"91d0c58b-2f0d-4833-9d27-070d99b1f281","resolution":{"observed_at":"2026-07-12T00:14:19.104498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:14:19.104498Z","title":"360+ x: A panoptic multi-modal scene understanding dataset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03748","last_updated":"2026-07-04T07:40:43Z","snapshot_observed_at":"2026-08-02T09:22:47.161760Z","submitted_at":"2026-07-04T07:40:43Z","title":"Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-12T00:14:19.104498Z"},"links":{"citing_paper":"/paper/2607.03748"},"observation_digest":"sha256:5467499d22fd732b882bafd58e5ecaed814d86ca893df951a9e01f76416b2418","observation_id":"dd9cebf7-e027-4f8d-93c1-9b5a5c87e95f","resolution":{"observed_at":"2026-07-12T00:14:19.104498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:14:19.104498Z","title":"Jigsaw-r1: A study of rule-based visual reinforcement learning with jigsaw puzzles.arXiv preprint arXiv:2505.23590, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03748","last_updated":"2026-07-04T07:40:43Z","snapshot_observed_at":"2026-08-02T09:22:47.161760Z","submitted_at":"2026-07-04T07:40:43Z","title":"Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-12T00:14:19.104498Z"},"links":{"citing_paper":"/paper/2607.03748"},"observation_digest":"sha256:9582e758b83f78c8c1a804d2ce4f31ff8e195220167dd86bd9d3efd21214ade5","observation_id":"839b1f2e-94aa-4775-bddb-93e245cc25ab","resolution":{"observed_at":"2026-07-12T00:14:19.104498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16999","last_updated":"2024-11-04T05:50:56Z","snapshot_observed_at":"2026-07-06T17:50:18.017647Z","submitted_at":"2024-03-25T17:59:23Z","title":"Visual CoT: Advancing Multi-Modal Language Models with a Comprehensive Dataset and Benchmark for Chain-of-Thought Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16999","snapshot_observed_at":"2026-07-12T00:14:19.104498Z","title":"Visual cot: Unleashing chain-of-thought reasoning in multi-modal language models.arXiv preprint arXiv:2403.16999, 2, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03748","last_updated":"2026-07-04T07:40:43Z","snapshot_observed_at":"2026-08-02T09:22:47.161760Z","submitted_at":"2026-07-04T07:40:43Z","title":"Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-12T00:14:19.104498Z"},"links":{"cited_paper":"/paper/2403.16999","citing_paper":"/paper/2607.03748"},"observation_digest":"sha256:54a0581ca40a17fa1600bd8b7dceb8e3ca8a471fd6f45119fddf078b8fcfe964","observation_id":"6d793074-df34-4364-aba7-d5f50018628c","resolution":{"observed_at":"2026-07-12T00:14:19.104498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23764","last_updated":"2026-05-23T03:42:56Z","snapshot_observed_at":"2026-07-06T21:33:07.415628Z","submitted_at":"2025-05-29T17:59:52Z","title":"MMSI-Bench: A Benchmark for Multi-Image Spatial Intelligence","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23764","snapshot_observed_at":"2026-07-12T00:14:19.104498Z","title":"Mmsi-bench: A benchmark for multi-image spatial intelligence.arXiv preprint arXiv:2505.23764, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03748","last_updated":"2026-07-04T07:40:43Z","snapshot_observed_at":"2026-08-02T09:22:47.161760Z","submitted_at":"2026-07-04T07:40:43Z","title":"Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-12T00:14:19.104498Z"},"links":{"cited_paper":"/paper/2505.23764","citing_paper":"/paper/2607.03748"},"observation_digest":"sha256:fdb2f195b1430183a902ec56a26483adff36184f2ad469dbec25d6a57b7c75c1","observation_id":"bfcc1faf-38bd-41c2-9286-02c45b6e8176","resolution":{"observed_at":"2026-07-12T00:14:19.104498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:14:19.104498Z","title":"Sat: Spatial aptitude training for multimodal language models.arXiv preprint arXiv:2412.07755, 3, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03748","last_updated":"2026-07-04T07:40:43Z","snapshot_observed_at":"2026-08-02T09:22:47.161760Z","submitted_at":"2026-07-04T07:40:43Z","title":"Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-12T00:14:19.104498Z"},"links":{"citing_paper":"/paper/2607.03748"},"observation_digest":"sha256:3a8ee2bbac8d64d7f6141530ca512fb34782b126587c2ec970de9008ef2c994d","observation_id":"ebd4c007-b700-4138-ba32-d3110d743d58","resolution":{"observed_at":"2026-07-12T00:14:19.104498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:14:19.104498Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03748","last_updated":"2026-07-04T07:40:43Z","snapshot_observed_at":"2026-08-02T09:22:47.161760Z","submitted_at":"2026-07-04T07:40:43Z","title":"Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-12T00:14:19.104498Z"},"links":{"citing_paper":"/paper/2607.03748"},"observation_digest":"sha256:7c6acd4a3cd49550c41cf1992a5dcfee8240200496fe127ec4670466041eafa5","observation_id":"5882ddfa-b7a1-4c47-931d-ec649625ea1b","resolution":{"observed_at":"2026-07-12T00:14:19.104498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:14:19.104498Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms.Advances in Neural Information Processing Systems, 37:87310–87356, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03748","last_updated":"2026-07-04T07:40:43Z","snapshot_observed_at":"2026-08-02T09:22:47.161760Z","submitted_at":"2026-07-04T07:40:43Z","title":"Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-12T00:14:19.104498Z"},"links":{"citing_paper":"/paper/2607.03748"},"observation_digest":"sha256:6396a412b45b1ac9f8c20c2dd855b724c174379646b3ca770c181545e3c2d649","observation_id":"fa8363de-f800-4dee-b7c6-4cf6deaa773d","resolution":{"observed_at":"2026-07-12T00:14:19.104498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:14:19.104498Z","title":"Blink: Multimodal large language models can see but not perceive","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03748","last_updated":"2026-07-04T07:40:43Z","snapshot_observed_at":"2026-08-02T09:22:47.161760Z","submitted_at":"2026-07-04T07:40:43Z","title":"Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-12T00:14:19.104498Z"},"links":{"citing_paper":"/paper/2607.03748"},"observation_digest":"sha256:f6cb79e4db1119e59a77a07c2e3f28f71a246df79eebb92ab5560bcfd2f0ed36","observation_id":"9a9889e3-27f4-4a05-b73f-4ba9f5152261","resolution":{"observed_at":"2026-07-12T00:14:19.104498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:14:19.104498Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03748","last_updated":"2026-07-04T07:40:43Z","snapshot_observed_at":"2026-08-02T09:22:47.161760Z","submitted_at":"2026-07-04T07:40:43Z","title":"Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-12T00:14:19.104498Z"},"links":{"citing_paper":"/paper/2607.03748"},"observation_digest":"sha256:556efcd38e1b88cf9ffdd099ef19f84d94be3d5b1f356e146a2e18814ec29b4d","observation_id":"ee7013a8-e731-4fb9-9841-756b7314f932","resolution":{"observed_at":"2026-07-12T00:14:19.104498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:14:19.104498Z","title":"Vlmevalkit: An open-source toolkit for evaluating large multi-modality models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03748","last_updated":"2026-07-04T07:40:43Z","snapshot_observed_at":"2026-08-02T09:22:47.161760Z","submitted_at":"2026-07-04T07:40:43Z","title":"Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-12T00:14:19.104498Z"},"links":{"citing_paper":"/paper/2607.03748"},"observation_digest":"sha256:bcf9af3f4a5b5cc85ab5bf06f67a3dbf79ce62266d98b13582e20ae29c34765e","observation_id":"d9339e26-51dc-4416-9d25-a4e49b726805","resolution":{"observed_at":"2026-07-12T00:14:19.104498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-07-12T00:14:19.104498Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03748","last_updated":"2026-07-04T07:40:43Z","snapshot_observed_at":"2026-08-02T09:22:47.161760Z","submitted_at":"2026-07-04T07:40:43Z","title":"Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-12T00:14:19.104498Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2607.03748"},"observation_digest":"sha256:56969dbafe256371540c16cd0f2312b2b6afcfc3441493bb6920c5ced2c528d0","observation_id":"1d45a60a-7412-4ced-89fa-a7b891c860dd","resolution":{"observed_at":"2026-07-12T00:14:19.104498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:14:19.104498Z","title":"CLIP-blind pairs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03748","last_updated":"2026-07-04T07:40:43Z","snapshot_observed_at":"2026-08-02T09:22:47.161760Z","submitted_at":"2026-07-04T07:40:43Z","title":"Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-12T00:14:19.104498Z"},"links":{"citing_paper":"/paper/2607.03748"},"observation_digest":"sha256:5a01b34c39b0d80cadcd4be9f9dc0e48631d2ce849b5bcdfa41088efa1039c4a","observation_id":"d05f6147-bd8f-420d-b14c-2baa9949f66a","resolution":{"observed_at":"2026-07-12T00:14:19.104498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.03748","last_updated":"2026-07-04T07:40:43Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-02T09:22:47.161760Z","submitted_at":"2026-07-04T07:40:43Z","title":"Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":52,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 0 inbound Pith citation observations for arXiv:2607.03748."}