{"as_of":"2026-08-08T21:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3989846870b5398b9d27ed326f3a241d09757f9d92a940de8744e39bf47b98af","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-10T06:30:28.462917Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.08497/citation-record","integrity":"/paper/2607.08497/integrity","json":"/paper/2607.08497/citation-record.json","paper":"/paper/2607.08497"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2607.08497","last_updated":"2026-07-09T13:55:55Z","snapshot_observed_at":"2026-08-03T10:33:29.237782Z","submitted_at":"2026-07-09T13:55:55Z","title":"Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-10T06:30:28.462917Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2607.08497"},"observation_digest":"sha256:fd608bd6371de577c5f1c90f94d4b765572e183fb3f8e566eec8f9af8f959db3","observation_id":"118692d1-fc3c-44b5-b6d3-f4442849222f","resolution":{"observed_at":"2026-07-10T06:36:52.563355Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":"2309.16609","doi":"10.48550/arxiv.2309.16609","metadata_source":"pith","pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen Technical Report","venue":"cs.CL","work_id":"bb1fd52f-6b2f-437c-9516-37bdf6eb9be8","year":2023},"citing_paper":{"arxiv_id":"2607.08497","last_updated":"2026-07-09T13:55:55Z","snapshot_observed_at":"2026-08-03T10:33:29.237782Z","submitted_at":"2026-07-09T13:55:55Z","title":"Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-10T06:30:28.462917Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2607.08497"},"observation_digest":"sha256:d870a33167d8882df8d6c4e163dbb4810edb1648176664d6d7ee5d7507679166","observation_id":"11e1e380-6d78-435e-ab1d-989592fae595","resolution":{"observed_at":"2026-07-10T06:36:52.572324Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:15.620681+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:15.620681+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:36:52.974035Z","title":"Qwen-vl: A versatile vision-language model for understand- ing, localization, text reading, and beyond","venue":null,"work_id":"3d19a049-f6da-4770-bfc2-148f91160eb0","year":2023},"citing_paper":{"arxiv_id":"2607.08497","last_updated":"2026-07-09T13:55:55Z","snapshot_observed_at":"2026-08-03T10:33:29.237782Z","submitted_at":"2026-07-09T13:55:55Z","title":"Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-10T06:30:28.462917Z"},"links":{"citing_paper":"/paper/2607.08497"},"observation_digest":"sha256:2363e8957b3f4ed2e7cf457439c112f3a28da348508ead58d126671e5413c353","observation_id":"ee0602c2-0354-4ea2-bb65-7a2d4e0d4002","resolution":{"observed_at":"2026-07-10T06:36:52.975236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2607.08497","last_updated":"2026-07-09T13:55:55Z","snapshot_observed_at":"2026-08-03T10:33:29.237782Z","submitted_at":"2026-07-09T13:55:55Z","title":"Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-10T06:30:28.462917Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.08497"},"observation_digest":"sha256:c49a6cdeb8fd538f1beb05c5e86cf3650affba8f9122b61679e3f436a74f9601","observation_id":"e567e0b5-1cc4-4e0d-915f-6656802e901d","resolution":{"observed_at":"2026-07-10T06:36:52.558779Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:36:52.972250Z","title":"In- structpix2pix: Learning to follow image editing instructions","venue":null,"work_id":"b99289b7-c66d-4cb7-92d7-11ec07f13ef2","year":2023},"citing_paper":{"arxiv_id":"2607.08497","last_updated":"2026-07-09T13:55:55Z","snapshot_observed_at":"2026-08-03T10:33:29.237782Z","submitted_at":"2026-07-09T13:55:55Z","title":"Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-10T06:30:28.462917Z"},"links":{"citing_paper":"/paper/2607.08497"},"observation_digest":"sha256:a1c0bc0f4521b83f056b1b3ec717920f7d9dff104502dd91cbff96b6382dcdba","observation_id":"acc2e0eb-e4c1-4c16-a46a-6db0cfd7c988","resolution":{"observed_at":"2026-07-10T06:36:52.973493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-07T22:11:30.869700Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":"2405.09818","doi":"10.48550/arxiv.2405.09818","metadata_source":"pith","pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","venue":"cs.CL","work_id":"2661b9a6-25cc-41a1-8100-612d2b801289","year":2024},"citing_paper":{"arxiv_id":"2607.08497","last_updated":"2026-07-09T13:55:55Z","snapshot_observed_at":"2026-08-03T10:33:29.237782Z","submitted_at":"2026-07-09T13:55:55Z","title":"Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-10T06:30:28.462917Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2607.08497"},"observation_digest":"sha256:2f869eca6fe16a5370b8a5556be724203bfde3af5511be4cac36a12844e75bc3","observation_id":"7a6a227c-33ce-4bf4-9ceb-f9880e313684","resolution":{"observed_at":"2026-07-10T06:36:52.570188Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-10T17:49:22.013335+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T17:49:22.013335+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":"2505.14683","doi":"10.48550/arxiv.2505.14683","metadata_source":"pith","pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emerging Properties in Unified Multimodal Pretraining","venue":"cs.CV","work_id":"e0cfd82c-f5d4-44fd-b531-ec73ab0a805b","year":2025},"citing_paper":{"arxiv_id":"2607.08497","last_updated":"2026-07-09T13:55:55Z","snapshot_observed_at":"2026-08-03T10:33:29.237782Z","submitted_at":"2026-07-09T13:55:55Z","title":"Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-10T06:30:28.462917Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2607.08497"},"observation_digest":"sha256:d33f04833f9053c8716905e56b3c56c74ca87e8760c03821f890a7a2173041c6","observation_id":"238ab7e4-30dd-4ca3-a8c5-82e808772937","resolution":{"observed_at":"2026-07-10T06:36:52.567988Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:36:52.968557Z","title":"Videoagent: A memory-augmented multi- modal agent for video understanding","venue":null,"work_id":"76b7bb98-3ac5-4179-bc03-12a11f1c2086","year":2024},"citing_paper":{"arxiv_id":"2607.08497","last_updated":"2026-07-09T13:55:55Z","snapshot_observed_at":"2026-08-03T10:33:29.237782Z","submitted_at":"2026-07-09T13:55:55Z","title":"Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-10T06:30:28.462917Z"},"links":{"citing_paper":"/paper/2607.08497"},"observation_digest":"sha256:1a1edd20469f078c56a6d925b7cb3610b2a6486ac03f5f9046f28b6febe0f69e","observation_id":"2a2f523f-2b61-476e-8eee-b7856980268b","resolution":{"observed_at":"2026-07-10T06:36:52.969766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15606","last_updated":"2025-02-03T12:56:55Z","snapshot_observed_at":"2026-08-03T10:35:12.497557Z","submitted_at":"2024-12-20T07:00:46Z","title":"Multi-modal Agent Tuning: Building a VLM-Driven Agent for Efficient Tool Usage","version":2},"cited_work":{"arxiv_id":"2412.15606","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.15606","snapshot_observed_at":"2026-07-10T06:36:52.552598Z","title":"Multi-modal agent tuning: Building a vlm-driven agent for efficient tool usage.arXiv preprint arXiv:2412.15606","venue":"cs.AI","work_id":"2cbcdb2f-a0aa-41a2-ae52-6dc83531353f","year":2024},"citing_paper":{"arxiv_id":"2607.08497","last_updated":"2026-07-09T13:55:55Z","snapshot_observed_at":"2026-08-03T10:33:29.237782Z","submitted_at":"2026-07-09T13:55:55Z","title":"Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-10T06:30:28.462917Z"},"links":{"cited_paper":"/paper/2412.15606","citing_paper":"/paper/2607.08497"},"observation_digest":"sha256:b2eb38ef9122d3c1b22d6b1afd78c638e19503c83c0259a20e77652098e7aff9","observation_id":"614e779c-392d-4a80-a56f-5936bfe66faf","resolution":{"observed_at":"2026-07-10T06:36:52.553796Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:36:52.966810Z","title":"Metagpt: Meta programming for a multi-agent collaborative framework","venue":null,"work_id":"c406797c-06b5-46e2-b568-86ecd25692f1","year":2023},"citing_paper":{"arxiv_id":"2607.08497","last_updated":"2026-07-09T13:55:55Z","snapshot_observed_at":"2026-08-03T10:33:29.237782Z","submitted_at":"2026-07-09T13:55:55Z","title":"Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-10T06:30:28.462917Z"},"links":{"citing_paper":"/paper/2607.08497"},"observation_digest":"sha256:1bd8cd2b8b4b1a59a37c62ce3fae108363cc11ef8f96846526c8900956485b08","observation_id":"3d65c253-8658-4c0e-a091-d89bfa607dbe","resolution":{"observed_at":"2026-07-10T06:36:52.968036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.01915","doi":"10.48550/arxiv.2601.01915","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Talkphoto: A versatile training-free conversa- tional assistant for intelligent image editing.arXiv preprint arXiv:2601.01915, 2026","venue":"arXiv (Cornell University)","work_id":"eb2848b2-955b-4f6f-a3a7-aab89522abbf","year":2026},"citing_paper":{"arxiv_id":"2607.08497","last_updated":"2026-07-09T13:55:55Z","snapshot_observed_at":"2026-08-03T10:33:29.237782Z","submitted_at":"2026-07-09T13:55:55Z","title":"Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-10T06:30:28.462917Z"},"links":{"citing_paper":"/paper/2607.08497"},"observation_digest":"sha256:dd02dab32c1b7b13322204b9695dca95e3d060f4e7de4f277b7238c6271d8989","observation_id":"4c0f5849-0085-4fe7-a67c-4d89f32e16da","resolution":{"observed_at":"2026-07-10T06:36:52.526893Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:36:52.970339Z","title":"Wegen: A unified model for interac- tive multimodal generation as we chat","venue":null,"work_id":"fd084aba-c73c-47ff-a392-711892070eb2","year":2025},"citing_paper":{"arxiv_id":"2607.08497","last_updated":"2026-07-09T13:55:55Z","snapshot_observed_at":"2026-08-03T10:33:29.237782Z","submitted_at":"2026-07-09T13:55:55Z","title":"Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-10T06:30:28.462917Z"},"links":{"citing_paper":"/paper/2607.08497"},"observation_digest":"sha256:c337586575ab65f95f0ff96541100d75dfa48035e9d0af97b5c162132b396a36","observation_id":"451c7b3c-4205-45bc-bd1f-1b7927b3efd1","resolution":{"observed_at":"2026-07-10T06:36:52.971543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.02744","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:36:52.547480Z","title":"SYNAPSE: Synergistic associative processing & semantic encoding","venue":null,"work_id":"a1270bcb-6fbd-44fa-915d-98e8bc0a33a2","year":2026},"citing_paper":{"arxiv_id":"2607.08497","last_updated":"2026-07-09T13:55:55Z","snapshot_observed_at":"2026-08-03T10:33:29.237782Z","submitted_at":"2026-07-09T13:55:55Z","title":"Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-10T06:30:28.462917Z"},"links":{"citing_paper":"/paper/2607.08497"},"observation_digest":"sha256:ab106a42b2599a3788afb4fd4e05f7548e38c504ed8db8089624f7f6ba6d75ce","observation_id":"4250f6db-719a-48d3-938d-93dcd311fe5c","resolution":{"observed_at":"2026-07-10T06:36:52.549002Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.04540","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:36:52.534028Z","title":"Videomem: En- hancing ultra-long video understanding via adaptive memory management","venue":null,"work_id":"06b302fa-968c-4777-bdb4-2b7a2fa7488b","year":2025},"citing_paper":{"arxiv_id":"2607.08497","last_updated":"2026-07-09T13:55:55Z","snapshot_observed_at":"2026-08-03T10:33:29.237782Z","submitted_at":"2026-07-09T13:55:55Z","title":"Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-10T06:30:28.462917Z"},"links":{"citing_paper":"/paper/2607.08497"},"observation_digest":"sha256:2d17132ad627b61cc5a81229048afece96885ff0aa0df349b771fdeda58078f7","observation_id":"868cf897-d97a-45b8-b55e-48b8ee1be68b","resolution":{"observed_at":"2026-07-10T06:36:52.535630Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18358","last_updated":"2024-05-28T16:55:41Z","snapshot_observed_at":"2026-08-03T17:33:50.716704Z","submitted_at":"2024-05-28T16:55:41Z","title":"MMCTAgent: Multi-modal Critical Thinking Agent Framework for Complex Visual Reasoning","version":1},"cited_work":{"arxiv_id":"2405.18358","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.18358","snapshot_observed_at":"2026-07-10T06:36:52.550162Z","title":"Mmctagent: Multi-modal critical thinking agent framework for complex visual reasoning","venue":"cs.CL","work_id":"a4f0fcc6-6575-4040-80d2-87b4f721a952","year":2024},"citing_paper":{"arxiv_id":"2607.08497","last_updated":"2026-07-09T13:55:55Z","snapshot_observed_at":"2026-08-03T10:33:29.237782Z","submitted_at":"2026-07-09T13:55:55Z","title":"Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-10T06:30:28.462917Z"},"links":{"cited_paper":"/paper/2405.18358","citing_paper":"/paper/2607.08497"},"observation_digest":"sha256:9d6259c6f442e974f1a1f047fcdcd4fed463a7f6394172c6d270f7cceaa76d57","observation_id":"364476b8-984f-488a-ba55-9972166d8930","resolution":{"observed_at":"2026-07-10T06:36:52.551375Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:36:52.961274Z","title":"Camel: Com- municative agents for” mind” exploration of large language model society","venue":null,"work_id":"84d5815b-bc01-4974-848a-574674eba1d3","year":2023},"citing_paper":{"arxiv_id":"2607.08497","last_updated":"2026-07-09T13:55:55Z","snapshot_observed_at":"2026-08-03T10:33:29.237782Z","submitted_at":"2026-07-09T13:55:55Z","title":"Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-10T06:30:28.462917Z"},"links":{"citing_paper":"/paper/2607.08497"},"observation_digest":"sha256:11f5333142c4cf9d7e81f683a76251b48a9fbfde1aefce27cec6773f34ad1cf5","observation_id":"afa2fd87-cf78-499d-a3e0-80358efa4eb8","resolution":{"observed_at":"2026-07-10T06:36:52.962455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:36:52.964879Z","title":"Blip- 2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"c32987c7-af0a-4946-b75c-990431170887","year":2023},"citing_paper":{"arxiv_id":"2607.08497","last_updated":"2026-07-09T13:55:55Z","snapshot_observed_at":"2026-08-03T10:33:29.237782Z","submitted_at":"2026-07-09T13:55:55Z","title":"Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-10T06:30:28.462917Z"},"links":{"citing_paper":"/paper/2607.08497"},"observation_digest":"sha256:564a9560e7225d93ae23f2eca61e2ea978760bbf444242cb2b8d386f123869a9","observation_id":"cb6cc774-ac5c-40ea-bb86-b702ebf7bb22","resolution":{"observed_at":"2026-07-10T06:36:52.966212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:36:52.957431Z","title":"Iterative trajectory exploration for multi- modal agents","venue":null,"work_id":"e95ea534-0b6b-4254-947e-6888428dc4cf","year":2025},"citing_paper":{"arxiv_id":"2607.08497","last_updated":"2026-07-09T13:55:55Z","snapshot_observed_at":"2026-08-03T10:33:29.237782Z","submitted_at":"2026-07-09T13:55:55Z","title":"Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-10T06:30:28.462917Z"},"links":{"citing_paper":"/paper/2607.08497"},"observation_digest":"sha256:c46b2d410059572c60c81cb22bfb681671c39d4ef37b5cad02411dfe5d657081","observation_id":"bfa69c8c-ae61-41f7-8130-cf3306aba638","resolution":{"observed_at":"2026-07-10T06:36:52.958907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:36:52.959495Z","title":"Llava-next: Improved reason- ing, ocr, and world knowledge, 2024","venue":null,"work_id":"7ce181c1-4111-4c05-bc8f-370f1bfcd5cf","year":2024},"citing_paper":{"arxiv_id":"2607.08497","last_updated":"2026-07-09T13:55:55Z","snapshot_observed_at":"2026-08-03T10:33:29.237782Z","submitted_at":"2026-07-09T13:55:55Z","title":"Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-10T06:30:28.462917Z"},"links":{"citing_paper":"/paper/2607.08497"},"observation_digest":"sha256:8a3eb7afaa921805483c6f4d8bdfe37d6978eab31f5521f57c16aa48a2117b6e","observation_id":"1a600f12-802a-4133-9427-85247b16fb6a","resolution":{"observed_at":"2026-07-10T06:36:52.960735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.19900","doi":"10.48550/arxiv.2511.19900","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agent0 -vl: Exploring self -evolving agent for tool -integrated vision -language reasoning","venue":"ArXiv.org","work_id":"a0b54170-89b2-4a4b-b390-b92a36cb244b","year":2025},"citing_paper":{"arxiv_id":"2607.08497","last_updated":"2026-07-09T13:55:55Z","snapshot_observed_at":"2026-08-03T10:33:29.237782Z","submitted_at":"2026-07-09T13:55:55Z","title":"Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-10T06:30:28.462917Z"},"links":{"citing_paper":"/paper/2607.08497"},"observation_digest":"sha256:2ce967898c6a365fb5ad1f599080b843acdfb5790e839d38601d077181a96d94","observation_id":"86aecfdd-2dbb-4b59-9ad8-8604735bb7df","resolution":{"observed_at":"2026-07-10T06:36:52.541423Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-30T14:25:28.966971+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-30T14:25:28.966971+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.09736","doi":"10.48550/arxiv.2508.09736","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seeing, listening, remembering, and reasoning: A multi- modal agent with long-term memory","venue":"arXiv (Cornell University)","work_id":"4e96e6d1-1009-4e40-bbfe-9317a90452ab","year":2025},"citing_paper":{"arxiv_id":"2607.08497","last_updated":"2026-07-09T13:55:55Z","snapshot_observed_at":"2026-08-03T10:33:29.237782Z","submitted_at":"2026-07-09T13:55:55Z","title":"Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-10T06:30:28.462917Z"},"links":{"citing_paper":"/paper/2607.08497"},"observation_digest":"sha256:2401369611c04bf5fdff5217f3c4927def90b754c6c1a65e386e11be2866f93d","observation_id":"86d93bfe-f407-41d6-a0f6-a399cf026589","resolution":{"observed_at":"2026-07-10T06:36:52.538636Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-14T09:19:47.876951+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T09:19:47.876951+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:36:52.955605Z","title":"Janusflow: Harmonizing autoregression and rectified flow for unified multimodal understanding and generation","venue":null,"work_id":"87880565-abb4-4c17-be2b-79922df9fb16","year":2025},"citing_paper":{"arxiv_id":"2607.08497","last_updated":"2026-07-09T13:55:55Z","snapshot_observed_at":"2026-08-03T10:33:29.237782Z","submitted_at":"2026-07-09T13:55:55Z","title":"Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-10T06:30:28.462917Z"},"links":{"citing_paper":"/paper/2607.08497"},"observation_digest":"sha256:11091bcbc97e52692b83f88b2a471b026dea2209c1c2a4f65872827088631b5b","observation_id":"d28de4e5-65ed-4b91-9306-d7bc82277630","resolution":{"observed_at":"2026-07-10T06:36:52.956862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.25140","last_updated":"2026-03-16T20:49:28Z","snapshot_observed_at":"2026-08-02T12:08:17.149184Z","submitted_at":"2025-09-29T17:51:03Z","title":"ReasoningBank: Scaling Agent Self-Evolving with Reasoning Memory","version":2},"cited_work":{"arxiv_id":"2509.25140","doi":"10.48550/arxiv.2509.25140","metadata_source":"pith","pith_arxiv_id":"2509.25140","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ReasoningBank: Scaling Agent Self-Evolving with Reasoning Memory","venue":"cs.AI","work_id":"551218b8-a306-4c1e-8795-6232cc30192b","year":2025},"citing_paper":{"arxiv_id":"2607.08497","last_updated":"2026-07-09T13:55:55Z","snapshot_observed_at":"2026-08-03T10:33:29.237782Z","submitted_at":"2026-07-09T13:55:55Z","title":"Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-10T06:30:28.462917Z"},"links":{"cited_paper":"/paper/2509.25140","citing_paper":"/paper/2607.08497"},"observation_digest":"sha256:c2f50ac7da2a9c7cbd7b9e5fc21256b4f417b99d209aa4c8b350b986778537fa","observation_id":"4044ca7d-07cc-42da-bdcc-eed259536201","resolution":{"observed_at":"2026-07-10T06:36:52.546322Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-22T15:52:34.995342+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T15:52:34.995342+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":"2306.14824","doi":"10.48550/arxiv.2306.14824","metadata_source":"pith","pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","venue":"cs.CL","work_id":"46e7f9e9-24c6-49af-b7d5-96159fa6f443","year":2023},"citing_paper":{"arxiv_id":"2607.08497","last_updated":"2026-07-09T13:55:55Z","snapshot_observed_at":"2026-08-03T10:33:29.237782Z","submitted_at":"2026-07-09T13:55:55Z","title":"Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-10T06:30:28.462917Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2607.08497"},"observation_digest":"sha256:d1b2a543e73307dd3cc24fc2a549eea13256d9c4dced02ec1ec7a686a3ad5f31","observation_id":"9bd478fc-be42-4874-84ef-3c93137fb3e5","resolution":{"observed_at":"2026-07-10T06:36:52.543951Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:36:52.953847Z","title":"Chatdev: Communicative agents for software devel- opment","venue":null,"work_id":"b74d3b7a-006c-4b02-9fd7-dff2114f8048","year":2024},"citing_paper":{"arxiv_id":"2607.08497","last_updated":"2026-07-09T13:55:55Z","snapshot_observed_at":"2026-08-03T10:33:29.237782Z","submitted_at":"2026-07-09T13:55:55Z","title":"Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-10T06:30:28.462917Z"},"links":{"citing_paper":"/paper/2607.08497"},"observation_digest":"sha256:343e191b87ee3374376a8d35c6ffd3514e5113ee7d09c9f2ef6a0b06a04d12fe","observation_id":"f010496c-7246-4375-b471-caec90bc69a6","resolution":{"observed_at":"2026-07-10T06:36:52.955062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:36:52.952235Z","title":"quiet\" and","venue":null,"work_id":"35b409a5-ead9-4306-a845-a5aed73b3bc1","year":2024},"citing_paper":{"arxiv_id":"2607.08497","last_updated":"2026-07-09T13:55:55Z","snapshot_observed_at":"2026-08-03T10:33:29.237782Z","submitted_at":"2026-07-09T13:55:55Z","title":"Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-10T06:30:28.462917Z"},"links":{"citing_paper":"/paper/2607.08497"},"observation_digest":"sha256:d1f0f3ff562605c14039eca798144b13dbc451f6bbceebf7c1f6dd75bfb38179","observation_id":"d8ca0203-eac4-4df3-8090-c8ae668ff738","resolution":{"observed_at":"2026-07-10T06:36:52.953298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.23278","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:36:52.528059Z","title":"Unilip: Adapting clip for unified multimodal understanding, generation and editing","venue":null,"work_id":"a1bad6a0-54ce-45f8-8478-3169a4b3c6e8","year":2025},"citing_paper":{"arxiv_id":"2607.08497","last_updated":"2026-07-09T13:55:55Z","snapshot_observed_at":"2026-08-03T10:33:29.237782Z","submitted_at":"2026-07-09T13:55:55Z","title":"Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-10T06:30:28.462917Z"},"links":{"citing_paper":"/paper/2607.08497"},"observation_digest":"sha256:6df3996dce1bf912f7647ec2c7d1787e00ce9863247327af9105b338657e1e2c","observation_id":"1632f313-2d01-48c0-a98e-7ad050f361fa","resolution":{"observed_at":"2026-07-10T06:36:52.529778Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":"2312.11805","doi":"10.1038/nrn2888","metadata_source":"pith","pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini: A Family of Highly Capable Multimodal Models","venue":"cs.CL","work_id":"83f7c85b-3f11-450f-ac0c-64d9745220b2","year":2023},"citing_paper":{"arxiv_id":"2607.08497","last_updated":"2026-07-09T13:55:55Z","snapshot_observed_at":"2026-08-03T10:33:29.237782Z","submitted_at":"2026-07-09T13:55:55Z","title":"Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-10T06:30:28.462917Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2607.08497"},"observation_digest":"sha256:0ed18ad0c36d7a1c43a97cda2732a08caa5af33a4e0ee75bc6d3d0c72c09c62c","observation_id":"3ac3107a-04e5-4f82-8ccd-8cb50a706ec4","resolution":{"observed_at":"2026-07-10T06:36:52.576992Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2607.08497","last_updated":"2026-07-09T13:55:55Z","snapshot_observed_at":"2026-08-03T10:33:29.237782Z","submitted_at":"2026-07-09T13:55:55Z","title":"Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-10T06:30:28.462917Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2607.08497"},"observation_digest":"sha256:c555825b8c67b94b275cd72f2572afe07c111baa4ed045a3b27d1aae8809a22d","observation_id":"d770cabd-c3fc-4b06-a29b-5cbfc367fbcf","resolution":{"observed_at":"2026-07-10T06:36:52.516126Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T16:08:17.350515+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:17.350515+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:17.350515+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:36:52.947087Z","title":"Crea: A collaborative multi-agent framework for creative content generation with diffusion mod- els","venue":null,"work_id":"2a6958cb-047a-44c3-9db5-fba91495ce8e","year":2025},"citing_paper":{"arxiv_id":"2607.08497","last_updated":"2026-07-09T13:55:55Z","snapshot_observed_at":"2026-08-03T10:33:29.237782Z","submitted_at":"2026-07-09T13:55:55Z","title":"Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-10T06:30:28.462917Z"},"links":{"citing_paper":"/paper/2607.08497"},"observation_digest":"sha256:863acf1b86c0a7ee15206efd5ca9c6af84ffdc3642e3a3274f0e030bf2c56a21","observation_id":"659ce5ac-57e5-4001-82c4-708bdb4ff38d","resolution":{"observed_at":"2026-07-10T06:36:52.948389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.12937","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:36:52.530912Z","title":"Yanyun-3: Enabling cross-platform strategy game operation with vision-language models.arXiv preprint arXiv:2511.12937, 2025","venue":null,"work_id":"ceb418d0-1690-4744-8d1d-e444055072cb","year":2025},"citing_paper":{"arxiv_id":"2607.08497","last_updated":"2026-07-09T13:55:55Z","snapshot_observed_at":"2026-08-03T10:33:29.237782Z","submitted_at":"2026-07-09T13:55:55Z","title":"Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-10T06:30:28.462917Z"},"links":{"citing_paper":"/paper/2607.08497"},"observation_digest":"sha256:af165b5233456dce31b66b98b5acf04454fac5fd29ebda3302fe1ba97fd3ef10","observation_id":"141f7f3d-8d8e-4a1b-9082-f83562ca4b1d","resolution":{"observed_at":"2026-07-10T06:36:52.532440Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:36:52.948933Z","title":"Multimodal needle in a haystack","venue":null,"work_id":"768faaa6-5bd0-45a9-89b5-151b00ccdc87","year":2025},"citing_paper":{"arxiv_id":"2607.08497","last_updated":"2026-07-09T13:55:55Z","snapshot_observed_at":"2026-08-03T10:33:29.237782Z","submitted_at":"2026-07-09T13:55:55Z","title":"Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-10T06:30:28.462917Z"},"links":{"citing_paper":"/paper/2607.08497"},"observation_digest":"sha256:6c0736dd54fbfb51f90833b4e69d949bcebbeebb37da2e28ef7748994371079a","observation_id":"a69fc2c7-550d-4561-9c66-dac08667474c","resolution":{"observed_at":"2026-07-10T06:36:52.950001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":"2508.18265","doi":"10.48550/arxiv.2508.18265","metadata_source":"pith","pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","venue":"cs.CV","work_id":"b8f5e260-fff5-444e-bcf5-2c42cfefd83d","year":2025},"citing_paper":{"arxiv_id":"2607.08497","last_updated":"2026-07-09T13:55:55Z","snapshot_observed_at":"2026-08-03T10:33:29.237782Z","submitted_at":"2026-07-09T13:55:55Z","title":"Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-10T06:30:28.462917Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2607.08497"},"observation_digest":"sha256:f9e5f10feac14fc42bb5bda6f697081091da4724182875f0598ed3bbdb5e81f1","observation_id":"c5b8d679-e97e-4e89-8220-6f2fb9b67d5f","resolution":{"observed_at":"2026-07-10T06:36:52.556292Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":"2409.18869","doi":"10.48550/arxiv.2409.18869","metadata_source":"pith","pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3: Next-Token Prediction is All You Need","venue":"cs.CV","work_id":"720d288e-fac0-464c-9929-19efd9a52afc","year":2024},"citing_paper":{"arxiv_id":"2607.08497","last_updated":"2026-07-09T13:55:55Z","snapshot_observed_at":"2026-08-03T10:33:29.237782Z","submitted_at":"2026-07-09T13:55:55Z","title":"Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-10T06:30:28.462917Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2607.08497"},"observation_digest":"sha256:2f500addd86e807db73af2aec6440e5dc05e705e43ea53c01e3eddbb9a8f4a08","observation_id":"1fab9c4f-c2c3-49c5-a1d7-b5ad56bbebd2","resolution":{"observed_at":"2026-07-10T06:36:52.574682Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:36:52.950506Z","title":"Videoagent: Long-form video understanding with large language model as agent","venue":null,"work_id":"fc1c4f05-8bd8-4c95-8286-2c7c52cff8dc","year":2024},"citing_paper":{"arxiv_id":"2607.08497","last_updated":"2026-07-09T13:55:55Z","snapshot_observed_at":"2026-08-03T10:33:29.237782Z","submitted_at":"2026-07-09T13:55:55Z","title":"Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-10T06:30:28.462917Z"},"links":{"citing_paper":"/paper/2607.08497"},"observation_digest":"sha256:550538a944f1da9ad4221d27da2fa566c9fa0bd364d50364afbae42fe7e96a7c","observation_id":"39bdbb5b-3444-48b1-a8a7-5554bbce8171","resolution":{"observed_at":"2026-07-10T06:36:52.951712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:36:52.963019Z","title":"Genartist: Multimodal llm as an agent for unified image gener- ation and editing.Advances in Neural Information Processing Systems, 37:128374–128395, 2024","venue":null,"work_id":"c43d4b56-4a44-49d9-8086-abb66fcbab0b","year":2024},"citing_paper":{"arxiv_id":"2607.08497","last_updated":"2026-07-09T13:55:55Z","snapshot_observed_at":"2026-08-03T10:33:29.237782Z","submitted_at":"2026-07-09T13:55:55Z","title":"Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-10T06:30:28.462917Z"},"links":{"citing_paper":"/paper/2607.08497"},"observation_digest":"sha256:71e24ea3422e1eab6e24ac70d4603a9e45c6176842a7c4fe4c2614a9281a4259","observation_id":"7ba7a256-fdbf-4092-b012-feb8aa1ee298","resolution":{"observed_at":"2026-07-10T06:36:52.964348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:36:52.945139Z","title":"Qwen-image technical report, 2025","venue":null,"work_id":"e54abd5b-34a0-489c-a666-2a855d80af58","year":2025},"citing_paper":{"arxiv_id":"2607.08497","last_updated":"2026-07-09T13:55:55Z","snapshot_observed_at":"2026-08-03T10:33:29.237782Z","submitted_at":"2026-07-09T13:55:55Z","title":"Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-10T06:30:28.462917Z"},"links":{"citing_paper":"/paper/2607.08497"},"observation_digest":"sha256:30970a7ffcbd163ba2b0f35a2bfd93e10cc5884168c7709b9e26d7a8cca141c7","observation_id":"11c699b5-43dc-49f3-b604-801e2d9687d7","resolution":{"observed_at":"2026-07-10T06:36:52.946383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13766","last_updated":"2025-03-11T17:31:27Z","snapshot_observed_at":"2026-08-03T10:33:33.362949Z","submitted_at":"2024-07-18T17:59:30Z","title":"Visual Haystacks: A Vision-Centric Needle-In-A-Haystack Benchmark","version":4},"cited_work":{"arxiv_id":"2407.13766","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.13766","snapshot_observed_at":"2026-07-10T06:36:52.559941Z","title":"Visual haystacks: A vision-centric needle-in-a-haystack benchmark","venue":"cs.CV","work_id":"ae09535b-4a27-493a-bc6c-2ec7b2882cba","year":2024},"citing_paper":{"arxiv_id":"2607.08497","last_updated":"2026-07-09T13:55:55Z","snapshot_observed_at":"2026-08-03T10:33:29.237782Z","submitted_at":"2026-07-09T13:55:55Z","title":"Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-10T06:30:28.462917Z"},"links":{"cited_paper":"/paper/2407.13766","citing_paper":"/paper/2607.08497"},"observation_digest":"sha256:409bf1aa0fd39245fdf5797bd6fd8da9272588e5a91f7953072ca6fb66402bd8","observation_id":"7fdc33c5-da4a-458a-b748-ea7865372227","resolution":{"observed_at":"2026-07-10T06:36:52.561097Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15564","last_updated":"2025-09-22T01:24:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-18T15:39:15Z","title":"Show-o2: Improved Native Unified Multimodal Models","version":3},"cited_work":{"arxiv_id":"2506.15564","doi":"10.48550/arxiv.2506.15564","metadata_source":"pith","pith_arxiv_id":"2506.15564","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Show-o2: Improved Native Unified Multimodal Models","venue":"cs.CV","work_id":"77f00563-1ce6-4fba-9d4e-c8ce83f716ac","year":2025},"citing_paper":{"arxiv_id":"2607.08497","last_updated":"2026-07-09T13:55:55Z","snapshot_observed_at":"2026-08-03T10:33:29.237782Z","submitted_at":"2026-07-09T13:55:55Z","title":"Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-10T06:30:28.462917Z"},"links":{"cited_paper":"/paper/2506.15564","citing_paper":"/paper/2607.08497"},"observation_digest":"sha256:1ae858c4a8b545adbc763442410bbe7d644e9f754b1ca3acddd8d0d74f957a46","observation_id":"981b8bcc-a252-40a0-996c-1ef5eb69dac3","resolution":{"observed_at":"2026-07-10T06:36:52.521661Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2607.08497","last_updated":"2026-07-09T13:55:55Z","snapshot_observed_at":"2026-08-03T10:33:29.237782Z","submitted_at":"2026-07-09T13:55:55Z","title":"Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-10T06:30:28.462917Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.08497"},"observation_digest":"sha256:ca24c104351c3ead369ee9dacbad1ec861979598514b01ada5bda8cc405ce3af","observation_id":"ebc799a5-f80d-4189-8158-bb72c5c21345","resolution":{"observed_at":"2026-07-10T06:36:52.510592Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.24699","doi":"10.48550/arxiv.2510.24699","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agentfold: Long-horizon web agents with proactive context management","venue":"arXiv (Cornell University)","work_id":"c066e479-5bdf-45aa-9a32-63dae2dff088","year":2025},"citing_paper":{"arxiv_id":"2607.08497","last_updated":"2026-07-09T13:55:55Z","snapshot_observed_at":"2026-08-03T10:33:29.237782Z","submitted_at":"2026-07-09T13:55:55Z","title":"Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-10T06:30:28.462917Z"},"links":{"citing_paper":"/paper/2607.08497"},"observation_digest":"sha256:24d7a37ef5829c8116219411cd399b1e4c2f3d4526cfb18e7190d22efa485b7d","observation_id":"62c9e693-29be-4823-999c-b826b20f61d8","resolution":{"observed_at":"2026-07-10T06:36:52.518800Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.02425","doi":"10.48550/arxiv.2512.02425","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Worldmm: Dynamic multimodal memory agent for long video reasoning","venue":"ArXiv.org","work_id":"fde41b2f-0fbd-4c37-b46b-28a847941c85","year":2025},"citing_paper":{"arxiv_id":"2607.08497","last_updated":"2026-07-09T13:55:55Z","snapshot_observed_at":"2026-08-03T10:33:29.237782Z","submitted_at":"2026-07-09T13:55:55Z","title":"Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-10T06:30:28.462917Z"},"links":{"citing_paper":"/paper/2607.08497"},"observation_digest":"sha256:d50d9085619e2d6bed25cb00e540013fedb8e1e9794cb60105d958187dea85dd","observation_id":"7b42fe35-f250-400d-a039-20e52b447e34","resolution":{"observed_at":"2026-07-10T06:36:52.513341Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-14T09:19:50.44401+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T09:19:50.44401+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2607.08497","last_updated":"2026-07-09T13:55:55Z","snapshot_observed_at":"2026-08-03T10:33:29.237782Z","submitted_at":"2026-07-09T13:55:55Z","title":"Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-10T06:30:28.462917Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2607.08497"},"observation_digest":"sha256:a0fbdd9cfed5149b917ddffaa3d5d0e49bc1972d62ed830f5cc9b370ccac915e","observation_id":"ed3a82d3-2bbf-40c7-928b-a0d057c187df","resolution":{"observed_at":"2026-07-10T06:36:52.565720Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T16:08:20.547492+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:36:52.943422Z","title":"Multi-turn consistent image editing","venue":null,"work_id":"e80b7863-a8cf-4c24-9ac4-ca9dccaa8865","year":2025},"citing_paper":{"arxiv_id":"2607.08497","last_updated":"2026-07-09T13:55:55Z","snapshot_observed_at":"2026-08-03T10:33:29.237782Z","submitted_at":"2026-07-09T13:55:55Z","title":"Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-10T06:30:28.462917Z"},"links":{"citing_paper":"/paper/2607.08497"},"observation_digest":"sha256:1f4fee0460311fb71af21e803259092c16f40d81301a88b036ab628ad89f5c71","observation_id":"e9555c9c-9e65-4e8e-beb9-46a671eaf0d0","resolution":{"observed_at":"2026-07-10T06:36:52.944652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":"2304.10592","doi":"10.18653/v1/2024.findings-emnlp.692","metadata_source":"pith","pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","venue":"cs.CV","work_id":"a7e3a737-e007-42bc-be89-c4d34c5ee071","year":2023},"citing_paper":{"arxiv_id":"2607.08497","last_updated":"2026-07-09T13:55:55Z","snapshot_observed_at":"2026-08-03T10:33:29.237782Z","submitted_at":"2026-07-09T13:55:55Z","title":"Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-10T06:30:28.462917Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2607.08497"},"observation_digest":"sha256:ccea62f78b0e5f881518e29186be3bb90ac9d8818f06e8f8fbaa2e8dca20d96c","observation_id":"8e0fb181-2552-434d-9b5e-cafdf3777fa3","resolution":{"observed_at":"2026-07-10T06:36:52.524292Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T17:23:55.433296+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T17:23:55.433296+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.08497","last_updated":"2026-07-09T13:55:55Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-03T10:33:29.237782Z","submitted_at":"2026-07-09T13:55:55Z","title":"Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":26,"verified_fuzzy":18},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2607.08497."}