{"as_of":"2026-08-07T08:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4e242ccd4051c42a54d0e326e473b4dd7422c16518392221c87f5be6c8fa0d13","coverage":[{"denominator":6,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T20:30:17.117740Z","state":"measured"},{"denominator":8,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":8,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T00:03:24.366318Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T15:31:12.447438Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.10494","last_updated":"2025-08-14T09:52:51Z","snapshot_observed_at":"2026-08-05T20:30:08.263197Z","submitted_at":"2025-08-14T09:52:51Z","title":"A Unified Multi-Agent Framework for Universal Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10494","snapshot_observed_at":"2026-08-03T00:03:24.366318Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.11790","last_updated":"2026-05-31T04:10:48Z","snapshot_observed_at":"2026-08-03T12:52:27.367861Z","submitted_at":"2026-02-12T10:14:36Z","title":"Beyond End-to-End Video Models: An LLM-Based Multi-Agent System for Educational Video Generation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T00:03:24.366318Z"},"links":{"cited_paper":"/paper/2508.10494","citing_paper":"/paper/2602.11790"},"observation_digest":"sha256:5dfbc9838012f5056df4b285b747f32af4e58a82876f7a6e653e405a06b00825","observation_id":"2ac124cc-c639-4ac6-8b6d-f4c6a9f7a748","resolution":{"observed_at":"2026-08-03T00:03:24.366318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10494","last_updated":"2025-08-14T09:52:51Z","snapshot_observed_at":"2026-08-05T20:30:08.263197Z","submitted_at":"2025-08-14T09:52:51Z","title":"A Unified Multi-Agent Framework for Universal Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":"2508.10494","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10494","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A unified multi-agent framework for universal multi- modal understanding and generation.arXiv preprint arXiv:2508.10494, 2025b","venue":null,"work_id":"5b43d6ce-a2e6-4a77-aa29-51d120cfe0c5","year":null},"citing_paper":{"arxiv_id":"2605.04097","last_updated":"2026-04-30T20:48:03Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-30T20:48:03Z","title":"CTM-AI: A Blueprint for General AI Inspired by a Model of Consciousness","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-09T19:47:49.262632Z"},"links":{"cited_paper":"/paper/2508.10494","citing_paper":"/paper/2605.04097"},"observation_digest":"sha256:eff14c3a99d84ae88d32c6d1d4477c5b89f23fa081e67f66dc83698cb6c45041","observation_id":"635ffa24-5d07-4a53-a8ea-c183c284c949","resolution":{"observed_at":"2026-05-11T15:31:12.515464Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.10494/citation-record","integrity":"/paper/2508.10494/integrity","json":"/paper/2508.10494/citation-record.json","paper":"/paper/2508.10494"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-05T20:30:16.690239Z","title":"In Forty-first International Conference on Machine Learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10494","last_updated":"2025-08-14T09:52:51Z","snapshot_observed_at":"2026-08-05T20:30:08.263197Z","submitted_at":"2025-08-14T09:52:51Z","title":"A Unified Multi-Agent Framework for Universal Multimodal Understanding and Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T20:30:16.690239Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2508.10494"},"observation_digest":"sha256:78bd6d58ddbdbfcc2020dc4f4da3c3f1448f2b15d2c60b02e97b9e515bf29d8c","observation_id":"3b0eeaa4-e497-4aa5-bf89-6c5204fa29fa","resolution":{"observed_at":"2026-08-05T20:30:16.690239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09439","last_updated":"2025-04-07T16:13:38Z","snapshot_observed_at":"2026-07-06T19:50:24.924617Z","submitted_at":"2024-11-14T16:58:19Z","title":"Spider: Any-to-Many Multimodal LLM","version":2},"cited_work":{"arxiv_id":"2411.09439","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.09439","snapshot_observed_at":"2026-08-05T20:30:17.239571Z","title":"Spider: Any-to-Many Multimodal LLM","venue":"cs.CV","work_id":"d86d208f-b488-4bfc-86db-274cad45b25b","year":2024},"citing_paper":{"arxiv_id":"2508.10494","last_updated":"2025-08-14T09:52:51Z","snapshot_observed_at":"2026-08-05T20:30:08.263197Z","submitted_at":"2025-08-14T09:52:51Z","title":"A Unified Multi-Agent Framework for Universal Multimodal Understanding and Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T20:30:16.892900Z"},"links":{"cited_paper":"/paper/2411.09439","citing_paper":"/paper/2508.10494"},"observation_digest":"sha256:71c7359d4af96791296308c8bb8b6517e62af9e12345ec8951b11cd4cb22bb41","observation_id":"0fbc1ba3-14af-48e3-b4d2-2f4459be40ff","resolution":{"observed_at":"2026-08-05T20:30:17.344362Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19168","last_updated":"2024-10-24T21:20:10Z","snapshot_observed_at":"2026-07-06T19:39:23.839070Z","submitted_at":"2024-10-24T21:20:10Z","title":"MMAU: A Massive Multi-Task Audio Understanding and Reasoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.19168","snapshot_observed_at":"2026-08-05T20:30:17.007674Z","title":"Tjandra, A.; Wu, Y .-C.; Guo, B.; Hoffman, J.; Ellis, B.; Vyas, A.; Shi, B.; Chen, S.; Le, M.; Zacharov, N.; et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.10494","last_updated":"2025-08-14T09:52:51Z","snapshot_observed_at":"2026-08-05T20:30:08.263197Z","submitted_at":"2025-08-14T09:52:51Z","title":"A Unified Multi-Agent Framework for Universal Multimodal Understanding and Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T20:30:17.007674Z"},"links":{"cited_paper":"/paper/2410.19168","citing_paper":"/paper/2508.10494"},"observation_digest":"sha256:26ed5a4c39d4c1ac6e8011aecd49502d72e6f7cf1edb207296ee943c108cd61b","observation_id":"72db0020-c938-47b3-8e5c-10777b249b66","resolution":{"observed_at":"2026-08-05T20:30:17.007674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05139","last_updated":"2025-02-07T18:15:57Z","snapshot_observed_at":"2026-07-06T20:33:01.960703Z","submitted_at":"2025-02-07T18:15:57Z","title":"Meta Audiobox Aesthetics: Unified Automatic Quality Assessment for Speech, Music, and Sound","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05139","snapshot_observed_at":"2026-08-05T20:30:17.117740Z","title":"selected experts","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10494","last_updated":"2025-08-14T09:52:51Z","snapshot_observed_at":"2026-08-05T20:30:08.263197Z","submitted_at":"2025-08-14T09:52:51Z","title":"A Unified Multi-Agent Framework for Universal Multimodal Understanding and Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T20:30:17.117740Z"},"links":{"cited_paper":"/paper/2502.05139","citing_paper":"/paper/2508.10494"},"observation_digest":"sha256:15fa2c402e8fd9fedd147a61acb3eff3ea92a2bbd04df725a19d919c23d1415c","observation_id":"d3c9ac56-06be-444c-970c-4ca2a81a1eda","resolution":{"observed_at":"2026-08-05T20:30:17.117740Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:30:17.468015Z","title":"InForty-first international conference on machine learning","venue":null,"work_id":"ab0ba089-aa77-48ca-9586-5e9bf59cf74c","year":null},"citing_paper":{"arxiv_id":"2508.10494","last_updated":"2025-08-14T09:52:51Z","snapshot_observed_at":"2026-08-05T20:30:08.263197Z","submitted_at":"2025-08-14T09:52:51Z","title":"A Unified Multi-Agent Framework for Universal Multimodal Understanding and Generation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T20:30:16.607857Z"},"links":{"citing_paper":"/paper/2508.10494"},"observation_digest":"sha256:565a7e6b85e2c0e182a3b31b9855a0a6f70e8eb81754995a24a92e3e42caf52b","observation_id":"55bb365e-ca33-420a-8175-092ec6e6efcd","resolution":{"observed_at":"2026-08-05T20:30:17.522832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07598","last_updated":"2025-03-11T06:44:25Z","snapshot_observed_at":"2026-07-06T20:50:05.070886Z","submitted_at":"2025-03-10T17:57:04Z","title":"VACE: All-in-One Video Creation and Editing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07598","snapshot_observed_at":"2026-08-05T20:30:16.786195Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.10494","last_updated":"2025-08-14T09:52:51Z","snapshot_observed_at":"2026-08-05T20:30:08.263197Z","submitted_at":"2025-08-14T09:52:51Z","title":"A Unified Multi-Agent Framework for Universal Multimodal Understanding and Generation","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T20:30:16.786195Z"},"links":{"cited_paper":"/paper/2503.07598","citing_paper":"/paper/2508.10494"},"observation_digest":"sha256:13dacced0163b376aa9f900d36e1e4737a945df32955671493e577b04ca1848d","observation_id":"5d0539fa-3aea-4e9e-89d8-f65909f27ec4","resolution":{"observed_at":"2026-08-05T20:30:16.786195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.10494","last_updated":"2025-08-14T09:52:51Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-05T20:30:08.263197Z","submitted_at":"2025-08-14T09:52:51Z","title":"A Unified Multi-Agent Framework for Universal Multimodal Understanding and Generation"},"reference_resolution":{"displayed":6,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":3,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":6},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 6 of 6 outbound references and 2 inbound Pith citation observations for arXiv:2508.10494."}