{"as_of":"2026-08-07T19:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5acc9c7630cf2e21767f04f657c1db9612cfa520fa898b59e4b0b0f35465223d","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T12:31:26.112925Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.21741/citation-record","integrity":"/paper/2507.21741/integrity","json":"/paper/2507.21741/citation-record.json","paper":"/paper/2507.21741"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:31:26.446992Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":"fc98369d-1c39-4283-b35a-dfd64f5386d6","year":2022},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-06T12:31:24.449021Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.013359Z"},"links":{"citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:dbc907a7b4d54f4647eb2f3ba68474ee81164f3caa7802823d22c777929ac517","observation_id":"9b290fad-7789-49b4-81c4-471ea9f4f717","resolution":{"observed_at":"2026-08-06T12:31:26.450246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:31:26.411157Z","title":"Uniter: Universal image-text representa- tion learning","venue":null,"work_id":"aa5fa57b-8b7c-492d-a436-6d393f74f43c","year":2020},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-06T12:31:24.449021Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.029256Z"},"links":{"citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:687b32129c12b44132e99f9f4d1d1749d32e60bafa4ec868f82c0adc82c38786","observation_id":"d6158cf1-a03d-4fa7-82d0-0b2f80fb5002","resolution":{"observed_at":"2026-08-06T12:31:26.414687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.14517","last_updated":"2022-01-11T03:50:31Z","snapshot_observed_at":"2026-07-06T11:14:04.454155Z","submitted_at":"2021-05-30T12:34:17Z","title":"GeoQA: A Geometric Question Answering Benchmark Towards Multimodal Numerical Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.14517","snapshot_observed_at":"2026-08-06T12:31:26.032238Z","title":"Geoqa: A geometric question answering benchmark to- wards multimodal numerical reasoning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-06T12:31:24.449021Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.032238Z"},"links":{"cited_paper":"/paper/2105.14517","citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:5bb649973c019333cee0de8ad8ae06eadd367a69d43ecaca649159ac8aaecaab","observation_id":"19b30b09-1918-4e97-9c92-8b68e719fc18","resolution":{"observed_at":"2026-08-06T12:31:26.032238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:31:26.038126Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-06T12:31:24.449021Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.038126Z"},"links":{"citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:3aa1fba25f963cc7ec6ffcd98ee12eec3476e0262bf3798f326efa3d5a92a804","observation_id":"f5cbb349-b375-4e07-979b-b13e43915fe4","resolution":{"observed_at":"2026-08-06T12:31:26.038126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:31:26.397083Z","title":"Instructblip: Towards general-purpose vision-language models with in- struction tuning,","venue":null,"work_id":"b81e9008-7b09-415f-bbfb-fc650da5abdb","year":2023},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-06T12:31:24.449021Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.040867Z"},"links":{"citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:a3d518c995e7545089a4bb114a8f9b4ace131fa75f7b9d87ba2173ffa31e14c0","observation_id":"c1c8e38f-9a7a-46f5-88c9-4a4c482968e3","resolution":{"observed_at":"2026-08-06T12:31:26.399980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11402","last_updated":"2024-10-22T23:13:34Z","snapshot_observed_at":"2026-07-06T19:17:02.745056Z","submitted_at":"2024-09-17T17:59:06Z","title":"NVLM: Open Frontier-Class Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11402","snapshot_observed_at":"2026-08-06T12:31:26.043505Z","title":"Nvlm: Open frontier-class multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-06T12:31:24.449021Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.043505Z"},"links":{"cited_paper":"/paper/2409.11402","citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:5a1f3c59a1faf889553f5db120f75f3635a511fd043259ba5b3f2decdbb9a912","observation_id":"20f951cd-4963-4261-a512-14d0829a679b","resolution":{"observed_at":"2026-08-06T12:31:26.043505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:31:26.388493Z","title":"Mme: A comprehensive evaluation benchmark for multi- modal large language models,","venue":null,"work_id":"f53c3d74-cdd3-4d15-9bf2-5d2e7a97413c","year":2024},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-06T12:31:24.449021Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.046621Z"},"links":{"citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:35a4533db67ec1ef60253b62f5fc2b5dcb6ef40fce8743f361fe7bcdceb8b674","observation_id":"68acd8d9-cf1d-4eb4-b295-f68536314c2a","resolution":{"observed_at":"2026-08-06T12:31:26.391906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00352","last_updated":"2024-11-01T14:36:52Z","snapshot_observed_at":"2026-07-06T16:01:07.532053Z","submitted_at":"2023-08-01T07:49:10Z","title":"MetaGPT: Meta Programming for A Multi-Agent Collaborative Framework","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00352","snapshot_observed_at":"2026-08-06T12:31:26.049030Z","title":"Metagpt: Meta programming for multi-agent col- laborative framework","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-06T12:31:24.449021Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.049030Z"},"links":{"cited_paper":"/paper/2308.00352","citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:eaedfce5667fbb20512ea48b540cf522d69ce0fd8eacb0b1fb89c84b74af6134","observation_id":"a444735a-947f-4d70-b860-00624c37a323","resolution":{"observed_at":"2026-08-06T12:31:26.049030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-06T12:31:26.051888Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-06T12:31:24.449021Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.051888Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:59445023d0275e7efc47fd26f6f737fe2dc160165f7780262f3db020399c4551","observation_id":"8b4015ee-c20f-46d4-ab7a-afa9f0be0a91","resolution":{"observed_at":"2026-08-06T12:31:26.051888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:31:26.380266Z","title":"Dvqa: Understanding data visu- alizations via question answering","venue":null,"work_id":"5e9b1519-8e61-434d-af52-8584efe22f6a","year":2018},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-06T12:31:24.449021Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.054721Z"},"links":{"citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:83cdd6b26559404c4f3f566578a078640df96ef6cbaa82eac6d247637a53f029","observation_id":"b2704b91-d00a-4a38-96a5-37ccec7f7ff1","resolution":{"observed_at":"2026-08-06T12:31:26.383131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04632","last_updated":"2021-08-18T21:55:27Z","snapshot_observed_at":"2026-08-01T20:01:49.108442Z","submitted_at":"2021-06-08T18:34:21Z","title":"VALUE: A Multi-Task Benchmark for Video-and-Language Understanding Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.04632","snapshot_observed_at":"2026-08-06T12:31:26.059865Z","title":"Value: A multi-task benchmark for video-and-language understand- ing evaluation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-06T12:31:24.449021Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.059865Z"},"links":{"cited_paper":"/paper/2106.04632","citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:5e294e24427da805c5e0f4c7a36c8cbe8a409e110958f0a7ef476f1d284a75a0","observation_id":"7ba075e9-3b99-40b1-8010-230270d6c175","resolution":{"observed_at":"2026-08-06T12:31:26.059865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:31:26.363319Z","title":"Blip: Bootstrapping language-image pre- training for unified vision-language understanding and generation","venue":null,"work_id":"2f552ed5-0867-4886-87cd-c8e20f4619af","year":2022},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-06T12:31:24.449021Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.062802Z"},"links":{"citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:81c0876ce98d76ae1556536c30903ec1d9aa595a5e78f2f0017365cc87136cc4","observation_id":"1c167ae1-5c2a-43d5-825b-1f490f60785a","resolution":{"observed_at":"2026-08-06T12:31:26.366203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-06T12:31:26.065302Z","title":"Seed-bench: Benchmarking multimodal llms with generative compre- hension","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-06T12:31:24.449021Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.065302Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:f8565f5705c5f5eb71792ecc8da4140d2f54d3a1997fe1d3155e09f4f6a8e0cf","observation_id":"1ba7ca47-eae9-479e-a316-ec72aeb044c8","resolution":{"observed_at":"2026-08-06T12:31:26.065302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-06T12:31:26.068491Z","title":"Evaluating ob- ject hallucination in large vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-06T12:31:24.449021Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.068491Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:dbd3c382811f630cf24c5448a52e4f766ad09ad5ac03a5327f8156cc44515e6a","observation_id":"76aa291a-bc34-46bf-a010-0976aa03728c","resolution":{"observed_at":"2026-08-06T12:31:26.068491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-06T12:31:26.071331Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-06T12:31:24.449021Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.071331Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:ea424fbc3cbb57c3b711fc330d949532139744c4e42c78c78c626c6acac8c040","observation_id":"ede1ea7f-a126-498b-8996-33326c899b63","resolution":{"observed_at":"2026-08-06T12:31:26.071331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02392","last_updated":"2024-08-28T08:49:57Z","snapshot_observed_at":"2026-07-06T18:40:22.951929Z","submitted_at":"2024-07-02T16:10:55Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02392","snapshot_observed_at":"2026-08-06T12:31:26.074772Z","title":"Tokenpacker: Efficient visual projector for multi- modal llm","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-06T12:31:24.449021Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.074772Z"},"links":{"cited_paper":"/paper/2407.02392","citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:d511fbd0b4d920dfdac6b08ff9c63beb937fc99773e0bf682ec950a294de22f8","observation_id":"b04a3492-ffc0-4989-92c4-271b99e7bb8a","resolution":{"observed_at":"2026-08-06T12:31:26.074772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:31:26.353617Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":"97f325f9-736a-4e13-bcba-ef6600a4992d","year":2021},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-06T12:31:24.449021Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.080676Z"},"links":{"citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:e15dca42cc86fed7d5225d4165534720ac0e8a31a906ea2715b2f871e3f059d1","observation_id":"1dd6caea-b43d-4aef-9ce0-1164a14fa382","resolution":{"observed_at":"2026-08-06T12:31:26.356567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:31:26.345166Z","title":"Hello gpt-4o","venue":null,"work_id":"f81169c7-fea4-4e3a-9dd5-9179aad8f2fa","year":2024},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-06T12:31:24.449021Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.083312Z"},"links":{"citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:837eb80efe3b6144b0db6f083765a6bcabcc418cd1734fb2387f0ea7907111bf","observation_id":"0249a39e-5b92-43f2-8dc0-9867770aaaa5","resolution":{"observed_at":"2026-08-06T12:31:26.347968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:31:26.335231Z","title":"[Radford et al., 2021a] Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, et al","venue":null,"work_id":"9ec348d4-4c74-4b26-a90d-12cbb40b3326","year":2024},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-06T12:31:24.449021Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.085780Z"},"links":{"citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:ca46ab8c06591510590966c5115b7148a520473889ab4644be2f2dcef5314739","observation_id":"d1136b45-0eb7-4423-b9cf-45ab13f36844","resolution":{"observed_at":"2026-08-06T12:31:26.338397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:31:26.326246Z","title":"Hug- ginggpt: Solving ai tasks with chatgpt and its friends in hugging face","venue":null,"work_id":"a9796681-f389-4f6e-978f-e893f547ce58","year":2024},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-06T12:31:24.449021Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.088243Z"},"links":{"citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:f53d0f7ded5729ec35f6186ef761b1c5617487da4baca2b0fccbd8d4f28ff3a8","observation_id":"36f9e785-7302-4ec7-a97b-9e954a01647e","resolution":{"observed_at":"2026-08-06T12:31:26.329223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T12:31:26.091282Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-06T12:31:24.449021Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.091282Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:fc6c4029df02177873f2cca4c4336a8f9f91f951b8c7fd6459684e437ddfb0b2","observation_id":"3fab29e7-4af2-4062-99ec-f3d863f35600","resolution":{"observed_at":"2026-08-06T12:31:26.091282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:31:26.317418Z","title":"Attention is all you need","venue":null,"work_id":"07eab816-1408-471d-b6ce-89611b59c4ff","year":2017},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-06T12:31:24.449021Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.094018Z"},"links":{"citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:1f1044dbe6f7cb12ff6c5a6cda30558edc2db9a4ac4a96ffbc48ec4cf60c4421","observation_id":"3a37acac-9ece-45ac-b4fd-db999bb3fd8b","resolution":{"observed_at":"2026-08-06T12:31:26.320574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:31:26.308901Z","title":"Introduction to convolutional neural networks","venue":null,"work_id":"05c97e05-3d4d-4138-99a4-8af5095a2b32","year":2017},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-06T12:31:24.449021Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.099172Z"},"links":{"citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:03fd171204e767722096742815db6d11fbb8a03633d4d81fea2f9727e8b90c02","observation_id":"af5e91bc-0260-4800-a078-d8b76e320927","resolution":{"observed_at":"2026-08-06T12:31:26.311833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20985","last_updated":"2024-05-31T16:31:38Z","snapshot_observed_at":"2026-08-04T13:01:39.904947Z","submitted_at":"2024-05-31T16:31:38Z","title":"DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20985","snapshot_observed_at":"2026-08-06T12:31:26.101813Z","title":"Deco: De- coupling token compression from semantic abstraction in multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-06T12:31:24.449021Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.101813Z"},"links":{"cited_paper":"/paper/2405.20985","citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:3e922a57c577822598e66d460f790139fa6fd3ff3c3d2a89a1a7b30f5a8262f9","observation_id":"755eb3ef-c83d-46cc-b854-83e06da943dc","resolution":{"observed_at":"2026-08-06T12:31:26.101813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-07-06T13:06:27.153765Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01917","snapshot_observed_at":"2026-08-06T12:31:26.104757Z","title":"Coca: Contrastive captioners are image-text foundation models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-06T12:31:24.449021Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.104757Z"},"links":{"cited_paper":"/paper/2205.01917","citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:e8b1f8d225212fc1d6c363b597a8523ed8945c5b9598637094a4772e1fa17529","observation_id":"601549d3-cebe-4ac9-940d-289cc83354ca","resolution":{"observed_at":"2026-08-06T12:31:26.104757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-08-06T12:31:26.107503Z","title":"Flo- rence: A new foundation model for computer vision.arXiv preprint arXiv:2111.11432,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-06T12:31:24.449021Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.107503Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:d01bbda2f66f05ffd9296e75720431f2fdf261c8d3f764a98a4d67dee5029dd0","observation_id":"45b1656b-993a-4acb-a062-d5813e053d15","resolution":{"observed_at":"2026-08-06T12:31:26.107503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:31:26.300220Z","title":"Easygen: Easing multimodal generation with bidiffuser and llms","venue":null,"work_id":"3d626748-b71f-48ee-b20f-c2ef7447940d","year":2024},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-06T12:31:24.449021Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.110181Z"},"links":{"citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:0c2aef2687948658e32a1b3b44ac1254a192799ff0a4b30dfb2530a67c93359d","observation_id":"41f0bfe4-120a-48ef-aa2e-b2bde586493c","resolution":{"observed_at":"2026-08-06T12:31:26.303148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:31:26.288702Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena.Advances in Neural Information Processing Systems , 36:46595– 46623, 2023","venue":null,"work_id":"fbc56544-374e-4628-9424-4429977d2e94","year":2023},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-06T12:31:24.449021Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.112925Z"},"links":{"citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:606da384b51e5ba2fd283ddd5b1a713d753238ab6295768d3d634cc15a5fd652","observation_id":"832fbd14-48b9-4ce9-a888-c694d51f440d","resolution":{"observed_at":"2026-08-06T12:31:26.293335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T12:31:26.096481Z","title":"Qwen2-vl: Enhanc- ing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-06T12:31:24.449021Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.096481Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:2b1570a1ccb6c08a7b488e747177b22ac51c9038523ec901115f15ccc8206a91","observation_id":"67244016-c8d3-4d9f-9475-48c2196fe6d2","resolution":{"observed_at":"2026-08-06T12:31:26.096481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:31:26.372151Z","title":"Ocr-free document understanding trans- former","venue":null,"work_id":"dd22663f-d85e-4809-8a7c-28c255ab277b","year":2022},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-06T12:31:24.449021Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.057257Z"},"links":{"citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:663e0ac14dee4ee0d0d7d52fed4c34adde0f9af6fb85231838774c9039713ea4","observation_id":"f39d8168-5047-4033-9f8d-a1275fdd40f3","resolution":{"observed_at":"2026-08-06T12:31:26.374882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:31:26.420658Z","title":"Honeybee: Locality-enhanced projector for multimodal llm","venue":null,"work_id":"0bf3a444-0c61-4ecd-ab58-57047fce57ae","year":2024},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-06T12:31:24.449021Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.026185Z"},"links":{"citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:c722f99b2e853b29ce63a103e41d238f31a110f63771eb571e2555d8c4b1f246","observation_id":"e640e00d-ee1a-49ad-9e67-2782314a0c7c","resolution":{"observed_at":"2026-08-06T12:31:26.423521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-08-06T12:31:26.035221Z","title":"Allava: Harnessing gpt4v-synthesized data for a lite vision-language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-06T12:31:24.449021Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.035221Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:edd0c32a307f3474e104e44db2127f73826cea20291e42837b05c6b3bfdcce50","observation_id":"bc5c1853-1c5a-4793-94e1-21bd4be5d566","resolution":{"observed_at":"2026-08-06T12:31:26.035221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:31:26.438286Z","title":"Claude 3.5 sonnet","venue":null,"work_id":"ce242a1f-1ca4-455a-876c-bfc9b53d9dc3","year":2024},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-06T12:31:24.449021Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.016801Z"},"links":{"citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:29c0f6bd514a08c65ed172084ba8d4a10c528b85a3e98d9d740d8c72d80d92bb","observation_id":"2a606dd0-01a3-457e-987e-de605d458991","resolution":{"observed_at":"2026-08-06T12:31:26.441144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:31:26.429083Z","title":"Language models are few-shot learners","venue":null,"work_id":"43571e60-3a19-4e94-afc4-23115545fd1e","year":2020},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-06T12:31:24.449021Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.023150Z"},"links":{"citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:dd9502b84467e2ef7b3e3a685aa16598b9865294463f12a1599dc5266465d49c","observation_id":"9781c94c-d3a5-4783-b2cd-f10bc6e367d7","resolution":{"observed_at":"2026-08-06T12:31:26.432442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T12:31:26.019701Z","title":"[Bai et al., 2023] Jinze Bai, Shuai Bai, Shusheng Yang, Shi- jie Wang, Sinan Tan, Peng Wang, Junyang Lin, Chang Zhou, and Jingren Zhou","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-06T12:31:24.449021Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.019701Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:140de23e88d4f2099f53907f772fd8b864277297ec5ce75b6dbd0948e3057360","observation_id":"fabbac7f-b0b7-49b4-a84c-845b2a2754cc","resolution":{"observed_at":"2026-08-06T12:31:26.019701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-06T12:31:26.077842Z","title":"Chartqa: A bench- mark for question answering about charts with visual and logical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-06T12:31:24.449021Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.077842Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:44b18b60409df3f201aaf4c208122bf4f4f48e14d03bdc5eab775d00eef33372","observation_id":"a858a163-883c-4807-a054-80b7481666a0","resolution":{"observed_at":"2026-08-06T12:31:26.077842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T12:31:24.449021Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":0,"verified_fuzzy":18},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 0 inbound Pith citation observations for arXiv:2507.21741."}