{"as_of":"2026-08-14T17:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f2a7da8b27f0884121f64fcfc762624c230e08ff912171abd164d569d34aeedb","coverage":[{"denominator":82,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":82,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T12:45:30.225562Z","state":"measured"},{"denominator":82,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":82,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.10308/citation-record","integrity":"/paper/2607.10308/integrity","json":"/paper/2607.10308/citation-record.json","paper":"/paper/2607.10308"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"arXiv preprint arXiv:2509.23661 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:a83f367ac2abfba89d40954e31de285aab387d362f9b26b4c9d4b3a1c7949f42","observation_id":"fc3cd6d6-9ce0-4792-9109-9405d05098e4","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"In: Proceedings of the IEEE International Con- ference on Computer Vision","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:52e5e32337423023797bd7a90df52e18cf75d4e0cc85953751beeed7430b91ab","observation_id":"ceee1d0f-c21f-4dad-8b67-c46396fb5566","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"arXiv preprint arXiv:2308.12966 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:3acd3bc575e1b4c4138885d798a296cf461f26f10bb13f5f0ff7ffb13cbcd53f","observation_id":"cd0fa4e2-ad18-4261-96b7-f5cdc4f65c04","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"In: 2025 IEEE International Conference on Robotics and Automation (ICRA)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:913c3e4e2d26b07fa04c5dcbe2f8c248d9b59656dd17c363e1a9124310087ea2","observation_id":"843d5d54-0973-4a59-9a46-9e357b262288","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:0e07261afb1fc5360e2724a6a69b9dddb49e742f9b041091ee23be7071410835","observation_id":"098fb335-ff7f-439a-8cc0-241bad9d3002","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-12T11:24:34.752305Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20750","snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"arXiv preprint arXiv:2412.20750 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"cited_paper":"/paper/2412.20750","citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:e53f0120d25890ad6f8ec509d91a98ac46623c922d38ba99a14a26ec99c1da28","observation_id":"6f1b9142-81fb-415b-9c86-3ec3c2174556","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"arXiv preprint arXiv:2502.03333 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:428360cefaf9935f1b4b2b5ba5af71779e47ba571000d7be73c16ceb8015ceea","observation_id":"e511088e-50ca-45b6-8ae6-4614fd8c5284","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"arXiv preprint arXiv:2306.13394 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:64c5791f581d9d1b8aeb8fe44e0e12a9802aa8c7b12006dc8535073d56cfa390","observation_id":"30dc8832-dc0d-480f-b07f-a9f62819d784","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15296","last_updated":"2024-12-08T04:24:31Z","snapshot_observed_at":"2026-08-14T10:19:04.189589Z","submitted_at":"2024-11-22T18:59:54Z","title":"MME-Survey: A Comprehensive Survey on Evaluation of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15296","snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"arXiv preprint arXiv:2411.15296 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"cited_paper":"/paper/2411.15296","citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:c0eef0aef4e6718e168cf8df48155d3022ecae19439bc14eb34f2dd083822878","observation_id":"d3532870-03af-48ba-8a64-349c3088724e","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"IEEE Transactions on Pattern Analysis and Machine Intelligence (2025) 16 Shihao Yuan, Yuanze Li,et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:41eb6bb7b6172b2b779527ee9fd6ee48c525788edc69a4dda4a9458c9e8f6cfd","observation_id":"36d7c6a4-0766-491b-afa8-275323f4079e","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:b5e91cc7436253b55eea8456cd3fa22bb175aa5c01a8e38daa19f3b1e77bd193","observation_id":"272c4b79-8890-43ab-b801-54e2ebc9ba7a","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"In: 6th International Symposium on Advanced Optical Manufacturing and Testing Technologies: Large Mirrors and Telescopes","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:68ff02beb6c153511ec30f5cb10c1aa293ad3a707cfe8d0c465debd9d7aaec3a","observation_id":"faf48d9b-5420-441b-972d-d699209e1608","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"In: Findings of the Association for Computational Linguistics: EMNLP 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:78405ce88c4760a56a259d195d0af33908add25c83f524ee11881d1f75894a02","observation_id":"9936cd5a-5e00-4fee-be27-df7188da402c","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"IEEE Transactions on Pattern Analysis and Machine Intelligence35(12), 2891– 2903 (2013)","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:2ab4cd0e23d14f8a8fa0fbe26025663dff4e12449757a24199464acd554afcf2","observation_id":"a7e5b587-2aa0-40ec-9572-ce6dc137fd84","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:cda1c961d2e5ffe7ab96b7197f2a52ac9c25ef1a975937d0d972feaf8aba31fa","observation_id":"54145ebc-a70e-45d0-b32b-7a3c51144474","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-11T14:42:37.584016Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"arXiv preprint arXiv:2511.21631 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:68e9ea1d2333c1ddb917a1a6db2db503f0ed5545eb65578ea45afd4d6ccc52f7","observation_id":"babe21aa-406f-4834-bd07-68b27bdf56eb","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:e0500db1d79d5e4a5b1242b2d021179301e5fe80b76f41c5a363212d3dd87854","observation_id":"258afc8c-4528-4180-868c-bea200dc584f","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"Advances in neural information processing systems36(2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:90e340bbd5e6e35c7ab12bc6979d0d460520387807411d7d63a66139a343b7a9","observation_id":"410893ee-a35a-4b9c-8c9e-289b7b3e59aa","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:a2a3858d5a91d41c7874121303c8cdac85a44aafd9e785b25ae4d6b62191e5af","observation_id":"9510a9bc-50e4-420f-9e27-de50b8a34f00","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"IEEE Transactions on Geoscience and Remote Sensing 58(12), 8555–8566 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:bb8a75ad69c46a389a6357e71b474c3a3f1d107093d306cd923f53ee5b38b75e","observation_id":"ef3c8c68-ac83-4960-94a5-e49d5f4919e9","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"In: Interna- tional Conference on Learning Representations (2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:21de187b54d90c57e8c7dd56be89c18994448c19a0a1491340c537ac5d9d0dc1","observation_id":"a5477224-087f-4e2d-804a-e9e079b8f558","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"In: The 36th Conference on Neural Information Pro- cessing Systems (NeurIPS) (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:6f4c00a39fa643097cbc25c8e142fe00e1f27df378fc459c4a9e152aced1e9b6","observation_id":"050816d6-ca58-4758-a415-e5974835bfcf","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"In: Proceedings of the IEEE/CVF Winter Conference on Applica- tions of Computer Vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:0e1eb9c4d847df216971cac0e9ffc7d59c214e1fe4d4a15bb028a014858ba67b","observation_id":"fa44945b-45bb-4539-bbf9-1f7c96267b92","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"College of the Redwoods 45(1), 1049–1060 (1998)","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:cd4dfb4ae33958e2a3ba41dd7dc4b347122cd15816e9db480cd4d3e75541f0af","observation_id":"5c27d858-80b1-45c3-a6fd-ce571d0adaa4","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19654","last_updated":"2025-03-30T15:08:23Z","snapshot_observed_at":"2026-08-07T16:38:22.084819Z","submitted_at":"2025-03-25T13:43:47Z","title":"RGB-Th-Bench: A Dense benchmark for Visual-Thermal Understanding of Vision Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19654","snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"arXiv preprint arXiv:2503.19654 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"cited_paper":"/paper/2503.19654","citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:0bda13b8e3f792029a87fa109cbd90513f44478fad72f0845e1d49c3f82ce5c4","observation_id":"4925424b-3398-4268-b47f-1d722f439f5e","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03277","last_updated":"2023-04-06T17:58:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-06T17:58:09Z","title":"Instruction Tuning with GPT-4","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03277","snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"arXiv preprint arXiv:2304.03277 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"cited_paper":"/paper/2304.03277","citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:7dfc32e825912ccc6845922ca32bd53d549bc2513fc602bc936a6c72fea08288","observation_id":"ae9e7076-267a-478a-8193-1fae7eab791d","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"In: Acquisition and Analysis of Pictorial Data","venue":null,"work_id":null,"year":1975},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:10b1c0a0ccc6c35082e50e2bd4e1b74a997c1e1018ac81f12330d02a0cbb3a32","observation_id":"05e37f0c-0573-4ae4-9411-54c74442dc1f","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"In: Spline Functions and Approximation Theory: Proceedings of the Symposium held at the University of Alberta, Edmon- ton May 29 to June 1, 1972","venue":null,"work_id":null,"year":1972},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:44720d653bc6dce721aec524527878c295e903188e6de29b2ee6d44674c63df7","observation_id":"fbe0518a-6581-455b-b207-dd702cba7ccd","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"In: Proceedings of the 1st Workshop on Taming Large Language Models: Controllability in the era of Interactive Assistants! pp","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:583820a95285a2a6757fb6a03b0ca240ae5e835c88c061c4227008313088d40f","observation_id":"862f6aae-9a86-4f81-871f-56eefae2caeb","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:be7c1d79150e0966acd4ab5f9ec779eeefffd4c96ed1621251026d75610a7f6a","observation_id":"fe206578-958e-427a-9200-0c804cf33a08","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"In: Proceedings of the 23rd Work- shop on Biomedical Natural Language Processing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:68de066a513d7601d1d99237c7758374b592886153e1a5cf8b31d1d1d3c59104","observation_id":"bb0e5f1c-4c23-46af-874d-46d32cd5fa08","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-08-13T04:48:56.237545Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"arXiv preprint arXiv:2508.18265 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:806208c117edafddd8f5f5fe1892a29141a45d98a15bf91975f36f7dea62e3b7","observation_id":"ca0e9194-7ddb-4ed6-b79b-72bdac0eaf42","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"Pattern Recognition137, 109347 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:92b88743ae5abe41a992dda435f7678392bd21d5b44c4046a9637a73b4aa22a3","observation_id":"0c17e454-0e74-433f-8081-823f826ecf10","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-08T03:31:37.699253Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"arXiv preprint arXiv:2308.02490 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:6c65969ae7430174ec29ec5e64cef2a315bd2b6b49eee957f6ec9e77d82b3321","observation_id":"1b952572-9fc5-40e8-b325-8f80971c842b","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11852","last_updated":"2025-05-17T05:31:17Z","snapshot_observed_at":"2026-08-09T21:06:19.528858Z","submitted_at":"2025-05-17T05:31:17Z","title":"MedSG-Bench: A Benchmark for Medical Image Sequences Grounding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.11852","snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"arXiv preprint arXiv:2505.11852 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"cited_paper":"/paper/2505.11852","citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:e4915db1eece156387ad54b138cf51e57b2f67787a3ac5f290dbdddc58372279","observation_id":"3d35ccc2-f62b-4d66-9848-5697affe6950","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:d1870ecefb2d37209e83974cf7492b7dadb8b7678941cb408ff5c48cf25f7b4a","observation_id":"368aa7e1-e7e3-4227-91de-45b8a048d9da","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"IEEE Transactions on Geoscience and Remote Sensing62, 1–20 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:d48847d70b249ddff39ea368ae937d9c4980995ca5874b4ceca436695db56590","observation_id":"868d7aa1-9e19-46af-adfc-9b02e82a7a5c","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"In: Infrared Materials, Devices, and Applications","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:9f8f0fd667b84b048368c275a35194d4923ad2a46be667df9575f5988235ca37","observation_id":"bacec7e0-0a8d-40cf-b243-89f089340548","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"IEEE Transac- tions on Visualization and Computer Graphics22(8), 2051–2069 (2015)","venue":null,"work_id":null,"year":2051},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:e0834fa59d9efdbbb2e3616f3200782028a2136142dc9b71f1f6842aee582069","observation_id":"1e2a96d6-a3be-4c12-8b61-706a2ff22899","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"Perception Mean","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:7941e7893b33a1b569db3e9fad7d777cbf1f2c9f21cb37c522188c002946ce77","observation_id":"67189ee0-2eba-4f3c-a53f-8f20fe52a087","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"Make sure you understand the scene fully","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:21fb6d0a085161996745042d010613c5c1b0e47e6bad4f67ef7a59aadb96274d","observation_id":"9e86b22f-2aed-48b0-a62c-46b1caa55a5f","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"You can check reference description if you are not sure about the scene, but DO NOT copy it","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:29dd49b9ddccc33241ec63583a6c4850f3987862ccdb3dd4493debe58f425344","observation_id":"a9971f5f-a842-495e-a7c8-947431e9da74","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:d44de80eb67abafd57ae494f571536c69c5d4e78f66cc7cf84e6a1b9cb4171f8","observation_id":"7a5d05f7-86e0-4da4-9586-1d2ad7680c23","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:a13050aa646bbf67c8142150ec0b4827f4792f84369c22083cd3b08209d08a8a","observation_id":"203f6acc-dd80-4b67-8add-79bd8d198fe3","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"[REQUIREMENT]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:7976a15bf650f47f93c5ddd2b0731d1ba3b9c4bab56db4074fd639d9064b178e","observation_id":"754649ac-2fa3-4fdc-8f81-2508cc802e17","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:c09f3ed824b570985b37aaedcdef03edac0199711de31243f11a34758e176d5c","observation_id":"e806e661-c901-4e73-8031-6390faa86515","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"Also DO NOT describe the features that not showing in both images","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:5a3b3d25b7e3226d7b4c3e8619b42b98ab27fbd2aa9d547b1670f32207f120e8","observation_id":"7828c9b9-ee5f-4286-9f2e-53f2b91a3e7b","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"<caption>","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:df9f3dedf3642e6ac64ec887257b88fb1fe3bea7f0c27a14de73f07ca8de81d5","observation_id":"a35c4048-0115-46e6-9ab7-ba34bf5e6825","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:f0e0fb0a2cf1193b8fcc5ad30bf94218f1517267692c8980e1726abf944021cd","observation_id":"461b51fc-fbd8-4f3f-ac86-0ff224db7f51","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"Such features may includes colors, shapes, photographic effects or other features that not involved in the scene description","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:22ec136b1cdf91fbb393e4053fb73e38ed05ecc2f7c5263ca07d4703c4cc11c0","observation_id":"c25d6afc-3bdc-4656-966d-67a2d3e349e0","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:2d487cc18d63e773306f0eff767d1033b09805f2f754c815ecb5f0b9154429c4","observation_id":"eda93e7d-4f39-4196-a1f1-0d805b923fd5","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"Please note the subject only can see the image","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:8125cfedc32083c2c1d9dc8b3b3f0a60aba789909ea1b1006a4960a163f4b059","observation_id":"58c119dc-6466-4229-8a7c-3b29b71aac86","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"[REQUIREMENT]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:3fb5150c494670eeca9ba039cb15ed4332b0ffcc8dfc3c27c512860e8e655dd0","observation_id":"1775cc6d-9c0f-4fe0-838a-51780bbd7853","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:f6e90657b729825c42c2847c0c7992f3d0f948c9cc049f062caf2a0d024a0047","observation_id":"191a3f88-0b3b-4c2b-b16a-ab72ea566ee5","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"Also DO NOT describe the features that already included in the scene description","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:c8d816599de555395099f82a42c4021efc5ecc6f97e749047f1ec0342f0b5f89","observation_id":"7c856f86-3fd5-475f-bc91-5d0147bea6ea","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"Scene description","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:7071de9dc5326de65cd8b9f3c61bfa62f96ec3c7ef75238589bd16f253fea909","observation_id":"62c09e8d-d990-42e7-bdeb-8725decf8dfe","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:b37113a1b1dd2af2be8c12099220162232f9d95cb8a9ff1e6d8da153f63ccdd9","observation_id":"8bf38a6e-bcf8-4b9e-a714-ca8c9c031378","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"Your question should be clear and meaningful, requiring the subject having a strong ability that connecting common knowledge to the scene to solve the question","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:dcdb1d6decb7ddb63a024dd003b196ee2ac5b9537c6819ed5f9c8e1fe79545c2","observation_id":"74406680-b243-4c7b-88c8-9958b8830b79","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"The answer should be clear and distinct","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:7fb79a2d1c06d8f3e277553ad8c3b91af780e5c34870f3b4c9bff945461b3c66","observation_id":"570fa3ac-ad52-4229-baba-9ce2282061a4","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"Adjust the number of incorrect answers according to your question (i.e","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:e2a3f7b232659850361aa0ff2cd1a6f9040e6559a07676cfed14493ab8a6ee76","observation_id":"f78a3fe5-52e5-4866-8d19-71f401398b85","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:3dd73c2e96de8519d97d7924c5f48c622dabd99514b4f7a1de683c5e64aa1dd8","observation_id":"6c0b5860-a7ec-463c-b7c9-6e53a5cde6f4","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"Supplementary Material 19","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:cc0f875ff4b7d1d4bc3f3c7d0420ddc4f02c3dd9feb3b955e61b02ee51cd186a","observation_id":"f80b735d-bba4-485a-8ee0-4b9519fee7cd","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"You need to generated all kinds of questions related to the question type and the ability behind the question type","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:d07b024f0c5b9acf0e16b679d8959ada7eef6a9c5b17c14edd47762ff303496d","observation_id":"43e71525-c8e7-44d5-b556-48f015bd05f4","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"Avoid generating question and answers with a lot of guessing and assuming","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:72c4cf385fa7dc8c141dfaed8d304439a99726d9313c022a72ad487c1a05d630","observation_id":"8ca4f32b-e9bb-4521-9164-033c62f1e96f","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"strategy","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:95beac7132ca0273fec25193ecf6a360caa6d779c037aef8089b505044cc1f28","observation_id":"591e9f40-8f1b-49fb-83f6-8c7ec20c9732","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:cfe20d1b99e016e10585e7c7e3b58d485ef893723f42ce4c6f43ab95c6aa3f78","observation_id":"5e483ee5-1db9-4e1a-93f6-87af8a7ae264","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:c18e236e99444b8ba9011b10224dbdab5c19fa88f348da185370be19e1a6a17b","observation_id":"6927f8ff-3e1e-432d-9fec-aa9373e017ba","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:bfc2b8eed422df7dfb7b1a9d9dacf798e74b3b6d3b29f1edfe6e5b62785965a6","observation_id":"ecb74f33-1979-4881-b83a-277ce3cd7aa7","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"You can assume the subject only can see the image and modality description","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:b31f82b05907c97b2d9f05fdd4e904377cb5811f3b2dd4e28bd8bd76e9f91d77","observation_id":"6d000499-fd03-4760-a8f4-f27a025c0230","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"However you can make up some extra knowledge in the modality description, it will be provided to subject","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:3e9a53067eda03787ceb24d9b6fe401f291450d296adc34be82202b4f00d87d6","observation_id":"ef1b10c2-e757-4640-bf51-cab01ed1efb0","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"<photographic_caption>: Photographic Description generated before","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:fe52e629fb3b8bbd6b11d5e7d86a7d5e184c881528b02cf3a84de1eb95d28b43","observation_id":"2676cc97-3b38-44c9-be21-b290ea18bc0b","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:f44cf795b39698c8f03a54698449f2dd6540f1bcaf113b39fc8161fe02c0bd8d","observation_id":"f66077f1-1441-4ace-aeca-700dfde55502","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:13d6dacc10dc80e176e7018e57ca09880389a9201fd4824c7f6c8fa914771fd4","observation_id":"75784c62-eacb-41cd-bb33-da82226b7781","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:41847187651987aaff7986bb9b1f4530715c647965ea7b7954ab6843979ad91e","observation_id":"141991e3-ba34-484d-8c1e-401e31fd230d","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"Your question should be clear and meaningful, requiring the subject having a strong ability that connecting common knowledge to the modality description to solve the question","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:30a99420092a295bc3a0bc383ee2056f5b83430c4089503ecfb00e698589ab1b","observation_id":"31744878-4a2e-4efb-a137-9ec2aa577674","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"The answer should be clear and distinct","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:671fd06a6f0103a7835d0084f7ff0f89c24af56cd03edb55c286fe490b718b56","observation_id":"e844caf8-76e9-430d-a102-0b31fc63ccae","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"Adjust the number of incorrect answers according to your question (i.e","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:33559fe32546baa627dcf9d474e19df571ee9037859e96035d0d1d8044a01688","observation_id":"99dd8491-aed4-44d1-b66e-13af45afdd06","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:b018dc66c9ddba1fb23015fe8585d9570d3ffcb6a336eae8da0be5987ce7574b","observation_id":"3ea8c76e-24b1-4f60-99ba-e25075a9d965","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:55f7a3ab4b83c8ec5c132a34dfcb937afd76b4c8528075c956c19fcdf1f145e0","observation_id":"cea9ec42-19a3-477e-99f7-930ee0c5859e","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"You need to generated all kinds of questions related to the question type and the ability behind the question type","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:a3557cc796075ac0dea3aad4e949e172d2c685e6eaf9d85a259c31dcfa0af92b","observation_id":"3262dc7a-229d-43e6-a665-f33406c6144e","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"Avoid generating question and answers with a lot of guessing and assuming","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:48c77a81ff2324b83fecf2461e93db598c872070b88fc9157b5ce3a2bd12f1cc","observation_id":"4d7a3cab-d979-4a51-a99d-05a1447e7115","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:45:30.225562Z","title":"strategy","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-07-14T12:45:30.225562Z"},"links":{"citing_paper":"/paper/2607.10308"},"observation_digest":"sha256:b9814a6bd9c0de370188b181e5688833f6032b173296657e204814cb222c37cb","observation_id":"95c24cdf-569d-4463-b928-21a60967a7f3","resolution":{"observed_at":"2026-07-14T12:45:30.225562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.10308","last_updated":"2026-07-11T13:28:16Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T08:09:32.911549Z","submitted_at":"2026-07-11T13:28:16Z","title":"Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis"},"reference_resolution":{"displayed":82,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":82,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":82},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 82 of 82 outbound references and 0 inbound Pith citation observations for arXiv:2607.10308."}