{"as_of":"2026-08-08T22:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7f45265aee86cf893f23ad00d4ffa0733e6ee2c2e30d7d55e6c529c17f8c3b52","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:36:40.971423Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T20:52:15.689430Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T20:52:15.794372Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"cited_work":{"arxiv_id":"2506.01872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.01872","snapshot_observed_at":"2026-08-05T20:52:15.794372Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","venue":"cs.CL","work_id":"3c6f3d45-67e2-4ac1-987b-3d08e95cd474","year":2025},"citing_paper":{"arxiv_id":"2508.09789","last_updated":"2025-08-13T13:19:31Z","snapshot_observed_at":"2026-08-07T19:48:56.301763Z","submitted_at":"2025-08-13T13:19:31Z","title":"Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:15.689430Z"},"links":{"cited_paper":"/paper/2506.01872","citing_paper":"/paper/2508.09789"},"observation_digest":"sha256:ff13be9ee9373d7a8bf3aba8d73b7e65ee92b9eb2a44cf616794d6c4cb4a87c5","observation_id":"90c7369b-9612-4c3c-97dc-37408295e3d3","resolution":{"observed_at":"2026-08-05T20:52:15.874065Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.01872/citation-record","integrity":"/paper/2506.01872/integrity","json":"/paper/2506.01872/citation-record.json","paper":"/paper/2506.01872"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:42.128965Z","title":"Cross-modal knowl- edge transfer without task-relevant source data","venue":null,"work_id":"5b8999b7-cff0-4200-8e9f-a2bdb447e384","year":null},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.691404Z"},"links":{"citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:a9951a485bd0239066971a6b4e07a97e96e4d4b3d06989f75c518f6311377a8e","observation_id":"e1af0789-5c74-4c5c-acbf-0d4047a2ebb1","resolution":{"observed_at":"2026-08-07T11:36:42.133525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:40.696541Z","title":"Flamingo: a visual language model for few-shot learning.Advances in neural information processing systems, 35:23716–23736,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.696541Z"},"links":{"citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:3e8b03561035e06fd1ffe74fa2d1f3893debfe21d34cac6b7dc29e9fb3f16538","observation_id":"fa820902-e015-4789-91ec-c07af08bbf27","resolution":{"observed_at":"2026-08-07T11:36:40.696541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:42.102737Z","title":"Vizwiz: nearly real-time answers to visual questions","venue":null,"work_id":"e2218d8d-f537-4db5-b109-99b4097b4b0c","year":2010},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.701204Z"},"links":{"citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:659c74389dd0a13ca8cdf77978381fcc700107e9001a199813736bd209f2b9fb","observation_id":"924c90d8-fbc5-45ac-bf64-7454f51d7bda","resolution":{"observed_at":"2026-08-07T11:36:42.107560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:40.706085Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.706085Z"},"links":{"citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:622d6a9fab604b714da90831debad3c38ad949ad334cbca3974aaaaa3ba04948","observation_id":"aeacbb12-cea9-4708-a291-26ea542e5719","resolution":{"observed_at":"2026-08-07T11:36:40.706085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-07T11:36:40.710912Z","title":"Qwen2-audio technical report.arXiv preprint arXiv:2407.10759, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.710912Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:49095feef7a234ab9a883e20d0bb7421fe6888be3dbcd15a889675df27b3e31c","observation_id":"6648d61c-8a36-4647-9aaf-b0ea378c37d4","resolution":{"observed_at":"2026-08-07T11:36:40.710912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.00698","last_updated":"2025-04-14T12:37:51Z","snapshot_observed_at":"2026-08-07T16:17:41.511601Z","submitted_at":"2025-04-01T12:08:07Z","title":"Command A: An Enterprise-Ready Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.00698","snapshot_observed_at":"2026-08-07T11:36:40.716425Z","title":"Command a: An enterprise-ready large language model.arXiv preprint arXiv:2504.00698, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.716425Z"},"links":{"cited_paper":"/paper/2504.00698","citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:d3fababd38ecb7b848bb1fbcc382d930c6d1b5ebb7a25944f314dd0c02504d3a","observation_id":"af52cf54-234d-440a-9e50-1d7fd06d532b","resolution":{"observed_at":"2026-08-07T11:36:40.716425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:40.721141Z","title":"Instructblip: Towards general- purpose vision-language models with instruction tuning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.721141Z"},"links":{"citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:92c3981d87bbbdf555c1954fd20d49f98c155c030e6fd9caedc52913b6588079","observation_id":"e8766ff0-7f14-4b54-abde-cc31a8a672ef","resolution":{"observed_at":"2026-08-07T11:36:40.721141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:42.066657Z","title":"Mind2web: To- wards a generalist agent for the web","venue":null,"work_id":"0ad4e832-fd79-4744-a368-cd931c611fa3","year":2023},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.725365Z"},"links":{"citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:47961c1faae737bc92707c82186680ce146bf4c7874678638aa009de374f726a","observation_id":"31ce1854-3024-4d43-8e11-b7fd81d333ee","resolution":{"observed_at":"2026-08-07T11:36:42.071183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:42.051891Z","title":"Un- locking continual learning abilities in language models","venue":null,"work_id":"83df25ad-3464-480a-a020-3576b2862eeb","year":2024},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.729763Z"},"links":{"citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:54102656278491f2cb04907b66fe99c8c53d2b6adbce6f841f77ee3d3dc5c35e","observation_id":"c8890aac-01f0-483d-b175-88e9b3e99226","resolution":{"observed_at":"2026-08-07T11:36:42.056469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-07T11:36:40.734902Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis.arXiv preprint arXiv:2405.21075, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.734902Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:18c8c56532091c1c6d8637f409da5993aba53dfde9c6a74793cb809c1aba4912","observation_id":"909dd815-b364-40a3-b1cf-9970e610f47e","resolution":{"observed_at":"2026-08-07T11:36:40.734902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:42.034991Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answer- ing","venue":null,"work_id":"58c8fe05-ab8f-474e-9d26-9a60030008d9","year":2017},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.740404Z"},"links":{"citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:14032320b32a395f2fea8f0a163d72b381025e78c161ea9f38cc99a291337336","observation_id":"b8501f14-26ff-461c-9413-8fa5d9508cc9","resolution":{"observed_at":"2026-08-07T11:36:42.040393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-07T11:36:40.744863Z","title":"Mea- suring massive multitask language understanding.arXiv preprint arXiv:2009.03300, 2020","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.744863Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:8967b03d6f68289b25875489c1647fefed44f471a45f0b85643e90180ff15b5d","observation_id":"d5ad4293-2ee8-4411-8a8d-81994764ba27","resolution":{"observed_at":"2026-08-07T11:36:40.744863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:42.018536Z","title":"Mea- suring massive multitask language understanding","venue":null,"work_id":"6b721f08-9c24-4892-bd07-60af80950c07","year":2020},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.749192Z"},"links":{"citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:910211be1136370d5fabaafe25e7a2e9ca9ee947c2881ecf13a36b69170d381b","observation_id":"efb757bd-589a-4e75-8573-c64633b16033","resolution":{"observed_at":"2026-08-07T11:36:42.023363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-07T11:36:40.753496Z","title":"Measuring mathematical problem solving with the math dataset.arXiv preprint arXiv:2103.03874, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.753496Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:d0d539f40b455798b987c42cc3af525ded5cb46f53aa74008162d19c67a48f45","observation_id":"0d82f4d7-46f9-42cd-b18e-f846bd28e613","resolution":{"observed_at":"2026-08-07T11:36:40.753496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:42.002450Z","title":"A survey on hal- lucination in large language models: Principles, taxonomy, challenges, and open questions.ACM Transactions on Infor- mation Systems, 43(2):1–55, 2025","venue":null,"work_id":"f6377f33-6543-48c5-9c51-38dbb88a1dc8","year":2025},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.757856Z"},"links":{"citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:79f28a87347f88066cb34dc9aa2f10d9e0aac740eb09c13033206652a187546e","observation_id":"eb87aa7f-186f-44a1-a28e-ba132f57a469","resolution":{"observed_at":"2026-08-07T11:36:42.007852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:41.985907Z","title":"Vi- sual hallucinations of multi-modal large language models","venue":null,"work_id":"22cb62bc-6016-4c63-8708-7a46cb170b80","year":2024},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.762022Z"},"links":{"citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:4f2149179a282df6a632abed6556a21ac58e51c3b8d6bc01019e166ffee4787a","observation_id":"34cd6813-9855-49a5-ae0d-7e37c5b4e887","resolution":{"observed_at":"2026-08-07T11:36:41.991139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T11:36:40.766171Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.766171Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:8af315409962555397f89fde118da2ccd6c9bd9056c1a7565b926b7c9cb8c85f","observation_id":"99c26643-4b09-4c85-a2bf-a7dfadcf576c","resolution":{"observed_at":"2026-08-07T11:36:40.766171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10582","last_updated":"2025-03-15T01:09:17Z","snapshot_observed_at":"2026-08-07T17:06:19.282495Z","submitted_at":"2025-03-13T17:32:48Z","title":"VisualWebInstruct: Scaling up Multimodal Instruction Data through Web Search","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10582","snapshot_observed_at":"2026-08-07T11:36:40.770638Z","title":"Visualwebinstruct: Scaling up mul- timodal instruction data through web search.arXiv preprint arXiv:2503.10582, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.770638Z"},"links":{"cited_paper":"/paper/2503.10582","citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:cd33dd1336c6fcc98157365b5323bd11adfc759cbc0da558f7e8cc2d3f9af8ac","observation_id":"154c5e3f-2190-42d6-a1d8-e62a225e2942","resolution":{"observed_at":"2026-08-07T11:36:40.770638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10739","last_updated":"2024-10-14T17:20:30Z","snapshot_observed_at":"2026-08-05T08:16:52.696697Z","submitted_at":"2024-10-14T17:20:30Z","title":"Balancing Continuous Pre-Training and Instruction Fine-Tuning: Optimizing Instruction-Following in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10739","snapshot_observed_at":"2026-08-07T11:36:40.774636Z","title":"Balancing continuous pre- training and instruction fine-tuning: Optimizing instruction- following in llms.arXiv preprint arXiv:2410.10739, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.774636Z"},"links":{"cited_paper":"/paper/2410.10739","citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:c708d4a446623a3208c5e9214f88fb42a04efe397255dd8ec0b3c8f0d885142c","observation_id":"b4e84bc1-4ae2-408f-86bf-f9723509e70b","resolution":{"observed_at":"2026-08-07T11:36:40.774636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:41.970439Z","title":"Designing incremental knowledge enrichment in generative pre-trained transformers","venue":null,"work_id":"bd8428db-a14d-4ad9-9a06-84e0313f6093","year":2024},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.779299Z"},"links":{"citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:1acb21f8d1159a602da350e1d157e2db37d65bbbac9796645f54d00de01c9358","observation_id":"8c832ede-f66d-438a-be7a-0ba35fce0495","resolution":{"observed_at":"2026-08-07T11:36:41.974922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:41.955317Z","title":"How does vision-language adaptation impact the safety of vision lan- guage models? InThe Thirteenth International Conference on Learning Representations, 2025","venue":null,"work_id":"9a714209-72e4-4b2a-8315-3aa951803c30","year":2025},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.783306Z"},"links":{"citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:0dbb92af822a2d81b644364d9f1821c6209df60f0bcbfcc3841b9e3bb4acfbc5","observation_id":"61ed4826-7bc6-4ced-b81a-cea6dd965cf5","resolution":{"observed_at":"2026-08-07T11:36:41.959745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T11:36:40.787378Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.787378Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:5c071fd73ae35c155041d0ef2ee945507af79a444da9f7d7ebb7a3a4830aff0e","observation_id":"b9d50346-ba26-4afc-8f63-fb884090c7d1","resolution":{"observed_at":"2026-08-07T11:36:40.787378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:40.791738Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.791738Z"},"links":{"citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:a892bcc40362866ea7db0326ef79b4e3fab0e0a5489709cd514bd9f85062f7c6","observation_id":"df20ca02-8c49-4974-b813-d82a3e6804ef","resolution":{"observed_at":"2026-08-07T11:36:40.791738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:41.928795Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"3ac16cc6-8344-43f8-81c5-203df868221e","year":2023},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.795832Z"},"links":{"citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:d499f97c99b98a4c2af3e3a42759b426dada8027d33c984565501183f2417306","observation_id":"e276370c-7e2e-4232-a449-b8da42c7e64b","resolution":{"observed_at":"2026-08-07T11:36:41.933320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:41.914067Z","title":"Should we really edit lan- guage models? on the evaluation of edited language mod- els.Advances in Neural Information Processing Systems, 37:30850–30885, 2025","venue":null,"work_id":"8aa4cc2c-8b06-407d-b9b4-6cdb10d95e93","year":2025},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.800064Z"},"links":{"citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:31ba0c10c8ce2b5fc114f4a850185eb9c87c252b84a7c2b88bfa516293e8d1e5","observation_id":"a7bbb40b-34c7-494c-98a9-db0f1ca5995b","resolution":{"observed_at":"2026-08-07T11:36:41.918615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:41.899093Z","title":"Vila: On pre-training for vi- sual language models","venue":null,"work_id":"f8f800ec-882b-4d18-8933-4eb0116d8f66","year":2024},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.804165Z"},"links":{"citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:742d4cd7bfd33db2add7556c3ba3075828bed765284270f3850b551ef8adcdde","observation_id":"c314cd9d-1f10-4f18-8d1e-6b3001fe8479","resolution":{"observed_at":"2026-08-07T11:36:41.903803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:41.882537Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":"143fc83c-e889-432b-8a23-bf70b47d1a9c","year":2023},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.808116Z"},"links":{"citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:64ea0f82b1d409fbd57c71c869ebde6418f334763126a2e356ccaef0f62d7ef3","observation_id":"9f2db8ec-ac21-4972-8839-1dc31e51d1e4","resolution":{"observed_at":"2026-08-07T11:36:41.887995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:41.867272Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"a5212c9c-fb11-45e7-8c2d-4c126d0c31a7","year":2024},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.812524Z"},"links":{"citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:65c1d97ea90dee97234f8f18d5252f138ea5eb41aa838b0313df737afc8bd436","observation_id":"7ff899c4-094e-437b-b8fc-1e7851f73c96","resolution":{"observed_at":"2026-08-07T11:36:41.872045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:41.851161Z","title":null,"venue":null,"work_id":"b4f50826-88e5-475f-b5ce-5e7f48be75a0","year":2023},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.816578Z"},"links":{"citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:5d41041139d9af435477620f783ac97481119795036866c7e3bcec997aaef6b2","observation_id":"3ce40f4e-2529-4c83-8e3b-45b3eecdbfaa","resolution":{"observed_at":"2026-08-07T11:36:41.856678Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-07-06T20:32:23.502480Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-08-07T11:36:40.820699Z","title":"Ola: Pushing the frontiers of omni-modal language model with progressive modality alignment.arXiv preprint arXiv:2502.04328, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.820699Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:f3a538495ab375d290480fdee6cb7a864b0e5331402599bdf1e2db648241c19d","observation_id":"79da6943-9a46-463a-9bf6-86ecd9b7955a","resolution":{"observed_at":"2026-08-07T11:36:40.820699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08916","last_updated":"2022-10-04T22:37:32Z","snapshot_observed_at":"2026-07-06T13:22:09.403770Z","submitted_at":"2022-06-17T17:53:47Z","title":"Unified-IO: A Unified Model for Vision, Language, and Multi-Modal Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08916","snapshot_observed_at":"2026-08-07T11:36:40.825255Z","title":"Unified-io: A unified model for vision, language, and multi-modal tasks.arXiv preprint arXiv:2206.08916, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.825255Z"},"links":{"cited_paper":"/paper/2206.08916","citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:f566d85aa2bef69b01fadd773dcc33f65fb68e529b03c2f5e2fdfd86b8079141","observation_id":"529958fe-3f15-4769-8f18-a9bcdd368ede","resolution":{"observed_at":"2026-08-07T11:36:40.825255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:41.831859Z","title":"Twin-merging: Dynamic integration of modular expertise in model merging.Advances in Neural Information Processing Systems, 37:78905–78935, 2025","venue":null,"work_id":"2553511a-fd46-4167-8196-c793160a3f5e","year":2025},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.829478Z"},"links":{"citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:c3a3da15e4906f0e5751a339b2f1fde6da0fd0e2ba5d70f5ead3c36bc6038cc8","observation_id":"0d3df754-8721-413e-8f20-7e98ae6626d4","resolution":{"observed_at":"2026-08-07T11:36:41.837458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08870","last_updated":"2025-03-03T17:58:12Z","snapshot_observed_at":"2026-07-06T17:01:40.744034Z","submitted_at":"2023-12-12T09:47:59Z","title":"Vista-LLaMA: Reducing Hallucination in Video Language Models via Equal Distance to Visual Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08870","snapshot_observed_at":"2026-08-07T11:36:40.834090Z","title":"Vista-llama: Reliable video narrator via equal distance to visual tokens.arXiv preprint arXiv:2312.08870,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.834090Z"},"links":{"cited_paper":"/paper/2312.08870","citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:871f7f0eca77c79adc6a51c7c16d09d342480f974f336856309a6502a5f20b3e","observation_id":"8e190d31-4252-4533-9a0a-c3cbdab840a8","resolution":{"observed_at":"2026-08-07T11:36:40.834090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14093","last_updated":"2026-05-01T01:50:44Z","snapshot_observed_at":"2026-08-04T06:47:25.827167Z","submitted_at":"2024-05-23T01:43:54Z","title":"A Survey on Vision-Language-Action Models for Embodied AI","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14093","snapshot_observed_at":"2026-08-07T11:36:40.838417Z","title":"A survey on vision-language-action models for embodied ai.arXiv preprint arXiv:2405.14093, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.838417Z"},"links":{"cited_paper":"/paper/2405.14093","citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:962e0d5c0e74d7d6178135ee86f714b9218451f3fbebc852d12237ee02ca1d4d","observation_id":"1affccfe-daea-4b92-83bc-467744de5989","resolution":{"observed_at":"2026-08-07T11:36:40.838417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:41.815147Z","title":"Harmbench: a standardized evalua- tion framework for automated red teaming and robust re- fusal","venue":null,"work_id":"6329f13b-1518-4c95-b918-c4a01a13719f","year":2024},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.842552Z"},"links":{"citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:ace7f2d3d645a0456df6e81402f97711c306950b9ff81c25622d4a57afcae46d","observation_id":"b1701925-ff57-43e7-8ef9-64715e37b98b","resolution":{"observed_at":"2026-08-07T11:36:41.819542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:41.799177Z","title":"Zero- shot tokenizer transfer","venue":null,"work_id":"53bf656e-1091-454d-8575-99edee3d469a","year":2024},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.846755Z"},"links":{"citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:655e44760b20d2b74392519d5468f1668b4ea938e4b91e8ea9275fc72462c3d7","observation_id":"98bbeb07-d298-415b-99f4-78cfd2334433","resolution":{"observed_at":"2026-08-07T11:36:41.803918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:41.782911Z","title":"Landmark atten- tion: Random-access infinite context length for transformers","venue":null,"work_id":"f2f8204e-2bf2-40e1-8455-d5aad0d98465","year":2023},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.851241Z"},"links":{"citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:a23504d6dda4207f601851cc796458ca34332d5b2fb14eec42d2183eee474594","observation_id":"095d3f88-a9be-47e0-8005-30935c5c5de0","resolution":{"observed_at":"2026-08-07T11:36:41.787802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:41.767184Z","title":"Gpt-4v(ision) system card, 2024","venue":null,"work_id":"fef299cc-6a22-4e3e-90ce-11105286f5b2","year":2024},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.855540Z"},"links":{"citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:acf62ef4c15ccd25c62ca96bfbf99b0e691942692b5699cb913a2b977f40880a","observation_id":"1a5410d5-78aa-44ee-8a7b-82b998298d13","resolution":{"observed_at":"2026-08-07T11:36:41.771594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:41.751304Z","title":"Recyclable tuning for continual pre-training","venue":null,"work_id":"44df7de7-1143-4d38-9379-ee536bf6023c","year":2023},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.859828Z"},"links":{"citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:5450aa814b7ce3e0e92a21b31cbe295c833c630fbbf959c0474c0e596333e870","observation_id":"eefb9305-1a57-4900-aa3e-74563ef55273","resolution":{"observed_at":"2026-08-07T11:36:41.756002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:40.864038Z","title":"Gpqa: A graduate-level google- proof q&a benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.864038Z"},"links":{"citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:ef8a6abb4347a4ee236058244c436153c92537bac51d1609b6850c27b516c3c2","observation_id":"ba55842c-b19b-4dbe-83ae-9dd910ee215a","resolution":{"observed_at":"2026-08-07T11:36:40.864038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:41.723869Z","title":"Zeroscrolls: A zero-shot benchmark for long text understanding","venue":null,"work_id":"ae544981-3f91-4ee0-b35d-861aa565d9b7","year":2023},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.868605Z"},"links":{"citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:4daa014c2d4a491799efbcd670285f436b73e427985e154ac54ea5f9358e11d5","observation_id":"c5a96ff0-830b-4ed2-9bcd-78b3dd89a948","resolution":{"observed_at":"2026-08-07T11:36:41.728583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:41.708994Z","title":"Visualizing data using t-sne.Journal of machine learning research, 9 (11), 2008","venue":null,"work_id":"480569b5-aeca-444c-8382-46180e50152a","year":2008},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.872971Z"},"links":{"citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:583aa38d2a0f16d6d7866eb270759583d4271f94a3e441d68a3dc6880bc60c5a","observation_id":"b910f5a5-3913-4127-af76-6bb92724c020","resolution":{"observed_at":"2026-08-07T11:36:41.713537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:41.693331Z","title":"Grokking of implicit reasoning in transformers: A mechanistic journey to the edge of generalization","venue":null,"work_id":"7b33cb5b-a65f-48e9-a37c-da36066c5a86","year":2024},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.877195Z"},"links":{"citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:91cb6fc77a9d8357ebe92c34f3d03c79972006e7279fa9b85a5d06302de7b97c","observation_id":"7b53ff50-3807-42ac-b061-c0fc21fc3018","resolution":{"observed_at":"2026-08-07T11:36:41.698565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12598","last_updated":"2025-02-18T07:15:28Z","snapshot_observed_at":"2026-08-07T18:10:01.556980Z","submitted_at":"2025-02-18T07:15:28Z","title":"Bring Your Own Knowledge: A Survey of Methods for LLM Knowledge Expansion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12598","snapshot_observed_at":"2026-08-07T11:36:40.881953Z","title":"Bring your own knowl- edge: A survey of methods for llm knowledge expansion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.881953Z"},"links":{"cited_paper":"/paper/2502.12598","citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:ef4255680771c4f18c06dbd8ffb67b8f0fd1e7a7d01aa0fc59ffe23702bca0ab","observation_id":"aeb4147d-444a-4b41-a82d-365b82e6905e","resolution":{"observed_at":"2026-08-07T11:36:40.881953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T11:36:40.886421Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.886421Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:14b143556060b1ce07f25e11f0fd9b78be0ddffc3b5155022abb2231d4dcbe26","observation_id":"68b02642-6947-4841-9e7d-fe2e7be24d76","resolution":{"observed_at":"2026-08-07T11:36:40.886421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:40.890971Z","title":"Mmlu-pro: A more robust and challenging multi-task language understanding benchmark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.890971Z"},"links":{"citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:c1e29fcb9c5b2ce31965c5d99b04412f11bc30b8850213061a2a8f2140042431","observation_id":"128be31d-9809-482e-95e9-3164d25ab06c","resolution":{"observed_at":"2026-08-07T11:36:40.890971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:41.665828Z","title":"Model soups: averaging weights of multiple fine-tuned models improves accuracy without increasing inference time","venue":null,"work_id":"4ee40fbd-eed9-4949-9604-12ac89a57ad2","year":2022},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.895728Z"},"links":{"citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:a8e0ac1a32bf363ccbdea11e977f306f374614dca47874b63f824de52fc01f4f","observation_id":"1a0ebfff-12ac-4a57-ae9d-4040e961363c","resolution":{"observed_at":"2026-08-07T11:36:41.671238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:41.650071Z","title":"Llama pro: Progressive llama with block expansion","venue":null,"work_id":"fc7fcf89-3785-4470-9ec8-9b98ba36017e","year":2024},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.899874Z"},"links":{"citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:41e147374d1432f67bdd570506132c2e70e515f231b9451ef0aa4d54c60d43bd","observation_id":"3a5e00e3-8686-42fe-9019-016b0a20706c","resolution":{"observed_at":"2026-08-07T11:36:41.654567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:41.633861Z","title":"Next-gpt: Any-to-any multimodal llm","venue":null,"work_id":"7ea98dac-9a9b-43e1-9e97-2f598301ee83","year":2024},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.903932Z"},"links":{"citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:6345074651bdd5257fd3d0249859f85665ca0ef26d34da8f2c2b49f6a321f332","observation_id":"cd45cb82-142e-4aa5-9c9b-7e2832b61339","resolution":{"observed_at":"2026-08-07T11:36:41.638912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01364","last_updated":"2024-02-07T07:14:39Z","snapshot_observed_at":"2026-08-04T18:35:41.659861Z","submitted_at":"2024-02-02T12:34:09Z","title":"Continual Learning for Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01364","snapshot_observed_at":"2026-08-07T11:36:40.908092Z","title":"Continual learn- ing for large language models: A survey.arXiv preprint arXiv:2402.01364, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.908092Z"},"links":{"cited_paper":"/paper/2402.01364","citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:fa755d99e9124b5dc0778c63b9e4f275a00bec64aa16adb404d55304aa8b1639","observation_id":"e6a6860c-0706-4fb5-9b00-4d29d8717c77","resolution":{"observed_at":"2026-08-07T11:36:40.908092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:41.616761Z","title":"Retrieval head mechanistically explains long- context factuality","venue":null,"work_id":"0b57598b-e0a8-4f9f-ab1b-e1b4055dca11","year":2025},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.912451Z"},"links":{"citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:fbb0980055009dfc66e2de6a6589100f0ed4549e3b56dd65a9f5ae97f9a3e477","observation_id":"4b6dc6db-7c2b-467d-8c13-65bb6fa506aa","resolution":{"observed_at":"2026-08-07T11:36:41.621347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:41.600653Z","title":"Video question answer- ing via gradually refined attention over appearance and mo- tion","venue":null,"work_id":"f8a407f5-4d23-487a-9e68-943a0ae1b576","year":2017},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.916694Z"},"links":{"citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:1c69dbbbf65df96fb10a227aca6aa546572b919b9435dbc5972930db516ee56a","observation_id":"b3dc0371-1a9a-4c1f-b955-057f2a8affc5","resolution":{"observed_at":"2026-08-07T11:36:41.605889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-07T11:36:40.920496Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.920496Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:f792e72da4b911eecee38f19a95d674e93504945a89f0659f0cef682fe879fb5","observation_id":"3ed08fda-21dd-4346-8727-bbe893c97c2f","resolution":{"observed_at":"2026-08-07T11:36:40.920496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-07T11:36:40.924741Z","title":"Qwen2 technical report.arXiv preprint arXiv:2407.10671, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.924741Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:e0e1e1c8ce502cbbb1378c57f758a302bf6fa262f224de5ecbc4258a7f01e5f3","observation_id":"be31ddf1-0aef-4842-a8fe-0c54fd66e4b8","resolution":{"observed_at":"2026-08-07T11:36:40.924741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:41.550588Z","title":"Recent advances of foundation language models-based continual learning: A survey.ACM Computing Surveys, 57(5):1–38, 2025","venue":null,"work_id":"0eb00716-61d5-4a7b-b72e-5ca40d4c5bd4","year":2025},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.929283Z"},"links":{"citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:a5260e291c7feb4832abc8a84a4fec68c337e0cca9b76bbde233df446670775d","observation_id":"14336129-7eba-499c-85bc-759081bc1aff","resolution":{"observed_at":"2026-08-07T11:36:41.573012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:41.506787Z","title":"Editing large language models: Problems, methods, and opportunities","venue":null,"work_id":"337d15a3-ccb5-4f56-ad23-a7e871c0358e","year":2023},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.933318Z"},"links":{"citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:91bf90cacba3732a12e85c8cd9c39f1e7487c76b6dea77f9247701a8f38c513d","observation_id":"1b8ea60b-628a-47f1-9732-d3759305e3ec","resolution":{"observed_at":"2026-08-07T11:36:41.526688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.12284","last_updated":"2024-05-03T17:36:07Z","snapshot_observed_at":"2026-08-02T15:00:50.388422Z","submitted_at":"2023-09-21T17:45:42Z","title":"MetaMath: Bootstrap Your Own Mathematical Questions for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.12284","snapshot_observed_at":"2026-08-07T11:36:40.937363Z","title":"Metamath: Bootstrap your own mathe- matical questions for large language models.arXiv preprint arXiv:2309.12284, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.937363Z"},"links":{"cited_paper":"/paper/2309.12284","citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:3c0dec98e56af5bf5108b5c64c8b81feeddd8b977379fb9e7e61fee90f262671","observation_id":"cb28d448-342b-4c7c-a8a0-f26b20b4dbcb","resolution":{"observed_at":"2026-08-07T11:36:40.937363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:41.465981Z","title":"Information association for lan- guage model updating by mitigating lm-logical discrepancy","venue":null,"work_id":"2f8e3221-0250-42a5-9853-675f0de61da8","year":2024},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.941841Z"},"links":{"citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:3c416d1d5c08a28124a265fb3064eca0495b8b70cf72349f5adeac5fc84021e5","observation_id":"89fecc9b-d645-4ac3-9dee-993a67b8cf58","resolution":{"observed_at":"2026-08-07T11:36:41.487166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:40.946173Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for ex- pert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.946173Z"},"links":{"citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:174b565cd5226d02b01bdbb6960a11235f0d6fa9e5dcfdc0a2c35d1329b9618b","observation_id":"84f8a660-3c08-4109-ba1c-0caa2d32960c","resolution":{"observed_at":"2026-08-07T11:36:40.946173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:41.413208Z","title":"Mm-llms: Recent advances in multimodal large language models","venue":null,"work_id":"54fa84a2-c744-4e24-859e-d469aab8d2a2","year":2024},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.950581Z"},"links":{"citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:487c1dc813f9f763be9b8f3793a47f4341c71c681fea2208af4c1a947451a661","observation_id":"dd47f181-8532-47e4-9065-ce6c1bbf431d","resolution":{"observed_at":"2026-08-07T11:36:41.428426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:41.380378Z","title":"Video-llama: An instruction-tuned audio-visual language model for video un- derstanding","venue":null,"work_id":"3fd60c03-6321-4554-8e58-52bf301dc968","year":2023},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.954652Z"},"links":{"citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:e9274506ab0d5928b2506827552cc592c8fa4913c45fa91c0aed4bc4636e56e5","observation_id":"df09e92e-c41d-46aa-ad9e-89810ca50123","resolution":{"observed_at":"2026-08-07T11:36:41.387194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:41.361784Z","title":"Cppo: Continual learning for rein- forcement learning with human feedback","venue":null,"work_id":"a37768a2-4848-4a04-bd5b-daad02f50b89","year":2024},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.958811Z"},"links":{"citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:616ea204160bafa0fd160046b21ddf4bc80d3b5a49bfbf63472a59eb813b1995","observation_id":"d774c08a-16b2-4a79-9772-32d79de708a0","resolution":{"observed_at":"2026-08-07T11:36:41.368420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-07T11:36:40.962864Z","title":"Video instruction tuning with synthetic data.arXiv preprint arXiv:2410.02713, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.962864Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:f1b58c9102e580f4465e0a6638cb78d519aabe8a6e41979ad1b0eaf0e9851f68","observation_id":"3078cda2-ac9b-406d-9bb7-d6b3f3c12bea","resolution":{"observed_at":"2026-08-07T11:36:40.962864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-07T11:36:40.967298Z","title":"Instruction-following evaluation for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.967298Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:72e621f8940a4bdd90277e8a34beb4e1b2145aa39b5558e8efc1db3e0b3c9ce2","observation_id":"ed9ab8ca-5a31-466c-b256-4edf59d43c14","resolution":{"observed_at":"2026-08-07T11:36:40.967298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03659","last_updated":"2024-10-11T15:07:31Z","snapshot_observed_at":"2026-08-05T12:32:26.990966Z","submitted_at":"2024-10-04T17:59:28Z","title":"Unraveling Cross-Modality Knowledge Conflicts in Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03659","snapshot_observed_at":"2026-08-07T11:36:40.971423Z","title":"Unraveling cross-modality knowledge con- flicts in large vision-language models.arXiv preprint arXiv:2410.03659, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.971423Z"},"links":{"cited_paper":"/paper/2410.03659","citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:b02108f369d0948374bde2c9bfd2d85ad617ad82d928ed94c3b560df75e8586b","observation_id":"47527f2e-8ffb-4862-b043-2ec7340325b1","resolution":{"observed_at":"2026-08-07T11:36:40.971423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T11:29:58.817503Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":0,"verified_fuzzy":35},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 1 inbound Pith citation observation for arXiv:2506.01872."}