{"as_of":"2026-08-18T17:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3aac385f1c5c7cca53ffd7beba3222f8b396a3f56db73fa59853e57c1086743b","coverage":[{"denominator":121,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T16:32:43.351429Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T00:55:26.251613Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18179","snapshot_observed_at":"2026-08-03T00:55:26.251613Z","title":"Seam: Semantically equivalent across modalities benchmark for vision-language models.arXiv preprint arXiv:2508.18179, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28640","last_updated":"2026-05-20T00:25:52Z","snapshot_observed_at":"2026-08-12T15:37:51.134557Z","submitted_at":"2026-05-20T00:25:52Z","title":"TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T00:55:26.251613Z"},"links":{"cited_paper":"/paper/2508.18179","citing_paper":"/paper/2607.28640"},"observation_digest":"sha256:3cd6731db324b92a9882f1698d064184e2ec34acc8bae64e1ab5f02b60077a9f","observation_id":"351a9023-0a61-4de3-8da0-72858a7b8fe0","resolution":{"observed_at":"2026-08-03T00:55:26.251613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.18179/citation-record","integrity":"/paper/2508.18179/integrity","json":"/paper/2508.18179/citation-record.json","paper":"/paper/2508.18179"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.07073","last_updated":"2024-10-10T17:59:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-09T17:16:22Z","title":"Pixtral 12B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07073","snapshot_observed_at":"2026-08-05T16:32:42.044547Z","title":"Pixtral 12b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:42.044547Z"},"links":{"cited_paper":"/paper/2410.07073","citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:adad9e4ece9a144e24f3ed6c150de40187d8f93af34cec9f5ae6b68384603de2","observation_id":"525eff74-1564-420d-9e24-250910d23a05","resolution":{"observed_at":"2026-08-05T16:32:42.044547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:32:42.161491Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:42.161491Z"},"links":{"citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:a3d04fc16b2d01155e3fb00e2bcd6a313ca36c774f74d831158edeedbc5dae03","observation_id":"f7c13701-c6ce-4f33-a3c6-e0747a3d2222","resolution":{"observed_at":"2026-08-05T16:32:42.161491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:32:42.248888Z","title":"The claude 3 model family: Opus, sonnet, haiku, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:42.248888Z"},"links":{"citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:1eada138ba83b55e26ea62c843056a64292413bfff87f523a12eae26a5f0647d","observation_id":"9392d820-17be-4b84-ab4f-116c7d4fdf35","resolution":{"observed_at":"2026-08-05T16:32:42.248888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:32:42.328402Z","title":"Claude 3.7 sonnet system card, 2025 a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:42.328402Z"},"links":{"citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:9b80778f94a4fbe748fa4f4b633d74c85f45c69874b04e73680e5831fa7ffbf1","observation_id":"81f11666-1191-4d31-a78d-ccd0d09c9ebd","resolution":{"observed_at":"2026-08-05T16:32:42.328402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:32:42.392037Z","title":"System card: Claude opus 4 & claude sonnet 4, 2025 b","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:42.392037Z"},"links":{"citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:fd5fc8ede376d814d41a7e953525dc51e2df6b7ebcf14401f64c04d17a192cc9","observation_id":"d6b6bc5d-0c83-4f22-8acd-3f74deaa4eed","resolution":{"observed_at":"2026-08-05T16:32:42.392037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:32:42.477810Z","title":"Vqa: Visual question answering","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:42.477810Z"},"links":{"citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:f80447cf6b4b4e95ed33e3145f4422d4ee4241b936b335f9ee1b3bcc62b8a9b4","observation_id":"22522544-7446-4faf-b137-7ab1c8a56688","resolution":{"observed_at":"2026-08-05T16:32:42.477810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-05T16:32:42.555428Z","title":"Openflamingo: An open-source framework for training large autoregressive vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:42.555428Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:6377c83c94baba287da54b4edfb9e60c79387ba6a300b10f2c9e6d77e913b342","observation_id":"2ebe7bf2-9001-4afe-ad5d-3ca79f1dec28","resolution":{"observed_at":"2026-08-05T16:32:42.555428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-05T16:32:42.617018Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:42.617018Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:a9719f575204f067f96d62f57a98c69ca1606b90ac6503143ec7e5d527172ea2","observation_id":"19c3fbbf-be30-42ee-a0f4-6b1c0e30c1c3","resolution":{"observed_at":"2026-08-05T16:32:42.617018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T16:32:42.703832Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:42.703832Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:96aff94c4c79b00fcd32fbb047cc11572e1daed524f0369dbfd523cb2abff745","observation_id":"908f5923-476e-4e50-9f6c-1f3d7eb22f97","resolution":{"observed_at":"2026-08-05T16:32:42.703832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-17T13:04:04.064087Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-05T16:32:42.732195Z","title":"Minigpt-v2: large language model as a unified interface for vision-language multi-task learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:42.732195Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:7524342d2f14cfc3cdb54b6f46f265d06e9c2b7a00ad2f3e2e3e54bcc042d572","observation_id":"d27bcae4-8b22-46ed-b3e6-93138cd72d66","resolution":{"observed_at":"2026-08-05T16:32:42.732195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:32:42.738792Z","title":"Uniter: Universal image-text representation learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:42.738792Z"},"links":{"citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:6c1dab44da49e236f4f825e4471fb122b5823a4eb50683c9666638cf86114cb1","observation_id":"6368c1c4-988f-430e-8956-038e765585a1","resolution":{"observed_at":"2026-08-05T16:32:42.738792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-05T16:32:42.744491Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:42.744491Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:f9dab81708b0e5e980136803be910330d3e0cb12e767eb5f2035a0abfdcc99b9","observation_id":"4299bd4a-fbe2-4ae1-afd2-876fe3333ec2","resolution":{"observed_at":"2026-08-05T16:32:42.744491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:32:42.750413Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:42.750413Z"},"links":{"citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:ade02e03548b0006cf6246ff3f5a938d4c3e17d793dd0c52f1465ef19ecff09e","observation_id":"3a261484-5d95-4ead-8c18-0509e1fba46a","resolution":{"observed_at":"2026-08-05T16:32:42.750413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:32:42.757959Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:42.757959Z"},"links":{"citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:0062aeb6929874f19753b2c7076457dfe9890ea203bccecf2d034408c298fd3c","observation_id":"6e0a6a27-b13f-48d8-bd7f-4c4f6711677a","resolution":{"observed_at":"2026-08-05T16:32:42.757959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:32:42.764237Z","title":"Chess.com, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:42.764237Z"},"links":{"citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:1329b76f64fe5bc9ebeea618657530b2e30c082963617acddefd367679b7ca06","observation_id":"1ddd3b3f-e5ba-497b-b01b-9f998cfffb9f","resolution":{"observed_at":"2026-08-05T16:32:42.764237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-05T16:32:42.770937Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:42.770937Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:9cd7a7ef0fcdb0740688bc1a224083819c3bbab02a311162529b8f6713cf9712","observation_id":"cfcead19-d472-4bd3-8bb4-880af03df0db","resolution":{"observed_at":"2026-08-05T16:32:42.770937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:32:42.777528Z","title":"Opencompass: A universal evaluation platform for foundation models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:42.777528Z"},"links":{"citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:4a3457e00f6877cca8e4523e20e3ae1373b1cb1c035ad5cc3cacf154056aa975","observation_id":"9e533b79-c3dc-4cdf-875c-326ccaec9818","resolution":{"observed_at":"2026-08-05T16:32:42.777528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03287","last_updated":"2023-11-07T02:18:48Z","snapshot_observed_at":"2026-08-18T12:52:38.378038Z","submitted_at":"2023-11-06T17:26:59Z","title":"Holistic Analysis of Hallucination in GPT-4V(ision): Bias and Interference Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03287","snapshot_observed_at":"2026-08-05T16:32:42.784068Z","title":"Holistic analysis of hallucination in gpt-4v (ision): Bias and interference challenges","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:42.784068Z"},"links":{"cited_paper":"/paper/2311.03287","citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:0564b2b636e74ddacfd4c043b3fa3c7d326edc2fe306de090982aba88903e2d1","observation_id":"f6a4f47f-e237-4390-bf52-d4f3f140aec1","resolution":{"observed_at":"2026-08-05T16:32:42.784068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:32:42.790967Z","title":"music21: A toolkit for computer-aided musicology and symbolic music analysis","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:42.790967Z"},"links":{"citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:38318d227ac700374d4ce205a583862ee5cd58ba59ff222d0ee51dae75590ac8","observation_id":"909f5dc2-0451-4b43-85d4-928a6b10d722","resolution":{"observed_at":"2026-08-05T16:32:42.790967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-08-13T18:58:34.541884Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-05T16:32:42.800336Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:42.800336Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:8aedaca3c35acb4c189c6a68a27c3cb2786ccf129bd4934985a66707a7cbb06e","observation_id":"623cc85f-a0fb-480c-a91e-9d459d15d2e9","resolution":{"observed_at":"2026-08-05T16:32:42.800336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T16:32:42.809612Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:42.809612Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:57c3e85683279ac06f58a70ec344ae99706dee91bac15a6a32f4ba726bb0ebe5","observation_id":"042497b8-5e67-4690-a45f-bedec4b34b1f","resolution":{"observed_at":"2026-08-05T16:32:42.809612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-05T16:32:42.817100Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:42.817100Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:d4739aae77691f3e7ecb229f06aedf17fa9baa517a0233edc24212286bcdd8dc","observation_id":"557dbf17-5f15-44e3-b677-7e18b7fa79c2","resolution":{"observed_at":"2026-08-05T16:32:42.817100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-05T16:32:42.823442Z","title":"Gemma: Open models based on gemini research and technology","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:42.823442Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:e5fae508469766d3ca0424b0480eebe381bb476adbaa93bbe67d8f498e569098","observation_id":"b548fcf9-34da-403c-a0d9-bc519078c568","resolution":{"observed_at":"2026-08-05T16:32:42.823442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-05T16:32:42.831534Z","title":"Gemma 2: Improving open language models at a practical size","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:42.831534Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:0273ddec2ceff728ca11b7a7cb2f174e63eea8022684a8e26810be3015a70c07","observation_id":"2d40e41b-4df4-4cc2-bd5e-5be2ec409b9b","resolution":{"observed_at":"2026-08-05T16:32:42.831534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:32:42.848467Z","title":"Introducing gemini 2.0: our new ai model for the agentic era, 2025 a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:42.848467Z"},"links":{"citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:dcdc4ff883f1a98ae09fee595cf88efd691f191044ad7ed6a05b4a6cf5683207","observation_id":"dc974796-0076-4805-9ca2-2817667dbec0","resolution":{"observed_at":"2026-08-05T16:32:42.848467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:32:42.854575Z","title":"Gemma 3 technical report, 2025 b","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:42.854575Z"},"links":{"citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:5adb808edadba0017d2497f5f2029f7ef749b107252e8fb6d7ef22a27b2f1cdb","observation_id":"5a836bc7-e02c-4b25-9585-f169472e5801","resolution":{"observed_at":"2026-08-05T16:32:42.854575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:32:42.864402Z","title":"Portable game notation specification and implementation guide, 1994","venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:42.864402Z"},"links":{"citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:bd15b73c44022fe9792b3c8f895ea80b76521939f3d0a90979461980eea11dd0","observation_id":"6d96fd3f-bb25-4d3b-8d93-ca52ab6b8a85","resolution":{"observed_at":"2026-08-05T16:32:42.864402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:32:42.870783Z","title":"Pmr: Prototypical modal rebalance for multimodal learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:42.870783Z"},"links":{"citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:fc87005e9411176c54d65dcbef0ca4e75e362f5da7e2fece09982bc811357870","observation_id":"b3be8c70-b887-4b2a-94e1-ee46191f300f","resolution":{"observed_at":"2026-08-05T16:32:42.870783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:32:42.877320Z","title":"Layoutgpt: Compositional visual planning and generation with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:42.877320Z"},"links":{"citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:208750d9f5e936ba34af26b3290e7430eb0284647a122277db6c399bf41bf417","observation_id":"1bba78f3-bf2a-4d2f-8492-81413d2aaa6c","resolution":{"observed_at":"2026-08-05T16:32:42.877320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:32:42.882769Z","title":"python-chess: A chess library for python, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:42.882769Z"},"links":{"citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:84cf61f5ab13409ccd8babf429f75d4e2903cc49a3eb8ddfd9ed0b208c6df5f3","observation_id":"50fd2ba7-bd79-455c-b4f2-a8ccf058a8a9","resolution":{"observed_at":"2026-08-05T16:32:42.882769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:32:42.891709Z","title":"Blink: Multimodal large language models can see but not perceive","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:42.891709Z"},"links":{"citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:b8f46d3b6bdfbe008908d1eb32250f8ee746440688d1984dbbad44cac175a243","observation_id":"ed43d763-ea8c-4457-b4ef-7bfcbe69bd21","resolution":{"observed_at":"2026-08-05T16:32:42.891709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.15010","last_updated":"2023-04-28T17:59:25Z","snapshot_observed_at":"2026-08-12T23:40:42.885633Z","submitted_at":"2023-04-28T17:59:25Z","title":"LLaMA-Adapter V2: Parameter-Efficient Visual Instruction Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.15010","snapshot_observed_at":"2026-08-05T16:32:42.899699Z","title":"Llama-adapter v2: Parameter-efficient visual instruction model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:42.899699Z"},"links":{"cited_paper":"/paper/2304.15010","citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:f2c7f0d34b4d77edbcb163cc78dfd293f97d25a316c2cf7abff557448dcf3aa9","observation_id":"663e06fa-ef94-4a8c-84ef-ed5e5653fea9","resolution":{"observed_at":"2026-08-05T16:32:42.899699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:32:42.904966Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:42.904966Z"},"links":{"citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:b53571289447e2e08bad608f823caccaa208cae9b9b430b7c23172367e453789","observation_id":"c5c2725d-325d-40b0-883e-9efcdd44eae3","resolution":{"observed_at":"2026-08-05T16:32:42.904966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-05T16:32:42.912222Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:42.912222Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:4434e227b8c30d82c77090e52c6a37505a6de67aec06263f3f31aa4b18f610ff","observation_id":"1096c998-ce92-4cad-b094-3c43de91fa1a","resolution":{"observed_at":"2026-08-05T16:32:42.912222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:32:42.917902Z","title":"What can large language models do in chemistry? a comprehensive benchmark on eight tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:42.917902Z"},"links":{"citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:638ae3e4f77d49432a36f2425e37a16377637266e09764a588324cfd3f298ac2","observation_id":"b936b9a4-6caf-4baa-a381-a1514f502bd4","resolution":{"observed_at":"2026-08-05T16:32:42.917902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:32:42.922914Z","title":"Exploring network structure, dynamics, and function using networkx","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:42.922914Z"},"links":{"citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:44a15d347b453b8e1fb36a748893aca061be7de5985031b801916a018ef8f096","observation_id":"8d11e22d-3154-4b94-bbf3-74e16e85c72c","resolution":{"observed_at":"2026-08-05T16:32:42.922914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16483","last_updated":"2023-11-27T15:20:23Z","snapshot_observed_at":"2026-08-16T14:40:01.654059Z","submitted_at":"2023-11-27T15:20:23Z","title":"ChartLlama: A Multimodal LLM for Chart Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16483","snapshot_observed_at":"2026-08-05T16:32:42.928350Z","title":"Chartllama: A multimodal llm for chart understanding and generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:42.928350Z"},"links":{"cited_paper":"/paper/2311.16483","citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:083e1b79cd2652e9373ce2b10b0f2e1ebd207cafc5566481bc3539a21684666f","observation_id":"bb84384c-ec52-4cbc-a89d-46289c2dd6be","resolution":{"observed_at":"2026-08-05T16:32:42.928350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-18T04:15:44.692958Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-08-05T16:32:42.934041Z","title":"Can mllms reason in multimodality? emma: An enhanced multimodal reasoning benchmark","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:42.934041Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:74a914e3ff587c2e87018eecb25984a963e44bdfd0814216b4f184b5225d3d6f","observation_id":"9d5b0801-966a-45f1-9e27-1ecb18d0c745","resolution":{"observed_at":"2026-08-05T16:32:42.934041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07167","last_updated":"2024-10-16T07:23:03Z","snapshot_observed_at":"2026-08-16T13:10:59.354278Z","submitted_at":"2024-10-09T17:59:04Z","title":"Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07167","snapshot_observed_at":"2026-08-05T16:32:42.939167Z","title":"Deciphering cross-modal alignment in large vision-language models with modality integration rate","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:42.939167Z"},"links":{"cited_paper":"/paper/2410.07167","citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:58dcd152ca36d6f18a8fa247c4c736c98556c1ba1c7d33b5f084d4b4d03523ce","observation_id":"ea38c2f4-6165-4719-8c34-37e37b7bb1a4","resolution":{"observed_at":"2026-08-05T16:32:42.939167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:32:42.945106Z","title":"Modality competition: What makes joint training of multi-modal network fail in deep learning?(provably)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:42.945106Z"},"links":{"citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:3fd9da8031ddc22cbff74a2f570cf256100144d87f60a31499ed65a37a0b5b2c","observation_id":"fd51e676-1cdc-497e-864d-136105f4a8f3","resolution":{"observed_at":"2026-08-05T16:32:42.945106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01483","last_updated":"2024-11-15T06:31:44Z","snapshot_observed_at":"2026-08-17T23:18:43.192721Z","submitted_at":"2024-05-02T17:14:57Z","title":"MANTIS: Interleaved Multi-Image Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01483","snapshot_observed_at":"2026-08-05T16:32:42.950450Z","title":"Mantis: Interleaved multi-image instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:42.950450Z"},"links":{"cited_paper":"/paper/2405.01483","citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:db9aed2d002575f6ba089710ccad5e71388facaf75c703d8b362029681924f38","observation_id":"8cd357c3-b2bf-436c-a51e-d3bd53657c32","resolution":{"observed_at":"2026-08-05T16:32:42.950450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:32:42.956607Z","title":"Spin: Sparsifying and integrating internal neurons in large language models for text classification","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:42.956607Z"},"links":{"citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:bf58cdb1dd90d47945e495c0ec4a95264524d43c2a9265a4d6d117fd3589b707","observation_id":"81bf7ea1-e689-4002-a7fd-4b3695743f52","resolution":{"observed_at":"2026-08-05T16:32:42.956607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:32:42.963041Z","title":"Pubchem 2025 update","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:42.963041Z"},"links":{"citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:9c53fb4457bcefb5afcc390ac3862c53db5abb96ab8f57fe3290d29688a92026","observation_id":"c7077a98-198b-45e1-b241-c10348bd59ba","resolution":{"observed_at":"2026-08-05T16:32:42.963041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:32:42.984383Z","title":"Large language models are zero-shot reasoners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:42.984383Z"},"links":{"citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:7acfcd0f565e4505b9cee5022bdc8e0d7770fb0eb4486f101745003c6e8be953","observation_id":"f53ec5da-aa9a-4c56-b10b-808a6a046c4b","resolution":{"observed_at":"2026-08-05T16:32:42.984383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:32:43.006862Z","title":"Learning multiple layers of features from tiny images","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:43.006862Z"},"links":{"citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:ab4aa24472aa787d695b2e772f4ce157c1e5fa09ba809fe2d9cc92b6d40c21d0","observation_id":"6bf091bc-e6df-4375-b0ba-726f35f368dc","resolution":{"observed_at":"2026-08-05T16:32:43.006862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:32:43.013709Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:43.013709Z"},"links":{"citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:9f3cc70a0cad7baeabd838994392f63455af3a529737979d8ebc9c2477b8d6db","observation_id":"5927e38e-4511-4f55-a206-f1a6aa216002","resolution":{"observed_at":"2026-08-05T16:32:43.013709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:32:43.020978Z","title":"Snap: A general-purpose network analysis and graph-mining library","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:43.020978Z"},"links":{"citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:97f24193cbadd695a4a7e5927e5e56cc67839a3403906b36f891e1e20ff75898","observation_id":"67eeec96-0dd9-40a7-a7a1-aeed20b5168c","resolution":{"observed_at":"2026-08-05T16:32:43.020978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-08-18T11:56:50.710310Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T16:32:43.026292Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:43.026292Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:740e9d2987cce391819e217ef81ada90f86b3fa795392ec16d9363946a55bfcd","observation_id":"65efaed9-bf46-43f4-a761-9ef8ee62548d","resolution":{"observed_at":"2026-08-05T16:32:43.026292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:32:43.033345Z","title":"Seed-bench: Benchmarking multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:43.033345Z"},"links":{"citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:3fd8d5a387e3b631ff94e87e21a9c4844132b3aacfc7f35c5aa43232fce17a96","observation_id":"3b7f39c6-b46e-49f8-b175-1e9ee5e70d0b","resolution":{"observed_at":"2026-08-05T16:32:43.033345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-08-13T00:09:23.835117Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-05T16:32:43.040398Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:43.040398Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:fed924621a3aee3e7814577b4cfef0eb5adaca517f3a33f33a9a445f0df4fa9a","observation_id":"c8c289cd-b6e4-4188-bf6e-c8e9db1b9195","resolution":{"observed_at":"2026-08-05T16:32:43.040398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:32:43.045873Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:43.045873Z"},"links":{"citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:fbaa666d22aa9bd6c96ec2477787d097bf1d0cb05ba11fc893bcd3cef0c3061b","observation_id":"3316da2c-5ec2-4606-93c8-29592ec1201f","resolution":{"observed_at":"2026-08-05T16:32:43.045873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:32:43.050715Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:43.050715Z"},"links":{"citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:4b0aaa56438fdc0aa66ae4f7af7f7fad4bf944e8c585e042c8042c439af408a8","observation_id":"e27a4424-be51-4d4c-85e0-bdeb6965c1b0","resolution":{"observed_at":"2026-08-05T16:32:43.050715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:32:43.055662Z","title":"Oscar: Object-semantics aligned pre-training for vision-language tasks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:43.055662Z"},"links":{"citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:b6828bcf2bb44e06250828cf633e254835b9f5c9486105a8239e5391ad9901a0","observation_id":"5131e450-4984-4ce0-85b1-f3b7bdfb6127","resolution":{"observed_at":"2026-08-05T16:32:43.055662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:32:43.060050Z","title":"Lichess evaluation database, 2025 a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:43.060050Z"},"links":{"citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:48e418d729a4bceb66371e20e9b890f82a797ecee8cca2fa0c01a792c49514e0","observation_id":"504b61d1-6c62-438d-870e-bb3cf0d968fe","resolution":{"observed_at":"2026-08-05T16:32:43.060050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:32:43.065022Z","title":"Lichess: Free online chess, 2025 b","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:43.065022Z"},"links":{"citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:b0d00f47adea77df9331b8d384e70abda680dcbf362490c78cc8150a5534df1b","observation_id":"05561b7a-905a-4928-9308-9fd88d1928a2","resolution":{"observed_at":"2026-08-05T16:32:43.065022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:32:43.070040Z","title":"Lichess puzzle database, 2025 c","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:43.070040Z"},"links":{"citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:b9735ee593c37974c509c6c70c90eacd11b0532633d842f667d01d9a0cf44e53","observation_id":"830962d1-0d78-42cf-a6fd-e832264415a5","resolution":{"observed_at":"2026-08-05T16:32:43.070040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:32:43.074656Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:43.074656Z"},"links":{"citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:31942edec7e005733282dadea1158981c003b6e50eb257b7abc77bbe35d3b5ca","observation_id":"1da1321c-6954-4054-bf68-99d4958d54bd","resolution":{"observed_at":"2026-08-05T16:32:43.074656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14566","last_updated":"2024-03-25T06:05:24Z","snapshot_observed_at":"2026-08-17T08:51:17.030494Z","submitted_at":"2023-10-23T04:49:09Z","title":"HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14566","snapshot_observed_at":"2026-08-05T16:32:43.079490Z","title":"Hallusionbench: You see what you think? or you think what you see? an image-context reasoning benchmark challenging for gpt-4v (ision), llava-1.5, and other multi-modality models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:43.079490Z"},"links":{"cited_paper":"/paper/2310.14566","citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:ceb690294c6ec0723a4d2701d8169797742dec7c6ec112a56ce44a94124b662a","observation_id":"41cd2bdc-7836-45af-b3ac-248c134213fa","resolution":{"observed_at":"2026-08-05T16:32:43.079490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:32:43.086560Z","title":"Improved baselines with visual instruction tuning, 2023 b","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:43.086560Z"},"links":{"citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:348966c57a6be7240fc4b1cb7359d033abecb48aa4fee08dfbc41979ba0db49c","observation_id":"dd0db3e4-c09f-463f-82dc-9ac001915bfa","resolution":{"observed_at":"2026-08-05T16:32:43.086560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:32:43.093718Z","title":"Visual instruction tuning, 2023 c","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:43.093718Z"},"links":{"citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:b4775d4379f1e12e77010d234e25e1e13e844f202cafa60d9c361b58b7a01fa4","observation_id":"f01e33cf-2675-40c4-b4c8-a5a2f57928d9","resolution":{"observed_at":"2026-08-05T16:32:43.093718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:32:43.099558Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge, January 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:43.099558Z"},"links":{"citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:05ef41bf3f80b064755fa47ea7ae5092f62d78759657021c7e78e130ee6e2180","observation_id":"01222fc1-4d5b-4862-9035-864045560d18","resolution":{"observed_at":"2026-08-05T16:32:43.099558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:32:43.106880Z","title":"Mmbench: Is your multi-modal model an all-around player? In European conference on computer vision, pp.\\ 216--233","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:43.106880Z"},"links":{"citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:d818c45c5cb59816ee75c768e6d8f7dead82972116d5de6fd1b9b2a9295bbb9c","observation_id":"0c38a33c-f9d0-4df9-bac2-6b1044cf1a3e","resolution":{"observed_at":"2026-08-05T16:32:43.106880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:32:43.116167Z","title":"Vilbert: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:43.116167Z"},"links":{"citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:5d8e1afa3eafee0b5fdd94a4614815049715b68cd86b81bfa68d254eec8dcdd6","observation_id":"7d0d69f5-1320-4526-b7e3-7e7e7976f46a","resolution":{"observed_at":"2026-08-05T16:32:43.116167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-05T16:32:43.123282Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:43.123282Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:2caef1ee5b04eed05efb84621277535687a3be57bc95f0fa6864651ab249d37a","observation_id":"e5ce209a-9bee-4fc2-b001-34eefa640d60","resolution":{"observed_at":"2026-08-05T16:32:43.123282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:32:43.129520Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:43.129520Z"},"links":{"citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:857bd44c789a872c3cea140f2695f31e0e1bcf0d1fd54c3b74b6ebf9c15e0ef6","observation_id":"305e7673-8562-4b24-9930-1ccd5454ec3b","resolution":{"observed_at":"2026-08-05T16:32:43.129520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:32:45.427629Z","title":"Gpt-4v(ision) system card, 2023","venue":null,"work_id":"002c606d-5c44-4372-b8ed-ac364b59d74b","year":2023},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:43.134751Z"},"links":{"citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:18643208a5640f02ae86f7e1019a6bdf4744286ae32ad5ed768f04064948636a","observation_id":"d87dc009-474d-4dce-8a68-80272dfd1454","resolution":{"observed_at":"2026-08-05T16:32:45.434566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T16:32:43.140039Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:43.140039Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:4c6d9a0ab7008ddc8c5ca9e3db8d7975bb7098ceb802b3fe12f2b2affabdfadf","observation_id":"3380c342-0974-4bcc-80b2-1ce4e181596a","resolution":{"observed_at":"2026-08-05T16:32:43.140039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:32:45.404869Z","title":"Gpt-4o mini: Advancing cost-efficient intelligence, 2024 b","venue":null,"work_id":"ced82a20-986f-4a59-9d2a-61a7b79b06cd","year":2024},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:43.146683Z"},"links":{"citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:54d8cdc1fd38c66d36d7711863ef84e92db63d1d55cba9902b1ac0532996bb0b","observation_id":"c60b406e-824d-4d6c-9ace-be98ff1e8954","resolution":{"observed_at":"2026-08-05T16:32:45.411773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:32:45.383464Z","title":"Openai o1 system card, December 2024 c","venue":null,"work_id":"78fd38eb-caf4-4557-901a-a74a026eba07","year":2024},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:43.152920Z"},"links":{"citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:163f2f27ef2ed5cebd792a23b4a34da44732dce6a3f0dc323fec35ebbd870f08","observation_id":"bd1b13ce-edee-4e6a-a115-d94fc2f79a8a","resolution":{"observed_at":"2026-08-05T16:32:45.388851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:32:45.353946Z","title":"Gpt-4.5 system card, 2025 a","venue":null,"work_id":"ed50b30b-0d2f-4296-a875-5fc42a0f855e","year":2025},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:43.161131Z"},"links":{"citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:ca12b38fa0695c3075bea657264374a9febb02d5120f26dee5c9023213ca6d5c","observation_id":"e9fcfc15-f111-494e-bd35-a5d55318156d","resolution":{"observed_at":"2026-08-05T16:32:45.366029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:32:45.334012Z","title":"Gpt-5 system card, 2025 b","venue":null,"work_id":"706fa844-944a-44d8-9bd7-798cadf67ce4","year":2025},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:43.167373Z"},"links":{"citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:00e5b8f4ed82058709587c152fa7ff18b4233f6cc929cf3792c7a4f4d5bbe07d","observation_id":"5d283bba-1925-4d51-9066-9845a0fb8af7","resolution":{"observed_at":"2026-08-05T16:32:45.338683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:32:45.316820Z","title":"Openai o3-mini system card, February 2025 c","venue":null,"work_id":"75a409bd-551f-41d0-bc2e-db16e848641c","year":2025},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:43.174490Z"},"links":{"citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:48efbad2510f4b436936a480371b9ab6d53f999907b4cec84d6c58d31a64e9d6","observation_id":"dff49c99-74e0-4a3d-9c22-846f2ce032c1","resolution":{"observed_at":"2026-08-05T16:32:45.322244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:32:45.290765Z","title":"Openai o3 and o4-mini system card, 2025 d","venue":null,"work_id":"f2d0abd4-4da5-4231-9e78-87ec88d9c70f","year":2025},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:43.180287Z"},"links":{"citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:381a144488613311505058c93f6f2e27abd5ab1ad154bd2f718450aecb01ef8c","observation_id":"59195a71-c2e5-4545-9cc0-44a80e816065","resolution":{"observed_at":"2026-08-05T16:32:45.301339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10549","last_updated":"2023-07-04T13:18:29Z","snapshot_observed_at":"2026-08-17T14:40:39.514784Z","submitted_at":"2022-12-20T18:53:14Z","title":"Cross-modal Attention Congruence Regularization for Vision-Language Relation Alignment","version":2},"cited_work":{"arxiv_id":"2212.10549","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.10549","snapshot_observed_at":"2026-08-05T16:32:44.167920Z","title":"Cross-modal Attention Congruence Regularization for Vision-Language Relation Alignment","venue":"cs.CL","work_id":"270fcbd3-d960-444d-b364-da8f248207f1","year":2022},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:43.185194Z"},"links":{"cited_paper":"/paper/2212.10549","citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:179d3479b856cde9ec71be2a7114b88b863daa894c3f04fc66169a8f5c31be52","observation_id":"aecaf710-6ce3-4431-9d76-183a18a5bf07","resolution":{"observed_at":"2026-08-05T16:32:44.173425Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02669","last_updated":"2025-06-02T16:48:29Z","snapshot_observed_at":"2026-08-18T09:11:46.634308Z","submitted_at":"2025-01-05T21:36:38Z","title":"Generalizing from SIMPLE to HARD Visual Reasoning: Can We Mitigate Modality Imbalance in VLMs?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02669","snapshot_observed_at":"2026-08-05T16:32:43.191067Z","title":"Generalizing from simple to hard visual reasoning: Can we mitigate modality imbalance in vlms? arXiv preprint arXiv:2501.02669, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:43.191067Z"},"links":{"cited_paper":"/paper/2501.02669","citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:4c7c840751d1b5c0e8e320af04226129b5d528417eda5802d8aa4d171def03f5","observation_id":"1102cc23-3b0f-46de-8988-d3a531a0f46d","resolution":{"observed_at":"2026-08-05T16:32:43.191067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:32:45.267085Z","title":"Balanced multimodal learning via on-the-fly gradient modulation","venue":null,"work_id":"711d36fb-04b0-4fd9-a8a4-acd614840bee","year":2022},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:43.197495Z"},"links":{"citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:504f6bf2c8b5f243d7860fe1d75dd149b8231b33bf3905c70e0df6fb6964a40b","observation_id":"1e58ada7-be1e-4694-8a90-9b7dc3640228","resolution":{"observed_at":"2026-08-05T16:32:45.274551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:32:45.246083Z","title":"Rdkit: Open-source cheminformatics, 2025","venue":null,"work_id":"b0b83fd0-ac24-4513-9d4e-a460802a5eed","year":2025},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:43.204721Z"},"links":{"citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:2927958fb39875ab64c296cb3fb4ff4c420bb96325e82db57fb39d543c6f9f01","observation_id":"c86ab290-9ad4-4a06-9a8a-5cfe6ac0e7dd","resolution":{"observed_at":"2026-08-05T16:32:45.253283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:32:45.220959Z","title":"The music encoding initiative (mei)","venue":null,"work_id":"09def640-8113-41c0-bcb9-a9f693e88563","year":2002},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:43.213015Z"},"links":{"citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:a2a8429965d77f0a0277a953374b1e022d2fd1c59c50ac96520eac05fc140a65","observation_id":"030b90b6-00d8-4128-8338-84030711a36f","resolution":{"observed_at":"2026-08-05T16:32:45.227880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:32:45.201007Z","title":"Music abc notation with music theory dataset, 2025","venue":null,"work_id":"d43e16a9-d816-4256-9ff1-520a23b684e4","year":2025},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:43.217878Z"},"links":{"citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:67c57645e92dcadda2cd13edd928ff802156c186f6cf74cbdd016218999a89eb","observation_id":"717576f2-79b3-4890-8ff8-b1ad6d093217","resolution":{"observed_at":"2026-08-05T16:32:45.207573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.07490","last_updated":"2019-12-03T19:30:19Z","snapshot_observed_at":"2026-08-17T10:15:40.814612Z","submitted_at":"2019-08-20T17:05:18Z","title":"LXMERT: Learning Cross-Modality Encoder Representations from Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.07490","snapshot_observed_at":"2026-08-05T16:32:43.223845Z","title":"Lxmert: Learning cross-modality encoder representations from transformers","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:43.223845Z"},"links":{"cited_paper":"/paper/1908.07490","citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:4eb04615ea4418a73363387f1c9f3a1e2d9bae7432563cbefc3e405412b9cce4","observation_id":"1ead4494-65b0-47ce-81c4-edce3d41d116","resolution":{"observed_at":"2026-08-05T16:32:43.223845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14893","last_updated":"2025-02-17T16:39:19Z","snapshot_observed_at":"2026-08-16T12:57:38.808695Z","submitted_at":"2025-02-17T16:39:19Z","title":"NOTA: Multimodal Music Notation Understanding for Visual Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14893","snapshot_observed_at":"2026-08-05T16:32:43.228974Z","title":"Nota: Multimodal music notation understanding for visual large language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:43.228974Z"},"links":{"cited_paper":"/paper/2502.14893","citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:8c1719d17d4c9d3253ba4710d63ba69faa17b16f450e3cdde3cb3d2af26a3114","observation_id":"7bfb62e6-aa72-44b2-ab6d-5f3d298cc645","resolution":{"observed_at":"2026-08-05T16:32:43.228974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:32:45.176837Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms","venue":null,"work_id":"39049b49-85b8-435f-b44a-aa3fe0419c38","year":2024},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:43.240271Z"},"links":{"citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:1c68eb4253517bbe15a628bffe22c98e646205cc7f7440d409e7ba39583bf866","observation_id":"a33936c0-6748-4474-a156-d578b814e4cb","resolution":{"observed_at":"2026-08-05T16:32:45.183943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T16:32:43.245876Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:43.245876Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:5164a35d32c414781b260d09375c492c1e59aa3786661583ccd3463d065ae1df","observation_id":"4f4a7637-c902-492c-8510-17f51cdf7608","resolution":{"observed_at":"2026-08-05T16:32:43.245876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T16:32:43.252491Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:43.252491Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:6f293d1d0c0549b4f4f2d7d2c9c0f6327f5c5594704af83a11be01a809b06b38","observation_id":"d5e8a843-d464-4c35-a635-ef36e6506200","resolution":{"observed_at":"2026-08-05T16:32:43.252491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:32:43.262505Z","title":"Towards generalist biomedical ai","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:43.262505Z"},"links":{"citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:2f06aa9d4069bb3b8258c7977a46484c3187781a60da0fe048f5131363964cd2","observation_id":"9db96dbe-cb7c-44e1-816d-70403c041b18","resolution":{"observed_at":"2026-08-05T16:32:43.262505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:32:43.268755Z","title":"Visualizing data using t-sne","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:43.268755Z"},"links":{"citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:da94607bf68dbb689002287cf99a9c47e0c558e7bd25bd4438724481d2b4726b","observation_id":"bcd0eec3-4e6b-426a-995d-ffb50898b36d","resolution":{"observed_at":"2026-08-05T16:32:43.268755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13301","last_updated":"2026-05-28T20:37:52Z","snapshot_observed_at":"2026-08-16T12:49:18.142083Z","submitted_at":"2025-03-17T15:45:17Z","title":"LIMCA: LLM for Automating Analog In-Memory Computing Architecture Design Exploration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13301","snapshot_observed_at":"2026-08-05T16:32:43.274487Z","title":"Limca: Llm for automating analog in-memory computing architecture design exploration","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:43.274487Z"},"links":{"cited_paper":"/paper/2503.13301","citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:b1efb24d485f561e7b8b963bca65eb019e4be0d9df31fdd76da371b920ce4970","observation_id":"c6325104-99ae-4d35-ac8a-7ef7ed205511","resolution":{"observed_at":"2026-08-05T16:32:43.274487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:32:45.110743Z","title":"Abc notation standard, 2004","venue":null,"work_id":"b87a0a60-e9cb-46e1-921d-9ec77efc52d6","year":2004},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:43.280710Z"},"links":{"citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:4eb7b4c72ca6ba812ed932a53e3fb39d8fc9d1366ab281547176aed21d6c3435","observation_id":"7364adca-5cf4-40f5-bb5d-e5596374413b","resolution":{"observed_at":"2026-08-05T16:32:45.120670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:32:45.090427Z","title":"Is a picture worth a thousand words? delving into spatial reasoning for vision language models","venue":null,"work_id":"66ecb758-708e-47e9-a17f-82394d92a9ec","year":2025},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:43.285992Z"},"links":{"citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:bbe19e3b4f05eb605c8fcd04652b407f1659bc6da60fdaab33d95eb6eda44eba","observation_id":"9997b4c6-3a97-4216-b471-9464fb84e6e2","resolution":{"observed_at":"2026-08-05T16:32:45.096888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05672","last_updated":"2024-02-08T13:47:50Z","snapshot_observed_at":"2026-08-12T15:58:37.148545Z","submitted_at":"2024-02-08T13:47:50Z","title":"Multilingual E5 Text Embeddings: A Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05672","snapshot_observed_at":"2026-08-05T16:32:43.290623Z","title":"Multilingual e5 text embeddings: A technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:43.290623Z"},"links":{"cited_paper":"/paper/2402.05672","citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:0526cf046389d02fd0b8bd37c07b74e7a7e8de76dcdc078e5561f42c36d812ac","observation_id":"62b0c2fd-bb29-43ab-998c-45fd3d7599f8","resolution":{"observed_at":"2026-08-05T16:32:43.290623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-05T16:32:43.296670Z","title":"Qwen2-vl: Enhancing vision-language model's perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:43.296670Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:e4c5c2e57d621b462738779bc6292587a339a8821a0e4487af78c04739191c85","observation_id":"efab14d9-2a73-482c-a6b2-3b0a7ed6279c","resolution":{"observed_at":"2026-08-05T16:32:43.296670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:32:45.066682Z","title":"Smiles, a chemical language and information system","venue":null,"work_id":"86b2a1c6-ec1e-4e47-8c0d-485ed817c2b3","year":1988},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:43.303240Z"},"links":{"citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:f55d9a8dd011492a3f7a95eac9e5e7545e205cdc351de063d1f64dcfacdf3c09","observation_id":"2f7a46f2-a96e-4f35-8c92-1046bfe948a6","resolution":{"observed_at":"2026-08-05T16:32:45.076071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:32:45.048140Z","title":"Tunesformer: Forming irish tunes with control codes by bar patching","venue":null,"work_id":"1a1c0750-33a2-47ab-ae01-15c147cc49ac","year":2023},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:43.308302Z"},"links":{"citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:c54e4a0503aa887d2b9ccbe20cda0a5754baa99801ebf23a22837e2d1dd494ca","observation_id":"388eac7b-f4f0-4743-b579-35c03b1ed15b","resolution":{"observed_at":"2026-08-05T16:32:45.053819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13478","last_updated":"2024-06-11T10:18:08Z","snapshot_observed_at":"2026-08-16T14:24:52.245092Z","submitted_at":"2024-01-24T14:23:12Z","title":"SciMMIR: Benchmarking Scientific Multi-modal Information Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13478","snapshot_observed_at":"2026-08-05T16:32:43.314453Z","title":"Scimmir: Benchmarking scientific multi-modal information retrieval","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:43.314453Z"},"links":{"cited_paper":"/paper/2401.13478","citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:9b4728cf6f8307213863552d2e8b48c9d3a4ada919a3b3aa2522d8ea85711932","observation_id":"4a82fe10-49e3-4c20-8230-99660a8f39ed","resolution":{"observed_at":"2026-08-05T16:32:43.314453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-05T16:32:43.321030Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:43.321030Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:3175aba4476a700f8878fc61981bedf68f8d60753714ceba999085153ee02fe7","observation_id":"fcd16cd4-e99e-429c-be21-0192a690c04b","resolution":{"observed_at":"2026-08-05T16:32:43.321030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:32:45.029677Z","title":"Lvlm-ehub: A comprehensive evaluation benchmark for large vision-language models","venue":null,"work_id":"947ba376-c287-415f-bd9b-20895541a1f7","year":2024},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:43.328301Z"},"links":{"citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:f99ddd9b3e6b3fc3fbde6f357f2661e40047fb4c65397418b3cb104454224fb5","observation_id":"f7631358-7355-417e-b85b-f59ba3d580eb","resolution":{"observed_at":"2026-08-05T16:32:45.035191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-08-17T11:08:48.802438Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-05T16:32:43.334674Z","title":"Qwen2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:43.334674Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:0af04128d51bd997e4d548b58dd9b5f74538522872efb99ba67312eda77f5402","observation_id":"922727b0-2cc7-4087-acb8-f82ec6c17722","resolution":{"observed_at":"2026-08-05T16:32:43.334674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T16:32:43.341074Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:43.341074Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:9de1c5d8cdb4735afb19f0c9ec0c340276131484a0588ea9bafe60582f6cb655","observation_id":"8f4aed58-150c-4fef-8a03-127c4dbe76ab","resolution":{"observed_at":"2026-08-05T16:32:43.341074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00844","last_updated":"2024-09-01T21:18:14Z","snapshot_observed_at":"2026-08-16T13:22:15.724102Z","submitted_at":"2024-09-01T21:18:14Z","title":"Report Cards: Qualitative Evaluation of Language Models Using Natural Language Summaries","version":1},"cited_work":{"arxiv_id":"2409.00844","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00844","snapshot_observed_at":"2026-08-05T16:32:43.758294Z","title":"Report Cards: Qualitative Evaluation of Language Models Using Natural Language Summaries","venue":"cs.LG","work_id":"9c9e6a32-e631-49e8-8ab9-bde9a81b394c","year":2024},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:43.345892Z"},"links":{"cited_paper":"/paper/2409.00844","citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:5f02dd5cde17b911ee7a668c07f9b5b63bbe0e7bb4c8c078c84e01ac33f0bb2f","observation_id":"5a76350f-abfb-43f5-87c0-66dfb21b3e17","resolution":{"observed_at":"2026-08-05T16:32:43.767477Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:32:45.005289Z","title":"mplug-owl2: Revolutionizing multi-modal large language model with modality collaboration","venue":null,"work_id":"a57a5c1b-003d-42b9-9a25-6b8feaea6d7d","year":2024},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:43.351429Z"},"links":{"citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:184f2f4fc719e4e686e634c4b925cf0eeca3cc570d1950d4c67d68c12a10c7af","observation_id":"c13d70d0-f14c-4ed2-a0d3-a8795c32a985","resolution":{"observed_at":"2026-08-05T16:32:45.012584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":80,"verified_exact":2,"verified_fuzzy":18},"total_outbound_references":121},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 100 of 121 outbound references and 1 inbound Pith citation observation for arXiv:2508.18179."}