Pith. sign in

Paper Citation Record · LEDGER

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models

As of 7 August 2026, this Paper Citation Record lists 100 of 205 outbound references and 2 inbound Pith citation observations for arXiv:2506.12958.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2506.12958 v2

Coverage vector

measured 100 of 205 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T00:39:42.008599Z

measured 102 of 102 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00

measured 2 of 2 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-07-04T00:30:00.449270Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-04T00:39:16.515159Z

Reference resolution

100 of 205 outbound references displayed

  • verified exact3
  • verified fuzzy0
  • unresolved96
  • parse uncertain0
  • malformed identifier1
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 22e77fb1-afc9-447b-ad28-c2aa00bf703f · outbound

This paper cites GPT-4 Technical Report.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models GPT-4 Technical Report

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.615536Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.615536Z digest=sha256:f77fa23ffde086b804afb51293a3725f58c615d3e7b147913767222bca5a9255

Observation 2a72d66f-913d-4913-b4fd-347fd990f34d · outbound

This paper cites Gemini: A Family of Highly Capable Multimodal Models.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Gemini: A Family of Highly Capable Multimodal Models

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.620839Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.620839Z digest=sha256:ba435628e513a9267f3c5015db628253d605d65abedb6cd89cd69e0004ef62f9

Observation fc12aaa7-ac0a-4015-9df2-edbde6fc0274 · outbound

This paper cites On the Opportunities and Risks of Foundation Models.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models On the Opportunities and Risks of Foundation Models

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.625249Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.625249Z digest=sha256:06c764723e32d3c16aa28898a3bbc9270dac863a9128e434d27691230a5ceff6

Observation 2713e6d7-e1c5-4ab0-8c91-1be92280ff06 · outbound

This paper cites The Llama 3 Herd of Models.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models The Llama 3 Herd of Models

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.629791Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.629791Z digest=sha256:dc900b615d9e72c3ca9ed0ca9f887657989bf09c775ff38f63dbfcbcbf047134

Observation dab422af-0405-4654-a183-5bb34a8b6071 · outbound

This paper cites Phi-4 Technical Report.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Phi-4 Technical Report

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.634680Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.634680Z digest=sha256:2b7566b099a721ff2544f886c4c09dde34fcbde84a1e1a1eb79d0b0f6109e42e

Observation 2d5ec7c9-4c18-4cc9-ac07-9ff8ff0158c0 · outbound

This paper cites Islam, A.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Islam, A

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.638742Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.638742Z digest=sha256:843ca193b8b497c7c21bfa92597e02cd40fce22b3f9a3e68fea599f88c5cc12b

Observation 2e1fe199-bb2d-41af-97c4-c0f839cd60d5 · outbound

This paper cites Top General Performance = Top Domain Performance? DomainCodeBench: A Multi-domain Code Generation Benchmark.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Top General Performance = Top Domain Performance? DomainCodeBench: A Multi-domain Code Generation Benchmark

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.642717Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.642717Z digest=sha256:94bcfd73e724cc7920c70d0bf3dc68270b7f2a66c95f8cc3cb3c3ed4da3b3230

Observation 12671620-04e8-46cb-b642-1c477a68f677 · outbound

This paper cites MMRo: Are Multimodal LLMs Eligible as the Brain for In-Home Robotics?.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models MMRo: Are Multimodal LLMs Eligible as the Brain for In-Home Robotics?

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.647061Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.647061Z digest=sha256:f952b4c526606bd7d222f0477ffe99730c31d23f1825008f4aea098c5abf223a

Observation 896f59b5-69ca-47b5-a9eb-80e6d851d4c7 · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.651400Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.651400Z digest=sha256:b9d3df2ef1742066cb6e9728654ac101bbef5fcce808a1ecd466e10e797ce653

Observation e5c6c6a6-9ccf-49b2-9f0d-8b1301c63d1e · outbound

This paper cites Kernan Freire, C.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Kernan Freire, C

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.655386Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.655386Z digest=sha256:bc0e44fd1403cd9f37e80b9c5aca1a88c57029e3729fe7b2d3dab02dfbf876c4

Observation dd1fd5f1-5b1b-4920-ae13-1bda3c35e56d · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.659215Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.659215Z digest=sha256:73ec11d8786633baaa479cb8a67297395318579d3b1e1788953d15f05e3612e8

Observation 73e3fb07-81fa-4fd3-b35a-81b054ecfbed · outbound

This paper cites FDM-Bench: A Comprehensive Benchmark for Evaluating Large Language Models in Additive Manufacturing Tasks.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models FDM-Bench: A Comprehensive Benchmark for Evaluating Large Language Models in Additive Manufacturing Tasks

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.663250Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.663250Z digest=sha256:2435a5d7fdd99ee6cfbfc1855a4604591a1685d2574fd06e6376b22a6724893e

Observation 9fdfcfdb-258b-47a6-8e08-62b3f0b30309 · outbound

This paper cites Fakih, R.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Fakih, R

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.667570Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.667570Z digest=sha256:e331a8275e5d2210b1e2f47ad2a70d262facc18b6ca93b941bd91c8129ca5761

Observation 25ca9dca-1ffa-4aff-809b-27353d0b0d36 · outbound

This paper cites Tizaoui, R.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Tizaoui, R

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.671793Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.671793Z digest=sha256:94e733a827e3c785aefe220f9144802f051da84a07fbd269c4fc20a5ba772e5c

Observation 5a0e13cb-75f2-42cd-bfc2-6b2335e1a9d8 · outbound

This paper cites Incorporating Large Language Models into Production Systems for Enhanced Task Automation and Flexibility.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Incorporating Large Language Models into Production Systems for Enhanced Task Automation and Flexibility

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.676164Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.676164Z digest=sha256:1141b503d5b9a017e5a55d4141a00702821589f330c18a7058f26ac96d1d75f1

Observation 05d52643-c9e0-42da-b3e9-9c86aff446f2 · outbound

This paper cites Ogundare, S.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Ogundare, S

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.679893Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.679893Z digest=sha256:0e547cb94752599d38f2f5b68e66e1f1f8ca1de8051b79189e5ab90f695ee05b

Observation b9dafaaa-0960-46f5-9b17-3d146a08ea74 · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.683409Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.683409Z digest=sha256:5c363c53f05a2f790fd96919a599a0c9efcb7e83d8134581044e5b25cd41c678

Observation 7cb939d5-6d1e-4d3a-af26-a83d0ec9f842 · outbound

This paper cites Large Language Models for Supply Chain Optimization.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Large Language Models for Supply Chain Optimization

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.686873Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.686873Z digest=sha256:b026761482d59367333aceee5dcdb7509c0f1b8002f18f545857d4b96246ec1e

Observation 63640395-7108-44df-8b52-f090b168807f · outbound

This paper cites Raman, A.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Raman, A

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.690624Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.690624Z digest=sha256:ed5a3672eb2ba6a6b4508aee50126a67d5c03c5d3116f687e5c9d525dbffc421

Observation b424281b-a063-4232-949d-841fb688cb6f · outbound

This paper cites Developing a Scalable Benchmark for Assessing Large Language Models in Knowledge Graph Engineering.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Developing a Scalable Benchmark for Assessing Large Language Models in Knowledge Graph Engineering

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.693989Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.693989Z digest=sha256:89c7c02b913e7220bffa71da021bf3e578fcfb750d2bd5e80866117d0a3bec5b

Observation 0c13e9a4-b54e-4bbd-97a8-2a3e11e63f50 · outbound

This paper cites bench authors, Beyond the imitation game: Quantify- ing and extrapolating the capabilities of language models, Transactions on Machine Learning Research (2023).

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models bench authors, Beyond the imitation game: Quantify- ing and extrapolating the capabilities of language models, Transactions on Machine Learning Research (2023)

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.697905Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.697905Z digest=sha256:8237af9a1507b4162478eefff5361a2f58f91606ba86d3dd7d0abb7aaab8bc9c

Observation 47aa9c45-576d-4b16-8f9c-02610589c765 · outbound

This paper cites Tracking the Moving Target: A Framework for Continuous Evaluation of LLM Test Generation in Industry.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Tracking the Moving Target: A Framework for Continuous Evaluation of LLM Test Generation in Industry

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.701052Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.701052Z digest=sha256:624750de584831c7f19720a5e6c6443ab835b2fccc88c46aaac173288c71f566

Observation 45969fe8-4c72-4500-9457-8a31e174c01a · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.705145Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.705145Z digest=sha256:42f11aff1f6ac19ec1f3235e4b730dbba9cb1fcc91c47e0c97e444ab949489c6

Observation 7b743598-c7ce-4dea-8175-0ada8e673ef5 · outbound

This paper cites A Survey on Large Language Models for Software Engineering.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models A Survey on Large Language Models for Software Engineering

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.708804Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.708804Z digest=sha256:1f2dfee10d5e10ebcefcd7ea36f8ee2658c1ce93b81d514b478af3fc7840807c

Observation cc39fc4f-2268-4700-b4e3-773a03027744 · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.713136Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.713136Z digest=sha256:afc15b39fe25abb4f69e6b8015f55c50c5c20b2ec568930b54d5be58c5c090d6

Observation 7ee961ce-1b53-4b12-a41e-1fa960769104 · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.717289Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.717289Z digest=sha256:b2182b7fc094cf49deb6e71cf83a7f2ca20973d153e66bd58176ca1d430ea151

Observation d35071e2-6a71-4045-afaa-bd7f04821575 · outbound

This paper cites Do Large Language Model Benchmarks Test Reliability?.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Do Large Language Model Benchmarks Test Reliability?

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.721221Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.721221Z digest=sha256:853ce68ad053863709b916a3765e22ee3164cb52a90268763aee7f1d584fcaa9

Observation 17853490-1b3d-4947-a2fe-55801a832645 · outbound

This paper cites Trustworthy LLMs: a Survey and Guideline for Evaluating Large Language Models' Alignment.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Trustworthy LLMs: a Survey and Guideline for Evaluating Large Language Models' Alignment

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.725446Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.725446Z digest=sha256:affdec6078d3c81a0b12bcac7eac1875721b5b9537a1ad47eaaeec5fbbef88bd

Observation bb7f8507-1658-4704-845c-110ed6a0b86d · outbound

This paper cites TEOChat: A Large Vision-Language Assistant for Temporal Earth Observation Data.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models TEOChat: A Large Vision-Language Assistant for Temporal Earth Observation Data

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.729658Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.729658Z digest=sha256:9545b4b01e86b8773e43c13290b7b027e2a3dd4031adf6cdcc0854cdc41a78a6

Observation 17eb8b0d-4c3d-43df-a02b-1b633efb8d05 · outbound

This paper cites Xiong, F.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Xiong, F

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.733804Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.733804Z digest=sha256:54eddc3485bf2f8a6f41bfd23971ef954e00332b177397d0fdb8f9c0c98fa045

Observation 6d95f1cf-d097-4862-953f-7717116ca134 · outbound

This paper cites Good at captioning, bad at counting: Benchmarking GPT-4V on Earth observation data.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Good at captioning, bad at counting: Benchmarking GPT-4V on Earth observation data

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.737914Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.737914Z digest=sha256:8643fc28bddd81cbe3e1b364a801d387ff85cbe34342d67c7428387f27c7d180

Observation eeca5cda-ba16-4d8f-a648-34cd90fe1baf · outbound

This paper cites STBench: Assessing the Ability of Large Language Models in Spatio-Temporal Analysis.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models STBench: Assessing the Ability of Large Language Models in Spatio-Temporal Analysis

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.742261Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.742261Z digest=sha256:f4df96e99da70e0b3508b6f9ee621573780abbcb67f7353469f64434b6c8550e

Observation 5b9f2c1f-ef36-4b4d-b51d-6a480b1277d6 · outbound

This paper cites Sapkota, R.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Sapkota, R

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.746251Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.746251Z digest=sha256:31c23c0cdd8caf36475b25b6cbaec778d2602420ee45be20d3e819c5e1a76b27

Observation cf07693c-673d-4c7d-b64e-d7774d47fbc0 · outbound

This paper cites GEOBench-VLM: Benchmarking Vision-Language Models for Geospatial Tasks.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models GEOBench-VLM: Benchmarking Vision-Language Models for Geospatial Tasks

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.749497Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.749497Z digest=sha256:b9f467e835623702a7481c4cd9e50a8f43000409b59060e904a8bf897761d038

Observation 015b86be-6aba-4bcd-b163-d57f470b86b4 · outbound

This paper cites Roberts, T.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Roberts, T

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.753415Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.753415Z digest=sha256:02a2172a536469f882fd643b259aa5e58990d78014e4daa415e885a73504b067

Observation 34c328bb-c4b8-44cc-a63f-6325c4738d5e · outbound

This paper cites RSUniVLM: A Unified Vision Language Model for Remote Sensing via Granularity-oriented Mixture of Experts.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models RSUniVLM: A Unified Vision Language Model for Remote Sensing via Granularity-oriented Mixture of Experts

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.756940Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.756940Z digest=sha256:21a5ba27ffc2c4d768a2ed3658234df13e29b4b92b5f2215a91c0d086e4d36e8

Observation 0ae8ff29-4cde-422d-9dc3-fd203fb620dc · outbound

This paper cites INS-MMBench: A Comprehensive Benchmark for Evaluating LVLMs' Performance in Insurance.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models INS-MMBench: A Comprehensive Benchmark for Evaluating LVLMs' Performance in Insurance

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.760849Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.760849Z digest=sha256:c28937fcefdf993016714c26a6c5b24d90710b4443188d77830229a168fe36f3

Observation fd27debd-ccab-4ec9-92b2-ad2e80910fd5 · outbound

This paper cites Measuring Massive Multitask Language Understanding.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Measuring Massive Multitask Language Understanding

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.765231Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.765231Z digest=sha256:3bbffa435d6877a8dc91310c4b10d3bc077a3d38dae70faab72efd7c451deb22

Observation ac4b8cd4-8a23-424e-9d88-6719ffc816ec · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.769927Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.769927Z digest=sha256:d3dcb4d86b372ed9b89235c86cdb6ce37d85602d355af562ac9473efc7075ceb

Observation bfc5a169-50ce-4d1c-a3ec-7ea13cd751fe · outbound

This paper cites IsoBench: Benchmarking Multimodal Foundation Models on Isomorphic Representations.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models IsoBench: Benchmarking Multimodal Foundation Models on Isomorphic Representations

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.773291Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.773291Z digest=sha256:37aaef7072a52e2c6fc9b10d0222a3854133332a6b7b6ed26ac0afe49b24d55e

Observation baa06e3f-ace0-4e5d-a9bd-4ce2120fd3b3 · outbound

This paper cites VisScience: An Extensive Benchmark for Evaluating K12 Educational Multi-modal Scientific Reasoning.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models VisScience: An Extensive Benchmark for Evaluating K12 Educational Multi-modal Scientific Reasoning

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.777416Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.777416Z digest=sha256:6e52dc8d81b42325d03dfcf82db8b6f7270d5fc1d664a4d5e70e2ae6ca741082

Observation b036bad6-e0c1-4035-8597-db4a9a169700 · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.781930Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.781930Z digest=sha256:c92341df992b98b12fbe6a127b7e384ecfa9959f5cc01da2c742f80b0851ad70

Observation 662fbc80-6ba8-4a53-b9e9-fa7625348af0 · outbound

This paper cites Anand, J.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Anand, J

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.786215Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.786215Z digest=sha256:e43a3ca36056a5dd5ca460f6ed27d9166a9c94f7e78ebec6af3fd67c7d395069

Observation 459e5491-99e7-4447-84c4-e24d25bb03ee · outbound

This paper cites Are large language models superhuman chemists?.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Are large language models superhuman chemists?

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.790176Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.790176Z digest=sha256:fa39089d7bfebba85c2a47fb51841f38a207c93028f16a6e80baf8d3b0568c5d

Observation 76e129ff-fae7-4056-b42c-d2b49e42a482 · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.793728Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.793728Z digest=sha256:d5517e6fd1d86e20c244d506329f7e4b394a6a97c30c34441ffcd9f4f0c9d0e5

Observation 163d8c6b-3890-4bb6-996f-6c7ca2aeb36c · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.797220Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.797220Z digest=sha256:829d54ec1a682cc2d2af5c654c071298c63fe36a8cd2e0f1410ab900febdce6c

Observation 0575fa89-83cc-4a9d-93c6-9b3f9879ba57 · outbound

This paper cites LlaSMol: Advancing Large Language Models for Chemistry with a Large-Scale, Comprehensive, High-Quality Instruction Tuning Dataset.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models LlaSMol: Advancing Large Language Models for Chemistry with a Large-Scale, Comprehensive, High-Quality Instruction Tuning Dataset

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.800506Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.800506Z digest=sha256:b86d211ffb6be169c901944b2b0d367eb837d79d58b598a03a56914b8023d448

Observation 2f3217dd-187c-45ef-a60f-244cc6f64d7f · outbound

This paper cites MaScQA: A Question Answering Dataset for Investigating Materials Science Knowledge of Large Language Models.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models MaScQA: A Question Answering Dataset for Investigating Materials Science Knowledge of Large Language Models

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.803960Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.803960Z digest=sha256:3bf0ce6b72d631014494c726ade17d2b516b2839894f8088a5105078bfdc1c66

Observation 876bb9b6-fd8a-4277-b1b4-f02d497effad · outbound

This paper cites LLM4Mat-Bench: Benchmarking Large Language Models for Materials Property Prediction.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models LLM4Mat-Bench: Benchmarking Large Language Models for Materials Property Prediction

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.808360Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.808360Z digest=sha256:eff8e39e06115a8a6d534ba8cfc065e986032f5358131a33ef0f99ad58a6af46

Observation 406b8ac6-39e1-4b40-b5df-853c56e65809 · outbound

This paper cites PRESTO: Progressive Pretraining Enhances Synthetic Chemistry Outcomes.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models PRESTO: Progressive Pretraining Enhances Synthetic Chemistry Outcomes

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.812250Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.812250Z digest=sha256:c6db998571136ba59d01280625babac0217b2ef876a895150c75d8c803a3e3a3

Observation d6541dfb-3b14-4440-bd58-ac9be06d78d7 · outbound

This paper cites DrugLLM: Open Large Language Model for Few-shot Molecule Generation.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models DrugLLM: Open Large Language Model for Few-shot Molecule Generation

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.816638Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.816638Z digest=sha256:79c1d6f5c585cd929563dabee2faa9c1aaf0eac46ae5c1eaa436fcbdc7229830

Observation 3eb95384-25ce-4589-b119-8b09891e2168 · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.820824Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.820824Z digest=sha256:72d579db4b7ef828f9b880dfb4e0dceedd83fc61daf3a2283bb8b06f20007afd

Observation 415390c2-1227-465c-a149-c8999ed55dd9 · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.824182Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.824182Z digest=sha256:f194d4bd64bd3150bc781d19eaf3c5501930a2604daa0734b38cfd62b52c0e8c

Observation 93e70b19-314a-48b5-acf5-924ffa0a41da · outbound

This paper cites WeatherQA: Can Multimodal Language Models Reason about Severe Weather?.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models WeatherQA: Can Multimodal Language Models Reason about Severe Weather?

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.827755Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.827755Z digest=sha256:e843ff9461351e671d3429ecda88c06ae1dd80d945d540528dfb448c5951f2be

Observation 41ddf636-1a72-4f42-96eb-c37e8d8960f4 · outbound

This paper cites CLLMate: A Multimodal Benchmark for Weather and Climate Events Forecasting.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models CLLMate: A Multimodal Benchmark for Weather and Climate Events Forecasting

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.831109Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.831109Z digest=sha256:a67d39cabbef89d279b3f1d17efd80feca582f99e5a8179c9cf974616fb09b0c

Observation 486c1bb9-f746-4797-84f8-7a75078d10f1 · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.834875Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.834875Z digest=sha256:0c72ece4664cb99271397cb0c95f35ee35cf02e4b665e3a0cec61ef7a9b515be

Observation 3f31b45e-c978-44a9-b2c7-21cf96fea40b · outbound

This paper cites DisasterQA: A Benchmark for Assessing the performance of LLMs in Disaster Response.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models DisasterQA: A Benchmark for Assessing the performance of LLMs in Disaster Response

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.838053Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.838053Z digest=sha256:94373ac756fb0f9f161fa62e8f0f04987c866ce2ba2bb9793609018633b2439b

Observation 2cc6b699-4760-4877-b558-46206ff6317c · outbound

This paper cites VayuBuddy: an LLM-Powered Chatbot to Democratize Air Quality Insights.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models VayuBuddy: an LLM-Powered Chatbot to Democratize Air Quality Insights

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.842241Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.842241Z digest=sha256:04ebb449b32ba8738bbcee7a0c08cd8d8d907af188cf4945ac2862f03f0f3051

Observation 6c9f8696-69cb-47b7-a1e1-b90cfe7cac76 · outbound

This paper cites Pafilis, S.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Pafilis, S

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.845914Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.845914Z digest=sha256:3ad1e058a8c08dd26bd2f438ce59dfec0dbd6f6e63e1d02e30e73e26f55b4436

Observation 9eb06b2f-9f5f-4d75-85f6-9c591c69a61d · outbound

This paper cites Abdelmageed, F.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Abdelmageed, F

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.849964Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.849964Z digest=sha256:df227c3bd5a4c087a342e445fd5abb13cd7145a9414a910dd3dffd7c781da955

Observation 8b5a2ea4-e28b-4999-bdba-2db041a08b62 · outbound

This paper cites Are We Done with MMLU?.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Are We Done with MMLU?

Reference 61

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.854056Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.854056Z digest=sha256:cb0b6316d3e2924ce9b55a27ac24101c97239d75c6a314f9d370f0404918d791

Observation 2152909a-75c5-43c6-a38a-7605a0e9bed3 · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 62

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.858056Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.858056Z digest=sha256:ae7a37bbf67b3ea575c1290326b332d5372fccf9c8b9547a604b68c934ff06c1

Observation 69fbe33a-b4be-4c9f-805d-4e5daa08b57d · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 63

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.862211Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.862211Z digest=sha256:eb7fad023e48d5a5a2ed0683af15fd7cc175a9679f980eea05fbf2a0f880aef3

Observation dcd02d8a-d1de-4d28-aacf-f6280cf63d25 · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.866695Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.866695Z digest=sha256:2b18a18bdb2b17d66aa8c1215b13a5a7cc32919b6c4cc80d15c0510f5f4df95d

Observation 8df08264-9de2-4a25-9421-78599b826a8a · outbound

This paper cites Edwards, C.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Edwards, C

Reference 65

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.871055Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.871055Z digest=sha256:d64f094f592cc69dacd2504a02fdcd3bdd12ba6b0360d568bb17810acf6ea1f6

Observation c85c5585-2d02-4e62-83a8-08718fe9be40 · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 66

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.874459Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.874459Z digest=sha256:8c097e12212646dcc2b09e08c93c27756b50138d2d23db2a36d5efcdbe484ae0

Observation 29ea0a6b-e898-411e-ad3f-02daf9765111 · outbound

This paper cites Davies, M.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Davies, M

Reference 67

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.877742Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.877742Z digest=sha256:6a224a351de5a60a53516463582f83396b9073c5b216f1252ff31c292a4c034d

Observation d09c6ae9-ac48-4e4e-a5fc-94a52fb674a1 · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 68

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.881368Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.881368Z digest=sha256:863eb539fd4a5ee7e9063b7f04f0561e9a00207d349583e6d501b5bcb50fd77c

Observation f36fd6d9-a808-4022-af84-409d5deabdbc · outbound

This paper cites ClimateLLM: Efficient Weather Forecasting via Frequency-Aware Large Language Models.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models ClimateLLM: Efficient Weather Forecasting via Frequency-Aware Large Language Models

Reference 69

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.885548Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.885548Z digest=sha256:043d7fb77570b9c89dd43d21cf6e993812ad4a6fdd948a084a94c808a02ae8f6

Observation fcbc7896-1894-40fe-b9dd-46279ab48d66 · outbound

This paper cites Sachdeva, N.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Sachdeva, N

Reference 70

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.889997Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.889997Z digest=sha256:b790423740fed1c1ccb59ce5935088fd871f62f9ce7672979ea05211723d74e6

Observation 583c3fae-d05a-4577-b23f-b0ebfb43c860 · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 71

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.893920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.893920Z digest=sha256:3899f551876f821074097f28a00cf0a6a2b9995600cbc02658f5d73eafd3d087

Observation 87d2ce94-80e9-4f9f-84f4-36e3d86f93aa · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 72

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.898305Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.898305Z digest=sha256:710708632ead4a7ea9ae1878bef21a539b4b4642d478fb0ec4fb8a17ffe7431b

Observation 10caa8a0-72a9-4ec0-98a5-e370804464e0 · outbound

This paper cites Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs

Reference 73

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.902404Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.902404Z digest=sha256:7a2f61af60b8e56a4fef78f44c94660c27b63de212bfc0c04bba266d992769e9

Observation ec9c7d18-c642-40cc-8285-665c74826ec4 · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 74

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.906598Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.906598Z digest=sha256:d987c4ed4482c2b505841f33f8acbd8612d45b8eee907c18bae5c68f0f5f3d2d

Observation 5455bd5c-2f4d-43bb-a23f-b15c5e66c49b · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 75

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.910567Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.910567Z digest=sha256:862272d23e2fe548ee9e3e359fbc5190588baa4ca9c607db74f18660bb3d8a1e

Observation baec2d01-64f0-431e-9c3b-1387ed1e70d7 · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 76

Resolution
verified exact
doi, observed 2026-08-07T00:39:42.734627Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T00:39:41.914769Z digest=sha256:6c3b7e2f88a76ea6d48caae95b853f8019774cbd04a091b8f86247da3d43089f

Observation 0caf4c69-bfbb-473c-a4b0-3963e0ca5858 · outbound

This paper cites Malla, C.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Malla, C

Reference 77

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.918902Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.918902Z digest=sha256:d85d3f5ba1e075b277c66fb2df01753ef3f10d82a4ffd14d8908cb5e19733903

Observation c9162ea3-2b41-4700-ba06-e3dfa2ae021f · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 78

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.923821Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.923821Z digest=sha256:12e47f4024ef07b874d913b2206ef1378dfb15c3f4088bb0d83bd5987db7f325

Observation 63c4f861-85b8-434c-87bf-7574c59db5c1 · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 79

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.927310Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.927310Z digest=sha256:9bdb3176f268692c03b22c4f9a39f24620ffdfc3864378b24c6a696e43ca3fe7

Observation c4ab97bc-27da-4f8e-9709-5ffd9cff91f4 · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 80

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.931577Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.931577Z digest=sha256:a623f9163c88b86e9013af05879dd9161030e3d5ea9b005229994a57393ae5cb

Observation 13e19500-827b-4e73-9199-aba13927bfa1 · outbound

This paper cites Language Prompt for Autonomous Driving.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Language Prompt for Autonomous Driving

Reference 81

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.935007Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.935007Z digest=sha256:d031297c7e108d0a3a20a4c34b1804290c90efcfd9c2c44f35353fe5ff6d8b32

Observation dd094b8a-70e8-4055-978a-0dea2ce54259 · outbound

This paper cites Logic Meets Magic: LLMs Cracking Smart Contract Vulnerabilities.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Logic Meets Magic: LLMs Cracking Smart Contract Vulnerabilities

Reference 82

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.938501Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.938501Z digest=sha256:6a0ffb5e248eece9e9774e0e44077a6a4121921f502104f0f9f7c4db73012b34

Observation 996de77b-5907-42c1-86da-fd6bac78b1a6 · outbound

This paper cites LLM-SmartAudit: Advanced Smart Contract Vulnerability Detection.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models LLM-SmartAudit: Advanced Smart Contract Vulnerability Detection

Reference 83

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.941957Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.941957Z digest=sha256:c3d36caa87711660874a7677d694ba485535eb35fb4adeefdf3be42c5c67b39c

Observation 7dd2f9f2-e621-41c1-a09b-05ad1de09f48 · outbound

This paper cites ACFIX: Guiding LLMs with Mined Common RBAC Practices for Context-Aware Repair of Access Control Vulnerabilities in Smart Contracts.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models ACFIX: Guiding LLMs with Mined Common RBAC Practices for Context-Aware Repair of Access Control Vulnerabilities in Smart Contracts

Reference 84

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.946070Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.946070Z digest=sha256:5df7788e7497e3f23bad544e667fab5da0b530655f7267c1e91a65f34dce9a56

Observation 1a3b0867-df9e-4ef7-9dcf-32fde5867a49 · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 85

Resolution
malformed identifier
no resolver link, observed 2026-08-07T00:39:41.950892Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.950892Z digest=sha256:b80ec73f6286d7cc614b9391a25b9d2b3dd3f4ae12f3565e4b4cdc2fa1ea5f7b

Observation 2c5e8517-ba74-46e8-a590-7cff7c738c7b · outbound

This paper cites Ethereum Price Prediction Employing Large Language Models for Short-term and Few-shot Forecasting.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Ethereum Price Prediction Employing Large Language Models for Short-term and Few-shot Forecasting

Reference 86

Resolution
verified exact
local_arxiv, observed 2026-08-07T00:39:43.674504Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T00:39:41.955259Z digest=sha256:2a5718531805b56e9d989a649f364522c67776285e639aa7b29869413c289512

Observation e6879f06-fd77-45b5-a5d3-6705c5f77814 · outbound

This paper cites Exploring LLM Cryptocurrency Trading Through Fact-Subjectivity Aware Reasoning.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Exploring LLM Cryptocurrency Trading Through Fact-Subjectivity Aware Reasoning

Reference 87

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.958895Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.958895Z digest=sha256:e37ba9fa7ea7ee8ae197d5b331a52df40dfdffa836cb0b85fa55ebebf0dfc6dd

Observation bb59d99e-d90b-4048-864e-43c08836a429 · outbound

This paper cites Large Language Models for Blockchain Security: A Systematic Literature Review.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Large Language Models for Blockchain Security: A Systematic Literature Review

Reference 88

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.963490Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.963490Z digest=sha256:c93d8211dbc78168d4641d92ba99ce04590e2a9fe6be8cddd9849048c09d8007

Observation ff40ad15-0fd6-4ffb-b399-4d85b0dd2199 · outbound

This paper cites Large Language Models in Cryptocurrency Securities Cases: Can a GPT Model Meaningfully Assist Lawyers?.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Large Language Models in Cryptocurrency Securities Cases: Can a GPT Model Meaningfully Assist Lawyers?

Reference 89

Resolution
verified exact
local_arxiv, observed 2026-08-07T00:39:43.636560Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T00:39:41.967124Z digest=sha256:7b441838da328aec10dd2b71766fc13d87dba050b4cdf78a2326654363da2ddc

Observation 63d28df8-52ec-428a-852e-e42117a0f360 · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 90

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.970780Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.970780Z digest=sha256:b6fb03bc9173728192cb7e6f8744048b1863a5b6e3eefcbcfd71e8b59218b6eb

Observation 454c4815-e6e7-4b6b-a6d9-fcc3d40cc7c8 · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 91

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.974138Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.974138Z digest=sha256:eef552d001f6a4032c7d3febf4794b3aea5758ec5785241e48995e3595690b53

Observation 7d63b3f8-0a63-489c-8ce9-aebedf8a93a2 · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 92

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.978237Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.978237Z digest=sha256:ee956ef21c7843779244c33a80e370c8dd67ad6d1808235bb4927715abdb772f

Observation 756b38bf-bb3d-4f4e-bd0e-7aed0526441d · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 93

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.981737Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.981737Z digest=sha256:d4fcc8967797265ed9fccd4ecfd32bceda442d13cf358499f6e414596dd29442

Observation ce57edaf-9138-4a1a-9e8a-22fb1fcea8b4 · outbound

This paper cites WHEN FLUE MEETS FLANG: Benchmarks and Large Pre-trained Language Model for Financial Domain.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models WHEN FLUE MEETS FLANG: Benchmarks and Large Pre-trained Language Model for Financial Domain

Reference 94

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.985661Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.985661Z digest=sha256:f18634ed2fef22f5d9b5eea1f09470d4a2b471658a228ce69e9d268d3c732ba1

Observation 3cbfd683-b20e-4fe3-9865-c3d859638272 · outbound

This paper cites LogLLM: Log-based Anomaly Detection Using Large Language Models.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models LogLLM: Log-based Anomaly Detection Using Large Language Models

Reference 95

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.989841Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.989841Z digest=sha256:abcc5e5ec1c119b2a63c72726cba746521fc78d7677713fc96d8e293204b47ee

Observation 9b129a3a-eb73-4630-ac44-4989b94424b5 · outbound

This paper cites Real-Time Anomaly Detection and Reactive Planning with Large Language Models.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Real-Time Anomaly Detection and Reactive Planning with Large Language Models

Reference 96

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.994028Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.994028Z digest=sha256:4c9fdfe3bf9c26741ed1eb85476ded696dbc819e2457cfaec1facd085e4dd2ae

Observation 83ec3f38-6365-431b-9bab-001ec26a5cc6 · outbound

This paper cites Zhang, D.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Zhang, D

Reference 97

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:41.997779Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:41.997779Z digest=sha256:15f63aeb81014269daaaefa00404ccaafc38e1f9c48dbea6a0b7ff412f69bc29

Observation ff885e08-d07b-475e-be47-43864ae90972 · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 98

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:42.001073Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:42.001073Z digest=sha256:8e45ca01431dd669d22841f51e0c97ac4ace019d798537419af8329024a484b1

Observation 215976d9-09fb-4dac-9b96-68245e69699a · outbound

This paper cites an unresolved cited work.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models Unresolved cited work

Reference 99

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:42.005109Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:42.005109Z digest=sha256:7220c78b2a2fa64e5a8cd115f41c2076df0a7dfec8d0e2248b513b34d2939604

Observation d3d98513-624c-4268-8633-5f40cf866eda · outbound

This paper cites MathChat: Benchmarking Mathematical Reasoning and Instruction Following in Multi-Turn Interactions.

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models MathChat: Benchmarking Mathematical Reasoning and Instruction Following in Multi-Turn Interactions

Reference 100

Resolution
unresolved
no resolver link, observed 2026-08-07T00:39:42.008599Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:39:42.008599Z digest=sha256:eefdee3b65a632df78119bffbcdd8d9f7a1d5b8afd9d789f6f8f4884af252697

Pith citing papers

Observation 203daee5-81f4-4de5-b65e-c0cebffff883 · inbound

ResearchClawBench: A Benchmark for End-to-End Autonomous Scientific Research cites this paper.

ResearchClawBench: A Benchmark for End-to-End Autonomous Scientific Research Domain Specific Benchmarks for Evaluating Multimodal Large Language Models

Reference 22

Resolution
verified exact
arxiv_id, observed 2026-06-29T08:33:15.815319Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-06-29T08:24:42.412763Z digest=sha256:6467edb6f8bb073762944ef9e0ce6a1e25700cde3c5fce05e4e449874827c8b2

Observation b41655b5-201e-41b0-9551-43758eaa1c12 · inbound

ResearchClawBench: A Benchmark for End-to-End Autonomous Scientific Research cites this paper.

ResearchClawBench: A Benchmark for End-to-End Autonomous Scientific Research Domain Specific Benchmarks for Evaluating Multimodal Large Language Models

Reference 22

Resolution
verified exact
arxiv_id, observed 2026-07-04T00:39:16.517228Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-07-04T00:30:00.449270Z digest=sha256:ce274c4baabee81fc43571c7bc94c710c70e830722c279c7708a70d21695c4df