{"as_of":"2026-08-07T15:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d920cc39c7fa03a2ef62fef422c0096abfb77318f196a0778d06077792098941","coverage":[{"denominator":205,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:39:42.008599Z","state":"measured"},{"denominator":102,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":102,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-04T00:30:00.449270Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T00:39:16.515159Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2506.12958","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.12958","snapshot_observed_at":"2026-07-04T00:39:16.515159Z","title":"arXiv preprint arXiv:2506.12958 , year=","venue":null,"work_id":"b80d64c4-9365-49a2-9d79-e4a6dd45cd98","year":null},"citing_paper":{"arxiv_id":"2606.07591","last_updated":"2026-07-03T01:40:25Z","snapshot_observed_at":"2026-08-02T19:22:43.861659Z","submitted_at":"2026-05-28T16:27:40Z","title":"ResearchClawBench: A Benchmark for End-to-End Autonomous Scientific Research","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-29T08:24:42.412763Z"},"links":{"cited_paper":"/paper/2506.12958","citing_paper":"/paper/2606.07591"},"observation_digest":"sha256:6467edb6f8bb073762944ef9e0ce6a1e25700cde3c5fce05e4e449874827c8b2","observation_id":"203daee5-81f4-4de5-b65e-c0cebffff883","resolution":{"observed_at":"2026-06-29T08:33:15.815319Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2506.12958","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.12958","snapshot_observed_at":"2026-07-04T00:39:16.515159Z","title":"arXiv preprint arXiv:2506.12958 , year=","venue":null,"work_id":"b80d64c4-9365-49a2-9d79-e4a6dd45cd98","year":null},"citing_paper":{"arxiv_id":"2606.07591","last_updated":"2026-07-03T01:40:25Z","snapshot_observed_at":"2026-08-02T19:22:43.861659Z","submitted_at":"2026-05-28T16:27:40Z","title":"ResearchClawBench: A Benchmark for End-to-End Autonomous Scientific Research","version":4},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-07-04T00:30:00.449270Z"},"links":{"cited_paper":"/paper/2506.12958","citing_paper":"/paper/2606.07591"},"observation_digest":"sha256:ce274c4baabee81fc43571c7bc94c710c70e830722c279c7708a70d21695c4df","observation_id":"b41655b5-201e-41b0-9551-43758eaa1c12","resolution":{"observed_at":"2026-07-04T00:39:16.517228Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.12958/citation-record","integrity":"/paper/2506.12958/integrity","json":"/paper/2506.12958/citation-record.json","paper":"/paper/2506.12958"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T00:39:41.615536Z","title":"Achiam, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.615536Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:f77fa23ffde086b804afb51293a3725f58c615d3e7b147913767222bca5a9255","observation_id":"22e77fb1-afc9-447b-ad28-c2aa00bf703f","resolution":{"observed_at":"2026-08-07T00:39:41.615536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T00:39:41.620839Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.620839Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:ba435628e513a9267f3c5015db628253d605d65abedb6cd89cd69e0004ef62f9","observation_id":"2a72d66f-913d-4913-b4fd-347fd990f34d","resolution":{"observed_at":"2026-08-07T00:39:41.620839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07258","last_updated":"2022-07-12T23:45:14Z","snapshot_observed_at":"2026-08-02T09:20:40.804790Z","submitted_at":"2021-08-16T17:50:08Z","title":"On the Opportunities and Risks of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07258","snapshot_observed_at":"2026-08-07T00:39:41.625249Z","title":"Bommasani, D","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.625249Z"},"links":{"cited_paper":"/paper/2108.07258","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:06c764723e32d3c16aa28898a3bbc9270dac863a9128e434d27691230a5ceff6","observation_id":"fc12aaa7-ac0a-4015-9df2-edbde6fc0274","resolution":{"observed_at":"2026-08-07T00:39:41.625249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T00:39:41.629791Z","title":"Grattafiori, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.629791Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:dc900b615d9e72c3ca9ed0ca9f887657989bf09c775ff38f63dbfcbcbf047134","observation_id":"2713e6d7-e1c5-4ab0-8c91-1be92280ff06","resolution":{"observed_at":"2026-08-07T00:39:41.629791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08905","last_updated":"2024-12-12T03:37:41Z","snapshot_observed_at":"2026-08-05T04:04:21.846023Z","submitted_at":"2024-12-12T03:37:41Z","title":"Phi-4 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08905","snapshot_observed_at":"2026-08-07T00:39:41.634680Z","title":"Abdin, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.634680Z"},"links":{"cited_paper":"/paper/2412.08905","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:2b7566b099a721ff2544f886c4c09dde34fcbde84a1e1a1eb79d0b0f6109e42e","observation_id":"dab422af-0405-4654-a183-5bb34a8b6071","resolution":{"observed_at":"2026-08-07T00:39:41.634680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.638742Z","title":"Islam, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.638742Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:843ca193b8b497c7c21bfa92597e02cd40fce22b3f9a3e68fea599f88c5cc12b","observation_id":"2d5ec7c9-4c18-4cc9-ac07-9ff8ff0158c0","resolution":{"observed_at":"2026-08-07T00:39:41.638742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18573","last_updated":"2025-03-17T17:58:13Z","snapshot_observed_at":"2026-07-06T20:12:54.710203Z","submitted_at":"2024-12-24T17:56:08Z","title":"Top General Performance = Top Domain Performance? DomainCodeBench: A Multi-domain Code Generation Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18573","snapshot_observed_at":"2026-08-07T00:39:41.642717Z","title":"Zheng, Y","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.642717Z"},"links":{"cited_paper":"/paper/2412.18573","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:94bcfd73e724cc7920c70d0bf3dc68270b7f2a66c95f8cc3cb3c3ed4da3b3230","observation_id":"2e1fe199-bb2d-41af-97c4-c0f839cd60d5","resolution":{"observed_at":"2026-08-07T00:39:41.642717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19693","last_updated":"2024-06-28T07:09:06Z","snapshot_observed_at":"2026-08-07T01:30:50.024771Z","submitted_at":"2024-06-28T07:09:06Z","title":"MMRo: Are Multimodal LLMs Eligible as the Brain for In-Home Robotics?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19693","snapshot_observed_at":"2026-08-07T00:39:41.647061Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.647061Z"},"links":{"cited_paper":"/paper/2406.19693","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:f952b4c526606bd7d222f0477ffe99730c31d23f1825008f4aea098c5abf223a","observation_id":"12671620-04e8-46cb-b642-1c477a68f677","resolution":{"observed_at":"2026-08-07T00:39:41.647061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.651400Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.651400Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:b9d3df2ef1742066cb6e9728654ac101bbef5fcce808a1ecd466e10e797ce653","observation_id":"896f59b5-69ca-47b5-a9eb-80e6d851d4c7","resolution":{"observed_at":"2026-08-07T00:39:41.651400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.655386Z","title":"Kernan Freire, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.655386Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:bc0e44fd1403cd9f37e80b9c5aca1a88c57029e3729fe7b2d3dab02dfbf876c4","observation_id":"e5c6c6a6-9ccf-49b2-9f0d-8b1301c63d1e","resolution":{"observed_at":"2026-08-07T00:39:41.655386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.659215Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.659215Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:73ec11d8786633baaa479cb8a67297395318579d3b1e1788953d15f05e3612e8","observation_id":"dd1fd5f1-5b1b-4920-ae13-1bda3c35e56d","resolution":{"observed_at":"2026-08-07T00:39:41.659215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09819","last_updated":"2024-12-13T03:16:14Z","snapshot_observed_at":"2026-07-06T20:06:17.706151Z","submitted_at":"2024-12-13T03:16:14Z","title":"FDM-Bench: A Comprehensive Benchmark for Evaluating Large Language Models in Additive Manufacturing Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09819","snapshot_observed_at":"2026-08-07T00:39:41.663250Z","title":"Eslaminia, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.663250Z"},"links":{"cited_paper":"/paper/2412.09819","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:2435a5d7fdd99ee6cfbfc1855a4604591a1685d2574fd06e6376b22a6724893e","observation_id":"73e3fb07-81fa-4fd3-b35a-81b054ecfbed","resolution":{"observed_at":"2026-08-07T00:39:41.663250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.667570Z","title":"Fakih, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.667570Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:e331a8275e5d2210b1e2f47ad2a70d262facc18b6ca93b941bd91c8129ca5761","observation_id":"9fdfcfdb-258b-47a6-8e08-62b3f0b30309","resolution":{"observed_at":"2026-08-07T00:39:41.667570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.671793Z","title":"Tizaoui, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.671793Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:94e733a827e3c785aefe220f9144802f051da84a07fbd269c4fc20a5ba772e5c","observation_id":"25ca9dca-1ffa-4aff-809b-27353d0b0d36","resolution":{"observed_at":"2026-08-07T00:39:41.671793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08550","last_updated":"2024-07-11T14:34:43Z","snapshot_observed_at":"2026-08-02T17:16:07.808763Z","submitted_at":"2024-07-11T14:34:43Z","title":"Incorporating Large Language Models into Production Systems for Enhanced Task Automation and Flexibility","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08550","snapshot_observed_at":"2026-08-07T00:39:41.676164Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.676164Z"},"links":{"cited_paper":"/paper/2407.08550","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:1141b503d5b9a017e5a55d4141a00702821589f330c18a7058f26ac96d1d75f1","observation_id":"5a0e13cb-75f2-42cd-bfc2-6b2335e1a9d8","resolution":{"observed_at":"2026-08-07T00:39:41.676164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.679893Z","title":"Ogundare, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.679893Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:0e547cb94752599d38f2f5b68e66e1f1f8ca1de8051b79189e5ab90f695ee05b","observation_id":"05d52643-c9e0-42da-b3e9-9c86aff446f2","resolution":{"observed_at":"2026-08-07T00:39:41.679893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.683409Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.683409Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:5c363c53f05a2f790fd96919a599a0c9efcb7e83d8134581044e5b25cd41c678","observation_id":"b9dafaaa-0960-46f5-9b17-3d146a08ea74","resolution":{"observed_at":"2026-08-07T00:39:41.683409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03875","last_updated":"2023-07-13T17:29:48Z","snapshot_observed_at":"2026-08-06T17:04:41.667784Z","submitted_at":"2023-07-08T01:42:22Z","title":"Large Language Models for Supply Chain Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03875","snapshot_observed_at":"2026-08-07T00:39:41.686873Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.686873Z"},"links":{"cited_paper":"/paper/2307.03875","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:b026761482d59367333aceee5dcdb7509c0f1b8002f18f545857d4b96246ec1e","observation_id":"7cb939d5-6d1e-4d3a-af26-a83d0ec9f842","resolution":{"observed_at":"2026-08-07T00:39:41.686873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.690624Z","title":"Raman, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.690624Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:ed5a3672eb2ba6a6b4508aee50126a67d5c03c5d3116f687e5c9d525dbffc421","observation_id":"63640395-7108-44df-8b52-f090b168807f","resolution":{"observed_at":"2026-08-07T00:39:41.690624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16622","last_updated":"2023-08-31T10:31:19Z","snapshot_observed_at":"2026-08-05T10:54:33.111936Z","submitted_at":"2023-08-31T10:31:19Z","title":"Developing a Scalable Benchmark for Assessing Large Language Models in Knowledge Graph Engineering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16622","snapshot_observed_at":"2026-08-07T00:39:41.693989Z","title":"Meyer, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.693989Z"},"links":{"cited_paper":"/paper/2308.16622","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:89c7c02b913e7220bffa71da021bf3e578fcfb750d2bd5e80866117d0a3bec5b","observation_id":"b424281b-a063-4232-949d-841fb688cb6f","resolution":{"observed_at":"2026-08-07T00:39:41.693989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.697905Z","title":"bench authors, Beyond the imitation game: Quantify- ing and extrapolating the capabilities of language models, Transactions on Machine Learning Research (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.697905Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:8237af9a1507b4162478eefff5361a2f58f91606ba86d3dd7d0abb7aaab8bc9c","observation_id":"0c13e9a4-b54e-4bbd-97a8-2a3e11e63f50","resolution":{"observed_at":"2026-08-07T00:39:41.697905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.18985","last_updated":"2025-04-26T18:08:13Z","snapshot_observed_at":"2026-08-05T23:30:35.975115Z","submitted_at":"2025-04-26T18:08:13Z","title":"Tracking the Moving Target: A Framework for Continuous Evaluation of LLM Test Generation in Industry","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.18985","snapshot_observed_at":"2026-08-07T00:39:41.701052Z","title":"Azanza, B","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.701052Z"},"links":{"cited_paper":"/paper/2504.18985","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:624750de584831c7f19720a5e6c6443ab835b2fccc88c46aaac173288c71f566","observation_id":"47aa9c45-576d-4b16-8f9c-02610589c765","resolution":{"observed_at":"2026-08-07T00:39:41.701052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.705145Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.705145Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:42f11aff1f6ac19ec1f3235e4b730dbba9cb1fcc91c47e0c97e444ab949489c6","observation_id":"45969fe8-4c72-4500-9457-8a31e174c01a","resolution":{"observed_at":"2026-08-07T00:39:41.705145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15223","last_updated":"2024-09-08T14:29:38Z","snapshot_observed_at":"2026-07-06T17:07:32.283102Z","submitted_at":"2023-12-23T11:09:40Z","title":"A Survey on Large Language Models for Software Engineering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15223","snapshot_observed_at":"2026-08-07T00:39:41.708804Z","title":"Zhang, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.708804Z"},"links":{"cited_paper":"/paper/2312.15223","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:1f2dfee10d5e10ebcefcd7ea36f8ee2658c1ce93b81d514b478af3fc7840807c","observation_id":"7b743598-c7ce-4dea-8175-0ada8e673ef5","resolution":{"observed_at":"2026-08-07T00:39:41.708804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.713136Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.713136Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:afc15b39fe25abb4f69e6b8015f55c50c5c20b2ec568930b54d5be58c5c090d6","observation_id":"cc39fc4f-2268-4700-b4e3-773a03027744","resolution":{"observed_at":"2026-08-07T00:39:41.713136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.717289Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.717289Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:b2182b7fc094cf49deb6e71cf83a7f2ca20973d153e66bd58176ca1d430ea151","observation_id":"7ee961ce-1b53-4b12-a41e-1fa960769104","resolution":{"observed_at":"2026-08-07T00:39:41.717289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03461","last_updated":"2025-02-05T18:58:19Z","snapshot_observed_at":"2026-08-05T09:14:32.339428Z","submitted_at":"2025-02-05T18:58:19Z","title":"Do Large Language Model Benchmarks Test Reliability?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03461","snapshot_observed_at":"2026-08-07T00:39:41.721221Z","title":"Vendrow, E","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.721221Z"},"links":{"cited_paper":"/paper/2502.03461","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:853ce68ad053863709b916a3765e22ee3164cb52a90268763aee7f1d584fcaa9","observation_id":"d35071e2-6a71-4045-afaa-bd7f04821575","resolution":{"observed_at":"2026-08-07T00:39:41.721221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.05374","last_updated":"2024-03-21T00:21:14Z","snapshot_observed_at":"2026-08-02T17:09:20.540788Z","submitted_at":"2023-08-10T06:43:44Z","title":"Trustworthy LLMs: a Survey and Guideline for Evaluating Large Language Models' Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.05374","snapshot_observed_at":"2026-08-07T00:39:41.725446Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.725446Z"},"links":{"cited_paper":"/paper/2308.05374","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:affdec6078d3c81a0b12bcac7eac1875721b5b9537a1ad47eaaeec5fbbef88bd","observation_id":"17853490-1b3d-4947-a2fe-55801a832645","resolution":{"observed_at":"2026-08-07T00:39:41.725446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06234","last_updated":"2025-01-27T01:45:15Z","snapshot_observed_at":"2026-07-06T19:29:55.838200Z","submitted_at":"2024-10-08T17:45:51Z","title":"TEOChat: A Large Vision-Language Assistant for Temporal Earth Observation Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06234","snapshot_observed_at":"2026-08-07T00:39:41.729658Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.729658Z"},"links":{"cited_paper":"/paper/2410.06234","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:9545b4b01e86b8773e43c13290b7b027e2a3dd4031adf6cdcc0854cdc41a78a6","observation_id":"bb7f8507-1658-4704-845c-110ed6a0b86d","resolution":{"observed_at":"2026-08-07T00:39:41.729658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.733804Z","title":"Xiong, F","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.733804Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:54eddc3485bf2f8a6f41bfd23971ef954e00332b177397d0fdb8f9c0c98fa045","observation_id":"17eb8b0d-4c3d-43df-a02b-1b633efb8d05","resolution":{"observed_at":"2026-08-07T00:39:41.733804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17600","last_updated":"2024-01-31T04:57:12Z","snapshot_observed_at":"2026-07-06T17:22:53.623679Z","submitted_at":"2024-01-31T04:57:12Z","title":"Good at captioning, bad at counting: Benchmarking GPT-4V on Earth observation data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.17600","snapshot_observed_at":"2026-08-07T00:39:41.737914Z","title":"Zhang, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.737914Z"},"links":{"cited_paper":"/paper/2401.17600","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:8643fc28bddd81cbe3e1b364a801d387ff85cbe34342d67c7428387f27c7d180","observation_id":"6d95f1cf-d097-4862-953f-7717116ca134","resolution":{"observed_at":"2026-08-07T00:39:41.737914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19065","last_updated":"2024-06-27T10:34:02Z","snapshot_observed_at":"2026-07-06T18:37:51.919811Z","submitted_at":"2024-06-27T10:34:02Z","title":"STBench: Assessing the Ability of Large Language Models in Spatio-Temporal Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19065","snapshot_observed_at":"2026-08-07T00:39:41.742261Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.742261Z"},"links":{"cited_paper":"/paper/2406.19065","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:f4df96e99da70e0b3508b6f9ee621573780abbcb67f7353469f64434b6c8550e","observation_id":"eeca5cda-ba16-4d8f-a648-34cd90fe1baf","resolution":{"observed_at":"2026-08-07T00:39:41.742261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.746251Z","title":"Sapkota, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.746251Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:31c23c0cdd8caf36475b25b6cbaec778d2602420ee45be20d3e819c5e1a76b27","observation_id":"5b9f2c1f-ef36-4b4d-b51d-6a480b1277d6","resolution":{"observed_at":"2026-08-07T00:39:41.746251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19325","last_updated":"2025-03-12T19:28:05Z","snapshot_observed_at":"2026-07-06T19:58:39.778401Z","submitted_at":"2024-11-28T18:59:56Z","title":"GEOBench-VLM: Benchmarking Vision-Language Models for Geospatial Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19325","snapshot_observed_at":"2026-08-07T00:39:41.749497Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.749497Z"},"links":{"cited_paper":"/paper/2411.19325","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:b9f467e835623702a7481c4cd9e50a8f43000409b59060e904a8bf897761d038","observation_id":"cf07693c-673d-4c7d-b64e-d7774d47fbc0","resolution":{"observed_at":"2026-08-07T00:39:41.749497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.753415Z","title":"Roberts, T","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.753415Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:02a2172a536469f882fd643b259aa5e58990d78014e4daa415e885a73504b067","observation_id":"015b86be-6aba-4bcd-b163-d57f470b86b4","resolution":{"observed_at":"2026-08-07T00:39:41.753415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05679","last_updated":"2024-12-10T02:23:30Z","snapshot_observed_at":"2026-07-06T20:03:16.082369Z","submitted_at":"2024-12-07T15:11:21Z","title":"RSUniVLM: A Unified Vision Language Model for Remote Sensing via Granularity-oriented Mixture of Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05679","snapshot_observed_at":"2026-08-07T00:39:41.756940Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.756940Z"},"links":{"cited_paper":"/paper/2412.05679","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:21a5ba27ffc2c4d768a2ed3658234df13e29b4b92b5f2215a91c0d086e4d36e8","observation_id":"34c328bb-c4b8-44cc-a63f-6325c4738d5e","resolution":{"observed_at":"2026-08-07T00:39:41.756940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09105","last_updated":"2025-08-07T20:56:50Z","snapshot_observed_at":"2026-08-04T23:42:10.367797Z","submitted_at":"2024-06-13T13:31:49Z","title":"INS-MMBench: A Comprehensive Benchmark for Evaluating LVLMs' Performance in Insurance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09105","snapshot_observed_at":"2026-08-07T00:39:41.760849Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.760849Z"},"links":{"cited_paper":"/paper/2406.09105","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:c28937fcefdf993016714c26a6c5b24d90710b4443188d77830229a168fe36f3","observation_id":"0ae8ff29-4cde-422d-9dc3-fd203fb620dc","resolution":{"observed_at":"2026-08-07T00:39:41.760849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-07T00:39:41.765231Z","title":"Hendrycks, C","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.765231Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:3bbffa435d6877a8dc91310c4b10d3bc077a3d38dae70faab72efd7c451deb22","observation_id":"fd27debd-ccab-4ec9-92b2-ad2e80910fd5","resolution":{"observed_at":"2026-08-07T00:39:41.765231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.769927Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.769927Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:d3dcb4d86b372ed9b89235c86cdb6ce37d85602d355af562ac9473efc7075ceb","observation_id":"ac4b8cd4-8a23-424e-9d88-6719ffc816ec","resolution":{"observed_at":"2026-08-07T00:39:41.769927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01266","last_updated":"2024-08-18T23:48:44Z","snapshot_observed_at":"2026-07-06T17:54:03.923842Z","submitted_at":"2024-04-01T17:43:27Z","title":"IsoBench: Benchmarking Multimodal Foundation Models on Isomorphic Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01266","snapshot_observed_at":"2026-08-07T00:39:41.773291Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.773291Z"},"links":{"cited_paper":"/paper/2404.01266","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:37aaef7072a52e2c6fc9b10d0222a3854133332a6b7b6ed26ac0afe49b24d55e","observation_id":"bfc5a169-50ce-4d1c-a3ec-7ea13cd751fe","resolution":{"observed_at":"2026-08-07T00:39:41.773291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13730","last_updated":"2024-12-02T15:11:23Z","snapshot_observed_at":"2026-07-06T19:18:53.582890Z","submitted_at":"2024-09-10T01:20:26Z","title":"VisScience: An Extensive Benchmark for Evaluating K12 Educational Multi-modal Scientific Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.13730","snapshot_observed_at":"2026-08-07T00:39:41.777416Z","title":"Jiang, Z","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.777416Z"},"links":{"cited_paper":"/paper/2409.13730","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:6e52dc8d81b42325d03dfcf82db8b6f7270d5fc1d664a4d5e70e2ae6ca741082","observation_id":"baa06e3f-ace0-4e5d-a9bd-4ce2120fd3b3","resolution":{"observed_at":"2026-08-07T00:39:41.777416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.781930Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.781930Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:c92341df992b98b12fbe6a127b7e384ecfa9959f5cc01da2c742f80b0851ad70","observation_id":"b036bad6-e0c1-4035-8597-db4a9a169700","resolution":{"observed_at":"2026-08-07T00:39:41.781930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.786215Z","title":"Anand, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.786215Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:e43a3ca36056a5dd5ca460f6ed27d9166a9c94f7e78ebec6af3fd67c7d395069","observation_id":"662fbc80-6ba8-4a53-b9e9-fa7625348af0","resolution":{"observed_at":"2026-08-07T00:39:41.786215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01475","last_updated":"2024-11-01T07:05:33Z","snapshot_observed_at":"2026-07-06T17:54:16.008254Z","submitted_at":"2024-04-01T20:56:25Z","title":"Are large language models superhuman chemists?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01475","snapshot_observed_at":"2026-08-07T00:39:41.790176Z","title":"Mirza, N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.790176Z"},"links":{"cited_paper":"/paper/2404.01475","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:fa39089d7bfebba85c2a47fb51841f38a207c93028f16a6e80baf8d3b0568c5d","observation_id":"459e5491-99e7-4447-84c4-e24d25bb03ee","resolution":{"observed_at":"2026-08-07T00:39:41.790176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.793728Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.793728Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:d5517e6fd1d86e20c244d506329f7e4b394a6a97c30c34441ffcd9f4f0c9d0e5","observation_id":"76e129ff-fae7-4056-b42c-d2b49e42a482","resolution":{"observed_at":"2026-08-07T00:39:41.793728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.797220Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.797220Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:829d54ec1a682cc2d2af5c654c071298c63fe36a8cd2e0f1410ab900febdce6c","observation_id":"163d8c6b-3890-4bb6-996f-6c7ca2aeb36c","resolution":{"observed_at":"2026-08-07T00:39:41.797220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09391","last_updated":"2024-08-10T13:28:11Z","snapshot_observed_at":"2026-08-04T14:26:55.582131Z","submitted_at":"2024-02-14T18:42:25Z","title":"LlaSMol: Advancing Large Language Models for Chemistry with a Large-Scale, Comprehensive, High-Quality Instruction Tuning Dataset","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09391","snapshot_observed_at":"2026-08-07T00:39:41.800506Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.800506Z"},"links":{"cited_paper":"/paper/2402.09391","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:b86d211ffb6be169c901944b2b0d367eb837d79d58b598a03a56914b8023d448","observation_id":"0575fa89-83cc-4a9d-93c6-9b3f9879ba57","resolution":{"observed_at":"2026-08-07T00:39:41.800506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09115","last_updated":"2023-08-17T17:51:05Z","snapshot_observed_at":"2026-07-06T16:07:21.951225Z","submitted_at":"2023-08-17T17:51:05Z","title":"MaScQA: A Question Answering Dataset for Investigating Materials Science Knowledge of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09115","snapshot_observed_at":"2026-08-07T00:39:41.803960Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.803960Z"},"links":{"cited_paper":"/paper/2308.09115","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:3bf0ce6b72d631014494c726ade17d2b516b2839894f8088a5105078bfdc1c66","observation_id":"2f3217dd-187c-45ef-a60f-244cc6f64d7f","resolution":{"observed_at":"2026-08-07T00:39:41.803960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00177","last_updated":"2024-11-30T14:01:56Z","snapshot_observed_at":"2026-07-06T19:43:14.670881Z","submitted_at":"2024-10-31T19:48:12Z","title":"LLM4Mat-Bench: Benchmarking Large Language Models for Materials Property Prediction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00177","snapshot_observed_at":"2026-08-07T00:39:41.808360Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.808360Z"},"links":{"cited_paper":"/paper/2411.00177","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:eff8e39e06115a8a6d534ba8cfc065e986032f5358131a33ef0f99ad58a6af46","observation_id":"876bb9b6-fd8a-4277-b1b4-f02d497effad","resolution":{"observed_at":"2026-08-07T00:39:41.808360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13193","last_updated":"2024-06-19T03:59:46Z","snapshot_observed_at":"2026-07-06T18:33:24.206083Z","submitted_at":"2024-06-19T03:59:46Z","title":"PRESTO: Progressive Pretraining Enhances Synthetic Chemistry Outcomes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13193","snapshot_observed_at":"2026-08-07T00:39:41.812250Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.812250Z"},"links":{"cited_paper":"/paper/2406.13193","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:c6db998571136ba59d01280625babac0217b2ef876a895150c75d8c803a3e3a3","observation_id":"406b8ac6-39e1-4b40-b5df-853c56e65809","resolution":{"observed_at":"2026-08-07T00:39:41.812250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.06690","last_updated":"2024-05-07T09:18:13Z","snapshot_observed_at":"2026-08-05T06:12:33.094547Z","submitted_at":"2024-05-07T09:18:13Z","title":"DrugLLM: Open Large Language Model for Few-shot Molecule Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.06690","snapshot_observed_at":"2026-08-07T00:39:41.816638Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.816638Z"},"links":{"cited_paper":"/paper/2405.06690","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:79c1d6f5c585cd929563dabee2faa9c1aaf0eac46ae5c1eaa436fcbdc7229830","observation_id":"d6541dfb-3b14-4440-bd58-ac9be06d78d7","resolution":{"observed_at":"2026-08-07T00:39:41.816638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.820824Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.820824Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:72d579db4b7ef828f9b880dfb4e0dceedd83fc61daf3a2283bb8b06f20007afd","observation_id":"3eb95384-25ce-4589-b119-8b09891e2168","resolution":{"observed_at":"2026-08-07T00:39:41.820824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.824182Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.824182Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:f194d4bd64bd3150bc781d19eaf3c5501930a2604daa0734b38cfd62b52c0e8c","observation_id":"415390c2-1227-465c-a149-c8999ed55dd9","resolution":{"observed_at":"2026-08-07T00:39:41.824182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11217","last_updated":"2024-06-24T03:55:30Z","snapshot_observed_at":"2026-07-06T18:31:57.866202Z","submitted_at":"2024-06-17T05:23:18Z","title":"WeatherQA: Can Multimodal Language Models Reason about Severe Weather?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11217","snapshot_observed_at":"2026-08-07T00:39:41.827755Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.827755Z"},"links":{"cited_paper":"/paper/2406.11217","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:e843ff9461351e671d3429ecda88c06ae1dd80d945d540528dfb448c5951f2be","observation_id":"93e70b19-314a-48b5-acf5-924ffa0a41da","resolution":{"observed_at":"2026-08-07T00:39:41.827755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19058","last_updated":"2025-02-16T10:05:11Z","snapshot_observed_at":"2026-07-06T19:23:37.758078Z","submitted_at":"2024-09-27T18:00:13Z","title":"CLLMate: A Multimodal Benchmark for Weather and Climate Events Forecasting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19058","snapshot_observed_at":"2026-08-07T00:39:41.831109Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.831109Z"},"links":{"cited_paper":"/paper/2409.19058","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:a67d39cabbef89d279b3f1d17efd80feca582f99e5a8179c9cf974616fb09b0c","observation_id":"41ddf636-1a72-4f42-96eb-c37e8d8960f4","resolution":{"observed_at":"2026-08-07T00:39:41.831109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.834875Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.834875Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:0c72ece4664cb99271397cb0c95f35ee35cf02e4b665e3a0cec61ef7a9b515be","observation_id":"486c1bb9-f746-4797-84f8-7a75078d10f1","resolution":{"observed_at":"2026-08-07T00:39:41.834875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20707","last_updated":"2024-10-09T00:13:06Z","snapshot_observed_at":"2026-07-06T19:40:34.668379Z","submitted_at":"2024-10-09T00:13:06Z","title":"DisasterQA: A Benchmark for Assessing the performance of LLMs in Disaster Response","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20707","snapshot_observed_at":"2026-08-07T00:39:41.838053Z","title":"Rawat, Disasterqa: A benchmark for assessing the performance of llms in disaster response, arXiv preprint arXiv:2410.20707 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.838053Z"},"links":{"cited_paper":"/paper/2410.20707","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:94373ac756fb0f9f161fa62e8f0f04987c866ce2ba2bb9793609018633b2439b","observation_id":"3f31b45e-c978-44a9-b2c7-21cf96fea40b","resolution":{"observed_at":"2026-08-07T00:39:41.838053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12760","last_updated":"2024-11-16T08:02:35Z","snapshot_observed_at":"2026-07-06T19:52:46.580689Z","submitted_at":"2024-11-16T08:02:35Z","title":"VayuBuddy: an LLM-Powered Chatbot to Democratize Air Quality Insights","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12760","snapshot_observed_at":"2026-08-07T00:39:41.842241Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.842241Z"},"links":{"cited_paper":"/paper/2411.12760","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:04ebb449b32ba8738bbcee7a0c08cd8d8d907af188cf4945ac2862f03f0f3051","observation_id":"2cc6b699-4760-4877-b558-46206ff6317c","resolution":{"observed_at":"2026-08-07T00:39:41.842241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.845914Z","title":"Pafilis, S","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.845914Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:3ad1e058a8c08dd26bd2f438ce59dfec0dbd6f6e63e1d02e30e73e26f55b4436","observation_id":"6c9f8696-69cb-47b7-a1e1-b90cfe7cac76","resolution":{"observed_at":"2026-08-07T00:39:41.845914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.849964Z","title":"Abdelmageed, F","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.849964Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:df227c3bd5a4c087a342e445fd5abb13cd7145a9414a910dd3dffd7c781da955","observation_id":"9eb06b2f-9f5f-4d75-85f6-9c591c69a61d","resolution":{"observed_at":"2026-08-07T00:39:41.849964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04127","last_updated":"2025-01-10T14:31:21Z","snapshot_observed_at":"2026-08-02T00:54:17.243656Z","submitted_at":"2024-06-06T14:49:06Z","title":"Are We Done with MMLU?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04127","snapshot_observed_at":"2026-08-07T00:39:41.854056Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.854056Z"},"links":{"cited_paper":"/paper/2406.04127","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:cb0b6316d3e2924ce9b55a27ac24101c97239d75c6a314f9d370f0404918d791","observation_id":"8b5a2ea4-e28b-4999-bdba-2db041a08b62","resolution":{"observed_at":"2026-08-07T00:39:41.854056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.858056Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.858056Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:ae7a37bbf67b3ea575c1290326b332d5372fccf9c8b9547a604b68c934ff06c1","observation_id":"2152909a-75c5-43c6-a38a-7605a0e9bed3","resolution":{"observed_at":"2026-08-07T00:39:41.858056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.862211Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.862211Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:eb7fad023e48d5a5a2ed0683af15fd7cc175a9679f980eea05fbf2a0f880aef3","observation_id":"69fbe33a-b4be-4c9f-805d-4e5daa08b57d","resolution":{"observed_at":"2026-08-07T00:39:41.862211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.866695Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.866695Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:2b18a18bdb2b17d66aa8c1215b13a5a7cc32919b6c4cc80d15c0510f5f4df95d","observation_id":"dcd02d8a-d1de-4d28-aacf-f6280cf63d25","resolution":{"observed_at":"2026-08-07T00:39:41.866695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.871055Z","title":"Edwards, C","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.871055Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:d64f094f592cc69dacd2504a02fdcd3bdd12ba6b0360d568bb17810acf6ea1f6","observation_id":"8df08264-9de2-4a25-9421-78599b826a8a","resolution":{"observed_at":"2026-08-07T00:39:41.871055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.874459Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.874459Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:8c097e12212646dcc2b09e08c93c27756b50138d2d23db2a36d5efcdbe484ae0","observation_id":"c85c5585-2d02-4e62-83a8-08718fe9be40","resolution":{"observed_at":"2026-08-07T00:39:41.874459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.877742Z","title":"Davies, M","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.877742Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:6a224a351de5a60a53516463582f83396b9073c5b216f1252ff31c292a4c034d","observation_id":"29ea0a6b-e898-411e-ad3f-02daf9765111","resolution":{"observed_at":"2026-08-07T00:39:41.877742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.881368Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.881368Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:863eb539fd4a5ee7e9063b7f04f0561e9a00207d349583e6d501b5bcb50fd77c","observation_id":"d09c6ae9-ac48-4e4e-a5fc-94a52fb674a1","resolution":{"observed_at":"2026-08-07T00:39:41.881368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11059","last_updated":"2025-02-16T09:57:50Z","snapshot_observed_at":"2026-07-06T20:37:18.647879Z","submitted_at":"2025-02-16T09:57:50Z","title":"ClimateLLM: Efficient Weather Forecasting via Frequency-Aware Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11059","snapshot_observed_at":"2026-08-07T00:39:41.885548Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.885548Z"},"links":{"cited_paper":"/paper/2502.11059","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:043d7fb77570b9c89dd43d21cf6e993812ad4a6fdd948a084a94c808a02ae8f6","observation_id":"f36fd6d9-a808-4022-af84-409d5deabdbc","resolution":{"observed_at":"2026-08-07T00:39:41.885548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.889997Z","title":"Sachdeva, N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.889997Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:b790423740fed1c1ccb59ce5935088fd871f62f9ce7672979ea05211723d74e6","observation_id":"fcbc7896-1894-40fe-b9dd-46279ab48d66","resolution":{"observed_at":"2026-08-07T00:39:41.889997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.893920Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.893920Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:3899f551876f821074097f28a00cf0a6a2b9995600cbc02658f5d73eafd3d087","observation_id":"583c3fae-d05a-4577-b23f-b0ebfb43c860","resolution":{"observed_at":"2026-08-07T00:39:41.893920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.898305Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.898305Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:710708632ead4a7ea9ae1878bef21a539b4b4642d478fb0ec4fb8a17ffe7431b","observation_id":"87d2ce94-80e9-4f9f-84f4-36e3d86f93aa","resolution":{"observed_at":"2026-08-07T00:39:41.898305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-07T00:39:41.902404Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.902404Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:7a2f61af60b8e56a4fef78f44c94660c27b63de212bfc0c04bba266d992769e9","observation_id":"10caa8a0-72a9-4ec0-98a5-e370804464e0","resolution":{"observed_at":"2026-08-07T00:39:41.902404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.906598Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.906598Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:d987c4ed4482c2b505841f33f8acbd8612d45b8eee907c18bae5c68f0f5f3d2d","observation_id":"ec9c7d18-c642-40cc-8285-665c74826ec4","resolution":{"observed_at":"2026-08-07T00:39:41.906598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.910567Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.910567Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:862272d23e2fe548ee9e3e359fbc5190588baa4ca9c607db74f18660bb3d8a1e","observation_id":"5455bd5c-2f4d-43bb-a23f-b15c5e66c49b","resolution":{"observed_at":"2026-08-07T00:39:41.910567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-031-73116-7_","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:42.730569Z","title":null,"venue":null,"work_id":"20ebcc2d-ad21-4bf4-aaf0-e89d01b11ae8","year":2025},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.914769Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:6c3b7e2f88a76ea6d48caae95b853f8019774cbd04a091b8f86247da3d43089f","observation_id":"baec2d01-64f0-431e-9c3b-1387ed1e70d7","resolution":{"observed_at":"2026-08-07T00:39:42.734627Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.918902Z","title":"Malla, C","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.918902Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:d85d3f5ba1e075b277c66fb2df01753ef3f10d82a4ffd14d8908cb5e19733903","observation_id":"0caf4c69-bfbb-473c-a4b0-3963e0ca5858","resolution":{"observed_at":"2026-08-07T00:39:41.918902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.923821Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.923821Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:12e47f4024ef07b874d913b2206ef1378dfb15c3f4088bb0d83bd5987db7f325","observation_id":"c9162ea3-2b41-4700-ba06-e3dfa2ae021f","resolution":{"observed_at":"2026-08-07T00:39:41.923821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.927310Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.927310Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:9bdb3176f268692c03b22c4f9a39f24620ffdfc3864378b24c6a696e43ca3fe7","observation_id":"63c4f861-85b8-434c-87bf-7574c59db5c1","resolution":{"observed_at":"2026-08-07T00:39:41.927310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.931577Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.931577Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:a623f9163c88b86e9013af05879dd9161030e3d5ea9b005229994a57393ae5cb","observation_id":"c4ab97bc-27da-4f8e-9709-5ffd9cff91f4","resolution":{"observed_at":"2026-08-07T00:39:41.931577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.04379","last_updated":"2025-03-30T15:11:24Z","snapshot_observed_at":"2026-08-02T02:55:03.543491Z","submitted_at":"2023-09-08T15:21:07Z","title":"Language Prompt for Autonomous Driving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.04379","snapshot_observed_at":"2026-08-07T00:39:41.935007Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.935007Z"},"links":{"cited_paper":"/paper/2309.04379","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:d031297c7e108d0a3a20a4c34b1804290c90efcfd9c2c44f35353fe5ff6d8b32","observation_id":"13e19500-827b-4e73-9199-aba13927bfa1","resolution":{"observed_at":"2026-08-07T00:39:41.935007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07058","last_updated":"2025-01-13T04:42:45Z","snapshot_observed_at":"2026-07-06T20:20:05.443672Z","submitted_at":"2025-01-13T04:42:45Z","title":"Logic Meets Magic: LLMs Cracking Smart Contract Vulnerabilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07058","snapshot_observed_at":"2026-08-07T00:39:41.938501Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.938501Z"},"links":{"cited_paper":"/paper/2501.07058","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:6a0ffb5e248eece9e9774e0e44077a6a4121921f502104f0f9f7c4db73012b34","observation_id":"dd094b8a-70e8-4055-978a-0dea2ce54259","resolution":{"observed_at":"2026-08-07T00:39:41.938501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09381","last_updated":"2024-11-04T09:11:18Z","snapshot_observed_at":"2026-08-06T12:39:54.817329Z","submitted_at":"2024-10-12T06:24:21Z","title":"LLM-SmartAudit: Advanced Smart Contract Vulnerability Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09381","snapshot_observed_at":"2026-08-07T00:39:41.941957Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.941957Z"},"links":{"cited_paper":"/paper/2410.09381","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:c3d36caa87711660874a7677d694ba485535eb35fb4adeefdf3be42c5c67b39c","observation_id":"996de77b-5907-42c1-86da-fd6bac78b1a6","resolution":{"observed_at":"2026-08-07T00:39:41.941957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06838","last_updated":"2025-07-21T05:24:59Z","snapshot_observed_at":"2026-08-04T23:33:44.230238Z","submitted_at":"2024-03-11T15:59:59Z","title":"ACFIX: Guiding LLMs with Mined Common RBAC Practices for Context-Aware Repair of Access Control Vulnerabilities in Smart Contracts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06838","snapshot_observed_at":"2026-08-07T00:39:41.946070Z","title":"Zhang, K","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.946070Z"},"links":{"cited_paper":"/paper/2403.06838","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:5df7788e7497e3f23bad544e667fab5da0b530655f7267c1e91a65f34dce9a56","observation_id":"7dd2f9f2-e621-41c1-a09b-05ad1de09f48","resolution":{"observed_at":"2026-08-07T00:39:41.946070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.950892Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.950892Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:b80ec73f6286d7cc614b9391a25b9d2b3dd3f4ae12f3565e4b4cdc2fa1ea5f7b","observation_id":"1a3b0867-df9e-4ef7-9dcf-32fde5867a49","resolution":{"observed_at":"2026-08-07T00:39:41.950892Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23190","last_updated":"2025-03-29T19:04:28Z","snapshot_observed_at":"2026-07-06T21:00:51.439463Z","submitted_at":"2025-03-29T19:04:28Z","title":"Ethereum Price Prediction Employing Large Language Models for Short-term and Few-shot Forecasting","version":1},"cited_work":{"arxiv_id":"2503.23190","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.23190","snapshot_observed_at":"2026-08-07T00:39:43.669913Z","title":"Ethereum Price Prediction Employing Large Language Models for Short-term and Few-shot Forecasting","venue":"cs.AI","work_id":"91907e4b-2dcc-4e64-806e-308abde2c50f","year":2025},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.955259Z"},"links":{"cited_paper":"/paper/2503.23190","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:2a5718531805b56e9d989a649f364522c67776285e639aa7b29869413c289512","observation_id":"2c5e8517-ba74-46e8-a590-7cff7c738c7b","resolution":{"observed_at":"2026-08-07T00:39:43.674504Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12464","last_updated":"2025-03-12T12:50:00Z","snapshot_observed_at":"2026-07-06T19:34:27.813248Z","submitted_at":"2024-10-16T11:25:13Z","title":"Exploring LLM Cryptocurrency Trading Through Fact-Subjectivity Aware Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12464","snapshot_observed_at":"2026-08-07T00:39:41.958895Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.958895Z"},"links":{"cited_paper":"/paper/2410.12464","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:e37ba9fa7ea7ee8ae197d5b331a52df40dfdffa836cb0b85fa55ebebf0dfc6dd","observation_id":"e6879f06-fd77-45b5-a5d3-6705c5f77814","resolution":{"observed_at":"2026-08-07T00:39:41.958895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14280","last_updated":"2025-03-24T12:14:43Z","snapshot_observed_at":"2026-08-05T15:09:56.720949Z","submitted_at":"2024-03-21T10:39:44Z","title":"Large Language Models for Blockchain Security: A Systematic Literature Review","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14280","snapshot_observed_at":"2026-08-07T00:39:41.963490Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.963490Z"},"links":{"cited_paper":"/paper/2403.14280","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:c93d8211dbc78168d4641d92ba99ce04590e2a9fe6be8cddd9849048c09d8007","observation_id":"bb59d99e-d90b-4048-864e-43c08836a429","resolution":{"observed_at":"2026-08-07T00:39:41.963490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06032","last_updated":"2024-02-22T16:21:51Z","snapshot_observed_at":"2026-07-06T16:05:11.328794Z","submitted_at":"2023-08-11T09:23:11Z","title":"Large Language Models in Cryptocurrency Securities Cases: Can a GPT Model Meaningfully Assist Lawyers?","version":4},"cited_work":{"arxiv_id":"2308.06032","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.06032","snapshot_observed_at":"2026-08-07T00:39:43.631395Z","title":"Large Language Models in Cryptocurrency Securities Cases: Can a GPT Model Meaningfully Assist Lawyers?","venue":"cs.AI","work_id":"46ca289f-4ccd-48ce-b17a-7e63c6c945a5","year":2023},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.967124Z"},"links":{"cited_paper":"/paper/2308.06032","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:7b441838da328aec10dd2b71766fc13d87dba050b4cdf78a2326654363da2ddc","observation_id":"ff40ad15-0fd6-4ffb-b399-4d85b0dd2199","resolution":{"observed_at":"2026-08-07T00:39:43.636560Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.970780Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.970780Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:b6fb03bc9173728192cb7e6f8744048b1863a5b6e3eefcbcfd71e8b59218b6eb","observation_id":"63d28df8-52ec-428a-852e-e42117a0f360","resolution":{"observed_at":"2026-08-07T00:39:41.970780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.974138Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.974138Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:eef552d001f6a4032c7d3febf4794b3aea5758ec5785241e48995e3595690b53","observation_id":"454c4815-e6e7-4b6b-a6d9-fcc3d40cc7c8","resolution":{"observed_at":"2026-08-07T00:39:41.974138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.978237Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.978237Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:ee956ef21c7843779244c33a80e370c8dd67ad6d1808235bb4927715abdb772f","observation_id":"7d63b3f8-0a63-489c-8ce9-aebedf8a93a2","resolution":{"observed_at":"2026-08-07T00:39:41.978237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.981737Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.981737Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:d4fcc8967797265ed9fccd4ecfd32bceda442d13cf358499f6e414596dd29442","observation_id":"756b38bf-bb3d-4f4e-bd0e-7aed0526441d","resolution":{"observed_at":"2026-08-07T00:39:41.981737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00083","last_updated":"2022-10-31T18:35:18Z","snapshot_observed_at":"2026-08-04T22:32:01.595836Z","submitted_at":"2022-10-31T18:35:18Z","title":"WHEN FLUE MEETS FLANG: Benchmarks and Large Pre-trained Language Model for Financial Domain","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00083","snapshot_observed_at":"2026-08-07T00:39:41.985661Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.985661Z"},"links":{"cited_paper":"/paper/2211.00083","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:f18634ed2fef22f5d9b5eea1f09470d4a2b471658a228ce69e9d268d3c732ba1","observation_id":"ce57edaf-9138-4a1a-9e8a-22fb1fcea8b4","resolution":{"observed_at":"2026-08-07T00:39:41.985661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08561","last_updated":"2025-04-14T02:52:50Z","snapshot_observed_at":"2026-08-07T03:25:42.519856Z","submitted_at":"2024-11-13T12:18:00Z","title":"LogLLM: Log-based Anomaly Detection Using Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.08561","snapshot_observed_at":"2026-08-07T00:39:41.989841Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.989841Z"},"links":{"cited_paper":"/paper/2411.08561","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:abcc5e5ec1c119b2a63c72726cba746521fc78d7677713fc96d8e293204b47ee","observation_id":"3cbfd683-b20e-4fe3-9865-c3d859638272","resolution":{"observed_at":"2026-08-07T00:39:41.989841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08735","last_updated":"2024-07-11T17:59:22Z","snapshot_observed_at":"2026-07-06T18:45:01.801741Z","submitted_at":"2024-07-11T17:59:22Z","title":"Real-Time Anomaly Detection and Reactive Planning with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08735","snapshot_observed_at":"2026-08-07T00:39:41.994028Z","title":"Sinha, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.994028Z"},"links":{"cited_paper":"/paper/2407.08735","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:4c9fdfe3bf9c26741ed1eb85476ded696dbc819e2457cfaec1facd085e4dd2ae","observation_id":"9b129a3a-eb73-4630-ac44-4989b94424b5","resolution":{"observed_at":"2026-08-07T00:39:41.994028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:41.997779Z","title":"Zhang, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.997779Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:15f63aeb81014269daaaefa00404ccaafc38e1f9c48dbea6a0b7ff412f69bc29","observation_id":"83ec3f38-6365-431b-9bab-001ec26a5cc6","resolution":{"observed_at":"2026-08-07T00:39:41.997779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:42.001073Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:42.001073Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:8e45ca01431dd669d22841f51e0c97ac4ace019d798537419af8329024a484b1","observation_id":"ff885e08-d07b-475e-be47-43864ae90972","resolution":{"observed_at":"2026-08-07T00:39:42.001073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:39:42.005109Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:42.005109Z"},"links":{"citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:7220c78b2a2fa64e5a8cd115f41c2076df0a7dfec8d0e2248b513b34d2939604","observation_id":"215976d9-09fb-4dac-9b96-68245e69699a","resolution":{"observed_at":"2026-08-07T00:39:42.005109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19444","last_updated":"2024-05-29T18:45:55Z","snapshot_observed_at":"2026-08-04T15:41:17.375198Z","submitted_at":"2024-05-29T18:45:55Z","title":"MathChat: Benchmarking Mathematical Reasoning and Instruction Following in Multi-Turn Interactions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19444","snapshot_observed_at":"2026-08-07T00:39:42.008599Z","title":"Liang, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:42.008599Z"},"links":{"cited_paper":"/paper/2405.19444","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:eefdee3b65a632df78119bffbcdd8d9f7a1d5b8afd9d789f6f8f4884af252697","observation_id":"d3d98513-624c-4268-8633-5f40cf866eda","resolution":{"observed_at":"2026-08-07T00:39:42.008599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":96,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":205},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 100 of 205 outbound references and 2 inbound Pith citation observations for arXiv:2506.12958."}