{"as_of":"2026-08-15T20:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7e38af1baf23449f9840c67967378ccd6259e8120bd3ecef5ba81c0a4ab07e35","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T11:19:55.660432Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T23:07:21.558834Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T13:35:46.054815Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.15574","last_updated":"2024-12-20T05:11:51Z","snapshot_observed_at":"2026-08-14T09:12:05.342191Z","submitted_at":"2024-12-20T05:11:51Z","title":"J-EDI QA: Benchmark for deep-sea organism-specific multimodal LLM","version":1},"cited_work":{"arxiv_id":"2412.15574","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15574","snapshot_observed_at":"2026-07-01T13:35:46.054815Z","title":"J-edi qa: Benchmark for deep-sea organism- specific multimodal llm","venue":null,"work_id":"3ebfe150-8f89-4714-b8ac-02d9356abaf4","year":2024},"citing_paper":{"arxiv_id":"2605.12542","last_updated":"2026-06-11T05:51:05Z","snapshot_observed_at":"2026-08-13T21:10:05.886370Z","submitted_at":"2026-05-09T08:34:30Z","title":"Earth Science Foundation Models: From Perception to Reasoning and Discovery","version":1},"reference_index":193,"source":"pdf_text","source_observed_at":"2026-05-14T22:07:40.242567Z"},"links":{"cited_paper":"/paper/2412.15574","citing_paper":"/paper/2605.12542"},"observation_digest":"sha256:2fa54416e6cfcb6fd4916ce9aeac850dc5927d5cc8738fc7dfe8c57f99850c98","observation_id":"5295aa94-fba0-4600-a95d-3766c4bb0ecb","resolution":{"observed_at":"2026-05-14T22:08:03.377193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15574","last_updated":"2024-12-20T05:11:51Z","snapshot_observed_at":"2026-08-14T09:12:05.342191Z","submitted_at":"2024-12-20T05:11:51Z","title":"J-EDI QA: Benchmark for deep-sea organism-specific multimodal LLM","version":1},"cited_work":{"arxiv_id":"2412.15574","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15574","snapshot_observed_at":"2026-07-01T13:35:46.054815Z","title":"J-edi qa: Benchmark for deep-sea organism- specific multimodal llm","venue":null,"work_id":"3ebfe150-8f89-4714-b8ac-02d9356abaf4","year":2024},"citing_paper":{"arxiv_id":"2605.12542","last_updated":"2026-06-11T05:51:05Z","snapshot_observed_at":"2026-08-13T21:10:05.886370Z","submitted_at":"2026-05-09T08:34:30Z","title":"Earth Science Foundation Models: From Perception to Reasoning and Discovery","version":2},"reference_index":193,"source":"pdf_text","source_observed_at":"2026-06-30T23:07:21.558834Z"},"links":{"cited_paper":"/paper/2412.15574","citing_paper":"/paper/2605.12542"},"observation_digest":"sha256:7ef1e10c0fba668c1bfad523a38a9186ab7b4508dcb90a48756b22b100fa4b25","observation_id":"88efef0f-03fa-47f4-ab0d-13a387965924","resolution":{"observed_at":"2026-07-01T13:35:46.056613Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.15574/citation-record","integrity":"/paper/2412.15574/integrity","json":"/paper/2412.15574/citation-record.json","paper":"/paper/2412.15574"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-11T11:19:55.539076Z","title":"Gemini Team, Google","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15574","last_updated":"2024-12-20T05:11:51Z","snapshot_observed_at":"2026-08-14T09:12:05.342191Z","submitted_at":"2024-12-20T05:11:51Z","title":"J-EDI QA: Benchmark for deep-sea organism-specific multimodal LLM","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T11:19:55.539076Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2412.15574"},"observation_digest":"sha256:dc0a8785d87a4167824808211268d8ceabb645d6973798b123980132fa859ec7","observation_id":"d537423b-c6ac-41e1-acf4-6d91d72cf7c2","resolution":{"observed_at":"2026-08-11T11:19:55.539076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16502","last_updated":"2024-06-13T15:02:39Z","snapshot_observed_at":"2026-08-13T09:07:54.479155Z","submitted_at":"2023-11-27T17:33:21Z","title":"MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16502","snapshot_observed_at":"2026-08-11T11:19:55.544988Z","title":"Xiang Yue, et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15574","last_updated":"2024-12-20T05:11:51Z","snapshot_observed_at":"2026-08-14T09:12:05.342191Z","submitted_at":"2024-12-20T05:11:51Z","title":"J-EDI QA: Benchmark for deep-sea organism-specific multimodal LLM","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T11:19:55.544988Z"},"links":{"cited_paper":"/paper/2311.16502","citing_paper":"/paper/2412.15574"},"observation_digest":"sha256:f13717939f903c910a36ae3b106d454ca92db4c1d3cb989cbdf549de44204ed8","observation_id":"92c676d1-9330-41f3-af57-c0829452c97a","resolution":{"observed_at":"2026-08-11T11:19:55.544988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-11T11:19:55.550086Z","title":"Pan Lu, et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15574","last_updated":"2024-12-20T05:11:51Z","snapshot_observed_at":"2026-08-14T09:12:05.342191Z","submitted_at":"2024-12-20T05:11:51Z","title":"J-EDI QA: Benchmark for deep-sea organism-specific multimodal LLM","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T11:19:55.550086Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2412.15574"},"observation_digest":"sha256:e7b57f2965c153ca358186a42e5220bab8ce70be1fa219b28c531378329b9ee0","observation_id":"0dbc1604-abb1-492b-9577-fe133f3d88c7","resolution":{"observed_at":"2026-08-11T11:19:55.550086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-08-15T02:35:59.111911Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-11T11:19:55.555858Z","title":"Haotian Liu, et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15574","last_updated":"2024-12-20T05:11:51Z","snapshot_observed_at":"2026-08-14T09:12:05.342191Z","submitted_at":"2024-12-20T05:11:51Z","title":"J-EDI QA: Benchmark for deep-sea organism-specific multimodal LLM","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T11:19:55.555858Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2412.15574"},"observation_digest":"sha256:4b57c8eb54d506fa2229d038c13392b3f03f723aa89f380efbccb28b5002fe8c","observation_id":"a11d6dd5-d448-46ba-a9c5-5c2ec1d2f13f","resolution":{"observed_at":"2026-08-11T11:19:55.555858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07533","last_updated":"2024-05-16T21:21:30Z","snapshot_observed_at":"2026-08-13T05:03:53.834176Z","submitted_at":"2023-12-12T18:58:18Z","title":"VILA: On Pre-training for Visual Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07533","snapshot_observed_at":"2026-08-11T11:19:55.561562Z","title":"Ji Lin, et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15574","last_updated":"2024-12-20T05:11:51Z","snapshot_observed_at":"2026-08-14T09:12:05.342191Z","submitted_at":"2024-12-20T05:11:51Z","title":"J-EDI QA: Benchmark for deep-sea organism-specific multimodal LLM","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T11:19:55.561562Z"},"links":{"cited_paper":"/paper/2312.07533","citing_paper":"/paper/2412.15574"},"observation_digest":"sha256:de7ac91dfdcf0f311ee07c670c1fcf5b94e7361e2ecfc054bb7843caf44d3799","observation_id":"e2b7b835-0f67-4478-9862-97133b946902","resolution":{"observed_at":"2026-08-11T11:19:55.561562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.08920","last_updated":"2019-05-13T23:28:48Z","snapshot_observed_at":"2026-08-14T16:44:17.918160Z","submitted_at":"2019-04-18T17:55:37Z","title":"Towards VQA Models That Can Read","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.08920","snapshot_observed_at":"2026-08-11T11:19:55.566918Z","title":"Amanpreet Singh, et al","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2412.15574","last_updated":"2024-12-20T05:11:51Z","snapshot_observed_at":"2026-08-14T09:12:05.342191Z","submitted_at":"2024-12-20T05:11:51Z","title":"J-EDI QA: Benchmark for deep-sea organism-specific multimodal LLM","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T11:19:55.566918Z"},"links":{"cited_paper":"/paper/1904.08920","citing_paper":"/paper/2412.15574"},"observation_digest":"sha256:0c74eee7c18454ae05b9d02b8b213b3772eb71c934dfa0d8778ecc68f0f7065d","observation_id":"b164f4d5-3d5e-4551-8311-461005726f74","resolution":{"observed_at":"2026-08-11T11:19:55.566918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-08T03:31:37.699253Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-11T11:19:55.572606Z","title":"Weihao Yu, et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15574","last_updated":"2024-12-20T05:11:51Z","snapshot_observed_at":"2026-08-14T09:12:05.342191Z","submitted_at":"2024-12-20T05:11:51Z","title":"J-EDI QA: Benchmark for deep-sea organism-specific multimodal LLM","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T11:19:55.572606Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2412.15574"},"observation_digest":"sha256:427c8c8ceb9b92283eb7b2d51e5eaed698b1f15ff0cd5d8648e61173180f91ed","observation_id":"9c804421-ee55-4c21-b32e-d065cf3b9bf9","resolution":{"observed_at":"2026-08-11T11:19:55.572606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-11T11:19:55.578987Z","title":"Bohao Li, et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15574","last_updated":"2024-12-20T05:11:51Z","snapshot_observed_at":"2026-08-14T09:12:05.342191Z","submitted_at":"2024-12-20T05:11:51Z","title":"J-EDI QA: Benchmark for deep-sea organism-specific multimodal LLM","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T11:19:55.578987Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2412.15574"},"observation_digest":"sha256:193b91c35c2944b2f26217bf28902049fcea62e55a3f384f1f02fba64d172faa","observation_id":"52090fd6-6981-47d3-977a-0d6b209b1977","resolution":{"observed_at":"2026-08-11T11:19:55.578987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-11T11:19:55.584128Z","title":"Chaoyou Fu, et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15574","last_updated":"2024-12-20T05:11:51Z","snapshot_observed_at":"2026-08-14T09:12:05.342191Z","submitted_at":"2024-12-20T05:11:51Z","title":"J-EDI QA: Benchmark for deep-sea organism-specific multimodal LLM","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T11:19:55.584128Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2412.15574"},"observation_digest":"sha256:4f393ddc3cc505864ea1b6207d58e89c04f684171c01a8f7a3f464d898993dbb","observation_id":"37bb9b46-26fb-4f5a-b339-e0e82f0ed43a","resolution":{"observed_at":"2026-08-11T11:19:55.584128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1902.09506","last_updated":"2019-05-10T22:24:55Z","snapshot_observed_at":"2026-08-14T17:11:31.853801Z","submitted_at":"2019-02-25T18:37:49Z","title":"GQA: A New Dataset for Real-World Visual Reasoning and Compositional Question Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.09506","snapshot_observed_at":"2026-08-11T11:19:55.590272Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.15574","last_updated":"2024-12-20T05:11:51Z","snapshot_observed_at":"2026-08-14T09:12:05.342191Z","submitted_at":"2024-12-20T05:11:51Z","title":"J-EDI QA: Benchmark for deep-sea organism-specific multimodal LLM","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T11:19:55.590272Z"},"links":{"cited_paper":"/paper/1902.09506","citing_paper":"/paper/2412.15574"},"observation_digest":"sha256:49c5d55c34fac93835e654f7f05a56eeb31194d370035aa1164fa65f0afcf070","observation_id":"f1f298b3-084b-498a-ad5d-cd3856b114c3","resolution":{"observed_at":"2026-08-11T11:19:55.590272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09265","last_updated":"2023-06-15T16:39:24Z","snapshot_observed_at":"2026-08-14T09:12:02.041204Z","submitted_at":"2023-06-15T16:39:24Z","title":"LVLM-eHub: A Comprehensive Evaluation Benchmark for Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09265","snapshot_observed_at":"2026-08-11T11:19:55.596858Z","title":"Peng Xu, et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15574","last_updated":"2024-12-20T05:11:51Z","snapshot_observed_at":"2026-08-14T09:12:05.342191Z","submitted_at":"2024-12-20T05:11:51Z","title":"J-EDI QA: Benchmark for deep-sea organism-specific multimodal LLM","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T11:19:55.596858Z"},"links":{"cited_paper":"/paper/2306.09265","citing_paper":"/paper/2412.15574"},"observation_digest":"sha256:eee739fadf198dd9e5adcbc037cee7008542983e1fe83c8986fd88544a2bcff9","observation_id":"e13a3f53-9826-477a-bb6f-f16d829690da","resolution":{"observed_at":"2026-08-11T11:19:55.596858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-08-11T03:45:43.920485Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-11T11:19:55.602716Z","title":"Ahmed Masry, et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.15574","last_updated":"2024-12-20T05:11:51Z","snapshot_observed_at":"2026-08-14T09:12:05.342191Z","submitted_at":"2024-12-20T05:11:51Z","title":"J-EDI QA: Benchmark for deep-sea organism-specific multimodal LLM","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T11:19:55.602716Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2412.15574"},"observation_digest":"sha256:cb387b454aebf567b6d55b845b07246f8bde994038b913b2b98841b96c57aa26","observation_id":"8171a99e-f033-4905-880f-20e6cc1afa22","resolution":{"observed_at":"2026-08-11T11:19:55.602716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12983","last_updated":"2023-11-21T20:34:47Z","snapshot_observed_at":"2026-08-13T10:06:26.439949Z","submitted_at":"2023-11-21T20:34:47Z","title":"GAIA: a benchmark for General AI Assistants","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12983","snapshot_observed_at":"2026-08-11T11:19:55.610958Z","title":"Grégoire Mialon, et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15574","last_updated":"2024-12-20T05:11:51Z","snapshot_observed_at":"2026-08-14T09:12:05.342191Z","submitted_at":"2024-12-20T05:11:51Z","title":"J-EDI QA: Benchmark for deep-sea organism-specific multimodal LLM","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T11:19:55.610958Z"},"links":{"cited_paper":"/paper/2311.12983","citing_paper":"/paper/2412.15574"},"observation_digest":"sha256:173cd39124ff795e431451fe29484d7cbba0b008e8a7072ced440383e5b63670","observation_id":"ceed74dc-d043-49e9-82ab-63a82947bb50","resolution":{"observed_at":"2026-08-11T11:19:55.610958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.06687","last_updated":"2023-11-06T07:02:19Z","snapshot_observed_at":"2026-08-13T11:19:29.069742Z","submitted_at":"2023-06-11T14:01:17Z","title":"LAMM: Language-Assisted Multi-Modal Instruction-Tuning Dataset, Framework, and Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.06687","snapshot_observed_at":"2026-08-11T11:19:55.616921Z","title":"Zhenfei Yin, et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15574","last_updated":"2024-12-20T05:11:51Z","snapshot_observed_at":"2026-08-14T09:12:05.342191Z","submitted_at":"2024-12-20T05:11:51Z","title":"J-EDI QA: Benchmark for deep-sea organism-specific multimodal LLM","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T11:19:55.616921Z"},"links":{"cited_paper":"/paper/2306.06687","citing_paper":"/paper/2412.15574"},"observation_digest":"sha256:bdd5f5905ea1521a58fabb543294b4447f3160184e861617aef48b34cc906cd9","observation_id":"c43b7dc4-e864-4441-90c3-98f940ce2eef","resolution":{"observed_at":"2026-08-11T11:19:55.616921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02813","last_updated":"2025-05-22T08:22:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-04T15:31:26Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02813","snapshot_observed_at":"2026-08-11T11:19:55.624220Z","title":"Xiang Yue, et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15574","last_updated":"2024-12-20T05:11:51Z","snapshot_observed_at":"2026-08-14T09:12:05.342191Z","submitted_at":"2024-12-20T05:11:51Z","title":"J-EDI QA: Benchmark for deep-sea organism-specific multimodal LLM","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T11:19:55.624220Z"},"links":{"cited_paper":"/paper/2409.02813","citing_paper":"/paper/2412.15574"},"observation_digest":"sha256:b0d4e5f6e311c428335878deadb71afb73d0f5260b8c26077c1bcece356229fe","observation_id":"7b93a2db-f74a-4028-ae7a-d3742f483373","resolution":{"observed_at":"2026-08-11T11:19:55.624220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.03493","last_updated":"2020-06-17T16:47:55Z","snapshot_observed_at":"2026-08-14T16:50:39.754754Z","submitted_at":"2019-04-06T16:50:31Z","title":"VATEX: A Large-Scale, High-Quality Multilingual Dataset for Video-and-Language Research","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.03493","snapshot_observed_at":"2026-08-11T11:19:55.631307Z","title":"Xin Wang, et al","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.15574","last_updated":"2024-12-20T05:11:51Z","snapshot_observed_at":"2026-08-14T09:12:05.342191Z","submitted_at":"2024-12-20T05:11:51Z","title":"J-EDI QA: Benchmark for deep-sea organism-specific multimodal LLM","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T11:19:55.631307Z"},"links":{"cited_paper":"/paper/1904.03493","citing_paper":"/paper/2412.15574"},"observation_digest":"sha256:8c5d4348a62772195034e8ec5300a053d5e3465b8ce701c0f9d42ac7d4c26b74","observation_id":"298c5c78-70e8-464c-aa83-3959799fe7ca","resolution":{"observed_at":"2026-08-11T11:19:55.631307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13786","last_updated":"2023-10-30T18:35:48Z","snapshot_observed_at":"2026-08-15T18:29:51.016687Z","submitted_at":"2023-05-23T07:54:37Z","title":"Perception Test: A Diagnostic Benchmark for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13786","snapshot_observed_at":"2026-08-11T11:19:55.636847Z","title":"Viorica Pătrăucean, et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15574","last_updated":"2024-12-20T05:11:51Z","snapshot_observed_at":"2026-08-14T09:12:05.342191Z","submitted_at":"2024-12-20T05:11:51Z","title":"J-EDI QA: Benchmark for deep-sea organism-specific multimodal LLM","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T11:19:55.636847Z"},"links":{"cited_paper":"/paper/2305.13786","citing_paper":"/paper/2412.15574"},"observation_digest":"sha256:0b0b60dc6053c6dc4a744efdae06b74504c4d69ef01d0b0b3e702cd18427e7e0","observation_id":"3630f9cd-e051-4639-8f7b-db90f12e0eb9","resolution":{"observed_at":"2026-08-11T11:19:55.636847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.09513","last_updated":"2022-10-17T07:46:47Z","snapshot_observed_at":"2026-08-14T07:30:23.106338Z","submitted_at":"2022-09-20T07:04:24Z","title":"Learn to Explain: Multimodal Reasoning via Thought Chains for Science Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.09513","snapshot_observed_at":"2026-08-11T11:19:55.643473Z","title":"Pan Lu, et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.15574","last_updated":"2024-12-20T05:11:51Z","snapshot_observed_at":"2026-08-14T09:12:05.342191Z","submitted_at":"2024-12-20T05:11:51Z","title":"J-EDI QA: Benchmark for deep-sea organism-specific multimodal LLM","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T11:19:55.643473Z"},"links":{"cited_paper":"/paper/2209.09513","citing_paper":"/paper/2412.15574"},"observation_digest":"sha256:ee2d31f757de78edfee4cc08d8c01bf2cd101bf8f96805fe04fcc1c0e32bbb19","observation_id":"a3f8adc9-9e04-453b-bbad-62d03cbc9531","resolution":{"observed_at":"2026-08-11T11:19:55.643473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07824","last_updated":"2024-04-11T15:09:22Z","snapshot_observed_at":"2026-08-15T12:47:33.308070Z","submitted_at":"2024-04-11T15:09:22Z","title":"Heron-Bench: A Benchmark for Evaluating Vision Language Models in Japanese","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07824","snapshot_observed_at":"2026-08-11T11:19:55.648610Z","title":"Yuichi Inoue, et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15574","last_updated":"2024-12-20T05:11:51Z","snapshot_observed_at":"2026-08-14T09:12:05.342191Z","submitted_at":"2024-12-20T05:11:51Z","title":"J-EDI QA: Benchmark for deep-sea organism-specific multimodal LLM","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T11:19:55.648610Z"},"links":{"cited_paper":"/paper/2404.07824","citing_paper":"/paper/2412.15574"},"observation_digest":"sha256:2e938d4deeb5005278cee83e1f39b2a515b7e3b8c14df09f9c7bee4e9b11b34a","observation_id":"857cc4c2-e511-49b9-a51e-46bb6b214275","resolution":{"observed_at":"2026-08-11T11:19:55.648610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13187","last_updated":"2025-01-27T10:19:44Z","snapshot_observed_at":"2026-08-13T00:49:56.474207Z","submitted_at":"2024-03-19T22:56:53Z","title":"Evolutionary Optimization of Model Merging Recipes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13187","snapshot_observed_at":"2026-08-11T11:19:55.653912Z","title":"arXiv preprint, arXiv: 2403.13187, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15574","last_updated":"2024-12-20T05:11:51Z","snapshot_observed_at":"2026-08-14T09:12:05.342191Z","submitted_at":"2024-12-20T05:11:51Z","title":"J-EDI QA: Benchmark for deep-sea organism-specific multimodal LLM","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T11:19:55.653912Z"},"links":{"cited_paper":"/paper/2403.13187","citing_paper":"/paper/2412.15574"},"observation_digest":"sha256:43fc95addc06159f3e0c8caa64491685d689a4453f2f186fd623577bce2a50eb","observation_id":"b4c762fd-04a0-46d5-981f-c0bcca5d4c38","resolution":{"observed_at":"2026-08-11T11:19:55.653912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17250","last_updated":"2025-03-19T08:24:14Z","snapshot_observed_at":"2026-08-12T22:17:19.530921Z","submitted_at":"2024-10-22T17:59:56Z","title":"JMMMU: A Japanese Massive Multi-discipline Multimodal Understanding Benchmark for Culture-aware Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17250","snapshot_observed_at":"2026-08-11T11:19:55.660432Z","title":"arXiv preprint, arXiv:2410.17250, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15574","last_updated":"2024-12-20T05:11:51Z","snapshot_observed_at":"2026-08-14T09:12:05.342191Z","submitted_at":"2024-12-20T05:11:51Z","title":"J-EDI QA: Benchmark for deep-sea organism-specific multimodal LLM","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T11:19:55.660432Z"},"links":{"cited_paper":"/paper/2410.17250","citing_paper":"/paper/2412.15574"},"observation_digest":"sha256:0a9e6103532105432874c368d32dc85de4b1d3751a3c1c2b25537f38e4d16463","observation_id":"7ba94a51-1a69-444b-83cd-954f656fe79d","resolution":{"observed_at":"2026-08-11T11:19:55.660432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.15574","last_updated":"2024-12-20T05:11:51Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T09:12:05.342191Z","submitted_at":"2024-12-20T05:11:51Z","title":"J-EDI QA: Benchmark for deep-sea organism-specific multimodal LLM"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 2 inbound Pith citation observations for arXiv:2412.15574."}