{"as_of":"2026-08-08T13:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c83f2167a8dfa47cced05195e67ca8fb6641f10eb48e788f4cd0e1fc4375ce32","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:10:21.111443Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:22:23.855247Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T00:22:26.516274Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-07T15:01:49.505888Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"cited_work":{"arxiv_id":"2505.17139","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.17139","snapshot_observed_at":"2026-08-07T00:22:26.516274Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","venue":"cs.CL","work_id":"4260d01d-7a7f-4f47-8a11-49c1d1f01d2d","year":2025},"citing_paper":{"arxiv_id":"2506.14345","last_updated":"2025-06-17T09:38:45Z","snapshot_observed_at":"2026-08-07T14:48:30.252463Z","submitted_at":"2025-06-17T09:38:45Z","title":"A Vision for Geo-Temporal Deep Research Systems: Towards Comprehensive, Transparent, and Reproducible Geo-Temporal Information Synthesis","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T00:22:23.855247Z"},"links":{"cited_paper":"/paper/2505.17139","citing_paper":"/paper/2506.14345"},"observation_digest":"sha256:911555af3e6dd25c49cc87cc9ca7bc8aadcbc6cfa0be06a9e57f3916debb5927","observation_id":"e1b52b5b-524f-4269-898e-da894a8fef87","resolution":{"observed_at":"2026-08-07T00:22:26.646516Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.17139/citation-record","integrity":"/paper/2505.17139/integrity","json":"/paper/2505.17139/citation-record.json","paper":"/paper/2505.17139"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T15:10:20.566305Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-07T15:01:49.505888Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.566305Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:a3a06a48692e5acbda42f117d6af67159cc44854e93db3b71198fd06b44794fc","observation_id":"12e6ab02-ab96-4435-9f59-007f7f320169","resolution":{"observed_at":"2026-08-07T15:10:20.566305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02031","last_updated":"2024-09-03T10:19:52Z","snapshot_observed_at":"2026-07-06T16:27:07.155310Z","submitted_at":"2023-10-03T13:17:35Z","title":"OceanGPT: A Large Language Model for Ocean Science Tasks","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02031","snapshot_observed_at":"2026-08-07T15:10:20.576960Z","title":"Oceangpt: A large language model for ocean science tasks.arXiv preprint arXiv:2310.02031, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-07T15:01:49.505888Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.576960Z"},"links":{"cited_paper":"/paper/2310.02031","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:e9376b8711e374d29c7eb4669a423dcb2c43812b5a3554bb857d43dd2576e732","observation_id":"6f7f9f8a-0dc7-4e7c-b5ab-106c5b6bd07a","resolution":{"observed_at":"2026-08-07T15:10:20.576960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:22.724660Z","title":"Matplotlib and seaborn","venue":null,"work_id":"25e69ff4-e0be-4df8-873d-6c93689c596b","year":2019},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-07T15:01:49.505888Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.586447Z"},"links":{"citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:5246dd115c8b7ff820a5bdfe6c5d939eb649cc765c9cdf381cc9bf8343dcc482","observation_id":"3b9a4a9b-84d1-49dc-8890-d6f090abcec9","resolution":{"observed_at":"2026-08-07T15:10:22.734997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:22.696127Z","title":"This reference does not exist: an exploration of llm citation accuracy and relevance","venue":null,"work_id":"6c2321e2-b4d9-420d-b60e-9cf32779e44b","year":2024},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-07T15:01:49.505888Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.597692Z"},"links":{"citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:c23a96aaba38b4ff226bde89f8ed8a82ed0c940ea9478fbc67e219342c707aa5","observation_id":"ee12df61-3140-427d-89bd-3baa7c2563f7","resolution":{"observed_at":"2026-08-07T15:10:22.704132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01976","last_updated":"2024-10-18T06:52:17Z","snapshot_observed_at":"2026-08-01T08:03:39.698594Z","submitted_at":"2024-03-04T12:19:28Z","title":"SciAssess: Benchmarking LLM Proficiency in Scientific Literature Analysis","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01976","snapshot_observed_at":"2026-08-07T15:10:20.605939Z","title":"Sciassess: Benchmarking llm proficiency in scientific literature analysis.arXiv preprint arXiv:2403.01976, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-07T15:01:49.505888Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.605939Z"},"links":{"cited_paper":"/paper/2403.01976","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:801ac449655c821aee7f8349535f71b486bf3c6595d3cb5254954fb8611c0d67","observation_id":"03694014-52e2-4d23-a59a-ca3afde7f50d","resolution":{"observed_at":"2026-08-07T15:10:20.605939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2407.14788","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:22.183748Z","title":"On the design and analysis of llm-based algorithms.arXiv preprint arXiv:2407.14788, 2024","venue":null,"work_id":"83ebe501-1fb9-4750-9363-dc82d9a53489","year":2024},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-07T15:01:49.505888Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.613696Z"},"links":{"citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:2104f6bdcf484ae3070681e9af638ce8f29525fa84b58f1d0142054163f77645","observation_id":"5c6626de-6fc7-4472-9abd-8611b34178a7","resolution":{"observed_at":"2026-08-07T15:10:22.199410Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:22.672149Z","title":"Grok, gemini, chatgpt and deepseek: Com- parison and applications in conversational artificial intelligence.INTELIGENCIA ARTIFICIAL, 2(1), 2025","venue":null,"work_id":"4f52d76f-4ec9-4796-8567-37c499700078","year":2025},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-07T15:01:49.505888Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.624596Z"},"links":{"citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:c7165719989686cae92cdbecbbee5720936a32ed167b6e58361b3297d9593f3c","observation_id":"5c3a3ed5-4562-4bb9-a41d-72eecfe0a441","resolution":{"observed_at":"2026-08-07T15:10:22.679570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:22.644780Z","title":"K2: A foundation language model for geoscience knowledge understanding and utilization","venue":null,"work_id":"183bbd3d-8e90-4614-a301-4e4d01573bcd","year":2024},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-07T15:01:49.505888Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.633444Z"},"links":{"citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:474cbab1c998c8f7e807d69d7d38e2bc571fba06d00551800766c68a5f1c1c7e","observation_id":"ddd7c2a3-4a07-4ef7-8503-14a8219b0570","resolution":{"observed_at":"2026-08-07T15:10:22.653051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:22.621984Z","title":"A deep learning model based on bert and sentence transformer for semantic keyphrase extraction on big social data.IEEE Access, 9:165252–165261, 2021","venue":null,"work_id":"23f0e196-78bb-48d2-bb1a-234772a346de","year":2021},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-07T15:01:49.505888Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.642177Z"},"links":{"citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:10e1ac000c5dd783c0fa167f7d6203b6f57fcbb3a3b10b32d919a0ba251b0b3b","observation_id":"3a77f33f-629b-42ae-aa1d-af2ec3f14e6e","resolution":{"observed_at":"2026-08-07T15:10:22.629090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14739","last_updated":"2025-03-28T15:21:44Z","snapshot_observed_at":"2026-07-29T21:41:16.650188Z","submitted_at":"2025-02-20T17:05:58Z","title":"SuperGPQA: Scaling LLM Evaluation across 285 Graduate Disciplines","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14739","snapshot_observed_at":"2026-08-07T15:10:20.649206Z","title":"Supergpqa: Scaling llm evaluation across 285 graduate disciplines.arXiv preprint arXiv:2502.14739, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-07T15:01:49.505888Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.649206Z"},"links":{"cited_paper":"/paper/2502.14739","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:810c9ca89eb2ae8708fad3f76805c9720e7adaf0eca126cb0b751ed89b156dfd","observation_id":"8e52f789-699d-415e-8981-809fe1d85431","resolution":{"observed_at":"2026-08-07T15:10:20.649206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:22.588673Z","title":"The impact factor.Current contents, 25(20):3–7, 1994","venue":null,"work_id":"39d6820f-6971-4c5f-b396-c7cb75f163f2","year":1994},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-07T15:01:49.505888Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.656055Z"},"links":{"citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:17392e0f24a89445b63996505b20e6c95718f67315841a2393ccbec5c0daf5cb","observation_id":"901f78dc-51e1-4aa5-89ae-83a1174aeb2f","resolution":{"observed_at":"2026-08-07T15:10:22.599611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T15:10:20.662840Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-07T15:01:49.505888Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.662840Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:18faa409a0678316baab94ba8e0a95c7d4e09c2f909ab9d26b33131297690d1b","observation_id":"558f8956-d940-4cbb-ac35-562400adbf7a","resolution":{"observed_at":"2026-08-07T15:10:20.662840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:22.550190Z","title":"Llm-based code generation method for golang compiler testing","venue":null,"work_id":"9c4c78fe-527e-4c3c-ad95-ed5895f1f416","year":2023},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-07T15:01:49.505888Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.674468Z"},"links":{"citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:c7e15ec8660a0b8f49278afa0403bf90137591cafb4e01e7c867d81a91c0ddbc","observation_id":"a51b57c8-8b18-4140-ba82-5509949b35fe","resolution":{"observed_at":"2026-08-07T15:10:22.566077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13773","last_updated":"2024-06-04T10:42:01Z","snapshot_observed_at":"2026-07-06T18:48:42.015848Z","submitted_at":"2024-06-04T10:42:01Z","title":"OpenDataLab: Empowering General Artificial Intelligence with Open Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13773","snapshot_observed_at":"2026-08-07T15:10:20.683625Z","title":"Opendatalab: Empowering general artificial intelligence with open datasets.arXiv preprint arXiv:2407.13773, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-07T15:01:49.505888Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.683625Z"},"links":{"cited_paper":"/paper/2407.13773","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:3e2d12c49dc30863ee5e1967ce2cb97519d6af973544c00dee997e0908167489","observation_id":"95be0cb6-704e-402e-886b-af5bf384528f","resolution":{"observed_at":"2026-08-07T15:10:20.683625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00916","last_updated":"2025-02-02T21:05:21Z","snapshot_observed_at":"2026-07-06T20:29:55.352526Z","submitted_at":"2025-02-02T21:05:21Z","title":"The Accuracy, Robustness, and Readability of LLM-Generated Sustainability-Related Word Definitions","version":1},"cited_work":{"arxiv_id":"2502.00916","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.00916","snapshot_observed_at":"2026-08-07T15:10:22.021571Z","title":"The Accuracy, Robustness, and Readability of LLM-Generated Sustainability-Related Word Definitions","venue":"cs.CL","work_id":"c977a6ef-e5e7-4285-98f4-1636b8fd1de1","year":2025},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-07T15:01:49.505888Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.695723Z"},"links":{"cited_paper":"/paper/2502.00916","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:94c8e19dbebfeedababab8ede347028ad535c4eca6698f60497c620fd307b189","observation_id":"91fc2325-9511-40b3-a819-e546cb97576a","resolution":{"observed_at":"2026-08-07T15:10:22.028408Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-07T15:10:20.704332Z","title":"Measuring massive multitask language understanding.arXiv preprint arXiv:2009.03300, 2020","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-07T15:01:49.505888Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.704332Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:60e96016af1c5b060790868f0245747b55cac58a16bbe4a63207fa59d4d10ff3","observation_id":"b1fc3332-5753-4732-b197-51241d8d9f52","resolution":{"observed_at":"2026-08-07T15:10:20.704332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:20.713964Z","title":"The era5 global reanalysis.Quarterly journal of the royal meteorological society, 146(730):1999–2049, 2020","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-07T15:01:49.505888Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.713964Z"},"links":{"citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:6943f1c894ee365f5adf87b47a8888e4473f7d235b9970bedae2b9acd610dea5","observation_id":"78b29462-ae4a-485d-b659-4a848770e410","resolution":{"observed_at":"2026-08-07T15:10:20.713964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:20.723245Z","title":"Gpt-4o: The cutting-edge advancement in multimodal llm.Authorea Preprints, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-07T15:01:49.505888Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.723245Z"},"links":{"citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:55116600c6c36724189ccd65e97a17130ce96627e7cbb979381d3349cb539725","observation_id":"281212e1-4636-41b7-acc7-a9c31a696dea","resolution":{"observed_at":"2026-08-07T15:10:20.723245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.00116","last_updated":"2023-03-31T20:24:14Z","snapshot_observed_at":"2026-08-05T20:36:19.181835Z","submitted_at":"2023-03-31T20:24:14Z","title":"Enhancing Large Language Models with Climate Resources","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.00116","snapshot_observed_at":"2026-08-07T15:10:20.734284Z","title":"Enhancing large language models with climate resources.arXiv preprint arXiv:2304.00116, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-07T15:01:49.505888Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.734284Z"},"links":{"cited_paper":"/paper/2304.00116","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:23ab706c95f60b00e99e51b3e4768dd5e878e7f14c01c13057672d0c15adb636","observation_id":"ebe8e811-81a1-49bf-b046-a2957d4f76d5","resolution":{"observed_at":"2026-08-07T15:10:20.734284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:22.487417Z","title":null,"venue":null,"work_id":"62fe9c5e-7435-49b7-8d18-b26ab9bd59c9","year":2024},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-07T15:01:49.505888Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.757242Z"},"links":{"citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:08ef2532ee973ed47e9854cfea1f0b896b1906d0ca57f05547f6a480eadcd91e","observation_id":"afffe1b5-8a9f-49a9-9371-5b9914af7231","resolution":{"observed_at":"2026-08-07T15:10:22.494299Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:22.465207Z","title":"Iterative large language models evolution through self-critique","venue":null,"work_id":"914ccef8-9b84-4872-a0fb-76965844cde1","year":2024},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-07T15:01:49.505888Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.766466Z"},"links":{"citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:10f160246bccbf369a70ec08983e44a744591c7b4ef1f01a1fa45138eee9d5f6","observation_id":"74aae74f-2757-4bb5-b553-06560836c397","resolution":{"observed_at":"2026-08-07T15:10:22.471709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13889","last_updated":"2024-12-07T09:43:20Z","snapshot_observed_at":"2026-07-06T19:05:44.820697Z","submitted_at":"2024-08-25T16:43:19Z","title":"LLM with Relation Classifier for Document-Level Relation Extraction","version":2},"cited_work":{"arxiv_id":"2408.13889","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.13889","snapshot_observed_at":"2026-08-07T15:10:21.947644Z","title":"LLM with Relation Classifier for Document-Level Relation Extraction","venue":"cs.CL","work_id":"0c03343a-b758-450d-8550-788bf3d76a21","year":2024},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-07T15:01:49.505888Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.777262Z"},"links":{"cited_paper":"/paper/2408.13889","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:eb9a69a16333f8c8448e2460d78dba5862719d68a9b694a8c5ca6904b74bef0d","observation_id":"6bc77e47-f0a3-4788-b6d7-8306b957569e","resolution":{"observed_at":"2026-08-07T15:10:21.956033Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-07T15:49:03.741523Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-08-07T15:10:20.798959Z","title":"Perception, reason, think, and plan: A survey on large multimodal reasoning models.arXiv preprint arXiv:2505.04921, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-07T15:01:49.505888Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.798959Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:d908f66d18500edfa17ebfa2acda4cac19722f5ff1b2ce84659f2599b11d4cf5","observation_id":"fe3cb26d-1bf5-4cb4-8269-3a815cbc21c2","resolution":{"observed_at":"2026-08-07T15:10:20.798959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:22.437666Z","title":null,"venue":null,"work_id":"a9c641ea-308c-42aa-af56-f69f59e33a4f","year":2025},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-07T15:01:49.505888Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.819684Z"},"links":{"citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:1f29a9edaa0384570a46da4d2a72ee8fa0c8dcd4028b69cba63dd5b8652bf3c6","observation_id":"872ab3e7-b821-49cc-87ec-146b1e0ff023","resolution":{"observed_at":"2026-08-07T15:10:22.445208Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T15:10:20.829089Z","title":"Deepseek-v3 technical report.arXiv preprint arXiv:2412.19437, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-07T15:01:49.505888Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.829089Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:405a8534b0a8a6b03a7f094dc5e06c6290432d4183c8639ac92966c6856927de","observation_id":"056aff60-4819-4244-93b8-6950fc322455","resolution":{"observed_at":"2026-08-07T15:10:20.829089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06292","last_updated":"2024-09-01T00:41:18Z","snapshot_observed_at":"2026-07-06T18:59:43.564435Z","submitted_at":"2024-08-12T16:58:11Z","title":"The AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06292","snapshot_observed_at":"2026-08-07T15:10:20.840356Z","title":"The ai scien- tist: Towards fully automated open-ended scientific discovery.arXiv preprint arXiv:2408.06292, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-07T15:01:49.505888Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.840356Z"},"links":{"cited_paper":"/paper/2408.06292","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:0bfef613a7999fbdd10fec30b56f5370c492909dd381840ce30c84e11d479362","observation_id":"62bd0b92-6d7e-4daa-b372-7e9b269ae79d","resolution":{"observed_at":"2026-08-07T15:10:20.840356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:20.852395Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering.Advances in Neural Information Processing Systems, 35:2507–2521, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-07T15:01:49.505888Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.852395Z"},"links":{"citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:42baf8778ba38ef55552479798b3c962ea684097cc55af84bcb82688a1eb8019","observation_id":"6531b314-a0a7-4985-8138-d996dd5fdde2","resolution":{"observed_at":"2026-08-07T15:10:20.852395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:22.392871Z","title":"The five environmental spheres","venue":null,"work_id":"8de8567b-242f-4990-8ab6-8654f888b9ea","year":2006},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-07T15:01:49.505888Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.859905Z"},"links":{"citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:17637a4b3471da7f16b2c76d9158b65edfc31dfc4dc6b760148d8304c96fb2e8","observation_id":"8f689b85-f820-48e3-a3e8-f959eef2b0ac","resolution":{"observed_at":"2026-08-07T15:10:22.399166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16701","last_updated":"2025-03-09T18:31:12Z","snapshot_observed_at":"2026-07-06T19:37:38.112629Z","submitted_at":"2024-10-22T05:12:19Z","title":"ClimaQA: An Automated Evaluation Framework for Climate Question Answering Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16701","snapshot_observed_at":"2026-08-07T15:10:20.868023Z","title":"Climaqa: An auto- mated evaluation framework for climate foundation models.arXiv preprint arXiv:2410.16701, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-07T15:01:49.505888Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.868023Z"},"links":{"cited_paper":"/paper/2410.16701","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:3a6a441b62b8f82fc44851ee5f6168d2586b9a23c126c50d8fb0282e9f7eecd8","observation_id":"bd80d183-00d0-4c2f-86be-20dacafbcab6","resolution":{"observed_at":"2026-08-07T15:10:20.868023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:22.369851Z","title":"Seafloorai: A large-scale vision- language dataset for seafloor geological survey.Advances in Neural Information Processing Systems, 37:22107–22123, 2024","venue":null,"work_id":"45e98122-2a91-4465-aa3d-f729d8a49086","year":2024},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-07T15:01:49.505888Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.876565Z"},"links":{"citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:14b45427ad9b2c571e7408e3b82d0c3c10b17839ca1dae2c5f7d2187759136b1","observation_id":"45cf0f75-ab81-4122-ba23-88b942d26cd5","resolution":{"observed_at":"2026-08-07T15:10:22.378751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00492","last_updated":"2024-05-01T12:59:37Z","snapshot_observed_at":"2026-07-06T18:08:13.456457Z","submitted_at":"2024-05-01T12:59:37Z","title":"Is Temperature the Creativity Parameter of Large Language Models?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00492","snapshot_observed_at":"2026-08-07T15:10:20.885364Z","title":"Is temperature the creativity parameter of large language models?arXiv preprint arXiv:2405.00492, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-07T15:01:49.505888Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.885364Z"},"links":{"cited_paper":"/paper/2405.00492","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:16cc764f9775d8c27de1467b388509a06363e732185ddbc697076c3cf6cd56ef","observation_id":"4c1b245e-0f1d-4ba5-bac3-493010190ebf","resolution":{"observed_at":"2026-08-07T15:10:20.885364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14249","last_updated":"2026-02-20T04:23:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-24T05:27:46Z","title":"Humanity's Last Exam","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14249","snapshot_observed_at":"2026-08-07T15:10:20.895287Z","title":"Humanity’s last exam.arXiv preprint arXiv:2501.14249, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-07T15:01:49.505888Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.895287Z"},"links":{"cited_paper":"/paper/2501.14249","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:496a0615be7deab75e4de66108b7d012931f577c20adfc5d2ff5513d48ccef4b","observation_id":"c50de15f-b858-4496-af4f-72d51508e97a","resolution":{"observed_at":"2026-08-07T15:10:20.895287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:20.903533Z","title":"Gpqa: A graduate-level google-proof q&a benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-07T15:01:49.505888Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.903533Z"},"links":{"citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:3945c871b23d998527bc288f857b618f4cd6ac27e71403a4f03cbb9eaf10d644","observation_id":"13166c0e-916b-40bc-b5bc-c9685bceabd0","resolution":{"observed_at":"2026-08-07T15:10:20.903533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04168","last_updated":"2025-05-12T19:41:57Z","snapshot_observed_at":"2026-07-06T19:11:27.624528Z","submitted_at":"2024-09-06T10:09:41Z","title":"From Calculation to Adjudication: Examining LLM judges on Mathematical Reasoning Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04168","snapshot_observed_at":"2026-08-07T15:10:20.913666Z","title":"From calculation to adjudication: Examining llm judges on mathematical reasoning tasks.arXiv preprint arXiv:2409.04168, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-07T15:01:49.505888Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.913666Z"},"links":{"cited_paper":"/paper/2409.04168","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:a345013cb118a3167b66d7db6ea97128aefb6e6a7031bd444fa7d6b1ba7a0e08","observation_id":"7d5f817d-5d5f-484e-9271-46d7e81fbf16","resolution":{"observed_at":"2026-08-07T15:10:20.913666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09085","last_updated":"2022-11-16T18:06:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-16T18:06:33Z","title":"Galactica: A Large Language Model for Science","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09085","snapshot_observed_at":"2026-08-07T15:10:20.923953Z","title":"Galactica: A large language model for science.arXiv preprint arXiv:2211.09085, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-07T15:01:49.505888Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.923953Z"},"links":{"cited_paper":"/paper/2211.09085","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:4fe7f01a83173baa3c0e91a40327215a502587e1ba96ad21275c49caa5a1534e","observation_id":"2ea61cff-348e-4ac5-8f3c-92b75c277f79","resolution":{"observed_at":"2026-08-07T15:10:20.923953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T15:10:20.951647Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-07T15:01:49.505888Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.951647Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:95197ec6f08fe1265cb1ca48df66130fc47a57d6c2b5733c71b2e8be1afdf529","observation_id":"673f422b-1eae-4dc7-b4f9-06cf2fd9c73e","resolution":{"observed_at":"2026-08-07T15:10:20.951647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T15:10:20.957403Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.arXiv preprint arXiv:2403.05530, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-07T15:01:49.505888Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.957403Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:696d89ff6ef77a7f68834cad25c93dda30fa98c8295af8480c987c99529edc2e","observation_id":"bf4b7597-e101-4f0e-a4d5-bdccec3f0e9d","resolution":{"observed_at":"2026-08-07T15:10:20.957403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:20.967014Z","title":"Large language models in medicine.Nature medicine, 29(8):1930–1940, 2023","venue":null,"work_id":null,"year":1930},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-07T15:01:49.505888Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.967014Z"},"links":{"citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:09075baddf066559426fddbaafbfa3bd6a767aa33b502a4582594d4aae83187c","observation_id":"acd440be-6d2c-4734-9ae5-b41998e399ba","resolution":{"observed_at":"2026-08-07T15:10:20.967014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.00483","last_updated":"2021-01-02T16:13:06Z","snapshot_observed_at":"2026-08-07T12:53:49.140858Z","submitted_at":"2020-12-01T13:42:37Z","title":"ClimaText: A Dataset for Climate Change Topic Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.00483","snapshot_observed_at":"2026-08-07T15:10:20.976823Z","title":"Climatext: A dataset for climate change topic detection.arXiv preprint arXiv:2012.00483, 2020","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-07T15:01:49.505888Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.976823Z"},"links":{"cited_paper":"/paper/2012.00483","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:3271fe02dacac42ada60d9f1c4bceb5cb04ba4a9545312604c47922529260dba","observation_id":"8756a6bd-781f-4f4d-9f0a-649e2e411800","resolution":{"observed_at":"2026-08-07T15:10:20.976823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18839","last_updated":"2024-09-27T15:35:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T15:35:15Z","title":"MinerU: An Open-Source Solution for Precise Document Content Extraction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18839","snapshot_observed_at":"2026-08-07T15:10:20.984124Z","title":"Mineru: An open-source solution for precise document content extraction.arXiv preprint arXiv:2409.18839, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-07T15:01:49.505888Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.984124Z"},"links":{"cited_paper":"/paper/2409.18839","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:2e7a361362b1936f99547c2bd8cf61855f93b08e787b2823e51481e250b26924","observation_id":"357c6f56-b065-4774-afe6-059089e7894a","resolution":{"observed_at":"2026-08-07T15:10:20.984124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10635","last_updated":"2024-06-28T08:24:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-20T07:01:57Z","title":"SciBench: Evaluating College-Level Scientific Problem-Solving Abilities of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10635","snapshot_observed_at":"2026-08-07T15:10:20.991495Z","title":"Scibench: Evaluating college-level scientific problem-solving abilities of large language models.arXiv preprint arXiv:2307.10635, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-07T15:01:49.505888Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.991495Z"},"links":{"cited_paper":"/paper/2307.10635","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:e519cfc243295192439b98e7ebd92e858236f5b1f709ce71215b418b6a162b54","observation_id":"12c2eb19-6730-442c-bc1a-4f20aabc21d0","resolution":{"observed_at":"2026-08-07T15:10:20.991495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:21.000707Z","title":"Mmlu-pro: A more robust and challenging multi-task language understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-07T15:01:49.505888Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:21.000707Z"},"links":{"citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:fda6a906edc01921e65eeee366c40c7fc3c3c70612b0885205c66dde2c6ed8e3","observation_id":"28c22c42-0dcb-4e72-a4ef-d3c17236d7a5","resolution":{"observed_at":"2026-08-07T15:10:21.000707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.12010","last_updated":"2022-12-17T12:20:08Z","snapshot_observed_at":"2026-08-05T05:26:22.580505Z","submitted_at":"2021-10-22T18:47:34Z","title":"ClimateBert: A Pretrained Language Model for Climate-Related Text","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.12010","snapshot_observed_at":"2026-08-07T15:10:21.012346Z","title":"Climatebert: A pretrained language model for climate-related text.arXiv preprint arXiv:2110.12010, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-07T15:01:49.505888Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:21.012346Z"},"links":{"cited_paper":"/paper/2110.12010","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:503bc7a61b07b02436e22523b1781504d647af33e5a982ac0275b9fb46779ff0","observation_id":"aa62ad69-0af6-4ff4-ba72-3673f29240f7","resolution":{"observed_at":"2026-08-07T15:10:21.012346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:21.021049Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-07T15:01:49.505888Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:21.021049Z"},"links":{"citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:d4f1692f1d45f90cdcf3272db123ffe46e95de20cc55c9d3dbe256c8a8cefdec","observation_id":"ee202403-8be4-410d-aa55-a0fe69b11eba","resolution":{"observed_at":"2026-08-07T15:10:21.021049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10412","last_updated":"2024-06-06T18:33:02Z","snapshot_observed_at":"2026-07-06T17:30:56.216307Z","submitted_at":"2024-02-16T02:32:06Z","title":"Measuring and Reducing LLM Hallucination without Gold-Standard Answers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10412","snapshot_observed_at":"2026-08-07T15:10:21.033271Z","title":"Measuring and reducing llm hallucination without gold-standard answers.arXiv preprint arXiv:2402.10412, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-07T15:01:49.505888Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:21.033271Z"},"links":{"cited_paper":"/paper/2402.10412","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:c0755f7db24ddf012e7d3a71532c2ab72c0fff80f670ec66d59437617433c9b7","observation_id":"882da276-877c-4230-8329-583e317e64c8","resolution":{"observed_at":"2026-08-07T15:10:21.033271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14741","last_updated":"2024-10-06T10:55:23Z","snapshot_observed_at":"2026-08-05T07:52:26.756537Z","submitted_at":"2024-04-23T04:47:22Z","title":"Generate-on-Graph: Treat LLM as both Agent and KG in Incomplete Knowledge Graph Question Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14741","snapshot_observed_at":"2026-08-07T15:10:21.043894Z","title":"Generate-on-graph: Treat llm as both agent and kg in incomplete knowledge graph question answering.arXiv preprint arXiv:2404.14741, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-07T15:01:49.505888Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:21.043894Z"},"links":{"cited_paper":"/paper/2404.14741","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:e7d90ba4799dc1788cdd4e2c9b37cfc62433386b7314bbd7374997e5355ea9bc","observation_id":"a3fa1203-58fb-4250-8f7a-2351f2c302e5","resolution":{"observed_at":"2026-08-07T15:10:21.043894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08066","last_updated":"2025-04-10T18:44:41Z","snapshot_observed_at":"2026-08-01T14:58:15.255937Z","submitted_at":"2025-04-10T18:44:41Z","title":"The AI Scientist-v2: Workshop-Level Automated Scientific Discovery via Agentic Tree Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08066","snapshot_observed_at":"2026-08-07T15:10:21.055953Z","title":"The ai scientist-v2: Workshop-level automated scientific discovery via agentic tree search.arXiv preprint arXiv:2504.08066, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-07T15:01:49.505888Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:21.055953Z"},"links":{"cited_paper":"/paper/2504.08066","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:83acd86cbf516b10de98bcf717484500d21828a796d34cdcca34993e6fd371f6","observation_id":"0a166818-bfdd-4da6-9091-d13638846a20","resolution":{"observed_at":"2026-08-07T15:10:21.055953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T15:10:21.069062Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-07T15:01:49.505888Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:21.069062Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:33fad1269de3906a7381d205d961f5c249d2ff80b65eae87bdb8609b6b8dc0a3","observation_id":"b950559e-db08-45cb-9739-4e1e6c3a1833","resolution":{"observed_at":"2026-08-07T15:10:21.069062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:21.082662Z","title":"Moose-chem: Large language models for rediscovering unseen chemistry scientific hypotheses.arXiv preprint arXiv:2410.07076, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-07T15:01:49.505888Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:21.082662Z"},"links":{"citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:26ee8f4081d2e14b087b452908c35011e94be30d99ab660517a7dd6e4e106849","observation_id":"066a04ea-38ca-43f4-b377-dab3c81ac489","resolution":{"observed_at":"2026-08-07T15:10:21.082662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06201","last_updated":"2024-03-27T06:31:42Z","snapshot_observed_at":"2026-08-05T14:27:49.828946Z","submitted_at":"2024-01-11T15:45:11Z","title":"EASYTOOL: Enhancing LLM-based Agents with Concise Tool Instruction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06201","snapshot_observed_at":"2026-08-07T15:10:21.090064Z","title":"Easytool: Enhancing llm-based agents with concise tool instruction.arXiv preprint arXiv:2401.06201, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-07T15:01:49.505888Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:21.090064Z"},"links":{"cited_paper":"/paper/2401.06201","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:6f3bcc0f6123c2814284c6628aa8e7611cf552d857dde67fdb95619a0323400e","observation_id":"f19a0ba4-1cee-4e09-b7f4-adc0898306ea","resolution":{"observed_at":"2026-08-07T15:10:21.090064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06852","last_updated":"2024-04-25T14:34:28Z","snapshot_observed_at":"2026-07-06T17:28:18.945477Z","submitted_at":"2024-02-10T01:11:59Z","title":"ChemLLM: A Chemical Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06852","snapshot_observed_at":"2026-08-07T15:10:21.095513Z","title":"Chemllm: A chemical large language model.arXiv preprint arXiv:2402.06852, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-07T15:01:49.505888Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:21.095513Z"},"links":{"cited_paper":"/paper/2402.06852","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:726996b0fa958dc521941058c54babbfd0114d6136d7a878e6756847404de16c","observation_id":"e5745806-da5d-4446-a65c-17f1f2f9bb1a","resolution":{"observed_at":"2026-08-07T15:10:21.095513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00305","last_updated":"2023-09-30T08:33:04Z","snapshot_observed_at":"2026-07-06T16:25:54.621792Z","submitted_at":"2023-09-30T08:33:04Z","title":"Towards LLM-based Fact Verification on News Claims with a Hierarchical Step-by-Step Prompting Method","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00305","snapshot_observed_at":"2026-08-07T15:10:21.101708Z","title":"Towards llm-based fact verification on news claims with a hierarchi- cal step-by-step prompting method.arXiv preprint arXiv:2310.00305, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-07T15:01:49.505888Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:21.101708Z"},"links":{"cited_paper":"/paper/2310.00305","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:87c5d7de592b03ff9d555dcc7c811ac62c6081b4a63d4a7959c5a8e14d649757","observation_id":"315d0c97-3918-4b71-8097-c69c1a985ad6","resolution":{"observed_at":"2026-08-07T15:10:21.101708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.07930","last_updated":"2023-07-16T03:03:59Z","snapshot_observed_at":"2026-07-06T15:54:28.831510Z","submitted_at":"2023-07-16T03:03:59Z","title":"GeoGPT: Understanding and Processing Geospatial Tasks through An Autonomous GPT","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.07930","snapshot_observed_at":"2026-08-07T15:10:21.111443Z","title":"earth\" as a positive keyword, astronomy-related papers may incorrectly appear relevant. To address this, we introduce","venue":null,"work_id":null,"year":1973},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-07T15:01:49.505888Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:21.111443Z"},"links":{"cited_paper":"/paper/2307.07930","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:929fad2a46cb12d0c03626e5553f88495c5c9e1df1f8c1ae1793691f40dfcc69","observation_id":"de14b375-f8d0-4057-97a3-1c5fa38b8394","resolution":{"observed_at":"2026-08-07T15:10:21.111443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T15:01:49.505888Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":3,"verified_fuzzy":10},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 1 inbound Pith citation observation for arXiv:2505.17139."}