{"as_of":"2026-08-10T17:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d2b4bc261335393348531f976764fbd814911291444fb3568b5b7ea813d5230d","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":19,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":19,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":19,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:58:42.512437Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T09:37:00.794953Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.02018","last_updated":"2025-05-04T07:48:36Z","snapshot_observed_at":"2026-08-08T09:28:02.889462Z","submitted_at":"2025-05-04T07:48:36Z","title":"R-Bench: Graduate-level Multi-disciplinary Benchmarks for LLM & MLLM Complex Reasoning Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02018","snapshot_observed_at":"2026-08-07T14:58:42.512437Z","title":"Dan Hendrycks, Collin Burns, Steven Basart, Andy Zou, Mantas Mazeika, Dawn Song, and Jacob Steinhardt","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16770","last_updated":"2025-05-23T15:40:22Z","snapshot_observed_at":"2026-08-09T02:01:21.817942Z","submitted_at":"2025-05-22T15:11:57Z","title":"RBench-V: A Primary Assessment for Visual Reasoning Models with Multi-modal Outputs","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:42.512437Z"},"links":{"cited_paper":"/paper/2505.02018","citing_paper":"/paper/2505.16770"},"observation_digest":"sha256:e8406bf459e0d95f532ace9986407c31adf3d7bbc8b218486b4fe7bb750c4dc9","observation_id":"a3b2dc24-843c-46a1-9923-1f07e03446ec","resolution":{"observed_at":"2026-08-07T14:58:42.512437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02018","last_updated":"2025-05-04T07:48:36Z","snapshot_observed_at":"2026-08-08T09:28:02.889462Z","submitted_at":"2025-05-04T07:48:36Z","title":"R-Bench: Graduate-level Multi-disciplinary Benchmarks for LLM & MLLM Complex Reasoning Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02018","snapshot_observed_at":"2026-08-07T04:23:50.587173Z","title":"R-bench: Graduate-level multi-disciplinary benchmarks for llm & mllm complex reasoning evaluation.arXiv preprint arXiv:2505.02018, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10764","last_updated":"2025-06-12T14:46:41Z","snapshot_observed_at":"2026-08-08T09:28:21.214766Z","submitted_at":"2025-06-12T14:46:41Z","title":"OPT-BENCH: Evaluating LLM Agent on Large-Scale Search Spaces Optimization Problems","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:23:50.587173Z"},"links":{"cited_paper":"/paper/2505.02018","citing_paper":"/paper/2506.10764"},"observation_digest":"sha256:a2434b07deec3ceeab4af04a3bad7029ed2dc8ff3efdf669f39df36367af58e2","observation_id":"4380e4f1-ea7e-40b0-b55e-c85b8b215dc0","resolution":{"observed_at":"2026-08-07T04:23:50.587173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02018","last_updated":"2025-05-04T07:48:36Z","snapshot_observed_at":"2026-08-08T09:28:02.889462Z","submitted_at":"2025-05-04T07:48:36Z","title":"R-Bench: Graduate-level Multi-disciplinary Benchmarks for LLM & MLLM Complex Reasoning Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02018","snapshot_observed_at":"2026-08-06T20:15:52.710933Z","title":"R-bench: Graduate-level multi-disciplinary benchmarks for llm & mllm complex reasoning evaluation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.710933Z"},"links":{"cited_paper":"/paper/2505.02018","citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:4ca07a7660ab87d960c286106c52e8906e7fb560f15a49e7b31e18b9183a5a03","observation_id":"8bfe9a92-6741-43ec-9626-7cc730452232","resolution":{"observed_at":"2026-08-06T20:15:52.710933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02018","last_updated":"2025-05-04T07:48:36Z","snapshot_observed_at":"2026-08-08T09:28:02.889462Z","submitted_at":"2025-05-04T07:48:36Z","title":"R-Bench: Graduate-level Multi-disciplinary Benchmarks for LLM & MLLM Complex Reasoning Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02018","snapshot_observed_at":"2026-08-05T18:53:05.031094Z","title":"arXiv preprint arXiv:2505.02018","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13938","last_updated":"2025-08-19T15:27:55Z","snapshot_observed_at":"2026-08-10T00:50:15.510226Z","submitted_at":"2025-08-19T15:27:55Z","title":"MME-SCI: A Comprehensive and Challenging Science Benchmark for Multimodal Large Language Models","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T18:53:05.031094Z"},"links":{"cited_paper":"/paper/2505.02018","citing_paper":"/paper/2508.13938"},"observation_digest":"sha256:6759f3eb98dc11eff5f5f5a027c05d032a0f164921e9a8b82a3877361c6c33ad","observation_id":"e2498c15-1ae6-4456-91ac-4b9828478eed","resolution":{"observed_at":"2026-08-05T18:53:05.031094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02018","last_updated":"2025-05-04T07:48:36Z","snapshot_observed_at":"2026-08-08T09:28:02.889462Z","submitted_at":"2025-05-04T07:48:36Z","title":"R-Bench: Graduate-level Multi-disciplinary Benchmarks for LLM & MLLM Complex Reasoning Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02018","snapshot_observed_at":"2026-08-02T23:41:42.234154Z","title":"R-bench: Graduate-level multi- disciplinarybenchmarksforLLM&MLLMcomplexreasoningevaluation.CoRR,abs/2505.02018,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.12984","last_updated":"2026-05-30T12:51:16Z","snapshot_observed_at":"2026-08-08T22:51:28.920174Z","submitted_at":"2026-02-13T14:58:18Z","title":"SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T23:41:42.234154Z"},"links":{"cited_paper":"/paper/2505.02018","citing_paper":"/paper/2602.12984"},"observation_digest":"sha256:c1214980026dfa63c7af08051c8d421acf97dcc1c0f10a772069e244ffaae632","observation_id":"b0663a81-39ac-4ee8-b7e8-d3f351d37055","resolution":{"observed_at":"2026-08-02T23:41:42.234154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02018","last_updated":"2025-05-04T07:48:36Z","snapshot_observed_at":"2026-08-08T09:28:02.889462Z","submitted_at":"2025-05-04T07:48:36Z","title":"R-Bench: Graduate-level Multi-disciplinary Benchmarks for LLM & MLLM Complex Reasoning Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02018","snapshot_observed_at":"2026-08-02T23:41:42.420473Z","title":"URLhttps://doi.org/10.48550/arXiv.250 5.02018","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.12984","last_updated":"2026-05-30T12:51:16Z","snapshot_observed_at":"2026-08-08T22:51:28.920174Z","submitted_at":"2026-02-13T14:58:18Z","title":"SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T23:41:42.420473Z"},"links":{"cited_paper":"/paper/2505.02018","citing_paper":"/paper/2602.12984"},"observation_digest":"sha256:39714ae8a9d780c8aa354ec2648dc0c4ce3b1ebda7f87f15c31598bf41ba279d","observation_id":"a84e9cb5-7ffb-4bf3-afd3-a6f9e5cf63c3","resolution":{"observed_at":"2026-08-02T23:41:42.420473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02018","last_updated":"2025-05-04T07:48:36Z","snapshot_observed_at":"2026-08-08T09:28:02.889462Z","submitted_at":"2025-05-04T07:48:36Z","title":"R-Bench: Graduate-level Multi-disciplinary Benchmarks for LLM & MLLM Complex Reasoning Evaluation","version":1},"cited_work":{"arxiv_id":"2505.02018","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.02018","snapshot_observed_at":"2026-07-10T09:37:00.794953Z","title":"R-bench: Graduate-level multi-disciplinary benchmarks for llm & mllm complex reasoning evaluation","venue":"cs.CV","work_id":"741dcc7b-4477-44f1-a131-a2598edc159f","year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-15T20:12:46.385646Z"},"links":{"cited_paper":"/paper/2505.02018","citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:671b78a58a9e7bf478adbbed1d8e0ce2f0562c051671869ff5ca76d0ea836433","observation_id":"64549480-e240-4c10-8fa0-a9dfccbb5966","resolution":{"observed_at":"2026-05-15T20:16:34.617724Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02018","last_updated":"2025-05-04T07:48:36Z","snapshot_observed_at":"2026-08-08T09:28:02.889462Z","submitted_at":"2025-05-04T07:48:36Z","title":"R-Bench: Graduate-level Multi-disciplinary Benchmarks for LLM & MLLM Complex Reasoning Evaluation","version":1},"cited_work":{"arxiv_id":"2505.02018","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.02018","snapshot_observed_at":"2026-07-10T09:37:00.794953Z","title":"R-bench: Graduate-level multi-disciplinary benchmarks for llm & mllm complex reasoning evaluation","venue":"cs.CV","work_id":"741dcc7b-4477-44f1-a131-a2598edc159f","year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-22T10:30:06.829915Z"},"links":{"cited_paper":"/paper/2505.02018","citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:37b1466d0cca93f142bd27c80d6925da64d079fa9962b60a4ef2f548fe42929c","observation_id":"797a0210-c121-42a9-957d-0453b00c769d","resolution":{"observed_at":"2026-05-22T10:31:25.093227Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02018","last_updated":"2025-05-04T07:48:36Z","snapshot_observed_at":"2026-08-08T09:28:02.889462Z","submitted_at":"2025-05-04T07:48:36Z","title":"R-Bench: Graduate-level Multi-disciplinary Benchmarks for LLM & MLLM Complex Reasoning Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02018","snapshot_observed_at":"2026-08-02T22:00:05.988418Z","title":"R-bench: Graduate-level multi-disciplinary benchmarks for llm & mllm complex reasoning evaluation.arXiv preprint arXiv:2505.02018, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:05.988418Z"},"links":{"cited_paper":"/paper/2505.02018","citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:6fcc4f63957eba7ff7f61d82be56cd63824371e4e3ef2dc41dd3cfe8780a9e03","observation_id":"7e63eb40-1a4e-4c5d-901b-a879d875aed6","resolution":{"observed_at":"2026-08-02T22:00:05.988418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02018","last_updated":"2025-05-04T07:48:36Z","snapshot_observed_at":"2026-08-08T09:28:02.889462Z","submitted_at":"2025-05-04T07:48:36Z","title":"R-Bench: Graduate-level Multi-disciplinary Benchmarks for LLM & MLLM Complex Reasoning Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02018","snapshot_observed_at":"2026-07-13T23:47:18.378887Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16432","last_updated":"2026-07-01T14:45:19Z","snapshot_observed_at":"2026-08-08T05:10:56.828861Z","submitted_at":"2026-03-17T12:10:56Z","title":"IRIS: A Real-World Benchmark for Inverse Recovery and Identification of Physical Dynamic Systems from Monocular Video","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-13T23:47:18.378887Z"},"links":{"cited_paper":"/paper/2505.02018","citing_paper":"/paper/2603.16432"},"observation_digest":"sha256:c81eaf251809e012c9e2b9811e9cf801d47bb1c184cead634044aa89970485c0","observation_id":"5bc41635-32bd-45f0-a7d2-1591273abba0","resolution":{"observed_at":"2026-07-13T23:47:18.378887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02018","last_updated":"2025-05-04T07:48:36Z","snapshot_observed_at":"2026-08-08T09:28:02.889462Z","submitted_at":"2025-05-04T07:48:36Z","title":"R-Bench: Graduate-level Multi-disciplinary Benchmarks for LLM & MLLM Complex Reasoning Evaluation","version":1},"cited_work":{"arxiv_id":"2505.02018","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.02018","snapshot_observed_at":"2026-07-10T09:37:00.794953Z","title":"R-bench: Graduate-level multi-disciplinary benchmarks for llm & mllm complex reasoning evaluation","venue":"cs.CV","work_id":"741dcc7b-4477-44f1-a131-a2598edc159f","year":2025},"citing_paper":{"arxiv_id":"2604.27711","last_updated":"2026-04-30T10:57:29Z","snapshot_observed_at":"2026-07-06T23:13:07.378140Z","submitted_at":"2026-04-30T10:57:29Z","title":"ExoActor: Exocentric Video Generation as Generalizable Interactive Humanoid Control","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-07T06:24:47.014162Z"},"links":{"cited_paper":"/paper/2505.02018","citing_paper":"/paper/2604.27711"},"observation_digest":"sha256:a12ec3f57907c65bba96afd2700ec9021e88253e08297900562c745fe6995359","observation_id":"58be337b-c331-4d8a-9e11-ca6c1b02246e","resolution":{"observed_at":"2026-05-12T10:21:30.430849Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02018","last_updated":"2025-05-04T07:48:36Z","snapshot_observed_at":"2026-08-08T09:28:02.889462Z","submitted_at":"2025-05-04T07:48:36Z","title":"R-Bench: Graduate-level Multi-disciplinary Benchmarks for LLM & MLLM Complex Reasoning Evaluation","version":1},"cited_work":{"arxiv_id":"2505.02018","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.02018","snapshot_observed_at":"2026-07-10T09:37:00.794953Z","title":"R-bench: Graduate-level multi-disciplinary benchmarks for llm & mllm complex reasoning evaluation","venue":"cs.CV","work_id":"741dcc7b-4477-44f1-a131-a2598edc159f","year":2025},"citing_paper":{"arxiv_id":"2605.08904","last_updated":"2026-05-09T11:51:34Z","snapshot_observed_at":"2026-07-06T23:21:02.177557Z","submitted_at":"2026-05-09T11:51:34Z","title":"OPT-BENCH: Evaluating the Iterative Self-Optimization of LLM Agents in Large-Scale Search Spaces","version":1},"reference_index":112,"source":"arxiv_source","source_observed_at":"2026-05-12T02:57:15.521594Z"},"links":{"cited_paper":"/paper/2505.02018","citing_paper":"/paper/2605.08904"},"observation_digest":"sha256:39c22361259531d37187cfb2b2e53a7e6bd783cce5c0ffe1abbb65f3dd44de09","observation_id":"5463af0c-4957-439c-86c4-2a873252e8f6","resolution":{"observed_at":"2026-05-12T03:01:18.709984Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02018","last_updated":"2025-05-04T07:48:36Z","snapshot_observed_at":"2026-08-08T09:28:02.889462Z","submitted_at":"2025-05-04T07:48:36Z","title":"R-Bench: Graduate-level Multi-disciplinary Benchmarks for LLM & MLLM Complex Reasoning Evaluation","version":1},"cited_work":{"arxiv_id":"2505.02018","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.02018","snapshot_observed_at":"2026-07-10T09:37:00.794953Z","title":"R-bench: Graduate-level multi-disciplinary benchmarks for llm & mllm complex reasoning evaluation","venue":"cs.CV","work_id":"741dcc7b-4477-44f1-a131-a2598edc159f","year":2025},"citing_paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T20:23:18.667677Z"},"links":{"cited_paper":"/paper/2505.02018","citing_paper":"/paper/2606.07962"},"observation_digest":"sha256:23dc9c16a9cc9b8f7c9e1736c255da71f3fd834ae995c18a6a0fcdc240aab600","observation_id":"b397e0b1-1b2e-4a2a-bbc7-90c5013a1e00","resolution":{"observed_at":"2026-07-02T20:27:22.590378Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02018","last_updated":"2025-05-04T07:48:36Z","snapshot_observed_at":"2026-08-08T09:28:02.889462Z","submitted_at":"2025-05-04T07:48:36Z","title":"R-Bench: Graduate-level Multi-disciplinary Benchmarks for LLM & MLLM Complex Reasoning Evaluation","version":1},"cited_work":{"arxiv_id":"2505.02018","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.02018","snapshot_observed_at":"2026-07-10T09:37:00.794953Z","title":"R-bench: Graduate-level multi-disciplinary benchmarks for llm & mllm complex reasoning evaluation","venue":"cs.CV","work_id":"741dcc7b-4477-44f1-a131-a2598edc159f","year":2025},"citing_paper":{"arxiv_id":"2606.29630","last_updated":"2026-06-28T22:27:26Z","snapshot_observed_at":"2026-08-03T22:42:04.127016Z","submitted_at":"2026-06-28T22:27:26Z","title":"SFBench: The SciFy Scientific Feasibility Benchmark","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T06:59:19.857066Z"},"links":{"cited_paper":"/paper/2505.02018","citing_paper":"/paper/2606.29630"},"observation_digest":"sha256:263d28948826d5233260a4ef75381a7a3b148f0a6ba3cdae9675ae1e9e775867","observation_id":"4f51371a-7990-4445-871a-7f81ef2b07f0","resolution":{"observed_at":"2026-06-30T07:04:21.322289Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02018","last_updated":"2025-05-04T07:48:36Z","snapshot_observed_at":"2026-08-08T09:28:02.889462Z","submitted_at":"2025-05-04T07:48:36Z","title":"R-Bench: Graduate-level Multi-disciplinary Benchmarks for LLM & MLLM Complex Reasoning Evaluation","version":1},"cited_work":{"arxiv_id":"2505.02018","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.02018","snapshot_observed_at":"2026-07-10T09:37:00.794953Z","title":"R-bench: Graduate-level multi-disciplinary benchmarks for llm & mllm complex reasoning evaluation","venue":"cs.CV","work_id":"741dcc7b-4477-44f1-a131-a2598edc159f","year":2025},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2505.02018","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:59899f5abb50bdf326776cda187f597a7b1fab2168c036eaf9c2fea69a26a339","observation_id":"1bac3f50-ff3e-4870-b37c-ed52de082641","resolution":{"observed_at":"2026-07-10T09:37:00.796446Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02018","last_updated":"2025-05-04T07:48:36Z","snapshot_observed_at":"2026-08-08T09:28:02.889462Z","submitted_at":"2025-05-04T07:48:36Z","title":"R-Bench: Graduate-level Multi-disciplinary Benchmarks for LLM & MLLM Complex Reasoning Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02018","snapshot_observed_at":"2026-07-14T11:49:31.595873Z","title":"arXiv preprint arXiv:2505.02018 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10428","last_updated":"2026-07-24T14:32:58Z","snapshot_observed_at":"2026-08-06T10:45:46.606756Z","submitted_at":"2026-07-11T18:22:49Z","title":"Enjoy Your Talk: A Human-Centered Benchmark for Multi-Turn Dialogue with Decoupled User Simulation, Target Modeling, and Judging","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-07-14T11:49:31.595873Z"},"links":{"cited_paper":"/paper/2505.02018","citing_paper":"/paper/2607.10428"},"observation_digest":"sha256:6296cb137e4a406d52646861cf400941e7c2bd22920a6bf1f11ad4121bf2a501","observation_id":"0c812abd-0d67-434e-afb2-cdd9590282e0","resolution":{"observed_at":"2026-07-14T11:49:31.595873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02018","last_updated":"2025-05-04T07:48:36Z","snapshot_observed_at":"2026-08-08T09:28:02.889462Z","submitted_at":"2025-05-04T07:48:36Z","title":"R-Bench: Graduate-level Multi-disciplinary Benchmarks for LLM & MLLM Complex Reasoning Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02018","snapshot_observed_at":"2026-08-02T07:20:38.710219Z","title":"arXiv preprint arXiv:2505.02018 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10428","last_updated":"2026-07-24T14:32:58Z","snapshot_observed_at":"2026-08-06T10:45:46.606756Z","submitted_at":"2026-07-11T18:22:49Z","title":"Enjoy Your Talk: A Human-Centered Benchmark for Multi-Turn Dialogue with Decoupled User Simulation, Target Modeling, and Judging","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-02T07:20:38.710219Z"},"links":{"cited_paper":"/paper/2505.02018","citing_paper":"/paper/2607.10428"},"observation_digest":"sha256:27349b84f4a86b56bb9ad59d58d73a3eb2a232eda2e6854c880fed7975058a76","observation_id":"9f756069-7f36-4809-bd2d-a468123d613e","resolution":{"observed_at":"2026-08-02T07:20:38.710219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02018","last_updated":"2025-05-04T07:48:36Z","snapshot_observed_at":"2026-08-08T09:28:02.889462Z","submitted_at":"2025-05-04T07:48:36Z","title":"R-Bench: Graduate-level Multi-disciplinary Benchmarks for LLM & MLLM Complex Reasoning Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02018","snapshot_observed_at":"2026-08-02T06:13:54.686646Z","title":"R-bench: Graduate-level multi-disciplinary benchmarks for llm & mllm complex reasoning evaluation.arXiv preprint arXiv:2505.02018, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:54.686646Z"},"links":{"cited_paper":"/paper/2505.02018","citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:ebedde72e1680ed210cfa87c94b73ebbbf93298306b06bfe7242ff8d612147b5","observation_id":"96a55390-e8ef-4e21-a9a3-17ef0e834002","resolution":{"observed_at":"2026-08-02T06:13:54.686646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02018","last_updated":"2025-05-04T07:48:36Z","snapshot_observed_at":"2026-08-08T09:28:02.889462Z","submitted_at":"2025-05-04T07:48:36Z","title":"R-Bench: Graduate-level Multi-disciplinary Benchmarks for LLM & MLLM Complex Reasoning Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02018","snapshot_observed_at":"2026-08-06T04:30:39.422268Z","title":"R-Bench: Graduate-level multi-disciplinary benchmarks for LLM & MLLM complex reasoning evaluation.arXiv preprint arXiv:2505.02018, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-09T12:43:19.697158Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:39.422268Z"},"links":{"cited_paper":"/paper/2505.02018","citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:ea3cbf5b1e2c80891baab7a77fccd080fea66bde8c669bcd4ac702caf8499b38","observation_id":"e38f4f09-afe9-4b91-9cad-06f220e0180c","resolution":{"observed_at":"2026-08-06T04:30:39.422268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.02018/citation-record","integrity":"/paper/2505.02018/integrity","json":"/paper/2505.02018/citation-record.json","paper":"/paper/2505.02018"},"outbound":[],"paper":{"arxiv_id":"2505.02018","last_updated":"2025-05-04T07:48:36Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T09:28:02.889462Z","submitted_at":"2025-05-04T07:48:36Z","title":"R-Bench: Graduate-level Multi-disciplinary Benchmarks for LLM & MLLM Complex Reasoning Evaluation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 19 inbound Pith citation observations for arXiv:2505.02018."}