{"as_of":"2026-08-09T10:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4bb7fe3173921bb4ed6f859cff1c9ec56b776828ae4050fbb48cc5c7ca610d69","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T15:29:29.577032Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.18438/citation-record","integrity":"/paper/2607.18438/integrity","json":"/paper/2607.18438/citation-record.json","paper":"/paper/2607.18438"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:29:23.070728Z","title":"ARC Prize Leaderboard","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18438","last_updated":"2026-07-20T18:46:17Z","snapshot_observed_at":"2026-08-08T04:15:26.223667Z","submitted_at":"2026-07-20T18:46:17Z","title":"Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T15:29:23.070728Z"},"links":{"citing_paper":"/paper/2607.18438"},"observation_digest":"sha256:6a84e4c11e21e7b9f41ac06dc2bab050a47727242c6b7ed3b2b9e253b1f15d6d","observation_id":"199fe0a8-c4c4-4def-b0fc-d153adc8b48b","resolution":{"observed_at":"2026-08-01T15:29:23.070728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:29:23.142006Z","title":"τ 2-Bench Telecom Benchmark Leaderboard","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18438","last_updated":"2026-07-20T18:46:17Z","snapshot_observed_at":"2026-08-08T04:15:26.223667Z","submitted_at":"2026-07-20T18:46:17Z","title":"Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T15:29:23.142006Z"},"links":{"citing_paper":"/paper/2607.18438"},"observation_digest":"sha256:c6ac00bf1125286d8c279178938b163df2e054507b47262ceb2dc02a23791e3f","observation_id":"98b12e11-c705-42d5-8d7e-4dd29783267c","resolution":{"observed_at":"2026-08-01T15:29:23.142006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:29:23.285997Z","title":"Humanity’s Last Exam Benchmark Leader- board","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18438","last_updated":"2026-07-20T18:46:17Z","snapshot_observed_at":"2026-08-08T04:15:26.223667Z","submitted_at":"2026-07-20T18:46:17Z","title":"Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T15:29:23.285997Z"},"links":{"citing_paper":"/paper/2607.18438"},"observation_digest":"sha256:498d46ba5324ac3573dea1c2f1c8eca6b8b5f796a44f03b342ace8c5683e841b","observation_id":"65cf5065-a338-470a-ab92-4fda93111e5c","resolution":{"observed_at":"2026-08-01T15:29:23.285997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:29:23.431791Z","title":"Introducing Claude Opus 4.7","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18438","last_updated":"2026-07-20T18:46:17Z","snapshot_observed_at":"2026-08-08T04:15:26.223667Z","submitted_at":"2026-07-20T18:46:17Z","title":"Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T15:29:23.431791Z"},"links":{"citing_paper":"/paper/2607.18438"},"observation_digest":"sha256:b471e49c8c7d35d59010d65bda221ef5884591eb20e68feb65a8ab942634b69c","observation_id":"c5941784-cf22-451b-b93c-d91dc20f6a0d","resolution":{"observed_at":"2026-08-01T15:29:23.431791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:29:23.571603Z","title":"Claude Mythos Preview System Card","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18438","last_updated":"2026-07-20T18:46:17Z","snapshot_observed_at":"2026-08-08T04:15:26.223667Z","submitted_at":"2026-07-20T18:46:17Z","title":"Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T15:29:23.571603Z"},"links":{"citing_paper":"/paper/2607.18438"},"observation_digest":"sha256:1872a0139be2281dc4d8a92278ba35d174b921c657aec78ac22c8464b63ebe95","observation_id":"a92a0fe3-69d0-4dbc-b7df-5392c0d50925","resolution":{"observed_at":"2026-08-01T15:29:23.571603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:29:23.682318Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18438","last_updated":"2026-07-20T18:46:17Z","snapshot_observed_at":"2026-08-08T04:15:26.223667Z","submitted_at":"2026-07-20T18:46:17Z","title":"Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T15:29:23.682318Z"},"links":{"citing_paper":"/paper/2607.18438"},"observation_digest":"sha256:1f1a8fc6ea26423292abbab5071c48840d808ed54d99a495b9710fd6603af130","observation_id":"46c37784-cc22-4005-b93c-d405ec4e3649","resolution":{"observed_at":"2026-08-01T15:29:23.682318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:29:23.797304Z","title":"Introducing GPT-5.5","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18438","last_updated":"2026-07-20T18:46:17Z","snapshot_observed_at":"2026-08-08T04:15:26.223667Z","submitted_at":"2026-07-20T18:46:17Z","title":"Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T15:29:23.797304Z"},"links":{"citing_paper":"/paper/2607.18438"},"observation_digest":"sha256:3d0375c06dc058d8425035dad2eb6181599ffbc901def6a5f9efa5368c409817","observation_id":"25c5f1eb-6ec9-490e-8c4c-ecdc93a38316","resolution":{"observed_at":"2026-08-01T15:29:23.797304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:29:23.914038Z","title":"Grok 4.3 Beta","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18438","last_updated":"2026-07-20T18:46:17Z","snapshot_observed_at":"2026-08-08T04:15:26.223667Z","submitted_at":"2026-07-20T18:46:17Z","title":"Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T15:29:23.914038Z"},"links":{"citing_paper":"/paper/2607.18438"},"observation_digest":"sha256:b0411d65a125b5d1ed76634b577d9286308de32574bfe414ae4eee8ba14a01c3","observation_id":"86e1502d-9276-42a8-bfd5-614bd3e637c9","resolution":{"observed_at":"2026-08-01T15:29:23.914038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:29:24.079864Z","title":"Qwen3.7: The Agent Frontier","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18438","last_updated":"2026-07-20T18:46:17Z","snapshot_observed_at":"2026-08-08T04:15:26.223667Z","submitted_at":"2026-07-20T18:46:17Z","title":"Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T15:29:24.079864Z"},"links":{"citing_paper":"/paper/2607.18438"},"observation_digest":"sha256:273bbaf442cde1399593ce8c291befd4bf3b61c8a0933ae208a2f6dfb6828efc","observation_id":"eb367314-54ce-45e8-a229-cb20f3c374f6","resolution":{"observed_at":"2026-08-01T15:29:24.079864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-01T15:29:24.224184Z","title":"Gonzalez, and Ion Stoica","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18438","last_updated":"2026-07-20T18:46:17Z","snapshot_observed_at":"2026-08-08T04:15:26.223667Z","submitted_at":"2026-07-20T18:46:17Z","title":"Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T15:29:24.224184Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2607.18438"},"observation_digest":"sha256:ea3d9226e2d974a853bca2fd6fad124866a32f78c85632103ef5ab0d0a8b2c42","observation_id":"aa2f134a-7b0c-48a9-8009-f1286765e82f","resolution":{"observed_at":"2026-08-01T15:29:24.224184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04770","last_updated":"2024-10-05T22:39:51Z","snapshot_observed_at":"2026-08-06T14:20:21.460707Z","submitted_at":"2024-06-07T09:15:44Z","title":"WildBench: Benchmarking LLMs with Challenging Tasks from Real Users in the Wild","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04770","snapshot_observed_at":"2026-08-01T15:29:24.341223Z","title":"WildBench: Benchmarking LLMs with Challenging Tasks from Real Users in the Wild","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18438","last_updated":"2026-07-20T18:46:17Z","snapshot_observed_at":"2026-08-08T04:15:26.223667Z","submitted_at":"2026-07-20T18:46:17Z","title":"Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T15:29:24.341223Z"},"links":{"cited_paper":"/paper/2406.04770","citing_paper":"/paper/2607.18438"},"observation_digest":"sha256:b4c2b2d6425417eed9ca436a8550429a75c6d753369725aeece4f4dee396b1ff","observation_id":"79d822aa-4ddb-4df3-bd1e-ec4c29589558","resolution":{"observed_at":"2026-08-01T15:29:24.341223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:29:24.460230Z","title":"AgentFrontier: Expanding the Capabil- ity Frontier of LLM Agents with ZPD-Guided Data Synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18438","last_updated":"2026-07-20T18:46:17Z","snapshot_observed_at":"2026-08-08T04:15:26.223667Z","submitted_at":"2026-07-20T18:46:17Z","title":"Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T15:29:24.460230Z"},"links":{"citing_paper":"/paper/2607.18438"},"observation_digest":"sha256:05e14bac13d294899683d018343a5c2d82ae57bcc50e53bc2338e2bef03d2af5","observation_id":"cf52d656-99a6-493f-ad55-56598de2dd88","resolution":{"observed_at":"2026-08-01T15:29:24.460230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.04123","last_updated":"2026-06-04T19:57:38Z","snapshot_observed_at":"2026-08-08T18:53:52.266559Z","submitted_at":"2025-12-02T16:45:10Z","title":"Measuring Agents in Production","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.04123","snapshot_observed_at":"2026-08-01T15:29:24.584013Z","title":"Pan et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18438","last_updated":"2026-07-20T18:46:17Z","snapshot_observed_at":"2026-08-08T04:15:26.223667Z","submitted_at":"2026-07-20T18:46:17Z","title":"Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T15:29:24.584013Z"},"links":{"cited_paper":"/paper/2512.04123","citing_paper":"/paper/2607.18438"},"observation_digest":"sha256:cd74a1d6f943795c4781ad4efdd5d6c3c46aaaa90ed30629b3b99a0c86c4f420","observation_id":"be277fbd-77a6-48c9-8b0c-12d907e8234a","resolution":{"observed_at":"2026-08-01T15:29:24.584013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-04T22:55:15.345443Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-01T15:29:24.722570Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18438","last_updated":"2026-07-20T18:46:17Z","snapshot_observed_at":"2026-08-08T04:15:26.223667Z","submitted_at":"2026-07-20T18:46:17Z","title":"Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T15:29:24.722570Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2607.18438"},"observation_digest":"sha256:8ddf65f8fbc298910812acd658047d41225d8a6dcf7c0b1308c4b8f93e3aab50","observation_id":"34aec3da-e1c8-4667-92ca-5fb377f91ae9","resolution":{"observed_at":"2026-08-01T15:29:24.722570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06770","last_updated":"2024-11-11T23:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T16:47:29Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06770","snapshot_observed_at":"2026-08-01T15:29:24.846792Z","title":"Jimenez et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18438","last_updated":"2026-07-20T18:46:17Z","snapshot_observed_at":"2026-08-08T04:15:26.223667Z","submitted_at":"2026-07-20T18:46:17Z","title":"Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T15:29:24.846792Z"},"links":{"cited_paper":"/paper/2310.06770","citing_paper":"/paper/2607.18438"},"observation_digest":"sha256:3376afb4afeca55c7729bc664e23a26a72e8ff3e08547b25c5c321d1761defb5","observation_id":"ca1b3420-6791-41f2-bfa6-4db8fbad9a91","resolution":{"observed_at":"2026-08-01T15:29:24.846792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14991","last_updated":"2024-10-17T07:23:23Z","snapshot_observed_at":"2026-07-06T18:34:47.155846Z","submitted_at":"2024-06-21T09:06:45Z","title":"SpreadsheetBench: Towards Challenging Real World Spreadsheet Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14991","snapshot_observed_at":"2026-08-01T15:29:24.950535Z","title":"SpreadsheetBench: Towards Challenging Real World Spreadsheet Manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18438","last_updated":"2026-07-20T18:46:17Z","snapshot_observed_at":"2026-08-08T04:15:26.223667Z","submitted_at":"2026-07-20T18:46:17Z","title":"Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T15:29:24.950535Z"},"links":{"cited_paper":"/paper/2406.14991","citing_paper":"/paper/2607.18438"},"observation_digest":"sha256:c542142d0e861a0e26580cb94e2fa35caff9d1e7ff50781ef446bd0416d4e3c8","observation_id":"164f11a7-8477-4b31-afce-87a851f1deff","resolution":{"observed_at":"2026-08-01T15:29:24.950535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04132","last_updated":"2024-03-07T01:22:38Z","snapshot_observed_at":"2026-08-02T17:55:33.750637Z","submitted_at":"2024-03-07T01:22:38Z","title":"Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04132","snapshot_observed_at":"2026-08-01T15:29:25.040725Z","title":"Chatbot Arena: An Open Platform for EvaluatingLLMsbyHumanPreference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18438","last_updated":"2026-07-20T18:46:17Z","snapshot_observed_at":"2026-08-08T04:15:26.223667Z","submitted_at":"2026-07-20T18:46:17Z","title":"Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T15:29:25.040725Z"},"links":{"cited_paper":"/paper/2403.04132","citing_paper":"/paper/2607.18438"},"observation_digest":"sha256:3b58c6ee26a0731ac3ba4b7273e5dacc24ee7c14b846f30fd72d46ecc92bad7a","observation_id":"1afa2c31-87b0-4c15-858f-f118faad26df","resolution":{"observed_at":"2026-08-01T15:29:25.040725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12045","last_updated":"2024-06-17T19:33:08Z","snapshot_observed_at":"2026-08-08T21:08:39.676079Z","submitted_at":"2024-06-17T19:33:08Z","title":"$\\tau$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12045","snapshot_observed_at":"2026-08-01T15:29:25.119434Z","title":"τ-bench: A Benchmark for Tool-Agent-User Inter- action in Real-World Domains","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18438","last_updated":"2026-07-20T18:46:17Z","snapshot_observed_at":"2026-08-08T04:15:26.223667Z","submitted_at":"2026-07-20T18:46:17Z","title":"Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T15:29:25.119434Z"},"links":{"cited_paper":"/paper/2406.12045","citing_paper":"/paper/2607.18438"},"observation_digest":"sha256:1a1bfaaefd65192eb8d13465de5286160baf7d8fc8d5a6a41a6f190448343bb8","observation_id":"e6019c4f-e0c5-4d44-8dc9-dfb79436910d","resolution":{"observed_at":"2026-08-01T15:29:25.119434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:29:25.207610Z","title":"GPQA Diamond Benchmark Leaderboard","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18438","last_updated":"2026-07-20T18:46:17Z","snapshot_observed_at":"2026-08-08T04:15:26.223667Z","submitted_at":"2026-07-20T18:46:17Z","title":"Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T15:29:25.207610Z"},"links":{"citing_paper":"/paper/2607.18438"},"observation_digest":"sha256:96c9b2834167720e907c701c46ab269e0d16e091fa16847106bfe5631242403b","observation_id":"ba79076e-70f6-42aa-b0c2-6211e74cc6e6","resolution":{"observed_at":"2026-08-01T15:29:25.207610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:29:25.254961Z","title":"MATH-500 Benchmark Leaderboard","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18438","last_updated":"2026-07-20T18:46:17Z","snapshot_observed_at":"2026-08-08T04:15:26.223667Z","submitted_at":"2026-07-20T18:46:17Z","title":"Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T15:29:25.254961Z"},"links":{"citing_paper":"/paper/2607.18438"},"observation_digest":"sha256:f283766b0a98feac5b7e3c31ac66e006e567883f6e4b98da3181ad319673858f","observation_id":"a682bf96-755a-461d-9ae9-0677552ab193","resolution":{"observed_at":"2026-08-01T15:29:25.254961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:29:25.310495Z","title":"https: //artificialanalysis.ai/evaluations/aime- 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18438","last_updated":"2026-07-20T18:46:17Z","snapshot_observed_at":"2026-08-08T04:15:26.223667Z","submitted_at":"2026-07-20T18:46:17Z","title":"Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T15:29:25.310495Z"},"links":{"citing_paper":"/paper/2607.18438"},"observation_digest":"sha256:b6c9bb59cb88ef6af86db06ba2c870e811c178e562e97962039f18eec0f3948d","observation_id":"10e94e7b-1cd9-4635-942e-8306e0a16a0c","resolution":{"observed_at":"2026-08-01T15:29:25.310495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16502","last_updated":"2024-06-13T15:02:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-27T17:33:21Z","title":"MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16502","snapshot_observed_at":"2026-08-01T15:29:25.488347Z","title":"MMMU: A Massive Multi-discipline Multi- modalUnderstandingandReasoningBenchmarkforExpertAGI","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18438","last_updated":"2026-07-20T18:46:17Z","snapshot_observed_at":"2026-08-08T04:15:26.223667Z","submitted_at":"2026-07-20T18:46:17Z","title":"Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T15:29:25.488347Z"},"links":{"cited_paper":"/paper/2311.16502","citing_paper":"/paper/2607.18438"},"observation_digest":"sha256:1deafd84ee243387863e5cc160b8a577b3d5896767794536fd0dd6f2c8728ec1","observation_id":"61df446c-4935-4572-926a-f55994545daa","resolution":{"observed_at":"2026-08-01T15:29:25.488347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-01T15:29:25.602195Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18438","last_updated":"2026-07-20T18:46:17Z","snapshot_observed_at":"2026-08-08T04:15:26.223667Z","submitted_at":"2026-07-20T18:46:17Z","title":"Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T15:29:25.602195Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2607.18438"},"observation_digest":"sha256:2cd76c33f02ca78e585d902df2cc44aa23f1096fc3cfb70887e57e453b267fed","observation_id":"0450d210-6410-4c0d-b99f-b0f43082cc93","resolution":{"observed_at":"2026-08-01T15:29:25.602195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16789","last_updated":"2023-10-03T14:45:48Z","snapshot_observed_at":"2026-07-06T16:00:46.542753Z","submitted_at":"2023-07-31T15:56:53Z","title":"ToolLLM: Facilitating Large Language Models to Master 16000+ Real-world APIs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16789","snapshot_observed_at":"2026-08-01T15:29:25.746583Z","title":"arXiv:2307.16789, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18438","last_updated":"2026-07-20T18:46:17Z","snapshot_observed_at":"2026-08-08T04:15:26.223667Z","submitted_at":"2026-07-20T18:46:17Z","title":"Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T15:29:25.746583Z"},"links":{"cited_paper":"/paper/2307.16789","citing_paper":"/paper/2607.18438"},"observation_digest":"sha256:916e43a0ba85c66fb2dce8d5a72398be0f8daa981017b24cd4553c908472d9b9","observation_id":"9a02249a-32d0-481c-aaa8-e66eae75cdca","resolution":{"observed_at":"2026-08-01T15:29:25.746583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08244","last_updated":"2023-10-25T06:54:12Z","snapshot_observed_at":"2026-08-02T00:07:12.855748Z","submitted_at":"2023-04-14T14:05:32Z","title":"API-Bank: A Comprehensive Benchmark for Tool-Augmented LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08244","snapshot_observed_at":"2026-08-01T15:29:25.830028Z","title":"API-Bank: A Comprehensive Benchmark for Tool-Augmented LLMs","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18438","last_updated":"2026-07-20T18:46:17Z","snapshot_observed_at":"2026-08-08T04:15:26.223667Z","submitted_at":"2026-07-20T18:46:17Z","title":"Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T15:29:25.830028Z"},"links":{"cited_paper":"/paper/2304.08244","citing_paper":"/paper/2607.18438"},"observation_digest":"sha256:58c0292afce078cc827e585896029e223aa28b1ee609c45bf8adb8b814c3f865","observation_id":"3e48715e-bf87-4070-8042-f448aa32867b","resolution":{"observed_at":"2026-08-01T15:29:25.830028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-01T15:29:25.978104Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18438","last_updated":"2026-07-20T18:46:17Z","snapshot_observed_at":"2026-08-08T04:15:26.223667Z","submitted_at":"2026-07-20T18:46:17Z","title":"Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T15:29:25.978104Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2607.18438"},"observation_digest":"sha256:90911e5b95a23b18a5eef624f60964778addad8499c73baaa11405895e53fa68","observation_id":"75bdcedc-0a18-4811-958c-30d6e7c4cf80","resolution":{"observed_at":"2026-08-01T15:29:25.978104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04475","last_updated":"2025-03-10T09:27:03Z","snapshot_observed_at":"2026-07-06T17:56:23.317089Z","submitted_at":"2024-04-06T02:29:02Z","title":"Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04475","snapshot_observed_at":"2026-08-01T15:29:26.141497Z","title":"Hashimoto","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18438","last_updated":"2026-07-20T18:46:17Z","snapshot_observed_at":"2026-08-08T04:15:26.223667Z","submitted_at":"2026-07-20T18:46:17Z","title":"Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T15:29:26.141497Z"},"links":{"cited_paper":"/paper/2404.04475","citing_paper":"/paper/2607.18438"},"observation_digest":"sha256:ac9e0ee86808f0b607444edc28399d7695f4c65257bca52029e111b9514ef217","observation_id":"e0e9443d-03ac-42f0-b36f-7d9d8a8b9786","resolution":{"observed_at":"2026-08-01T15:29:26.141497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12983","last_updated":"2023-11-21T20:34:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-21T20:34:47Z","title":"GAIA: a benchmark for General AI Assistants","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12983","snapshot_observed_at":"2026-08-01T15:29:26.306719Z","title":"GAIA: a benchmark for General AI As- sistants","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18438","last_updated":"2026-07-20T18:46:17Z","snapshot_observed_at":"2026-08-08T04:15:26.223667Z","submitted_at":"2026-07-20T18:46:17Z","title":"Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T15:29:26.306719Z"},"links":{"cited_paper":"/paper/2311.12983","citing_paper":"/paper/2607.18438"},"observation_digest":"sha256:52e90d260b2a847460e854afa11fb3f7dbe6929e148696dcfa83367677210554","observation_id":"dbc74aea-868e-4afc-9ae7-3903b33d138c","resolution":{"observed_at":"2026-08-01T15:29:26.306719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:29:26.450130Z","title":"APEX-Agents","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18438","last_updated":"2026-07-20T18:46:17Z","snapshot_observed_at":"2026-08-08T04:15:26.223667Z","submitted_at":"2026-07-20T18:46:17Z","title":"Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T15:29:26.450130Z"},"links":{"citing_paper":"/paper/2607.18438"},"observation_digest":"sha256:9392629c64cefe5fa3d59d34e92ff11900c4428b4fe9107223d435a1e204b326","observation_id":"6721ea98-8a24-4d57-944e-251f92ceba4c","resolution":{"observed_at":"2026-08-01T15:29:26.450130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13147","last_updated":"2025-08-08T15:28:01Z","snapshot_observed_at":"2026-08-04T08:26:16.909949Z","submitted_at":"2024-12-17T18:12:47Z","title":"Are Your LLMs Capable of Stable Reasoning?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13147","snapshot_observed_at":"2026-08-01T15:29:26.561138Z","title":"Are Your LLMs Capable of Stable Reasoning? arXiv:2412.13147, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18438","last_updated":"2026-07-20T18:46:17Z","snapshot_observed_at":"2026-08-08T04:15:26.223667Z","submitted_at":"2026-07-20T18:46:17Z","title":"Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T15:29:26.561138Z"},"links":{"cited_paper":"/paper/2412.13147","citing_paper":"/paper/2607.18438"},"observation_digest":"sha256:cc5bd1fc2c602e8163e533e3e5c3b9d559ba9550fb72c628ba250d1a746a88e6","observation_id":"df722cae-32da-4264-9865-75bf17af0167","resolution":{"observed_at":"2026-08-01T15:29:26.561138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:29:26.693813Z","title":"Project Glasswing","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18438","last_updated":"2026-07-20T18:46:17Z","snapshot_observed_at":"2026-08-08T04:15:26.223667Z","submitted_at":"2026-07-20T18:46:17Z","title":"Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T15:29:26.693813Z"},"links":{"citing_paper":"/paper/2607.18438"},"observation_digest":"sha256:777c28f1181b431ecadb64051775738c6cfd7c330869e285437ded048fdb1d75","observation_id":"e43b92a4-133a-4a15-8c65-8b8bb364b280","resolution":{"observed_at":"2026-08-01T15:29:26.693813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:29:26.838864Z","title":"Claude Mythos Preview: Anthropic’s Frontier Model Explained","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18438","last_updated":"2026-07-20T18:46:17Z","snapshot_observed_at":"2026-08-08T04:15:26.223667Z","submitted_at":"2026-07-20T18:46:17Z","title":"Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T15:29:26.838864Z"},"links":{"citing_paper":"/paper/2607.18438"},"observation_digest":"sha256:f9cc94687490c278f332da4918524ffac5b20beb872ebaae2ea1a6b231079860","observation_id":"a0ca0af4-d1a1-45b7-a902-76095d03c743","resolution":{"observed_at":"2026-08-01T15:29:26.838864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:29:26.968437Z","title":"Holistic Agent Leader- board: GAIA","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18438","last_updated":"2026-07-20T18:46:17Z","snapshot_observed_at":"2026-08-08T04:15:26.223667Z","submitted_at":"2026-07-20T18:46:17Z","title":"Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T15:29:26.968437Z"},"links":{"citing_paper":"/paper/2607.18438"},"observation_digest":"sha256:8a8a5dd84f496461f90177585de1ce5a683268c1ed5bee0a13b523546c20751a","observation_id":"54ef6eb1-c340-4cc9-8b34-a0f704039f99","resolution":{"observed_at":"2026-08-01T15:29:26.968437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-08-04T15:54:46.196160Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-08-01T15:29:27.108781Z","title":"arXiv:2411.04872, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18438","last_updated":"2026-07-20T18:46:17Z","snapshot_observed_at":"2026-08-08T04:15:26.223667Z","submitted_at":"2026-07-20T18:46:17Z","title":"Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T15:29:27.108781Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2607.18438"},"observation_digest":"sha256:1a9529de9a68f9de26bc2f4b5fe2d534e820404f7da3bf189d94577b634d800c","observation_id":"c8223312-68e0-4dc1-b75a-1ce7a7689831","resolution":{"observed_at":"2026-08-01T15:29:27.108781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-01T15:29:27.236946Z","title":"LiveCodeBench: Holistic and Contami- nation Free Evaluation of Large Language Models for Code","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18438","last_updated":"2026-07-20T18:46:17Z","snapshot_observed_at":"2026-08-08T04:15:26.223667Z","submitted_at":"2026-07-20T18:46:17Z","title":"Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T15:29:27.236946Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2607.18438"},"observation_digest":"sha256:be2a417e000ab5d1b664686640c739816f816c5f5dc2ed1c9f749724800c3e03","observation_id":"dd0ef2fa-538b-4ceb-ab22-42df4ed8a441","resolution":{"observed_at":"2026-08-01T15:29:27.236946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09783","last_updated":"2024-04-03T23:29:03Z","snapshot_observed_at":"2026-08-07T21:58:55.637060Z","submitted_at":"2023-11-16T11:03:04Z","title":"Investigating Data Contamination in Modern Benchmarks for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09783","snapshot_observed_at":"2026-08-01T15:29:27.374252Z","title":"Investigating Data Contamina- tion in Modern Benchmarks for Large Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18438","last_updated":"2026-07-20T18:46:17Z","snapshot_observed_at":"2026-08-08T04:15:26.223667Z","submitted_at":"2026-07-20T18:46:17Z","title":"Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T15:29:27.374252Z"},"links":{"cited_paper":"/paper/2311.09783","citing_paper":"/paper/2607.18438"},"observation_digest":"sha256:3a2a155b17f2bda9f7936f3909d139ace78b939adaf301a80ca56aa1d17f2b19","observation_id":"832cdfff-61ee-400e-9c61-dcf0b491a644","resolution":{"observed_at":"2026-08-01T15:29:27.374252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:29:27.505166Z","title":"Anthropic API documentation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18438","last_updated":"2026-07-20T18:46:17Z","snapshot_observed_at":"2026-08-08T04:15:26.223667Z","submitted_at":"2026-07-20T18:46:17Z","title":"Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T15:29:27.505166Z"},"links":{"citing_paper":"/paper/2607.18438"},"observation_digest":"sha256:92e9a52d1cdf48c8b77d570585af2d6bb54deb41e2ed83b2b13b11a1e5d8d1d9","observation_id":"f2cbc7d4-c6f3-4dc7-9736-64b0026e5fb3","resolution":{"observed_at":"2026-08-01T15:29:27.505166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:29:27.579197Z","title":"Gemini API documentation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18438","last_updated":"2026-07-20T18:46:17Z","snapshot_observed_at":"2026-08-08T04:15:26.223667Z","submitted_at":"2026-07-20T18:46:17Z","title":"Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T15:29:27.579197Z"},"links":{"citing_paper":"/paper/2607.18438"},"observation_digest":"sha256:18d7caca851b6379478d3970177d735f088f540ac7444e4bbf67291a0a988e94","observation_id":"bb4d9cfe-0542-4d59-81fc-e38bc39c98dd","resolution":{"observed_at":"2026-08-01T15:29:27.579197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:29:27.635227Z","title":"OpenAI API reference","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18438","last_updated":"2026-07-20T18:46:17Z","snapshot_observed_at":"2026-08-08T04:15:26.223667Z","submitted_at":"2026-07-20T18:46:17Z","title":"Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T15:29:27.635227Z"},"links":{"citing_paper":"/paper/2607.18438"},"observation_digest":"sha256:30c2b40f0b6b32a4a0fee6ce5f41f3d437f6c583d9e6415ea4418a912d54d74a","observation_id":"2f09ac12-5d15-46c7-9323-d81a42746256","resolution":{"observed_at":"2026-08-01T15:29:27.635227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:29:27.700320Z","title":"Adaptive thinking","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18438","last_updated":"2026-07-20T18:46:17Z","snapshot_observed_at":"2026-08-08T04:15:26.223667Z","submitted_at":"2026-07-20T18:46:17Z","title":"Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T15:29:27.700320Z"},"links":{"citing_paper":"/paper/2607.18438"},"observation_digest":"sha256:0767d33ec57d33a6920410a588e7445505297e43fcde694d33693a79d59aa215","observation_id":"9015a179-9740-4a4e-9b9e-e292861079af","resolution":{"observed_at":"2026-08-01T15:29:27.700320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:29:27.703737Z","title":"Gemini thinking","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18438","last_updated":"2026-07-20T18:46:17Z","snapshot_observed_at":"2026-08-08T04:15:26.223667Z","submitted_at":"2026-07-20T18:46:17Z","title":"Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T15:29:27.703737Z"},"links":{"citing_paper":"/paper/2607.18438"},"observation_digest":"sha256:6e129801b726ba52638aa541fa0f0909768352874235c4139df13406a7d706b6","observation_id":"ff719fe2-494c-4888-88d9-75f23ea9945f","resolution":{"observed_at":"2026-08-01T15:29:27.703737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:29:27.729612Z","title":"Reasoning models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18438","last_updated":"2026-07-20T18:46:17Z","snapshot_observed_at":"2026-08-08T04:15:26.223667Z","submitted_at":"2026-07-20T18:46:17Z","title":"Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T15:29:27.729612Z"},"links":{"citing_paper":"/paper/2607.18438"},"observation_digest":"sha256:f3cf97f729ae8cb03d29225d962ebfa8d6d609bf46b1a989066827cd8286ebc5","observation_id":"b9c86265-215c-42b4-98af-cade56917493","resolution":{"observed_at":"2026-08-01T15:29:27.729612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:29:27.872812Z","title":"AA-Omniscience: Evaluating Cross- Domain Knowledge Reliability in Large Language Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18438","last_updated":"2026-07-20T18:46:17Z","snapshot_observed_at":"2026-08-08T04:15:26.223667Z","submitted_at":"2026-07-20T18:46:17Z","title":"Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T15:29:27.872812Z"},"links":{"citing_paper":"/paper/2607.18438"},"observation_digest":"sha256:a277d400cfd8058703b292066ddae5698cfc9cfbdbb08ab11e65c9004105c430","observation_id":"da1afee8-2254-41c8-a250-dc17ace86eb9","resolution":{"observed_at":"2026-08-01T15:29:27.872812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:29:28.016995Z","title":"Context Length Alone Hurts LLM Performance Despite Perfect Retrieval","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18438","last_updated":"2026-07-20T18:46:17Z","snapshot_observed_at":"2026-08-08T04:15:26.223667Z","submitted_at":"2026-07-20T18:46:17Z","title":"Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T15:29:28.016995Z"},"links":{"citing_paper":"/paper/2607.18438"},"observation_digest":"sha256:26317057465fbdd72dab23ecf293d7bc90181a7ff9bc1b0539c74d3a25ac35a5","observation_id":"686673b7-628e-455a-817a-91a3608e4013","resolution":{"observed_at":"2026-08-01T15:29:28.016995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:29:28.123820Z","title":"AA-Omniscience: Knowledge and Halluci- nation Benchmark","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18438","last_updated":"2026-07-20T18:46:17Z","snapshot_observed_at":"2026-08-08T04:15:26.223667Z","submitted_at":"2026-07-20T18:46:17Z","title":"Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-01T15:29:28.123820Z"},"links":{"citing_paper":"/paper/2607.18438"},"observation_digest":"sha256:835c0b2f7ea13a6d6bcd4c5a107b7b5f3ea26776b2c0a515c1cd9af81e2e2003","observation_id":"924eb265-a4e8-4033-8bd0-665f4c8775e2","resolution":{"observed_at":"2026-08-01T15:29:28.123820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.04664","last_updated":"2025-09-04T21:26:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-04T21:26:31Z","title":"Why Language Models Hallucinate","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.04664","snapshot_observed_at":"2026-08-01T15:29:28.235129Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18438","last_updated":"2026-07-20T18:46:17Z","snapshot_observed_at":"2026-08-08T04:15:26.223667Z","submitted_at":"2026-07-20T18:46:17Z","title":"Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T15:29:28.235129Z"},"links":{"cited_paper":"/paper/2509.04664","citing_paper":"/paper/2607.18438"},"observation_digest":"sha256:486bc5a71e0f459c8013b49400c348806f9ec9ae8bd46860dd5ac0495add4181","observation_id":"d31f90aa-ea5f-4814-b6eb-2506aa063eb5","resolution":{"observed_at":"2026-08-01T15:29:28.235129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:29:28.335808Z","title":"Claude Fable 5 and Claude Mythos 5","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18438","last_updated":"2026-07-20T18:46:17Z","snapshot_observed_at":"2026-08-08T04:15:26.223667Z","submitted_at":"2026-07-20T18:46:17Z","title":"Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T15:29:28.335808Z"},"links":{"citing_paper":"/paper/2607.18438"},"observation_digest":"sha256:fe625ff18b1abfb5d6491773fc60bba3b0c02b85fa79db6eed382b1f1008a1db","observation_id":"fcd7a8fc-2e9e-4786-b250-2b065eb18798","resolution":{"observed_at":"2026-08-01T15:29:28.335808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:29:28.505901Z","title":"Artificial Analysis Intelligence Index","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18438","last_updated":"2026-07-20T18:46:17Z","snapshot_observed_at":"2026-08-08T04:15:26.223667Z","submitted_at":"2026-07-20T18:46:17Z","title":"Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-01T15:29:28.505901Z"},"links":{"citing_paper":"/paper/2607.18438"},"observation_digest":"sha256:c7bfeb7db6abb46de165ebd4076bf5f0f5abdb4a44ce0d51504d2dafebc87e5f","observation_id":"80a38cb3-1ead-4f0f-9e68-19d31dca1107","resolution":{"observed_at":"2026-08-01T15:29:28.505901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:29:29.037989Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18438","last_updated":"2026-07-20T18:46:17Z","snapshot_observed_at":"2026-08-08T04:15:26.223667Z","submitted_at":"2026-07-20T18:46:17Z","title":"Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-01T15:29:29.037989Z"},"links":{"citing_paper":"/paper/2607.18438"},"observation_digest":"sha256:9b48a88fa271ce3cbbffa4e34a498c2e93ebd7e8c89ed071f81d6b49a1011dc7","observation_id":"bf7420a9-0ec0-4c21-92ab-0a5a112220d2","resolution":{"observed_at":"2026-08-01T15:29:29.037989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:29:29.254414Z","title":"Artificial Analysis Intelligence Index: Methodology","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18438","last_updated":"2026-07-20T18:46:17Z","snapshot_observed_at":"2026-08-08T04:15:26.223667Z","submitted_at":"2026-07-20T18:46:17Z","title":"Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-01T15:29:29.254414Z"},"links":{"citing_paper":"/paper/2607.18438"},"observation_digest":"sha256:b38a5f0df6fb46ca6c94432979a8d0398653167a2eb45babb94f068201ae6a65","observation_id":"744271cb-af13-4ff9-bc2c-d1eb992b9f24","resolution":{"observed_at":"2026-08-01T15:29:29.254414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:29:29.460428Z","title":"AssetOpsBench: Stirrup Agent","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18438","last_updated":"2026-07-20T18:46:17Z","snapshot_observed_at":"2026-08-08T04:15:26.223667Z","submitted_at":"2026-07-20T18:46:17Z","title":"Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-01T15:29:29.460428Z"},"links":{"citing_paper":"/paper/2607.18438"},"observation_digest":"sha256:867f49cdb1560da4b4473cf1b4017223246271236ac41b6d8ab03a64b388bd93","observation_id":"b76a908b-d87a-4bce-a245-d025cda6e789","resolution":{"observed_at":"2026-08-01T15:29:29.460428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:29:29.577032Z","title":"Nemotron 3 Ultra: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18438","last_updated":"2026-07-20T18:46:17Z","snapshot_observed_at":"2026-08-08T04:15:26.223667Z","submitted_at":"2026-07-20T18:46:17Z","title":"Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-01T15:29:29.577032Z"},"links":{"citing_paper":"/paper/2607.18438"},"observation_digest":"sha256:8c7781016e66c5c92390c3c49ec40f064faa686476fad12dbfbe4a9fe6eaa4fb","observation_id":"a169a86c-7b9a-4bc1-8c97-bfb852aaa9e5","resolution":{"observed_at":"2026-08-01T15:29:29.577032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14249","last_updated":"2026-02-20T04:23:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-24T05:27:46Z","title":"Humanity's Last Exam","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14249","snapshot_observed_at":"2026-08-01T15:29:28.838974Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18438","last_updated":"2026-07-20T18:46:17Z","snapshot_observed_at":"2026-08-08T04:15:26.223667Z","submitted_at":"2026-07-20T18:46:17Z","title":"Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-01T15:29:28.838974Z"},"links":{"cited_paper":"/paper/2501.14249","citing_paper":"/paper/2607.18438"},"observation_digest":"sha256:e540025bc3b2014365302fa3d3dd2e65c4966b3e90d3dc2b8c2b3b2969bfd3a5","observation_id":"1d788fbd-d216-4eab-9658-8c918d5a007b","resolution":{"observed_at":"2026-08-01T15:29:28.838974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.18438","last_updated":"2026-07-20T18:46:17Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T04:15:26.223667Z","submitted_at":"2026-07-20T18:46:17Z","title":"Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":53,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 0 inbound Pith citation observations for arXiv:2607.18438."}