{"as_of":"2026-08-08T07:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:699eb3773c5336382653a429f306a059a999981dedf8f06b972ac810876e7f38","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:33:13.512658Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T21:18:28.946759Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T21:18:29.388938Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"cited_work":{"arxiv_id":"2506.10481","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.10481","snapshot_observed_at":"2026-08-05T21:18:29.388938Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","venue":"cs.AI","work_id":"0feea441-1a9a-4ea0-9fe0-4487a48b73e0","year":2025},"citing_paper":{"arxiv_id":"2508.09101","last_updated":"2025-08-12T17:29:20Z","snapshot_observed_at":"2026-08-05T21:18:24.957038Z","submitted_at":"2025-08-12T17:29:20Z","title":"AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:28.946759Z"},"links":{"cited_paper":"/paper/2506.10481","citing_paper":"/paper/2508.09101"},"observation_digest":"sha256:f98d9f8f6fab5aace265143ed21dd516d345e8c8d825e472ec9584d069974f6f","observation_id":"13979a02-a595-4766-af05-c8b0caeed694","resolution":{"observed_at":"2026-08-05T21:18:29.439278Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10481","snapshot_observed_at":"2026-08-04T09:39:47.742161Z","title":"Solvability,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.17868","last_updated":"2026-07-15T10:42:46Z","snapshot_observed_at":"2026-08-07T14:24:19.514495Z","submitted_at":"2025-10-16T05:07:12Z","title":"UniCode: Augmenting Evaluation for Code Reasoning","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T09:39:47.742161Z"},"links":{"cited_paper":"/paper/2506.10481","citing_paper":"/paper/2510.17868"},"observation_digest":"sha256:2cf488b3b0e90576c01798b1f79aa1e3604ed4bed78fd17f0c844e380fb2c2a9","observation_id":"dbbbccce-7a7a-4d22-ad08-be68d7ac57e0","resolution":{"observed_at":"2026-08-04T09:39:47.742161Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.10481/citation-record","integrity":"/paper/2506.10481/integrity","json":"/paper/2506.10481/citation-record.json","paper":"/paper/2506.10481"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T04:13:14.044604Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-07T04:33:07.868175Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:07.868175Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:6d4bc84ffdea64960834154af0d9ac0ff9c0c03fe43af5d9df24d7e77f3d45d9","observation_id":"677cd943-be5c-4dcf-a8c9-ac7b9834aae1","resolution":{"observed_at":"2026-08-07T04:33:07.868175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-07T04:33:07.895300Z","title":"Program synthesis with large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:07.895300Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:c8c5761de06469a59eb8acd3612f11c9edd56080e8d8021fcd925cdba6f5c4cd","observation_id":"5fb3d385-2c8a-4fb5-9930-86e32248768a","resolution":{"observed_at":"2026-08-07T04:33:07.895300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05229","last_updated":"2025-08-27T16:24:39Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T17:36:37Z","title":"GSM-Symbolic: Understanding the Limitations of Mathematical Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05229","snapshot_observed_at":"2026-08-07T04:33:07.938420Z","title":"Gsm-symbolic: Understanding the limitations of mathematical reasoning in large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:07.938420Z"},"links":{"cited_paper":"/paper/2410.05229","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:0da7c1fa2008d51a579aac1cb768aa3440c80a5badac66a4ca7700f7f2c8180b","observation_id":"1eed0699-97f2-441f-8413-d8a27d8de4ee","resolution":{"observed_at":"2026-08-07T04:33:07.938420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23123","last_updated":"2025-03-04T06:22:40Z","snapshot_observed_at":"2026-07-06T19:42:21.306600Z","submitted_at":"2024-10-30T15:31:54Z","title":"On Memorization of Large Language Models in Logical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23123","snapshot_observed_at":"2026-08-07T04:33:08.113023Z","title":"On memorization of large language models in logical reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:08.113023Z"},"links":{"cited_paper":"/paper/2410.23123","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:2e120d5e9264f068abe5fb8e9b644520ee25f594462e640be8a4a8ec715551a2","observation_id":"8971f75e-77ab-4780-8d59-2d75b01c8113","resolution":{"observed_at":"2026-08-07T04:33:08.113023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.07814","last_updated":"2022-02-08T23:16:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-08T23:16:31Z","title":"Competition-Level Code Generation with AlphaCode","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.07814","snapshot_observed_at":"2026-08-07T04:33:08.236487Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:08.236487Z"},"links":{"cited_paper":"/paper/2203.07814","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:8e1fe50f554d9de894a32722ccd4be69921c38c541e20dc2dfe7cda188863eed","observation_id":"7933ce0e-30ce-49d6-a056-1b2d95da9aec","resolution":{"observed_at":"2026-08-07T04:33:08.236487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-07-31T19:08:41.925451Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01257","snapshot_observed_at":"2026-08-07T04:33:08.345343Z","title":"Codeelo: Benchmarking competition-level code generation of llms with human-comparable elo ratings","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:08.345343Z"},"links":{"cited_paper":"/paper/2501.01257","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:aad5c3b57f4481effe3625815d1049409a2ad8fc12f74b797e56e8b4c9f4336f","observation_id":"89daff14-5780-49b5-be69-a6f71cfab640","resolution":{"observed_at":"2026-08-07T04:33:08.345343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10952","last_updated":"2024-04-16T23:27:38Z","snapshot_observed_at":"2026-08-07T05:16:48.851507Z","submitted_at":"2024-04-16T23:27:38Z","title":"Can Language Models Solve Olympiad Programming?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10952","snapshot_observed_at":"2026-08-07T04:33:08.494278Z","title":"Can language models solve olympiad programming? CoRR, abs/2404.10952, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:08.494278Z"},"links":{"cited_paper":"/paper/2404.10952","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:95a71a723f418d02dd48986c8a7027e86c34b326a4c1f96fa1a05c525d251379","observation_id":"b523538d-5be5-47d3-99ad-e3c9115faf50","resolution":{"observed_at":"2026-08-07T04:33:08.494278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-07T04:33:08.592196Z","title":"Livecodebench: Holistic and contamination free evaluation of large language models for code","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:08.592196Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:c40e4a1cc0e570a634081f85cdb4a8395ca303664360ca73ea28d3874b8a27a6","observation_id":"e5402a56-4632-4d42-b63f-2a855608d68c","resolution":{"observed_at":"2026-08-07T04:33:08.592196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:14.352740Z","title":"Effibench: Bench- marking the efficiency of automatically generated code","venue":null,"work_id":"b5fe8a09-298e-4053-99ad-2c4b250f66cb","year":2024},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:08.686791Z"},"links":{"citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:8519afdb4b3229eee3b4e278367d0c595c49972eb4da28ccee565385eb6b759b","observation_id":"0df138f1-78c1-4e82-8fc4-c382798f3814","resolution":{"observed_at":"2026-08-07T04:33:14.355418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:14.344236Z","title":"A performance study of llm-generated code on leetcode","venue":null,"work_id":"57d004e2-29ff-442d-9bfe-6975081dfafa","year":2024},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:08.803139Z"},"links":{"citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:f94c78703fb5922e3f9c6635debd787ed78a470f61a73561ef3aade0da011e0f","observation_id":"17bca638-1c3d-4a3d-9784-a2dc78abc840","resolution":{"observed_at":"2026-08-07T04:33:14.347033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T04:33:09.009199Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:09.009199Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:3af81346e4d78f73899d40b1b4f3e0230855bd7d24a2c8c3b84feafbf60fc813","observation_id":"54080233-0ace-4240-9f4a-2f7ce7a3622c","resolution":{"observed_at":"2026-08-07T04:33:09.009199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:09.150957Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:09.150957Z"},"links":{"citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:d75f11a6b9491484f0cd6891030e3cce5d8e17a5d77a15f0558584ba8b1f95ce","observation_id":"642496ed-ad65-45d1-b167-ee0c48c136be","resolution":{"observed_at":"2026-08-07T04:33:09.150957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:14.331664Z","title":"Towards reasoning in large language models: A survey","venue":null,"work_id":"1b191fe7-20b2-452a-b28c-8522155d52ce","year":2023},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:09.261275Z"},"links":{"citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:0848bf05962da2c112449fe07fd28e0d108d27f767c6d8da2196354070890b44","observation_id":"3901de89-a2fe-44eb-8d03-327450d93252","resolution":{"observed_at":"2026-08-07T04:33:14.334289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09686","last_updated":"2025-01-23T08:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T17:37:58Z","title":"Towards Large Reasoning Models: A Survey of Reinforced Reasoning with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09686","snapshot_observed_at":"2026-08-07T04:33:09.361597Z","title":"Towards large reasoning models: A survey of reinforced reasoning with large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:09.361597Z"},"links":{"cited_paper":"/paper/2501.09686","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:5586cba20b37b55f6f892da11f451b96d0a5730d076a0cd8c5ce3e8896159311","observation_id":"b1450cc4-1139-4609-83d5-ce03f3fd2944","resolution":{"observed_at":"2026-08-07T04:33:09.361597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T04:33:09.512190Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:09.512190Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:29438706226635df674ff93b85a60df3133bb019990f395b1deda4c53e8bbd9d","observation_id":"44bfdff2-8214-40e2-9022-85520e23a5fa","resolution":{"observed_at":"2026-08-07T04:33:09.512190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:09.609005Z","title":"Measuring mathematical problem solving with the MATH dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:09.609005Z"},"links":{"citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:a6ae83b2678c2a499f6f78ea5fde81d0d9161e5aae00657b316ffb306199fdf7","observation_id":"6b3a8478-b429-413d-927c-2b2ce0f6eba6","resolution":{"observed_at":"2026-08-07T04:33:09.609005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:14.319558Z","title":"Cohen, Ruslan Salakhut- dinov, and Christopher D","venue":null,"work_id":"32afe33c-3ad6-480d-bb9f-e51aea78e75f","year":2018},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:09.793808Z"},"links":{"citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:a03c675e5130de2c246eca3f00a85815f74598c981818ebcabe8038b6597c8de","observation_id":"f94983e6-4a73-4d5e-ab04-21ddc0139989","resolution":{"observed_at":"2026-08-07T04:33:14.322073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:14.311656Z","title":"Logicbench: Towards systematic evaluation of logical reasoning ability of large language models","venue":null,"work_id":"819d56c9-0585-4754-9358-56ea3a1c38d7","year":2024},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:09.948383Z"},"links":{"citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:6857774166c6f1413a786f0f17a0801986610ee6c01b9412c09fbf7189275456","observation_id":"5ed49304-8946-4d3d-97d9-ba86e3bd6312","resolution":{"observed_at":"2026-08-07T04:33:14.314247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:14.303920Z","title":"Criticbench: Benchmarking llms for critique-correct reasoning","venue":null,"work_id":"81371d03-a7aa-4c06-93a0-550c030bbb88","year":2024},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:10.071881Z"},"links":{"citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:21075c98cfacb75fdff7d02183306acc6e55a78ae3a2babe934b61bd3a2775d1","observation_id":"fb1688cf-6872-4115-987d-2288f1ad5ade","resolution":{"observed_at":"2026-08-07T04:33:14.306856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12521","last_updated":"2025-02-18T04:11:29Z","snapshot_observed_at":"2026-08-07T18:10:14.927590Z","submitted_at":"2025-02-18T04:11:29Z","title":"Inference-Time Computations for LLM Reasoning and Planning: A Benchmark and Insights","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12521","snapshot_observed_at":"2026-08-07T04:33:10.196140Z","title":"Inference-time computations for LLM reasoning and planning: A benchmark and insights","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:10.196140Z"},"links":{"cited_paper":"/paper/2502.12521","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:9b474807253224186d1c2d8f14263346671bb750216e68a331f1afcd7eabb7df","observation_id":"e6186f45-f387-4eaa-8c0c-0ba4ae4d219d","resolution":{"observed_at":"2026-08-07T04:33:10.196140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04973","last_updated":"2024-07-06T06:48:16Z","snapshot_observed_at":"2026-07-06T18:42:18.289966Z","submitted_at":"2024-07-06T06:48:16Z","title":"LogicVista: Multimodal LLM Logical Reasoning Benchmark in Visual Contexts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04973","snapshot_observed_at":"2026-08-07T04:33:10.271856Z","title":"Logicvista: Multimodal LLM logical reasoning benchmark in visual contexts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:10.271856Z"},"links":{"cited_paper":"/paper/2407.04973","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:c3dd443cb173e16e596c10cc2b29c25f749c38280bd8ea18c209f211098d93dc","observation_id":"0b740906-92a7-4fd4-96b5-eacbd9f605c5","resolution":{"observed_at":"2026-08-07T04:33:10.271856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09170","last_updated":"2024-06-13T14:31:19Z","snapshot_observed_at":"2026-07-06T18:30:19.486766Z","submitted_at":"2024-06-13T14:31:19Z","title":"Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09170","snapshot_observed_at":"2026-08-07T04:33:10.361435Z","title":"Test of time: A benchmark for evaluating llms on temporal reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:10.361435Z"},"links":{"cited_paper":"/paper/2406.09170","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:47cd86c5207a052366b1014d241cef03ed7ebbbf6ec9ad21a5540bde3286743a","observation_id":"257705c7-de3a-4bd4-beb8-34177dabd9b4","resolution":{"observed_at":"2026-08-07T04:33:10.361435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15778","last_updated":"2024-10-12T11:00:25Z","snapshot_observed_at":"2026-07-06T19:07:07.234443Z","submitted_at":"2024-08-28T13:16:41Z","title":"LogicGame: Benchmarking Rule-Based Reasoning Abilities of Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15778","snapshot_observed_at":"2026-08-07T04:33:10.456529Z","title":"Logicgame: Benchmarking rule-based reasoning abilities of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:10.456529Z"},"links":{"cited_paper":"/paper/2408.15778","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:9f0e4ee704731bc2a1ccbb2b44dd878c6e81c9c992deceecf71507d4aff06c33","observation_id":"76549ae5-f538-4580-a655-95ee05d74ed8","resolution":{"observed_at":"2026-08-07T04:33:10.456529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:14.295791Z","title":"Are llms capable of data-based statistical and causal reasoning? benchmarking advanced quantitative reasoning with data","venue":null,"work_id":"303c58ed-680b-46f1-bd69-9049dd20ba00","year":2024},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:10.553871Z"},"links":{"citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:6357d2238c88400a80baf8110255ffa3b15317b1c0f56ce6f409e8c47cf06a41","observation_id":"d3e75ec1-cd0f-449f-b2f6-6dc02a3ad2d9","resolution":{"observed_at":"2026-08-07T04:33:14.299145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:14.288260Z","title":"Codereval: A benchmark of pragmatic code generation with generative pre-trained models","venue":null,"work_id":"b08f95e5-6581-4a86-aa35-8604e7b07da0","year":2024},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:10.636451Z"},"links":{"citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:6d7deb5d31ffafe86c15be6d7e03617cfb92f94a44c30f977f7ea42ad241b904","observation_id":"d92827bc-67a8-4fd7-b70b-55ec6e095b75","resolution":{"observed_at":"2026-08-07T04:33:14.291143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11470","last_updated":"2024-10-09T05:59:07Z","snapshot_observed_at":"2026-07-06T18:47:00.524107Z","submitted_at":"2024-07-16T08:08:48Z","title":"Beyond Correctness: Benchmarking Multi-dimensional Code Generation for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11470","snapshot_observed_at":"2026-08-07T04:33:10.690842Z","title":"Beyond correctness: Benchmarking multi-dimensional code generation for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:10.690842Z"},"links":{"cited_paper":"/paper/2407.11470","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:3a522c6fb450b9608df1cdc61b2cdde80832715e202fb876a45c8431207a3c62","observation_id":"936321a4-c108-462a-bd8c-590b38ec447c","resolution":{"observed_at":"2026-08-07T04:33:10.690842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.09043","last_updated":"2024-09-05T14:00:11Z","snapshot_observed_at":"2026-07-06T14:43:31.440090Z","submitted_at":"2023-01-22T02:59:59Z","title":"CodeScore: Evaluating Code Generation by Learning Code Execution","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.09043","snapshot_observed_at":"2026-08-07T04:33:10.781213Z","title":"Codescore: Evaluating code generation by learning code execution","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:10.781213Z"},"links":{"cited_paper":"/paper/2301.09043","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:3f876e0d855545ee7d682b00d17b054d89d2d649bea3a3ce192c35906351b487","observation_id":"0655c6db-019a-414a-90cd-857c259b7560","resolution":{"observed_at":"2026-08-07T04:33:10.781213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:14.281165Z","title":"Cruxeval: A benchmark for code reasoning, understanding and execution","venue":null,"work_id":"1888f9e9-6748-4377-9c87-dacd8fba66b6","year":2024},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:10.889582Z"},"links":{"citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:08d62062c6fb37352b165c53d005c2f1c7e8e3fdeba646a2265c505d2dc98905","observation_id":"899dd107-2403-4bd5-81cc-ccb94887e1b4","resolution":{"observed_at":"2026-08-07T04:33:14.283713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:10.980550Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:10.980550Z"},"links":{"citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:bcfba8bf07f09029e0cde17f49fa4cca47a3ae0af8077933088b5cae8a9284ac","observation_id":"e2cd57c7-dded-4765-bbc7-79afff3440b4","resolution":{"observed_at":"2026-08-07T04:33:10.980550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19149","last_updated":"2025-02-26T14:08:17Z","snapshot_observed_at":"2026-08-07T17:46:15.418149Z","submitted_at":"2025-02-26T14:08:17Z","title":"Isolating Language-Coding from Problem-Solving: Benchmarking LLMs with PseudoEval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19149","snapshot_observed_at":"2026-08-07T04:33:11.064635Z","title":"Isolat- ing language-coding from problem-solving: Benchmarking llms with pseudoeval","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:11.064635Z"},"links":{"cited_paper":"/paper/2502.19149","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:629f09b305fe7b1715446b49a269040728fd50aa6a5fd42c6d13fb344b96e6ea","observation_id":"cf56bd4a-4897-40bf-b472-3e3af2586d02","resolution":{"observed_at":"2026-08-07T04:33:11.064635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06643","last_updated":"2026-07-06T05:56:24Z","snapshot_observed_at":"2026-08-07T17:18:54.590513Z","submitted_at":"2025-03-09T14:41:18Z","title":"Is Your Benchmark Still Useful? Dynamic Benchmarking for Code Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06643","snapshot_observed_at":"2026-08-07T04:33:11.149875Z","title":"Is your benchmark (still) useful? dynamic benchmarking for code language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:11.149875Z"},"links":{"cited_paper":"/paper/2503.06643","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:947269c366c97bf3f9c5f6f79acb117def9c70d3784726411c34b5c536c6adc5","observation_id":"d710289c-aca7-4203-b897-827a8eb75b65","resolution":{"observed_at":"2026-08-07T04:33:11.149875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04149","last_updated":"2025-06-03T22:14:34Z","snapshot_observed_at":"2026-08-07T17:25:44.092200Z","submitted_at":"2025-03-06T06:56:59Z","title":"Dynamic Benchmarking of Reasoning Capabilities in Code Large Language Models Under Data Contamination","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04149","snapshot_observed_at":"2026-08-07T04:33:11.223662Z","title":"Dynamic benchmarking of reasoning ca- pabilities in code large language models under data contamination","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:11.223662Z"},"links":{"cited_paper":"/paper/2503.04149","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:e9384651825a276120ab7d14af66d8cdc1135a9806e480df01d1e70fc6441a54","observation_id":"81670f9e-1a1b-4357-9c81-a8e809fea339","resolution":{"observed_at":"2026-08-07T04:33:11.223662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04197","last_updated":"2024-09-22T12:40:35Z","snapshot_observed_at":"2026-07-06T18:26:37.581248Z","submitted_at":"2024-06-06T15:55:53Z","title":"DICE: Detecting In-distribution Contamination in LLM's Fine-tuning Phase for Math Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04197","snapshot_observed_at":"2026-08-07T04:33:11.291003Z","title":"DICE: detecting in- distribution contamination in llm’s fine-tuning phase for math reasoning.CoRR, abs/2406.04197, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:11.291003Z"},"links":{"cited_paper":"/paper/2406.04197","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:8c6474cd66e7b9ea10af121641ccb3790930dc88ff81ec58cccb10a781e38539","observation_id":"7cbaf7ec-3ed3-4e85-ac20-d6eec217d703","resolution":{"observed_at":"2026-08-07T04:33:11.291003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19341","last_updated":"2023-10-30T08:31:47Z","snapshot_observed_at":"2026-08-06T06:09:43.812715Z","submitted_at":"2023-10-30T08:31:47Z","title":"Skywork: A More Open Bilingual Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19341","snapshot_observed_at":"2026-08-07T04:33:11.374239Z","title":"Skywork: A more open bilingual foundation model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:11.374239Z"},"links":{"cited_paper":"/paper/2310.19341","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:053b00c72e5b02c4fe168da845b7c79528f31e2aea69760a4ef53527a86a9262","observation_id":"86c6e912-7fc3-4588-a43e-04df53aa5026","resolution":{"observed_at":"2026-08-07T04:33:11.374239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18824","last_updated":"2024-04-29T16:05:36Z","snapshot_observed_at":"2026-07-06T18:07:10.639325Z","submitted_at":"2024-04-29T16:05:36Z","title":"Benchmarking Benchmark Leakage in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18824","snapshot_observed_at":"2026-08-07T04:33:11.477391Z","title":"Benchmarking benchmark leakage in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:11.477391Z"},"links":{"cited_paper":"/paper/2404.18824","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:deaa406058f1c3273b47b7d2e18ddd3f96de0db2ad29e1e43ffeaafc0ae794fd","observation_id":"9a361e93-bc4a-4fe3-8ff8-29e3ba0a6029","resolution":{"observed_at":"2026-08-07T04:33:11.477391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:14.273775Z","title":"Investigating data contamination in modern benchmarks for large language models","venue":null,"work_id":"13259565-8de4-4015-9d2c-717d965198b2","year":2024},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:11.551800Z"},"links":{"citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:bb01d3488006042f5e92816728b575b1ae8dbeadc46a3cead87b6de07ce50786","observation_id":"21f92f1a-3f2d-4dfb-aa4f-5b0138120960","resolution":{"observed_at":"2026-08-07T04:33:14.276180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04244","last_updated":"2024-06-06T16:41:39Z","snapshot_observed_at":"2026-07-30T15:43:06.151242Z","submitted_at":"2024-06-06T16:41:39Z","title":"Benchmark Data Contamination of Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04244","snapshot_observed_at":"2026-08-07T04:33:11.622079Z","title":"Tahar Kechadi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:11.622079Z"},"links":{"cited_paper":"/paper/2406.04244","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:e1f150c1ab09d7904eb551c0339c0f4325df523f8d489b7f7cdcf13fb560ddb3","observation_id":"e1523533-2660-400b-a1a6-ae70109142aa","resolution":{"observed_at":"2026-08-07T04:33:11.622079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:14.266211Z","title":"Docker: lightweight linux containers for consistent development and deployment","venue":null,"work_id":"09070e44-a561-4e30-a9d7-278e9fb7c5c2","year":2014},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:11.694824Z"},"links":{"citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:2e5c189ee54c18e816a937590f2763c0002f7a2ce65e763a6c39eb64e6a55799","observation_id":"581e0455-150e-48ab-9d57-5697dd66c467","resolution":{"observed_at":"2026-08-07T04:33:14.269060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T04:33:11.777217Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:11.777217Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:e113b489eb4de50eb79186df27ef6ff3a91b3a3aaf672649dc0f35c5cc67a9f3","observation_id":"84463afe-3213-45f6-a19b-96af79e2c121","resolution":{"observed_at":"2026-08-07T04:33:11.777217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00640","last_updated":"2024-11-01T14:57:16Z","snapshot_observed_at":"2026-08-07T10:39:44.274910Z","submitted_at":"2024-11-01T14:57:16Z","title":"Adding Error Bars to Evals: A Statistical Approach to Language Model Evaluations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00640","snapshot_observed_at":"2026-08-07T04:33:11.879063Z","title":"Adding error bars to evals: A statistical approach to language model evaluations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:11.879063Z"},"links":{"cited_paper":"/paper/2411.00640","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:4c1156608ed6fac5d8875f35ba36703413e8a2af992bb2540508a548a8ced938","observation_id":"5c822408-c600-4247-902c-ca8fd4e6e333","resolution":{"observed_at":"2026-08-07T04:33:11.879063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:14.258634Z","title":"Nolazco-Flores, Lori Landay, Matthew Thomas Jackson, Paul Röttger, Philip H","venue":null,"work_id":"aef1f770-7fce-492c-94c9-07c103d7415e","year":2024},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:11.977474Z"},"links":{"citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:cfedf816096f546b47e147a4a75a76d9a9d5bfe291b968f06ad61efa6350ad0f","observation_id":"10f87df3-ad7f-464e-b7ed-19503c52def0","resolution":{"observed_at":"2026-08-07T04:33:14.261358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T04:33:12.079334Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:12.079334Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:442c5560c7d1380fd7f7577c072d8451e8255afb29d8b03a11787e8274fc361e","observation_id":"78bc563c-3cb6-405f-8318-ba1d6dad94cc","resolution":{"observed_at":"2026-08-07T04:33:12.079334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12186","last_updated":"2024-11-12T13:24:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:57:57Z","title":"Qwen2.5-Coder Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12186","snapshot_observed_at":"2026-08-07T04:33:12.172149Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:12.172149Z"},"links":{"cited_paper":"/paper/2409.12186","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:f4180da7d8d5ca45dfde1c2c2852c6dd9582dfd45f1537e909fa02463493bf84","observation_id":"fe56bd4e-ee86-4a6d-b0d5-d7659287e70a","resolution":{"observed_at":"2026-08-07T04:33:12.172149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T04:33:12.250698Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:12.250698Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:dd1e0b469657ec3a3ac7063df9f445dbea90952f27fafe709783277f7caa6fc6","observation_id":"0f70dad5-8764-4312-90b2-39fd99cf8493","resolution":{"observed_at":"2026-08-07T04:33:12.250698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T04:33:12.323405Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:12.323405Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:638e0e258ec138ff7ab27aaf5200367398fb14c28242b818bdf6ed6c90cf4b52","observation_id":"0529cc92-095b-44cb-8316-c9290a998c21","resolution":{"observed_at":"2026-08-07T04:33:12.323405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:14.250805Z","title":"doubao-pro-32k","venue":null,"work_id":"0ce30160-c5a7-475f-8bd7-0ee5e69571c4","year":null},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:12.399148Z"},"links":{"citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:156429e65397cba932681f082ff7772b80ce19648d338b715505cdc2b326f9cd","observation_id":"3aeae70a-eee1-41d7-9a3a-e4ddcdf67436","resolution":{"observed_at":"2026-08-07T04:33:14.253388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T04:33:12.478817Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:12.478817Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:464edbd049f9a1b7c1b439292626cd4f61dda401cc1f6d1d517c5d1e5edd7922","observation_id":"cc5cf503-ffa5-4de0-bbac-16aa997f02ab","resolution":{"observed_at":"2026-08-07T04:33:12.478817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:14.235696Z","title":"claude 3.5 sonnet","venue":null,"work_id":"5f808b1d-f64f-4da6-9349-028b6c75f0c8","year":2025},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:12.507631Z"},"links":{"citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:fc4c96374b6f789432da98da914e8052805aadf60dac06eb7e8a084998cea056","observation_id":"f8db0d76-cfd0-479b-b6cf-7caf3d627a57","resolution":{"observed_at":"2026-08-07T04:33:14.238282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:14.227786Z","title":"Qwq-32b: Embracing the power of reinforcement learning, March 2025","venue":null,"work_id":"f9a3b367-5b83-4578-9e93-dad128ed257b","year":2025},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:12.617668Z"},"links":{"citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:f708e4dad709319ce035635dea2af450084fdebcb256100250de24fb68843b25","observation_id":"403f9abe-e5ea-4cf3-bc42-4d22cfb671a1","resolution":{"observed_at":"2026-08-07T04:33:14.230706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:14.219805Z","title":null,"venue":null,"work_id":"a3b59af9-2e83-4d9c-a19f-217d9474e912","year":2025},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:12.706993Z"},"links":{"citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:9dfc4bc4242b9ef6ff40c5b4da1590f0e4317b571e33f3fc59265cff23a5129a","observation_id":"285ab06e-1f0e-4e19-b97e-d93f3d7f8337","resolution":{"observed_at":"2026-08-07T04:33:14.222489Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:14.211759Z","title":null,"venue":null,"work_id":"551929d3-43ae-4fa5-8abf-b0dd1b90cc2c","year":null},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:12.833113Z"},"links":{"citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:75721a07c5113d1e9af72470f3b73e6382e2315e96abefd3aaa2faecf524cd9b","observation_id":"9c620678-4793-4185-978f-c60b35414ddc","resolution":{"observed_at":"2026-08-07T04:33:14.214256Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-07T04:33:13.126641Z","title":"Scaling LLM test-time compute optimally can be more effective than scaling model parameters","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:13.126641Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:5de6a1f5fb0f610a40dc789725f0583604ab38b11b0ae149e6c36c51f8df5a17","observation_id":"deed81ee-5c08-42de-9023-ce48a68ffa60","resolution":{"observed_at":"2026-08-07T04:33:13.126641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:14.204103Z","title":null,"venue":null,"work_id":"dc25d3fc-776e-4b1a-bb59-9b0ad962b81e","year":2025},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:12.976100Z"},"links":{"citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:d9e229c3cb457a2523122f6844cb853a59455cae94ce11c55ffdbf09048244cd","observation_id":"60544d7f-15a2-489a-8b3c-118c1fc619ac","resolution":{"observed_at":"2026-08-07T04:33:14.206611Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14503","last_updated":"2025-05-23T05:26:50Z","snapshot_observed_at":"2026-07-06T19:54:00.822571Z","submitted_at":"2024-11-21T08:31:06Z","title":"Planning-Driven Programming: A Large Language Model Programming Workflow","version":3},"cited_work":{"arxiv_id":"2411.14503","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.14503","snapshot_observed_at":"2026-08-07T04:33:13.600619Z","title":"Planning-Driven Programming: A Large Language Model Programming Workflow","venue":"cs.SE","work_id":"5fec93f8-5036-4297-8a69-ea91d283150f","year":2024},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:13.290319Z"},"links":{"cited_paper":"/paper/2411.14503","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:0fba1234c8165af6673cf681975ef52e7b14507a8aa0f36d9babeaa827f95370","observation_id":"19fc4506-4f00-48ae-b270-3aa91ee352fc","resolution":{"observed_at":"2026-08-07T04:33:13.651606Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18449","last_updated":"2025-12-01T00:16:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-25T18:45:04Z","title":"SWE-RL: Advancing LLM Reasoning via Reinforcement Learning on Open Software Evolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18449","snapshot_observed_at":"2026-08-07T04:33:13.242807Z","title":"Swe-rl: Advancing llm reasoning via reinforcement learning on open software evolution","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:13.242807Z"},"links":{"cited_paper":"/paper/2502.18449","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:e164d4c01eec8aa256206fb067637bfb241434541dcf1f0534e3279f86a7fb1b","observation_id":"715587bd-377a-4a17-973e-dbeb65973865","resolution":{"observed_at":"2026-08-07T04:33:13.242807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02310","last_updated":"2025-02-24T09:25:51Z","snapshot_observed_at":"2026-08-04T04:41:35.684065Z","submitted_at":"2024-11-04T17:36:40Z","title":"MdEval: Massively Multilingual Code Debugging","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02310","snapshot_observed_at":"2026-08-07T04:33:13.471509Z","title":"Mdeval: Massively multilingual code debugging","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:13.471509Z"},"links":{"cited_paper":"/paper/2411.02310","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:0ec5bd6c6c4e7581912503809e1e95cb9a1a28c8191f7093e3b2e2bbbff41c63","observation_id":"27f0621f-2e87-4b49-b354-a7e7f545caa3","resolution":{"observed_at":"2026-08-07T04:33:13.471509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-07T04:33:13.374423Z","title":"Megatron-lm: Training multi-billion parameter language models using model parallelism","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:13.374423Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:0245879065d4da9e7aa8fb8ab5cb2b51df5d02b59aef6d4af9c82b0c9fedbb4f","observation_id":"fbc1b3c7-92aa-45d0-916b-6e48fd573c5a","resolution":{"observed_at":"2026-08-07T04:33:13.374423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:14.188194Z","title":"Codetransocean: A comprehensive multilingual benchmark for code translation","venue":null,"work_id":"211de308-0d2c-474a-960e-2684a9156c32","year":2023},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:13.509440Z"},"links":{"citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:3b0cd17a82d57d5c30c4fdf9998bde3f99aff0c8f3e4ceda4d7f35865fb38a64","observation_id":"4113a733-6537-474f-8a8e-bc155c22e733","resolution":{"observed_at":"2026-08-07T04:33:14.191077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:14.196458Z","title":null,"venue":null,"work_id":"2da51440-6326-4643-862c-f6a3837e43a0","year":2021},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:13.480183Z"},"links":{"citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:cd27d36f2b7d123079e3d7e346c621e4cc02e7ece09ecb785c392ee8141be3a1","observation_id":"946b8748-aacf-4824-b769-b34ddf9071d9","resolution":{"observed_at":"2026-08-07T04:33:14.199024Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:14.102311Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":"86885235-3924-43af-aa20-fce077340ae4","year":2023},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:13.512658Z"},"links":{"citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:adfd14c7f43600f687194ebb654e0175166d69838e4654adb6b0361e581258cc","observation_id":"fc7e4390-da56-4d66-955b-7a41fb5b3a58","resolution":{"observed_at":"2026-08-07T04:33:14.174519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:14.243123Z","title":null,"venue":null,"work_id":"800e5e1b-5b00-42a3-adeb-64d6bebb3ade","year":2025},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:12.468028Z"},"links":{"citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:8f9237d2ad05ba64a734e63931e263d41ee1920da4ba373e58e12d8170d3a39d","observation_id":"9991e6ca-2d3c-4e5b-b22d-0a670a1e87ba","resolution":{"observed_at":"2026-08-07T04:33:14.245758Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T05:19:15.942866Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":2,"unresolved":41,"verified_exact":1,"verified_fuzzy":17},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 2 inbound Pith citation observations for arXiv:2506.10481."}