{"as_of":"2026-08-12T23:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cdc3c765051578d6e6d289ca957e2d7251c7315dd3514c885f6a9380c1afdc19","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T17:25:31.762978Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T12:58:02.335060Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-11T12:58:02.541932Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"cited_work":{"arxiv_id":"2412.08972","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.08972","snapshot_observed_at":"2026-08-11T12:58:02.541932Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","venue":"cs.CL","work_id":"27aa050f-b48f-4114-90a9-cb9e8b628bab","year":2024},"citing_paper":{"arxiv_id":"2412.13670","last_updated":"2025-05-29T03:19:42Z","snapshot_observed_at":"2026-08-12T14:04:58.110354Z","submitted_at":"2024-12-18T09:53:12Z","title":"AntiLeakBench: Preventing Data Contamination by Automatically Constructing Benchmarks with Updated Real-World Knowledge","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-11T12:58:02.335060Z"},"links":{"cited_paper":"/paper/2412.08972","citing_paper":"/paper/2412.13670"},"observation_digest":"sha256:8169d772eec43373a569f8d4c1003984beb81430c62eba08e02e572bc0966ed2","observation_id":"dd2a529d-24b1-45f7-8885-b74ad43c7ffc","resolution":{"observed_at":"2026-08-11T12:58:02.549983Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.08972/citation-record","integrity":"/paper/2412.08972/integrity","json":"/paper/2412.08972/citation-record.json","paper":"/paper/2412.08972"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:25:31.466590Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.466590Z"},"links":{"citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:c99ad9817cd6514bf185a14492c6568448a9af9d0e014c8c708942aec4eba766","observation_id":"fe74d52f-9e9a-4981-9381-23d17cb9ce5a","resolution":{"observed_at":"2026-08-11T17:25:31.466590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:25:31.472716Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.472716Z"},"links":{"citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:a3cd86f92727f398c9f2ae17ae04a71dc59109e1193b3490936fb41fd76f6d8f","observation_id":"c9c95e2b-5f9e-46d6-bf7c-2a2d276398b7","resolution":{"observed_at":"2026-08-11T17:25:31.472716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.13319","last_updated":"2019-05-30T21:28:12Z","snapshot_observed_at":"2026-08-10T18:39:13.771066Z","submitted_at":"2019-05-30T21:28:12Z","title":"MathQA: Towards Interpretable Math Word Problem Solving with Operation-Based Formalisms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.13319","snapshot_observed_at":"2026-08-11T17:25:31.478406Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.478406Z"},"links":{"cited_paper":"/paper/1905.13319","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:0d34d3e7fc2389340896ec1bf31478f05724072f881f9eb505ee34f740e9ea24","observation_id":"599ee7b7-00f5-4437-a3b6-b38fe3bb4ac1","resolution":{"observed_at":"2026-08-11T17:25:31.478406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:25:32.629491Z","title":null,"venue":null,"work_id":"c75dc7b6-1502-4399-b880-d6d824d96503","year":2024},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.484261Z"},"links":{"citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:9493763932dfb1601cd2458b97491dafc50326e2431086baa489e1ed230c0c6a","observation_id":"472af47e-a485-4b67-bd82-325ffc628e56","resolution":{"observed_at":"2026-08-11T17:25:32.634419Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.12588","last_updated":"2023-10-23T01:27:38Z","snapshot_observed_at":"2026-08-02T13:06:11.850456Z","submitted_at":"2022-11-22T21:06:00Z","title":"Program of Thoughts Prompting: Disentangling Computation from Reasoning for Numerical Reasoning Tasks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.12588","snapshot_observed_at":"2026-08-11T17:25:31.490688Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.490688Z"},"links":{"cited_paper":"/paper/2211.12588","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:a2eb9dda9c8ed349096611658755a120a0245849fe181a81a6947f93c6280d0c","observation_id":"8c645659-9cea-455c-896a-efcc98ce5329","resolution":{"observed_at":"2026-08-11T17:25:31.490688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00690","last_updated":"2024-01-01T07:35:31Z","snapshot_observed_at":"2026-08-12T16:17:56.440369Z","submitted_at":"2024-01-01T07:35:31Z","title":"Benchmarking Large Language Models on Controllable Generation under Diversified Instructions","version":1},"cited_work":{"arxiv_id":"2401.00690","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.00690","snapshot_observed_at":"2026-08-11T17:25:32.514344Z","title":"Benchmarking Large Language Models on Controllable Generation under Diversified Instructions","venue":"cs.CL","work_id":"9642555d-2c04-47f0-9322-a207b64ddce2","year":2024},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.502542Z"},"links":{"cited_paper":"/paper/2401.00690","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:5a803d29463919e81b0fe6b166e4b0f8e9c445800a300423baa59c6a2896f1d7","observation_id":"c9fcdded-cafc-41bd-aeb4-2870f989629b","resolution":{"observed_at":"2026-08-11T17:25:32.521547Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-11T17:25:31.507934Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.507934Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:d103b12808219c17bef5da67430aae32bd1566058b75d9a7a178e7adcddb68d4","observation_id":"b3ab5312-a0a8-4a93-8215-efe0af9a4d2f","resolution":{"observed_at":"2026-08-11T17:25:31.507934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00234","last_updated":"2024-10-05T11:47:02Z","snapshot_observed_at":"2026-07-06T14:36:25.690733Z","submitted_at":"2022-12-31T15:57:09Z","title":"A Survey on In-context Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00234","snapshot_observed_at":"2026-08-11T17:25:31.514193Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.514193Z"},"links":{"cited_paper":"/paper/2301.00234","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:9321797cceaeffcdf6d0d4c1f7ad5c0b227ce73b7d21825d3f531f3631379f7f","observation_id":"75cfa14a-b8f9-4487-896f-7ae1df5c893d","resolution":{"observed_at":"2026-08-11T17:25:31.514193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-11T17:25:31.522554Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.522554Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:481a66714de796fd8d1e7f0376b5cc7cfb39ac6c146c5eb462f24676124278fd","observation_id":"ab56d529-30ee-4481-861e-93a4c9952e9d","resolution":{"observed_at":"2026-08-11T17:25:31.522554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14890","last_updated":"2024-02-12T17:30:25Z","snapshot_observed_at":"2026-08-11T04:52:28.671968Z","submitted_at":"2023-12-22T18:07:44Z","title":"NPHardEval: Dynamic Benchmark on Reasoning Ability of Large Language Models via Complexity Classes","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14890","snapshot_observed_at":"2026-08-11T17:25:31.528740Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.528740Z"},"links":{"cited_paper":"/paper/2312.14890","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:f92d57ffa4e7baefb1ce21784b696aeea7c789e96a2b7505c7fd9cb435444a8f","observation_id":"cef593c2-1dbc-4197-adc3-f9923440cff7","resolution":{"observed_at":"2026-08-11T17:25:31.528740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12726","last_updated":"2023-01-30T08:51:19Z","snapshot_observed_at":"2026-08-10T11:18:05.083290Z","submitted_at":"2023-01-30T08:51:19Z","title":"Specializing Smaller Language Models towards Multi-Step Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12726","snapshot_observed_at":"2026-08-11T17:25:31.534205Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.534205Z"},"links":{"cited_paper":"/paper/2301.12726","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:edba6fed26d6dbf4979cf1eb0c450dedc64c3ea3ab35110ecc855f937e1d51d5","observation_id":"dcd5b8b4-e197-468e-b98f-c474912133a6","resolution":{"observed_at":"2026-08-11T17:25:31.534205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.04971","last_updated":"2020-02-15T19:26:05Z","snapshot_observed_at":"2026-07-06T08:43:31.085150Z","submitted_at":"2019-12-10T20:36:07Z","title":"Neural Module Networks for Reasoning over Text","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.04971","snapshot_observed_at":"2026-08-11T17:25:31.539635Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.539635Z"},"links":{"cited_paper":"/paper/1912.04971","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:8db7757f79fa0243e5b2c7395388376f68d1e6021a2e19f36fcdfba522027daa","observation_id":"faa6572b-b8ad-4e9f-8cc2-f61ace86641f","resolution":{"observed_at":"2026-08-11T17:25:31.539635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00840","last_updated":"2024-10-11T20:08:54Z","snapshot_observed_at":"2026-08-10T23:00:56.264646Z","submitted_at":"2022-09-02T06:50:11Z","title":"FOLIO: Natural Language Reasoning with First-Order Logic","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.00840","snapshot_observed_at":"2026-08-11T17:25:31.545315Z","title":"Joty, Alexander R","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.545315Z"},"links":{"cited_paper":"/paper/2209.00840","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:b90c844d3452c1cf8bb7535370614e5868c21c9d58aeba5a1286de9d060521e1","observation_id":"80815c01-31e8-47f4-862e-111eaa9ec44e","resolution":{"observed_at":"2026-08-11T17:25:31.545315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.09150","last_updated":"2024-01-08T07:49:23Z","snapshot_observed_at":"2026-08-12T16:55:07.089833Z","submitted_at":"2023-09-17T04:18:39Z","title":"Can Large Language Models Understand Real-World Complex Instructions?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.09150","snapshot_observed_at":"2026-08-11T17:25:31.551256Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.551256Z"},"links":{"cited_paper":"/paper/2309.09150","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:7908dd593e5a5a54b2ea0073ba0ac1d8cf7e59a90dbf1931b7502f641384cbe8","observation_id":"a36dd340-b6a0-4515-8470-c043cb3bfde8","resolution":{"observed_at":"2026-08-11T17:25:31.551256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-11T17:25:31.556838Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.556838Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:105d1f3ef5798f171dac22491b0fb529d1ef00057ecf355790148273732abc7d","observation_id":"3b3b2d29-82b6-4140-8d85-e1d892dbcc71","resolution":{"observed_at":"2026-08-11T17:25:31.556838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02787","last_updated":"2024-06-04T21:25:06Z","snapshot_observed_at":"2026-08-07T01:29:09.279611Z","submitted_at":"2024-06-04T21:25:06Z","title":"Disentangling Logic: The Role of Context in Large Language Model Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02787","snapshot_observed_at":"2026-08-11T17:25:31.562964Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.562964Z"},"links":{"cited_paper":"/paper/2406.02787","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:c71d2783a35afaa9e97a83d8f3888a3fded31867f9dcad7ac0f757de6b97c50d","observation_id":"dad0c5e5-51b0-4dea-a78e-47e6e0f51821","resolution":{"observed_at":"2026-08-11T17:25:31.562964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02981","last_updated":"2024-01-24T18:16:34Z","snapshot_observed_at":"2026-07-06T17:12:06.715778Z","submitted_at":"2024-01-01T06:22:04Z","title":"Fine-tuning and Utilization Methods of Domain-specific LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02981","snapshot_observed_at":"2026-08-11T17:25:31.568737Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.568737Z"},"links":{"cited_paper":"/paper/2401.02981","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:6c24765825ecaaebfb4583c9b46756c403bf5490ae6e1422c3fa5276be58d94d","observation_id":"1bcfb457-4e42-403d-b33e-24e07603a894","resolution":{"observed_at":"2026-08-11T17:25:31.568737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20410","last_updated":"2024-06-05T15:39:26Z","snapshot_observed_at":"2026-08-08T02:42:16.160487Z","submitted_at":"2023-10-31T12:32:38Z","title":"FollowBench: A Multi-level Fine-grained Constraints Following Benchmark for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.20410","snapshot_observed_at":"2026-08-11T17:25:31.573876Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.573876Z"},"links":{"cited_paper":"/paper/2310.20410","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:ff87ac4e6693378eb9087e6581a65262ddb687981423fc16443048228d629614","observation_id":"84047906-9d58-4a8b-b19f-970db3f7ca96","resolution":{"observed_at":"2026-08-11T17:25:31.573876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11916","last_updated":"2023-01-29T05:14:17Z","snapshot_observed_at":"2026-08-07T04:02:08.445660Z","submitted_at":"2022-05-24T09:22:26Z","title":"Large Language Models are Zero-Shot Reasoners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.11916","snapshot_observed_at":"2026-08-11T17:25:31.579584Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.579584Z"},"links":{"cited_paper":"/paper/2205.11916","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:f3da1dbdbfc7136828f4b8a83acf9955f8fbcc8c47cdd75007cc9c9dd12573ae","observation_id":"554c006a-5a8d-431e-90e0-d7d6e714a2b1","resolution":{"observed_at":"2026-08-11T17:25:31.579584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:25:32.613474Z","title":null,"venue":null,"work_id":"2287c2bd-e93f-49c3-870f-9ee062aa4934","year":2023},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.590606Z"},"links":{"citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:be9fbf519038f97a96a14329d77b01523302697591b775d857bfad2d40b115cd","observation_id":"8c110deb-f1f6-4d3d-b68f-216350ef4e65","resolution":{"observed_at":"2026-08-11T17:25:32.618511Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.04146","last_updated":"2017-10-23T16:45:03Z","snapshot_observed_at":"2026-08-02T16:52:38.363314Z","submitted_at":"2017-05-11T13:04:47Z","title":"Program Induction by Rationale Generation : Learning to Solve and Explain Algebraic Word Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.04146","snapshot_observed_at":"2026-08-11T17:25:31.596604Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.596604Z"},"links":{"cited_paper":"/paper/1705.04146","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:04fc060287fd048a3787e8d1a2d013671098372afa4ffbc99c724fa363bcf8e4","observation_id":"e8113bb3-d5cd-4f4a-aaa8-2ac2ecb38777","resolution":{"observed_at":"2026-08-11T17:25:31.596604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18743","last_updated":"2024-08-25T09:58:57Z","snapshot_observed_at":"2026-08-06T10:19:25.039692Z","submitted_at":"2023-11-30T17:41:30Z","title":"AlignBench: Benchmarking Chinese Alignment of Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18743","snapshot_observed_at":"2026-08-11T17:25:31.603431Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.603431Z"},"links":{"cited_paper":"/paper/2311.18743","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:d7d66bad39e589184fd3c74bc6ab49aa3bdde08fb7d2c2135e86badf0563e5ba","observation_id":"66f26733-5eae-44f1-b1d6-7627e89aeeab","resolution":{"observed_at":"2026-08-11T17:25:31.603431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.12584","last_updated":"2019-04-26T06:50:54Z","snapshot_observed_at":"2026-08-06T17:51:03.744239Z","submitted_at":"2019-04-26T06:50:54Z","title":"The Neuro-Symbolic Concept Learner: Interpreting Scenes, Words, and Sentences From Natural Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.12584","snapshot_observed_at":"2026-08-11T17:25:31.609161Z","title":"Tenenbaum, and Jiajun Wu","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.609161Z"},"links":{"cited_paper":"/paper/1904.12584","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:357d3019082a688e633690d9aa3b80fb8daead8c44414dcb73ba5ca762e27f60","observation_id":"d3cafca9-863a-4946-9151-f0ca0cfdaa72","resolution":{"observed_at":"2026-08-11T17:25:31.609161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T17:25:31.620525Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.620525Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:c6cef52c67fb202a620bd2473d5a3b75b1f7a0fb0c588c64ef426b1c92d722b3","observation_id":"8e8f1c96-c593-444a-ba49-79d753438df8","resolution":{"observed_at":"2026-08-11T17:25:31.620525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:25:32.596625Z","title":null,"venue":null,"work_id":"b7b343fe-4f7c-4736-ba82-a07fe1fc2d82","year":2024},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.626065Z"},"links":{"citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:bb00d40d3ad93565278e780423088e602ad092ef4fdaf289847ba5fdb3f5d710","observation_id":"a7fe685c-4e24-41a8-9943-9522fe5cded6","resolution":{"observed_at":"2026-08-11T17:25:32.601585Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04235","last_updated":"2024-03-08T17:04:49Z","snapshot_observed_at":"2026-08-10T15:38:52.066066Z","submitted_at":"2023-11-06T08:50:29Z","title":"Can LLMs Follow Simple Rules?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04235","snapshot_observed_at":"2026-08-11T17:25:31.631000Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.631000Z"},"links":{"cited_paper":"/paper/2311.04235","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:df0cac8c39b08702ef2d7f05a8746947c1407bf6ea93f348fbaed61dcfe2f517","observation_id":"a2997379-5792-4bc2-ba04-86a4b9da5cdb","resolution":{"observed_at":"2026-08-11T17:25:31.631000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.12295","last_updated":"2023-10-19T01:54:27Z","snapshot_observed_at":"2026-08-10T11:45:15.322675Z","submitted_at":"2023-05-20T22:25:38Z","title":"Logic-LM: Empowering Large Language Models with Symbolic Solvers for Faithful Logical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.12295","snapshot_observed_at":"2026-08-11T17:25:31.635627Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.635627Z"},"links":{"cited_paper":"/paper/2305.12295","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:7af41e387881de5cf047590885690df4c27f9c236d25fa442e052b7713fc069a","observation_id":"d07f299e-107c-41cc-a9d8-1f3fb7fbe234","resolution":{"observed_at":"2026-08-11T17:25:31.635627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:25:31.640961Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.640961Z"},"links":{"citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:b861584cc24a91a5244bac6ca56b7f26282123d6655002526aecce6b8058a8f6","observation_id":"54d7ec07-72ff-4892-8fef-63be4a50f400","resolution":{"observed_at":"2026-08-11T17:25:31.640961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14542","last_updated":"2023-10-23T03:48:24Z","snapshot_observed_at":"2026-08-02T02:18:14.255273Z","submitted_at":"2023-10-23T03:48:24Z","title":"Evaluating Large Language Models on Controlled Generation Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14542","snapshot_observed_at":"2026-08-11T17:25:31.645790Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.645790Z"},"links":{"cited_paper":"/paper/2310.14542","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:6f3233c5b5c5267c622fce7590fa112bc8d1a4bb568753e399f657bb793120b9","observation_id":"29a4a05b-dc45-474b-8d11-7feff824a42e","resolution":{"observed_at":"2026-08-11T17:25:31.645790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08440","last_updated":"2024-10-17T07:00:19Z","snapshot_observed_at":"2026-08-10T09:48:43.509866Z","submitted_at":"2024-07-11T12:26:55Z","title":"Beyond Instruction Following: Evaluating Inferential Rule Following of Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08440","snapshot_observed_at":"2026-08-11T17:25:31.650877Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.650877Z"},"links":{"cited_paper":"/paper/2407.08440","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:f82658e6ae27f0077bfed832da469058c3fc71811c93767ebe057cbc0b4c7959","observation_id":"ff534545-f620-4513-9392-6df483194e48","resolution":{"observed_at":"2026-08-11T17:25:31.650877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.13048","last_updated":"2021-06-03T19:15:08Z","snapshot_observed_at":"2026-08-10T11:45:16.885523Z","submitted_at":"2020-12-24T00:55:46Z","title":"ProofWriter: Generating Implications, Proofs, and Abductive Statements over Natural Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.13048","snapshot_observed_at":"2026-08-11T17:25:31.657742Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.657742Z"},"links":{"cited_paper":"/paper/2012.13048","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:591d2621a755d67f8417ac4d160acae5378b33e2e3ce7bd136695f085bbad90e","observation_id":"93c81ae0-192f-4a1e-a76b-4770122d047f","resolution":{"observed_at":"2026-08-11T17:25:31.657742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.08963","last_updated":"2024-04-04T21:57:12Z","snapshot_observed_at":"2026-08-02T06:53:39.097077Z","submitted_at":"2023-09-16T11:31:58Z","title":"Struc-Bench: Are Large Language Models Really Good at Generating Complex Structured Data?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.08963","snapshot_observed_at":"2026-08-11T17:25:31.663743Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.663743Z"},"links":{"cited_paper":"/paper/2309.08963","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:e4c8702ab87c38a48933ba2228eb847a22c70b9884abbf26d06abc1366c131b0","observation_id":"1cfbde95-e41a-4638-a9fc-2b37c86c2a4e","resolution":{"observed_at":"2026-08-11T17:25:31.663743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-11T17:25:31.669363Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.669363Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:c924052f4b1215e40378ada0a338b2171dfb634190968e7f4fbaa91d4547151f","observation_id":"ecbe2bb7-1901-4741-8d75-912bb2e577b5","resolution":{"observed_at":"2026-08-11T17:25:31.669363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-11T17:25:31.674596Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.674596Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:822b8c3307f0aa177744c1f76a3e8122f32c18c25732bbd5d9432e2bb5be14e9","observation_id":"e0baaebf-292d-4d06-a7f2-7c8db95538c2","resolution":{"observed_at":"2026-08-11T17:25:31.674596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10509","last_updated":"2023-06-23T00:59:13Z","snapshot_observed_at":"2026-08-10T13:24:05.354678Z","submitted_at":"2022-12-20T18:26:34Z","title":"Interleaving Retrieval with Chain-of-Thought Reasoning for Knowledge-Intensive Multi-Step Questions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10509","snapshot_observed_at":"2026-08-11T17:25:31.679713Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.679713Z"},"links":{"cited_paper":"/paper/2212.10509","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:476964f6c5d7d8e1070013c657f90e2adc828d25527f2628c1a1404fc9974f5f","observation_id":"d1b92c73-8178-4984-90f9-730491d49f0c","resolution":{"observed_at":"2026-08-11T17:25:31.679713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13654","last_updated":"2024-08-24T19:11:54Z","snapshot_observed_at":"2026-08-12T22:58:04.270397Z","submitted_at":"2024-08-24T19:11:54Z","title":"Symbolic Working Memory Enhances Language Models for Complex Rule Application","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13654","snapshot_observed_at":"2026-08-11T17:25:31.685026Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.685026Z"},"links":{"cited_paper":"/paper/2408.13654","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:8a13f5fbbc39eac46ab9067a84e2639600db06e030cf88541846670e2d414e48","observation_id":"c88a85ba-37a6-4566-a606-1ce458d5726c","resolution":{"observed_at":"2026-08-11T17:25:31.685026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-08-11T17:25:31.690218Z","title":"Chi, Quoc V","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.690218Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:398dba7b1d2bde49b849ca54f5cda0c54e9f356e0b04fc7a1555b7005807121d","observation_id":"c782645d-ffea-4ab0-b09b-eed7f272ade5","resolution":{"observed_at":"2026-08-11T17:25:31.690218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03846","last_updated":"2023-03-08T07:37:43Z","snapshot_observed_at":"2026-08-10T13:53:36.347431Z","submitted_at":"2023-03-07T12:24:17Z","title":"Larger language models do in-context learning differently","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03846","snapshot_observed_at":"2026-08-11T17:25:31.695578Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.695578Z"},"links":{"cited_paper":"/paper/2303.03846","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:10c4c9e4d80c995efc970aab3d859fbfc6219905a6e36488100fd7693fa954c0","observation_id":"1a85ad85-4774-4a3b-9fa8-dffe70884ab0","resolution":{"observed_at":"2026-08-11T17:25:31.695578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03978","last_updated":"2024-10-31T08:11:04Z","snapshot_observed_at":"2026-07-06T18:41:35.995594Z","submitted_at":"2024-07-04T14:50:45Z","title":"Benchmarking Complex Instruction-Following with Multiple Constraints Composition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03978","snapshot_observed_at":"2026-08-11T17:25:31.700799Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.700799Z"},"links":{"cited_paper":"/paper/2407.03978","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:2832589c1622fadc4c16b5d3d0bfeebc89891ac5d10bbe4ecb35bf4fe7dbd3c6","observation_id":"4cdb2072-3836-4bf3-93a8-6fbb1f18f0f0","resolution":{"observed_at":"2026-08-11T17:25:31.700799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:25:32.567641Z","title":null,"venue":null,"work_id":"1a0cdb69-17e1-4ee4-973b-0b34cb394c80","year":2024},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.706510Z"},"links":{"citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:5977a6c0d5a8fa5082dd9e20d18899c24385d4dc565bc2d9937afa23addae931","observation_id":"89f1b186-2986-43fc-b091-9e364538064d","resolution":{"observed_at":"2026-08-11T17:25:32.573102Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13670","last_updated":"2025-05-29T03:19:42Z","snapshot_observed_at":"2026-08-12T14:04:58.110354Z","submitted_at":"2024-12-18T09:53:12Z","title":"AntiLeakBench: Preventing Data Contamination by Automatically Constructing Benchmarks with Updated Real-World Knowledge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13670","snapshot_observed_at":"2026-08-11T17:25:31.711425Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.711425Z"},"links":{"cited_paper":"/paper/2412.13670","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:7e98a7f33f68fb07b94b6bc1947c3fd916574777851525bf05ecf298aa75f5e8","observation_id":"5c57647e-2132-4c7d-9d04-3f09215c7e4b","resolution":{"observed_at":"2026-08-11T17:25:31.711425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18667","last_updated":"2024-02-28T19:23:27Z","snapshot_observed_at":"2026-08-12T08:10:09.546344Z","submitted_at":"2024-02-28T19:23:27Z","title":"FOFO: A Benchmark to Evaluate LLMs' Format-Following Capability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18667","snapshot_observed_at":"2026-08-11T17:25:31.716582Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.716582Z"},"links":{"cited_paper":"/paper/2402.18667","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:52370eca9fe9ca41bb2a6cb4f31abf66dc5922efebb4ea5b0c5fa79a95483c3d","observation_id":"3ffddade-a12f-4d0c-822a-75a995be22b8","resolution":{"observed_at":"2026-08-11T17:25:31.716582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.12244","last_updated":"2025-05-27T06:49:09Z","snapshot_observed_at":"2026-08-11T20:57:48.098709Z","submitted_at":"2023-04-24T16:31:06Z","title":"WizardLM: Empowering large pre-trained language models to follow complex instructions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.12244","snapshot_observed_at":"2026-08-11T17:25:31.721684Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.721684Z"},"links":{"cited_paper":"/paper/2304.12244","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:8c63899a0cf5e96aa8f7857215d3e91d2ea177cae3b41efcc17263b8ce4ca766","observation_id":"f9aa2e2f-1cc9-4ae8-9b06-958f5effb3e4","resolution":{"observed_at":"2026-08-11T17:25:31.721684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11436","last_updated":"2024-06-18T04:41:07Z","snapshot_observed_at":"2026-08-11T09:11:01.699684Z","submitted_at":"2024-02-18T03:10:39Z","title":"Pride and Prejudice: LLM Amplifies Self-Bias in Self-Refinement","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11436","snapshot_observed_at":"2026-08-11T17:25:31.727116Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.727116Z"},"links":{"cited_paper":"/paper/2402.11436","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:31d590811c6fa5c143b7717e1e9ce9734ad2228730e2dddb15b32b63adb4ea87","observation_id":"a8f55908-4f7a-4154-a59b-33998ccec510","resolution":{"observed_at":"2026-08-11T17:25:31.727116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10873","last_updated":"2025-07-13T05:18:48Z","snapshot_observed_at":"2026-08-06T10:56:30.385023Z","submitted_at":"2023-10-16T22:53:54Z","title":"IDEAL: Influence-Driven Selective Annotations Empower In-Context Learners in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10873","snapshot_observed_at":"2026-08-11T17:25:31.732283Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.732283Z"},"links":{"cited_paper":"/paper/2310.10873","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:7fd47bb91f8e8e93fe2c6814ea4ee5c1b3f0f028304928502c2f26c5b767ad0c","observation_id":"844f10de-a47f-4635-bcba-4a3297884042","resolution":{"observed_at":"2026-08-11T17:25:31.732283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14198","last_updated":"2024-10-18T06:25:27Z","snapshot_observed_at":"2026-08-12T22:20:21.632613Z","submitted_at":"2024-10-18T06:25:27Z","title":"Supervised Chain of Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14198","snapshot_observed_at":"2026-08-11T17:25:31.737463Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.737463Z"},"links":{"cited_paper":"/paper/2410.14198","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:09b469d4f5b527822ca2de59dab4fc847d75549b709623f194f6e3e1087f4289","observation_id":"384d583b-315a-4a8a-adf5-48678e0a6465","resolution":{"observed_at":"2026-08-11T17:25:31.737463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-11T17:25:31.742515Z","title":"Xing, Hao Zhang, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.742515Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:becdf2088d437606e9ffcadfad5a9a2513233d72f390b159ebccd2c5e2ffca63","observation_id":"73562581-8cd3-4c46-b5f0-be198b988482","resolution":{"observed_at":"2026-08-11T17:25:31.742515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.06598","last_updated":"2021-04-15T02:21:45Z","snapshot_observed_at":"2026-08-09T03:58:03.718727Z","submitted_at":"2021-04-14T02:53:32Z","title":"AR-LSAT: Investigating Analytical Reasoning of Text","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.06598","snapshot_observed_at":"2026-08-11T17:25:31.747587Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.747587Z"},"links":{"cited_paper":"/paper/2104.06598","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:9381b6fcc8b4ab363d9e303d882255e760718a992b9c44f8bb661cb9848ed2bc","observation_id":"85d4fd0c-8c37-4866-b2a1-3e3105cc69c4","resolution":{"observed_at":"2026-08-11T17:25:31.747587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-11T17:25:31.752696Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.752696Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:fe165655b8e029cecfab730b54d0e0c73d4af2b43c2301f91fa9a1b722615f74","observation_id":"74a6d8bb-5218-4579-9c27-2f087c4131ca","resolution":{"observed_at":"2026-08-11T17:25:31.752696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06221","last_updated":"2024-03-10T13:58:38Z","snapshot_observed_at":"2026-08-09T08:53:09.846575Z","submitted_at":"2024-03-10T13:58:38Z","title":"TRAD: Enhancing LLM Agents with Step-Wise Thought Retrieval and Aligned Decision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06221","snapshot_observed_at":"2026-08-11T17:25:31.757823Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.757823Z"},"links":{"cited_paper":"/paper/2403.06221","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:227c10948847bfe9791b919a55ab3a95fd78478ac1e0f4b5627a6859d68fdb13","observation_id":"ab0a5149-1d39-483d-bf07-d5ecd39f7b4f","resolution":{"observed_at":"2026-08-11T17:25:31.757823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17167","last_updated":"2024-03-14T09:52:16Z","snapshot_observed_at":"2026-08-08T18:43:29.715488Z","submitted_at":"2023-09-29T12:04:14Z","title":"DyVal: Dynamic Evaluation of Large Language Models for Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17167","snapshot_observed_at":"2026-08-11T17:25:31.762978Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.762978Z"},"links":{"cited_paper":"/paper/2309.17167","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:0d8a147fb7e83ae8cce3802a323e1bf3890436de7ed5d7ea2f7b436763828ac3","observation_id":"7b10c5b1-eb13-437b-a2d3-e8c4a2892122","resolution":{"observed_at":"2026-08-11T17:25:31.762978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":50,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 1 inbound Pith citation observation for arXiv:2412.08972."}