{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:64O6RAHHYXEO4YTNP5TUYPVCD3","short_pith_number":"pith:64O6RAHH","schema_version":"1.0","canonical_sha256":"f71de880e7c5c8ee626d7f674c3ea21ee5c99ea8a43168c098297aa8c4fa1806","source":{"kind":"arxiv","id":"2410.10479","version":2},"attestation_state":"computed","paper":{"title":"TMGBench: A Systematic Game Benchmark for Evaluating Strategic Reasoning Abilities of LLMs","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.GT"],"primary_cat":"cs.AI","authors_text":"Dianbo Sui, Haochuan Wang, Lei Li, Lingpeng Kong, Xiachong Feng, Yu Guo, Zhanyue Qin","submitted_at":"2024-10-14T13:15:34Z","abstract_excerpt":"The rapid advancement of large language models has accelerated their application in reasoning, with strategic reasoning drawing increasing attention. To evaluate the strategic reasoning capabilities of LLMs, game theory, with its concise structure, has become the preferred approach for many researchers. However, current research typically focuses on a limited selection of games, resulting in low coverage of game types. Additionally, classic game scenarios carry risks of data leakage, and the benchmarks used often lack extensibility, rendering them inadequate for evaluating state-of-the-art mod"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2410.10479","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.AI","submitted_at":"2024-10-14T13:15:34Z","cross_cats_sorted":["cs.GT"],"title_canon_sha256":"098a7087f15b5cd3bde696f6e97ba4428cf2909b5fdd524368bb321ff1c91d34","abstract_canon_sha256":"6e57f495ac41a5edd6977e145d8b7ecc040fd780903f172a77ad3ae7d7aca1bd"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:10:32.412581Z","signature_b64":"z6qYnyoRTd8FvrZCsRPibQWoSBt3cxff5tFsbHuLCZaxOBMG6p11ybUr6KzS7tj/WpkBwwaKpCsPCdpTrBglAw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"f71de880e7c5c8ee626d7f674c3ea21ee5c99ea8a43168c098297aa8c4fa1806","last_reissued_at":"2026-07-05T11:10:32.412073Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:10:32.412073Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"TMGBench: A Systematic Game Benchmark for Evaluating Strategic Reasoning Abilities of LLMs","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.GT"],"primary_cat":"cs.AI","authors_text":"Dianbo Sui, Haochuan Wang, Lei Li, Lingpeng Kong, Xiachong Feng, Yu Guo, Zhanyue Qin","submitted_at":"2024-10-14T13:15:34Z","abstract_excerpt":"The rapid advancement of large language models has accelerated their application in reasoning, with strategic reasoning drawing increasing attention. To evaluate the strategic reasoning capabilities of LLMs, game theory, with its concise structure, has become the preferred approach for many researchers. However, current research typically focuses on a limited selection of games, resulting in low coverage of game types. Additionally, classic game scenarios carry risks of data leakage, and the benchmarks used often lack extensibility, rendering them inadequate for evaluating state-of-the-art mod"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2410.10479","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2410.10479/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2410.10479","created_at":"2026-07-05T11:10:32.412133+00:00"},{"alias_kind":"arxiv_version","alias_value":"2410.10479v2","created_at":"2026-07-05T11:10:32.412133+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2410.10479","created_at":"2026-07-05T11:10:32.412133+00:00"},{"alias_kind":"pith_short_12","alias_value":"64O6RAHHYXEO","created_at":"2026-07-05T11:10:32.412133+00:00"},{"alias_kind":"pith_short_16","alias_value":"64O6RAHHYXEO4YTN","created_at":"2026-07-05T11:10:32.412133+00:00"},{"alias_kind":"pith_short_8","alias_value":"64O6RAHH","created_at":"2026-07-05T11:10:32.412133+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":3,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2605.10410","citing_title":"Equilibrium Residuals Expose Three Regimes of Matrix-Game Strategic Reasoning in Language Models","ref_index":10,"is_internal_anchor":false},{"citing_arxiv_id":"2604.07733","citing_title":"CivBench: Progress-Based Evaluation for LLMs' Strategic Decision-Making in Civilization V","ref_index":37,"is_internal_anchor":false},{"citing_arxiv_id":"2604.19278","citing_title":"Explicit Trait Inference for Multi-Agent Coordination","ref_index":63,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/64O6RAHHYXEO4YTNP5TUYPVCD3","json":"https://pith.science/pith/64O6RAHHYXEO4YTNP5TUYPVCD3.json","graph_json":"https://pith.science/api/pith-number/64O6RAHHYXEO4YTNP5TUYPVCD3/graph.json","events_json":"https://pith.science/api/pith-number/64O6RAHHYXEO4YTNP5TUYPVCD3/events.json","paper":"https://pith.science/paper/64O6RAHH"},"agent_actions":{"view_html":"https://pith.science/pith/64O6RAHHYXEO4YTNP5TUYPVCD3","download_json":"https://pith.science/pith/64O6RAHHYXEO4YTNP5TUYPVCD3.json","view_paper":"https://pith.science/paper/64O6RAHH","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2410.10479&json=true","fetch_graph":"https://pith.science/api/pith-number/64O6RAHHYXEO4YTNP5TUYPVCD3/graph.json","fetch_events":"https://pith.science/api/pith-number/64O6RAHHYXEO4YTNP5TUYPVCD3/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/64O6RAHHYXEO4YTNP5TUYPVCD3/action/timestamp_anchor","attest_storage":"https://pith.science/pith/64O6RAHHYXEO4YTNP5TUYPVCD3/action/storage_attestation","attest_author":"https://pith.science/pith/64O6RAHHYXEO4YTNP5TUYPVCD3/action/author_attestation","sign_citation":"https://pith.science/pith/64O6RAHHYXEO4YTNP5TUYPVCD3/action/citation_signature","submit_replication":"https://pith.science/pith/64O6RAHHYXEO4YTNP5TUYPVCD3/action/replication_record"}},"created_at":"2026-07-05T11:10:32.412133+00:00","updated_at":"2026-07-05T11:10:32.412133+00:00"}