{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:CZICXR6BHQWJWKV73ACOJVSWCQ","short_pith_number":"pith:CZICXR6B","schema_version":"1.0","canonical_sha256":"16502bc7c13c2c9b2abfd804e4d656140394087995e8f8aff4fa0c3797b39703","source":{"kind":"arxiv","id":"2502.07980","version":1},"attestation_state":"computed","paper":{"title":"CIRCUIT: A Benchmark for Circuit Interpretation and Reasoning Capabilities of LLMs","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.LG","authors_text":"Lejla Skelic, Matthew Cox, Ruonan Han, Tao Yu, Wenjie Lu, Yan Xu","submitted_at":"2025-02-11T21:53:48Z","abstract_excerpt":"The role of Large Language Models (LLMs) has not been extensively explored in analog circuit design, which could benefit from a reasoning-based approach that transcends traditional optimization techniques. In particular, despite their growing relevance, there are no benchmarks to assess LLMs' reasoning capability about circuits. Therefore, we created the CIRCUIT dataset consisting of 510 question-answer pairs spanning various levels of analog-circuit-related subjects. The best-performing model on our dataset, GPT-4o, achieves 48.04% accuracy when evaluated on the final numerical answer. To eva"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2502.07980","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2025-02-11T21:53:48Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"ffdedb5e3219df92bcbd0e3bbc5a083886a3a822d3f51f3d115d40d2bdaeeca4","abstract_canon_sha256":"0d2054de4e9d24eb26bae7d72dd8e90c70bb97d6866bb9acf11efec154197c3b"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:13:13.185347Z","signature_b64":"/CfouiGeBEv9Unc2zmZlP8eYC6Z2AvxgABp/BMGkHF9gB1BqJlFbhuu3ziwuLN8uCCpTu2dmzlIOKALqvCJUDQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"16502bc7c13c2c9b2abfd804e4d656140394087995e8f8aff4fa0c3797b39703","last_reissued_at":"2026-07-05T10:13:13.184818Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:13:13.184818Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"CIRCUIT: A Benchmark for Circuit Interpretation and Reasoning Capabilities of LLMs","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.LG","authors_text":"Lejla Skelic, Matthew Cox, Ruonan Han, Tao Yu, Wenjie Lu, Yan Xu","submitted_at":"2025-02-11T21:53:48Z","abstract_excerpt":"The role of Large Language Models (LLMs) has not been extensively explored in analog circuit design, which could benefit from a reasoning-based approach that transcends traditional optimization techniques. In particular, despite their growing relevance, there are no benchmarks to assess LLMs' reasoning capability about circuits. Therefore, we created the CIRCUIT dataset consisting of 510 question-answer pairs spanning various levels of analog-circuit-related subjects. The best-performing model on our dataset, GPT-4o, achieves 48.04% accuracy when evaluated on the final numerical answer. To eva"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2502.07980","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2502.07980/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2502.07980","created_at":"2026-07-05T10:13:13.184878+00:00"},{"alias_kind":"arxiv_version","alias_value":"2502.07980v1","created_at":"2026-07-05T10:13:13.184878+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2502.07980","created_at":"2026-07-05T10:13:13.184878+00:00"},{"alias_kind":"pith_short_12","alias_value":"CZICXR6BHQWJ","created_at":"2026-07-05T10:13:13.184878+00:00"},{"alias_kind":"pith_short_16","alias_value":"CZICXR6BHQWJWKV7","created_at":"2026-07-05T10:13:13.184878+00:00"},{"alias_kind":"pith_short_8","alias_value":"CZICXR6B","created_at":"2026-07-05T10:13:13.184878+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":4,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.23704","citing_title":"PCB-QA: Evaluating LLMs over the First Printed Circuit Board Design Question-Answer Dataset","ref_index":38,"is_internal_anchor":false},{"citing_arxiv_id":"2512.10159","citing_title":"Enhancing Large Language Model-Based Systems for End-to-End Circuit Analysis Problem Solving","ref_index":19,"is_internal_anchor":false},{"citing_arxiv_id":"2602.15037","citing_title":"CircuChain: Disentangling Competence and Compliance in LLM Circuit Analysis","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2604.12290","citing_title":"Frontier-Eng: Benchmarking Self-Evolving Agents on Real-World Engineering Tasks with Generative Optimization","ref_index":20,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/CZICXR6BHQWJWKV73ACOJVSWCQ","json":"https://pith.science/pith/CZICXR6BHQWJWKV73ACOJVSWCQ.json","graph_json":"https://pith.science/api/pith-number/CZICXR6BHQWJWKV73ACOJVSWCQ/graph.json","events_json":"https://pith.science/api/pith-number/CZICXR6BHQWJWKV73ACOJVSWCQ/events.json","paper":"https://pith.science/paper/CZICXR6B"},"agent_actions":{"view_html":"https://pith.science/pith/CZICXR6BHQWJWKV73ACOJVSWCQ","download_json":"https://pith.science/pith/CZICXR6BHQWJWKV73ACOJVSWCQ.json","view_paper":"https://pith.science/paper/CZICXR6B","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2502.07980&json=true","fetch_graph":"https://pith.science/api/pith-number/CZICXR6BHQWJWKV73ACOJVSWCQ/graph.json","fetch_events":"https://pith.science/api/pith-number/CZICXR6BHQWJWKV73ACOJVSWCQ/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/CZICXR6BHQWJWKV73ACOJVSWCQ/action/timestamp_anchor","attest_storage":"https://pith.science/pith/CZICXR6BHQWJWKV73ACOJVSWCQ/action/storage_attestation","attest_author":"https://pith.science/pith/CZICXR6BHQWJWKV73ACOJVSWCQ/action/author_attestation","sign_citation":"https://pith.science/pith/CZICXR6BHQWJWKV73ACOJVSWCQ/action/citation_signature","submit_replication":"https://pith.science/pith/CZICXR6BHQWJWKV73ACOJVSWCQ/action/replication_record"}},"created_at":"2026-07-05T10:13:13.184878+00:00","updated_at":"2026-07-05T10:13:13.184878+00:00"}