Pith. sign in

Paper Citation Record · LEDGER

COMPASS: A Multi-Dimensional Benchmark for Evaluating Code Generation in Large Language Models

As of 23 August 2026, this Paper Citation Record lists 9 of 9 outbound references and 1 inbound Pith citation observation for arXiv:2508.13757.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2508.13757 v1

Coverage vector

measured 9 of 9 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-15T17:14:57.176868Z

measured 10 of 10 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-22T06:32:14.747728+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-05-08T17:58:54.689999Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-09T06:55:42.738972Z

Reference resolution

9 of 9 outbound references displayed

  • verified exact0
  • verified fuzzy4
  • unresolved5
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 00a574af-c152-449d-b83b-80f9c7d668c1 · outbound

This paper cites Evaluating Large Language Models Trained on Code.

COMPASS: A Multi-Dimensional Benchmark for Evaluating Code Generation in Large Language Models Evaluating Large Language Models Trained on Code

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-15T17:14:57.141012Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:14:57.141012Z digest=sha256:19b112979cc8d44f0bdf5fea3f2bd3d8457e6abf4a5716d784483adc209372c3

Observation dca436d3-46f3-401f-b525-01cfac0e62f2 · outbound

This paper cites Program Synthesis with Large Language Models.

COMPASS: A Multi-Dimensional Benchmark for Evaluating Code Generation in Large Language Models Program Synthesis with Large Language Models

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-15T17:14:57.146033Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:14:57.146033Z digest=sha256:e00509b0e55bfb1b62e934687c7a7b489c15570c55a7a6759eff52ba3e92dff9

Observation ff5ac8a7-4678-434c-b26c-f595df2f3d8d · outbound

This paper cites SWE-bench: Can Language Models Resolve Real-World GitHub Issues?.

COMPASS: A Multi-Dimensional Benchmark for Evaluating Code Generation in Large Language Models SWE-bench: Can Language Models Resolve Real-World GitHub Issues?

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-15T17:14:57.150366Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:14:57.150366Z digest=sha256:57815c80051cd07d6d788ccf7461a3dd2c842c8fc97560f567351b1a92122861

Observation 4ce98c4a-db03-4b39-8122-7ebc8fade0fc · outbound

This paper cites Hackerrank-astra: A benchmark for evaluating llms in coding competitions,.

COMPASS: A Multi-Dimensional Benchmark for Evaluating Code Generation in Large Language Models Hackerrank-astra: A benchmark for evaluating llms in coding competitions,

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T17:14:57.314025Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-15T17:14:57.154789Z digest=sha256:c6b5a1daa8fa9746ce31be88dfa8f70ae98b8770cdf1660202759ab68d383ab9

Observation 61a6db8a-f570-4ad7-96fa-a829041d8ecc · outbound

This paper cites Managing technical debt with the sqale method,.

COMPASS: A Multi-Dimensional Benchmark for Evaluating Code Generation in Large Language Models Managing technical debt with the sqale method,

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T17:14:57.301360Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-15T17:14:57.159106Z digest=sha256:64612d12194eef7fa518f361e845d71dd9226746fa22a4386b8bd352be27c18b

Observation 418899ed-cb2e-4fba-b96d-7021727ba079 · outbound

This paper cites A metrics suite for object oriented design,.

COMPASS: A Multi-Dimensional Benchmark for Evaluating Code Generation in Large Language Models A metrics suite for object oriented design,

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T17:14:57.289058Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-15T17:14:57.164108Z digest=sha256:a727aa7d6b39365609c86185cb618f5e737d58d1071a20d6c1d54c4be42f1470

Observation 982d7808-e294-4979-8dd3-d48ac183144f · outbound

This paper cites Measuring Coding Challenge Competence With APPS.

COMPASS: A Multi-Dimensional Benchmark for Evaluating Code Generation in Large Language Models Measuring Coding Challenge Competence With APPS

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-15T17:14:57.168475Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:14:57.168475Z digest=sha256:9612e70d9e422a99fcc04fd60c7a4217d515e8031047c06bb3745e3e9b2ee01a

Observation d1a5c496-06e0-4d3e-bb3e-4b09d06320ae · outbound

This paper cites DS-1000: A Natural and Reliable Benchmark for Data Science Code Generation.

COMPASS: A Multi-Dimensional Benchmark for Evaluating Code Generation in Large Language Models DS-1000: A Natural and Reliable Benchmark for Data Science Code Generation

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-15T17:14:57.172706Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:14:57.172706Z digest=sha256:425bb81c6acb71eb6ce330645eaa623a6b5cb8030c11711a8867746723df920b

Observation 001f5b98-4def-4c60-9095-fbcb3ea4ece0 · outbound

This paper cites Modeling the performance prediction problem in industrial and organizational psychology,.

COMPASS: A Multi-Dimensional Benchmark for Evaluating Code Generation in Large Language Models Modeling the performance prediction problem in industrial and organizational psychology,

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T17:14:57.275920Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-15T17:14:57.176868Z digest=sha256:8e9980084d7ccbf056e121c0790a71d43f2d9794329cd3f32a56fb293a51264c

Pith citing papers

Observation b94b25d9-0201-41c3-bc78-75150cac7030 · inbound

ARIADNE: Agentic Reward-Informed Adaptive Decision Exploration via Blackboard-Driven MCTS for Competitive Program Generation cites this paper.

ARIADNE: Agentic Reward-Informed Adaptive Decision Exploration via Blackboard-Driven MCTS for Competitive Program Generation COMPASS: A Multi-Dimensional Benchmark for Evaluating Code Generation in Large Language Models

Reference 23

Resolution
verified exact
arxiv_id, observed 2026-05-09T06:55:42.787053Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-05-08T17:58:54.689999Z digest=sha256:cc070bf1780ef08523df850c3769f5cd897b1c91ab27238c1186ace4ebf96d3c