Pith. sign in

Paper Citation Record · LEDGER

HackerRank-ASTRA: Evaluating Correctness & Consistency of Large Language Models on cross-domain multi-file project problems

As of 12 August 2026, this Paper Citation Record lists 8 of 8 outbound references and 0 inbound Pith citation observations for arXiv:2502.00226.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2502.00226 v1

Coverage vector

measured 8 of 8 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-09T19:46:23.635504Z

measured 8 of 8 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-12T06:34:41.77262+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

8 of 8 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved8
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation c0188b4d-f77f-400f-b809-c542f336ef2e · outbound

This paper cites HumanEval Pro and MBPP Pro: Evaluating Large Language Models on Self-invoking Code Generation.

HackerRank-ASTRA: Evaluating Correctness & Consistency of Large Language Models on cross-domain multi-file project problems HumanEval Pro and MBPP Pro: Evaluating Large Language Models on Self-invoking Code Generation

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-09T19:46:23.589246Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T19:46:23.589246Z digest=sha256:0ea7441e0032e9b59c9e98853b5ca4408a1f94f8ed2c3f5e8667c6423b38f36b

Observation a5472529-8f3f-4855-a760-60bbce9b0ebd · outbound

This paper cites SWE-bench: Can Language Models Resolve Real-World GitHub Issues?.

HackerRank-ASTRA: Evaluating Correctness & Consistency of Large Language Models on cross-domain multi-file project problems SWE-bench: Can Language Models Resolve Real-World GitHub Issues?

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-09T19:46:23.596333Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T19:46:23.596333Z digest=sha256:9e209c8f8785438d1cdecc3419eb8046f14e68d8e496d7588c4c84ed0a18a0b0

Observation 45939f3d-620a-46b6-85e1-1f2ce27f1231 · outbound

This paper cites SWE-bench Multimodal: Do AI Systems Generalize to Visual Software Domains?.

HackerRank-ASTRA: Evaluating Correctness & Consistency of Large Language Models on cross-domain multi-file project problems SWE-bench Multimodal: Do AI Systems Generalize to Visual Software Domains?

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-09T19:46:23.602920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T19:46:23.602920Z digest=sha256:e938a560136021072b5e7e0af1b3d7e2c26c82c2b94233e50eb5c4a9d6a93cb1

Observation 3d1a30ce-b9ac-4416-b692-f81861dea393 · outbound

This paper cites DevEval: A Manually-Annotated Code Generation Benchmark Aligned with Real-World Code Repositories.

HackerRank-ASTRA: Evaluating Correctness & Consistency of Large Language Models on cross-domain multi-file project problems DevEval: A Manually-Annotated Code Generation Benchmark Aligned with Real-World Code Repositories

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-09T19:46:23.609043Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T19:46:23.609043Z digest=sha256:0f6e81eeaacac1f8b5f5a235ebf3a12b6e7bb6142a6db88b0f22a2a2c61094c5

Observation 05b2843a-be17-4e07-a091-5aa9935f771a · outbound

This paper cites Enhancing Large Language Models in Coding Through Multi-Perspective Self-Consistency.

HackerRank-ASTRA: Evaluating Correctness & Consistency of Large Language Models on cross-domain multi-file project problems Enhancing Large Language Models in Coding Through Multi-Perspective Self-Consistency

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-09T19:46:23.615149Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T19:46:23.615149Z digest=sha256:8d2ac57b3597726dcbd17ef0be3a16331030562b8a064d299da37245466d958c

Observation abfbb0e0-656b-4b1e-92a5-d5f25c2dccbd · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

HackerRank-ASTRA: Evaluating Correctness & Consistency of Large Language Models on cross-domain multi-file project problems DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-09T19:46:23.621432Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T19:46:23.621432Z digest=sha256:1c9d85c1a19e8ffb8228a6cf03fcf5e9093655b9d4f01b1df2c913b0626d461f

Observation e0156aa4-85de-49ac-8a05-1faef45343f4 · outbound

This paper cites AgentBench: Evaluating LLMs as Agents.

HackerRank-ASTRA: Evaluating Correctness & Consistency of Large Language Models on cross-domain multi-file project problems AgentBench: Evaluating LLMs as Agents

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-09T19:46:23.628097Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T19:46:23.628097Z digest=sha256:db2625133c5679f2aa58dfcc61536361c55b80074e52aae0c30e0fb01a1114b8

Observation 0b1e7f17-7f48-4c2c-952d-dd87aa842518 · outbound

This paper cites MLAgentBench: Evaluating Language Agents on Machine Learning Experimentation.

HackerRank-ASTRA: Evaluating Correctness & Consistency of Large Language Models on cross-domain multi-file project problems MLAgentBench: Evaluating Language Agents on Machine Learning Experimentation

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-09T19:46:23.635504Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T19:46:23.635504Z digest=sha256:fe2300ca3e69f97fd04c2bf024c4e96380ea13d17c5a3025819480b34ae5f253

Pith citing papers

No inbound Pith citation observations are available.