Pith. sign in

Paper Citation Record · LEDGER

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models

As of 18 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 1 inbound Pith citation observation for arXiv:2505.07247.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.07247 v2

Coverage vector

measured 55 of 55 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-15T22:25:37.576015Z

measured 56 of 56 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-18T06:34:40.430872+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-06-28T01:31:59.207857Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-02T13:06:59.574503Z

Reference resolution

55 of 55 outbound references displayed

  • verified exact2
  • verified fuzzy26
  • unresolved27
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 67fbe111-a202-46c8-b410-e574b45b5b86 · outbound

This paper cites Automated essay scoring using discourse external knowledge,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Automated essay scoring using discourse external knowledge,

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.912982Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T22:25:37.274255Z digest=sha256:8842c0c7245625398b54fff0f972ff29c9cd5320dacf796f68af7f66e296dd24

Observation a261be39-31ca-4da5-83e0-f1df5bb8d924 · outbound

This paper cites Improve LLM-based Automatic Essay Scoring with Linguistic Features.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Improve LLM-based Automatic Essay Scoring with Linguistic Features

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.280015Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.280015Z digest=sha256:0f32c220b0ad0488ba2e8329fe60d1a711394d191ebe2f0edda01844cdf2ecb9

Observation 252dac85-dd2e-406a-9f94-fff6f6a7e2ae · outbound

This paper cites An automated essay scoring systems: a systematic literature review,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models An automated essay scoring systems: a systematic literature review,

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.285968Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.285968Z digest=sha256:9b75db0aede0013a778a7b511ba51408f7b6fc47b8ecc8c0e1b6123545141829

Observation e2ed5a10-882d-4a1f-9aba-33ab95e0a017 · outbound

This paper cites Prompt Agnostic Essay Scorer: A Domain Generalization Approach to Cross-prompt Automated Essay Scoring.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Prompt Agnostic Essay Scorer: A Domain Generalization Approach to Cross-prompt Automated Essay Scoring

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.292005Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.292005Z digest=sha256:a5b8633184dc58d9ea8f3ed4870b99060fa3c341be583e05eb49f4a32490f6ac

Observation d9c6e080-0e50-47f4-bb20-8d2efc0137c3 · outbound

This paper cites Automated cross-prompt scoring of essay traits,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Automated cross-prompt scoring of essay traits,

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.894874Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T22:25:37.298617Z digest=sha256:153b73c2a1203867ca8f264e174c6aab17a2898d5fba6f54b30c6bccfb4c2e6f

Observation 912ca936-70d2-4507-9245-d4e4244cc659 · outbound

This paper cites A short answer grading system in chinese by cnn,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models A short answer grading system in chinese by cnn,

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.878163Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T22:25:37.303916Z digest=sha256:4a5834c5344aa02ed62d3df4a024065a46e02c1de601d505270ea1b1b5caf157

Observation 829ae285-d36a-4c41-8a0c-60318537ab5e · outbound

This paper cites A short answer grading system in chinese by support vector approach,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models A short answer grading system in chinese by support vector approach,

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.860512Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T22:25:37.310513Z digest=sha256:3696b0004668f3d5c77277c92b2565b452bc278e7807d29a33b2247a240e2b94

Observation 386e1beb-863f-44e7-a6c0-d34bcc21ea38 · outbound

This paper cites GPT-4 Technical Report.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models GPT-4 Technical Report

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.320977Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.320977Z digest=sha256:515236c4a27b016c8100b4ee526358f0010af3481af78b6c5ef19e0e59fcd2ba

Observation 55358dc4-2826-4d13-98f9-4e1707ff31c0 · outbound

This paper cites DeepSeek-V3 Technical Report.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models DeepSeek-V3 Technical Report

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.327052Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.327052Z digest=sha256:fe5e679095c7afde28ed081dc92c401321d31a91a2fea5d7f32937b3d85fe091

Observation b4c81324-9f60-445b-aaa2-7dcd8871c39c · outbound

This paper cites Is llm-as-a-judge robust? investigating universal adversarial attacks on zero-shot LLM assessment,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Is llm-as-a-judge robust? investigating universal adversarial attacks on zero-shot LLM assessment,

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.826092Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T22:25:37.333237Z digest=sha256:c02580a685c7fd981558c0c7ad53a74bea23a18c53603e7de4c0b3262e09c215

Observation 5c11d8d6-24ed-4e6f-9441-1b18a3f151d8 · outbound

This paper cites Beyond yes and no: Improving zero-shot LLM rankers via scoring fine-grained relevance labels,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Beyond yes and no: Improving zero-shot LLM rankers via scoring fine-grained relevance labels,

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.339086Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.339086Z digest=sha256:9a85c3dea97692a516ed2b79f9ba139b7f0a68ad6ce568f8b870b479944d6f65

Observation 99d57d2b-b45f-4f1e-849e-bbd86b60f8e9 · outbound

This paper cites GLIDER: Grading LLM Interactions and Decisions using Explainable Ranking.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models GLIDER: Grading LLM Interactions and Decisions using Explainable Ranking

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.344350Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.344350Z digest=sha256:568f1f2e6be9d33fba2390a26fbb60b6e109cd7e8fa08294665b2359765ff83e

Observation 511f91b4-d53e-4cea-a979-f4fc8b288f8c · outbound

This paper cites The hewlett foundation: Automated essay scoring,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models The hewlett foundation: Automated essay scoring,

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.794015Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T22:25:37.349667Z digest=sha256:2454964783dc1a8f7ef44f3804bf5c3790e5b36c1b33ffda2d864baa6ff07008

Observation a965f117-da47-41b9-acdc-5bd224f349e7 · outbound

This paper cites Scaa: A dataset for automated short answer grading of children’s free-text answers in hindi and marathi,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Scaa: A dataset for automated short answer grading of children’s free-text answers in hindi and marathi,

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.776588Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T22:25:37.354817Z digest=sha256:5eae2d75fc8f7407de837edc502aaf010aa8f91c5687d0080e96f7727a1cdada

Observation 088ada9b-177a-4113-96e2-2227693bf7dc · outbound

This paper cites Semeval-2013 task 7: The joint student response analysis and 8th recognizing textual entailment challenge,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Semeval-2013 task 7: The joint student response analysis and 8th recognizing textual entailment challenge,

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.759778Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T22:25:37.362594Z digest=sha256:1f2fb11a930475fc2fb9d80486e8877fb565d58103a27f626fd40758ef86552f

Observation bf3115d5-c7e7-4a57-bbf6-9bd2d745b62a · outbound

This paper cites Automated long answer grading with ricechem dataset,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Automated long answer grading with ricechem dataset,

Reference 17

Resolution
verified exact
doi, observed 2026-08-15T22:25:37.729426Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T22:25:37.367944Z digest=sha256:28311885e5686bbf7f0c1d0431b8515a683b3434772c00466802122be653cc72

Observation 0e1ba55a-c0ad-4ab8-b42f-bfd1716b1701 · outbound

This paper cites A new benchmark for automatic essay scoring in Portuguese,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models A new benchmark for automatic essay scoring in Portuguese,

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.743082Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T22:25:37.372891Z digest=sha256:910f21491577ee7650f3b89ee302f2cd7eb232de6a47b00ad96e17108e6df44b

Observation cbc2963d-3deb-4e7b-8d79-9807ff684553 · outbound

This paper cites The hewlett foundation: Short answer scoring,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models The hewlett foundation: Short answer scoring,

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.725844Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T22:25:37.377921Z digest=sha256:298296033940bcee35179276ba4fd237560672c291ec36c35b5fc659c2d16537

Observation acbf8cb8-182e-4175-8775-11c8fd53b5a6 · outbound

This paper cites Automated short answer grading: A simple solution for a difficult task,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Automated short answer grading: A simple solution for a difficult task,

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.843962Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T22:25:37.383844Z digest=sha256:6aac9a10d2d440a4facc6288b3a8f832afefc994f9e94ea3ae7ab12548b8d13f

Observation 6afe4656-bf16-43bf-99da-d58bd0d25ca4 · outbound

This paper cites Text-to-text semantic similarity for automatic short answer grading,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Text-to-text semantic similarity for automatic short answer grading,

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.709426Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T22:25:37.389358Z digest=sha256:4f376c4e4bbe547d1b6b7ece2f2e2b357e2234035de4f0bb30d55c21b173e112

Observation bad24b5e-2541-4b04-a955-c8261d244d3e · outbound

This paper cites M-sim: Multi-level semantic inference model for chinese short answer scoring in low-resource scenarios,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models M-sim: Multi-level semantic inference model for chinese short answer scoring in low-resource scenarios,

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.394258Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.394258Z digest=sha256:d04662a23117305bb877b92a075fe03b599901bc15efcc982e8ce5e1f3b50f5c

Observation 9a5fcc17-45e1-4d69-a623-daaa37582af8 · outbound

This paper cites L-eval: Instituting standardized evaluation for long context language models,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models L-eval: Instituting standardized evaluation for long context language models,

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.398920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.398920Z digest=sha256:dc390e8a1d501716cfd6131f73267be8a3aac513c282e36efaa441b3cc7ef862

Observation 2349f097-da85-4721-9716-150d5a970d50 · outbound

This paper cites Is ChatGPT a Good NLG Evaluator? A Preliminary Study.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Is ChatGPT a Good NLG Evaluator? A Preliminary Study

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.403992Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.403992Z digest=sha256:0a4d1b99721d19f70bdae48e6b0591f3c72d933318b844c7ad70cd50071ec844

Observation 07c991bb-86cc-4b08-be06-421a1ecda4dd · outbound

This paper cites Large language models can accurately predict searcher preferences,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Large language models can accurately predict searcher preferences,

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.409653Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.409653Z digest=sha256:ddc199643fcd1c3298e8036046a9eeec7e2178eaf6ced2357e9fd141c0f1057b

Observation 96646ba5-160a-4a0e-b933-c3bb4f3c1727 · outbound

This paper cites Perspectives on large language models for relevance judgment,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Perspectives on large language models for relevance judgment,

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.414616Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.414616Z digest=sha256:565b1a5641ef368de78847fc99e9f79f8c454fbf0b7a3cec2cd18d8f12b694fa

Observation dae34f46-775f-4dab-a7ee-37d877c99256 · outbound

This paper cites Enhancing transfer learning of llms through fine- tuning on task - related corpora for automated short-answer grading,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Enhancing transfer learning of llms through fine- tuning on task - related corpora for automated short-answer grading,

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.419985Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.419985Z digest=sha256:12f7c458814cbe977fed551cb5428523eb1234d6de79d118f5413994b0d52817

Observation d73afecf-e8c8-4978-b5e1-c7acc727f5b6 · outbound

This paper cites Judging llm-as-a-judge with mt-bench and chatbot arena,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Judging llm-as-a-judge with mt-bench and chatbot arena,

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.692860Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T22:25:37.425721Z digest=sha256:0aafcdccd0cffb05e2572615dd8a96d5f6a1042fdef03a53123c973b579631b3

Observation 6582a659-2704-4c6c-b725-52ab8b99af63 · outbound

This paper cites JudgeLM: Fine-tuned Large Language Models are Scalable Judges.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models JudgeLM: Fine-tuned Large Language Models are Scalable Judges

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.430750Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.430750Z digest=sha256:bb514d789fe7a1df87eef4bda06bf0fcc9c509590e7a68e00dd97700cf31857a

Observation d502c796-fd84-42f1-8049-02881aedbc6c · outbound

This paper cites Calibrating llm-based evaluator,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Calibrating llm-based evaluator,

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.677109Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T22:25:37.436046Z digest=sha256:29d6ae6a176d3a0ad0d6588cae9e50bb50fcd02746be11ddcc630babc2450103

Observation 5085b9eb-2aab-4a30-b7ae-9e5a56eea2ac · outbound

This paper cites Exploring LLM prompting strategies for joint essay scoring and feedback generation,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Exploring LLM prompting strategies for joint essay scoring and feedback generation,

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.657994Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T22:25:37.441453Z digest=sha256:215d6cf54d3a5e467171aed510ef26f2ff5d4e5be1d91d6881eff8f255aba6fc

Observation a11fa56b-b699-4441-93d1-0dd229a46bfd · outbound

This paper cites Knowledge distillation of llms for automatic scoring of science assessments,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Knowledge distillation of llms for automatic scoring of science assessments,

Reference 32

Resolution
verified exact
doi, observed 2026-08-15T22:25:38.639092Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T22:25:37.446603Z digest=sha256:2950f1ab43838ed22e6aab605b8972d0ab85dd08ae85d2908dbcf2590dd2b31d

Observation 78ac1071-4924-43a4-9fff-f65ff5ffe322 · outbound

This paper cites Efficient LLM comparative assessment: A product of experts framework for pairwise comparisons,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Efficient LLM comparative assessment: A product of experts framework for pairwise comparisons,

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.621608Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T22:25:37.451542Z digest=sha256:7c0b39142e0bd43b480a10a61521fb4c4ce8c2aa321053cf3c83147adc6a3ac0

Observation c269c917-9381-49f4-8d96-57aa088222ea · outbound

This paper cites Evaluating the Performance of Large Language Models on GAOKAO Benchmark.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Evaluating the Performance of Large Language Models on GAOKAO Benchmark

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.456671Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.456671Z digest=sha256:4a8392a704d7f5ce4be216f0f852a3fa5e77df670fa97f7fd43c12ccc291a4a6

Observation 54ae2945-2617-47e4-a733-106cf548c468 · outbound

This paper cites Asag2024: A combined benchmark for short answer grading,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Asag2024: A combined benchmark for short answer grading,

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.602647Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T22:25:37.461937Z digest=sha256:9db6cd5e228fc4db67a8013bbe9a5df13a187b7480e2bdf3b9317826cac6f320

Observation 52d578ba-2876-4185-a84b-e85747418324 · outbound

This paper cites Learning to grade short answer questions using semantic similarity measures and dependency graph alignments,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Learning to grade short answer questions using semantic similarity measures and dependency graph alignments,

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.585881Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T22:25:37.467209Z digest=sha256:8f67327739685e213ccdace4b882098df5bcf0226863b249eeb542dbbb33ed0c

Observation 925e2821-4893-4ad6-a445-fead623247ff · outbound

This paper cites Short Answer Grading Using One-shot Prompting and Text Similarity Scoring Model.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Short Answer Grading Using One-shot Prompting and Text Similarity Scoring Model

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.472178Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.472178Z digest=sha256:3a54c350fcb7e4e985761889eb451b0c37a38baa3661de39298a6b9dd0f4c5f3

Observation acd4b2d9-23c4-411b-b0d9-922849d098f3 · outbound

This paper cites Improving the performance of automatic short answer grading using transfer learning and augmentation,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Improving the performance of automatic short answer grading using transfer learning and augmentation,

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.568533Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T22:25:37.477724Z digest=sha256:8efb5b017cd77feaf44bcda35dba786402c471fa6c734e15fb1b55a2bbccf445

Observation 8d7f6a0e-8165-41d1-8b43-f30162a0c3ec · outbound

This paper cites Rankcse: Unsupervised sentence representations learning via learning to rank,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Rankcse: Unsupervised sentence representations learning via learning to rank,

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.488466Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.488466Z digest=sha256:a819f5ca2f97f34b7c1d4f6f7e10d8a7b023c2ee120f82346d4661405a2e9030

Observation 686aa5dd-108c-432b-a090-a893239baf40 · outbound

This paper cites Diffcse: Difference-based contrastive learning for sentence embeddings,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Diffcse: Difference-based contrastive learning for sentence embeddings,

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.494149Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.494149Z digest=sha256:4e70751d0e3afaa9bf40bf6c57228c5dc5c6b7026476f38abecc1a836cc1fde6

Observation a7b0f1aa-06c5-4b17-a5de-eac4c2bdf49f · outbound

This paper cites The Llama 3 Herd of Models.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models The Llama 3 Herd of Models

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.500317Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.500317Z digest=sha256:140b5dcd270ebb82c3ea435326e2481325a54cab1e4962d301527e77442617c4

Observation ae56ddeb-cae5-4be3-b1f8-96a9f14e3088 · outbound

This paper cites Qwen2 Technical Report.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Qwen2 Technical Report

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.506787Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.506787Z digest=sha256:3b22b2b17688a0e060040fb8c0a1279546cb5ab2c35f82042c59fcf004ba4e37

Observation 58b4a6ac-9710-4122-b4ce-d3c865d5e18d · outbound

This paper cites Qwen2.5 Technical Report.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Qwen2.5 Technical Report

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.512994Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.512994Z digest=sha256:096f598c2bf6a456d2a87a26d7f62bc446165b22e2271525efc82fe1dbb5f68f

Observation 84584afa-9c5a-4e59-b8ff-b16473278719 · outbound

This paper cites Chatglm: A family of large language models from glm-130b to glm-4 all tools,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Chatglm: A family of large language models from glm-130b to glm-4 all tools,

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.518394Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.518394Z digest=sha256:cac1da4864b8747dfcb55fafb8a95812faeb3c217a400ded901e7204e8edfc7a

Observation 71a9af5a-d4c3-4296-bc87-56f3fc752410 · outbound

This paper cites Mixtral of Experts.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Mixtral of Experts

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.523662Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.523662Z digest=sha256:1b825cd0b288451729bb3220f20aa0042556676215e0af547c9085f2dbca6d24

Observation a7453a82-4f67-4c99-8a73-591823a94ac1 · outbound

This paper cites DeepSeek-Prover-V2: Advancing Formal Mathematical Reasoning via Reinforcement Learning for Subgoal Decomposition.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models DeepSeek-Prover-V2: Advancing Formal Mathematical Reasoning via Reinforcement Learning for Subgoal Decomposition

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.529198Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.529198Z digest=sha256:10d15189b379b250fee474fb212fcdc0e7eb04cf3958de45d5c6d70449292f29

Observation d58c5dac-f04f-45c5-b45d-bbe6b83dd563 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.534647Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.534647Z digest=sha256:0b343b53065664abe127fbebedcc44b74eed298bc23b29247385e2e318742a5a

Observation 5b056d15-8807-4cf6-8812-62df98e22eea · outbound

This paper cites Qwq-32b: Embracing the power of reinforcement learning,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Qwq-32b: Embracing the power of reinforcement learning,

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.539755Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.539755Z digest=sha256:da8126e69489451e04b9e94c029935094f3ad53b67558cf73446191a09328d50

Observation 5f567276-c64d-448b-8881-337321c075f2 · outbound

This paper cites [Online].

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models [Online]

Reference 49

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.518609Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T22:25:37.544686Z digest=sha256:16ca34ef29dea34dd9dc6f7f20ff26b16e3cea235ce93517638992d581e9cd68

Observation 01067c15-d59f-4f01-a3af-d0f553581b28 · outbound

This paper cites Team, “Superdistillation achieves near-r1 performance with just 5.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Team, “Superdistillation achieves near-r1 performance with just 5

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.501567Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T22:25:37.549465Z digest=sha256:37c32e6b74b4bfdc57d10f0383e84ffb2e29e6a545cd656a9faa51d5ac5612d6

Observation 5dd7b017-bf1f-4171-b263-f0f7211e982a · outbound

This paper cites Mimo: Unlocking the reasoning potential of language model – from pretraining to posttraining,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Mimo: Unlocking the reasoning potential of language model – from pretraining to posttraining,

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.474371Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T22:25:37.554685Z digest=sha256:ef157171336ea6aaa752e451a3059da7be2e85be7d54baa8d51cf9d7be52dfae

Observation 14436c82-d65d-4ab5-bc33-000dfcc84204 · outbound

This paper cites Metamath: Bootstrap your own mathematical questions for large language models,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Metamath: Bootstrap your own mathematical questions for large language models,

Reference 52

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.448544Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T22:25:37.559542Z digest=sha256:6f0bec848fb81021bad6265becce5c502e696a52d7c293a4ffee2a915aa4037d

Observation 16cc9b54-bef9-49e7-81fb-d12e7e169f9e · outbound

This paper cites - Independently evaluate each step: * Determine correctness ('label').

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models - Independently evaluate each step: * Determine correctness ('label')

Reference 54

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.430755Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T22:25:37.565249Z digest=sha256:e2b82a51794f1d2a5897ff4ba831c83d6a08ad9609404b4d89872df25b13cdbd

Observation 5d1ca454-5bb4-4f89-a8d1-d7e9a87204ba · outbound

This paper cites - Provide an overall evaluation ('label’).

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models - Provide an overall evaluation ('label’)

Reference 55

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.412132Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T22:25:37.570304Z digest=sha256:280a5042e0baf001f6a5a7aebbf6beee2bf38cf9f1f184867844c1e18a954e1f

Observation 445126fd-d2be-47a6-82fd-0627bea49cd0 · outbound

This paper cites id": "Math_ShortAns_3.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models id": "Math_ShortAns_3

Reference 56

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.394516Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T22:25:37.576015Z digest=sha256:377c09c4064f6bd570c1663ebf9987cbb862bcfeb6a322ad6c3e665977c405fa

Observation 1580b7cf-c95d-4dc3-9c56-74a12d5a4853 · outbound

This paper cites Available: https://doi.org/10.1016/j.engappai.2023.106292.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Available: https://doi.org/10.1016/j.engappai.2023.106292

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.483240Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.483240Z digest=sha256:758085c1df122cae713c857c80be774246bc7f4efeb1c2f3b08bf6d6076994d6

Pith citing papers

Observation abf010d1-098e-4099-99b2-b8a950e31a72 · inbound

EDIT: Evidence-Diagnosed Intervention Training for Rule-Faithful LLM Grading cites this paper.

EDIT: Evidence-Diagnosed Intervention Training for Rule-Faithful LLM Grading SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models

Reference 28

Resolution
verified exact
arxiv_id, observed 2026-07-02T13:06:59.575912Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-06-28T01:31:59.207857Z digest=sha256:4b51c4c761cdd4205fba2011ea3e66953d6f6a1e755347d5145b2ae4014e2e92