Pith. sign in

Paper Citation Record · LEDGER

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models

As of 19 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 1 inbound Pith citation observation for arXiv:2505.07247.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.07247 v2

Coverage vector

measured 55 of 55 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-15T22:25:37.576015Z

measured 56 of 56 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-19T06:32:44.657259+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-06-28T01:31:59.207857Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-02T13:06:59.574503Z

Reference resolution

55 of 55 outbound references displayed

  • verified exact2
  • verified fuzzy26
  • unresolved27
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 67fbe111-a202-46c8-b410-e574b45b5b86 · outbound

This paper cites Automated essay scoring using discourse external knowledge,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Automated essay scoring using discourse external knowledge,

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.912982Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-15T22:25:37.274255Z digest=sha256:e019c60d63a23fb452fc71a61226610e1fd56b254433c0d9eb5bcb96815c2128

Observation a261be39-31ca-4da5-83e0-f1df5bb8d924 · outbound

This paper cites Improve LLM-based Automatic Essay Scoring with Linguistic Features.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Improve LLM-based Automatic Essay Scoring with Linguistic Features

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.280015Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.280015Z digest=sha256:78f254e9fb728f8bfec755b4d9420ddde8c1093341cd41f1e4fcdc72869700d9

Observation 252dac85-dd2e-406a-9f94-fff6f6a7e2ae · outbound

This paper cites An automated essay scoring systems: a systematic literature review,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models An automated essay scoring systems: a systematic literature review,

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.285968Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.285968Z digest=sha256:40dfa9ada4e45acdac46cd0be6902c24d7d1cb64fd6874b3936c633bbc4cbb02

Observation e2ed5a10-882d-4a1f-9aba-33ab95e0a017 · outbound

This paper cites Prompt Agnostic Essay Scorer: A Domain Generalization Approach to Cross-prompt Automated Essay Scoring.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Prompt Agnostic Essay Scorer: A Domain Generalization Approach to Cross-prompt Automated Essay Scoring

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.292005Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.292005Z digest=sha256:f31aee840dc4b6442ddd025cdfe1289c8ab81e22294d581efdc78631b90e8097

Observation d9c6e080-0e50-47f4-bb20-8d2efc0137c3 · outbound

This paper cites Automated cross-prompt scoring of essay traits,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Automated cross-prompt scoring of essay traits,

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.894874Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-15T22:25:37.298617Z digest=sha256:40c88cab218ea385e0a8e644117e390b93f268688aba3c49d063f2184c6a9141

Observation 912ca936-70d2-4507-9245-d4e4244cc659 · outbound

This paper cites A short answer grading system in chinese by cnn,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models A short answer grading system in chinese by cnn,

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.878163Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-15T22:25:37.303916Z digest=sha256:fb3158ddc504fd25045df621b0c105ade4cadf97909983768a7505f060ee4bdb

Observation 829ae285-d36a-4c41-8a0c-60318537ab5e · outbound

This paper cites A short answer grading system in chinese by support vector approach,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models A short answer grading system in chinese by support vector approach,

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.860512Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-15T22:25:37.310513Z digest=sha256:96b75c4f15fa7b109bd3162dc14dca2a9c4647354838817ad99f2827b8d0971c

Observation 386e1beb-863f-44e7-a6c0-d34bcc21ea38 · outbound

This paper cites GPT-4 Technical Report.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models GPT-4 Technical Report

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.320977Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.320977Z digest=sha256:869bf590152c34ed8920c6b3a82cf1bf91973759047b3e3776cd10582fd114bd

Observation 55358dc4-2826-4d13-98f9-4e1707ff31c0 · outbound

This paper cites DeepSeek-V3 Technical Report.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models DeepSeek-V3 Technical Report

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.327052Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.327052Z digest=sha256:bc835de281ca46aa9a5c3f3e0eba3822ab2029f0084f272791b5683c648ea2ed

Observation b4c81324-9f60-445b-aaa2-7dcd8871c39c · outbound

This paper cites Is llm-as-a-judge robust? investigating universal adversarial attacks on zero-shot LLM assessment,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Is llm-as-a-judge robust? investigating universal adversarial attacks on zero-shot LLM assessment,

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.826092Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-15T22:25:37.333237Z digest=sha256:4d06d4252ee344c1d0ff7e3db080dcffb4271f6c74d33b8c067f463ffa613ee1

Observation 5c11d8d6-24ed-4e6f-9441-1b18a3f151d8 · outbound

This paper cites Beyond yes and no: Improving zero-shot LLM rankers via scoring fine-grained relevance labels,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Beyond yes and no: Improving zero-shot LLM rankers via scoring fine-grained relevance labels,

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.339086Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.339086Z digest=sha256:2c9fe2e9312fb38480e47ffaffa79354a25a3d4bb104732a2a1e92ebbdb74db4

Observation 99d57d2b-b45f-4f1e-849e-bbd86b60f8e9 · outbound

This paper cites GLIDER: Grading LLM Interactions and Decisions using Explainable Ranking.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models GLIDER: Grading LLM Interactions and Decisions using Explainable Ranking

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.344350Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.344350Z digest=sha256:cfc8f6a0d9f79c3a2a4c0d7296f551c79590c7229e1afeda7792050a113422fe

Observation 511f91b4-d53e-4cea-a979-f4fc8b288f8c · outbound

This paper cites The hewlett foundation: Automated essay scoring,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models The hewlett foundation: Automated essay scoring,

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.794015Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-15T22:25:37.349667Z digest=sha256:78fba497d38cc0b05f77f75cd7e230b42e30cd647f91376ca9ceefabe4f06858

Observation a965f117-da47-41b9-acdc-5bd224f349e7 · outbound

This paper cites Scaa: A dataset for automated short answer grading of children’s free-text answers in hindi and marathi,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Scaa: A dataset for automated short answer grading of children’s free-text answers in hindi and marathi,

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.776588Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-15T22:25:37.354817Z digest=sha256:b4932ba1e06693002268ba094ecfe4cd2f28f9b5b635d94a67d310d8eb0dd902

Observation 088ada9b-177a-4113-96e2-2227693bf7dc · outbound

This paper cites Semeval-2013 task 7: The joint student response analysis and 8th recognizing textual entailment challenge,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Semeval-2013 task 7: The joint student response analysis and 8th recognizing textual entailment challenge,

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.759778Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-15T22:25:37.362594Z digest=sha256:36697c03280352a65cc5e934da837718d9fcd46c65ec1517959260426daf81e3

Observation bf3115d5-c7e7-4a57-bbf6-9bd2d745b62a · outbound

This paper cites Automated long answer grading with ricechem dataset,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Automated long answer grading with ricechem dataset,

Reference 17

Resolution
verified exact
doi, observed 2026-08-15T22:25:37.729426Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-15T22:25:37.367944Z digest=sha256:239d3108b29a551f72200d6827f3c77febda30a367f46d734c6ed968102a37ad

Observation 0e1ba55a-c0ad-4ab8-b42f-bfd1716b1701 · outbound

This paper cites A new benchmark for automatic essay scoring in Portuguese,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models A new benchmark for automatic essay scoring in Portuguese,

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.743082Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-15T22:25:37.372891Z digest=sha256:05bf1e9a3d75d3fe0ea19929162f0c1a5f6edc1969f9b47a1f12c7abc98e78be

Observation cbc2963d-3deb-4e7b-8d79-9807ff684553 · outbound

This paper cites The hewlett foundation: Short answer scoring,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models The hewlett foundation: Short answer scoring,

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.725844Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-15T22:25:37.377921Z digest=sha256:bd1943d43230834a058e0a38362f87bf02bdeeb49f408dbf94a4e0451cbd7e36

Observation acbf8cb8-182e-4175-8775-11c8fd53b5a6 · outbound

This paper cites Automated short answer grading: A simple solution for a difficult task,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Automated short answer grading: A simple solution for a difficult task,

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.843962Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-15T22:25:37.383844Z digest=sha256:e9b8d3d97300a621349030d2a3e2c1802ba23fd4d2662f5e269c0a39292c9c02

Observation 6afe4656-bf16-43bf-99da-d58bd0d25ca4 · outbound

This paper cites Text-to-text semantic similarity for automatic short answer grading,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Text-to-text semantic similarity for automatic short answer grading,

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.709426Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-15T22:25:37.389358Z digest=sha256:9a2abf4df5dfd04f409d36fb99209f592a87bc08d798c45150e3d9aa46e9465a

Observation bad24b5e-2541-4b04-a955-c8261d244d3e · outbound

This paper cites M-sim: Multi-level semantic inference model for chinese short answer scoring in low-resource scenarios,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models M-sim: Multi-level semantic inference model for chinese short answer scoring in low-resource scenarios,

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.394258Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.394258Z digest=sha256:70b86c1f7151cfa47c3e8d72519d5bce30a6723c1f5de7b1d82abf78b68a8c0e

Observation 9a5fcc17-45e1-4d69-a623-daaa37582af8 · outbound

This paper cites L-eval: Instituting standardized evaluation for long context language models,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models L-eval: Instituting standardized evaluation for long context language models,

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.398920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.398920Z digest=sha256:13ebed4f60521f88bd1c8d00dbf0cefa76a6841ce6030207c91fc60e65c918a5

Observation 2349f097-da85-4721-9716-150d5a970d50 · outbound

This paper cites Is ChatGPT a Good NLG Evaluator? A Preliminary Study.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Is ChatGPT a Good NLG Evaluator? A Preliminary Study

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.403992Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.403992Z digest=sha256:e764be8744ec4ea42318f0e0136860b6cf87166d3dd869472cd8a0fa6961adbd

Observation 07c991bb-86cc-4b08-be06-421a1ecda4dd · outbound

This paper cites Large language models can accurately predict searcher preferences,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Large language models can accurately predict searcher preferences,

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.409653Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.409653Z digest=sha256:830408cc45d170877a4f3e70e975ca80b168e5bdff4418e582685072e9d28c24

Observation 96646ba5-160a-4a0e-b933-c3bb4f3c1727 · outbound

This paper cites Perspectives on large language models for relevance judgment,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Perspectives on large language models for relevance judgment,

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.414616Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.414616Z digest=sha256:3b15c1da82605d4247b50f8ede63cf99e850531c4b00c367e157809351e6985f

Observation dae34f46-775f-4dab-a7ee-37d877c99256 · outbound

This paper cites Enhancing transfer learning of llms through fine- tuning on task - related corpora for automated short-answer grading,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Enhancing transfer learning of llms through fine- tuning on task - related corpora for automated short-answer grading,

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.419985Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.419985Z digest=sha256:7df01232a875914d69c61c465047eaade56e56b595f4c688d7c27465502db394

Observation d73afecf-e8c8-4978-b5e1-c7acc727f5b6 · outbound

This paper cites Judging llm-as-a-judge with mt-bench and chatbot arena,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Judging llm-as-a-judge with mt-bench and chatbot arena,

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.692860Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-15T22:25:37.425721Z digest=sha256:7d680469caf2b21a9c73d64185d63ba0831a72bd45806716587d062d31c2bcb4

Observation 6582a659-2704-4c6c-b725-52ab8b99af63 · outbound

This paper cites JudgeLM: Fine-tuned Large Language Models are Scalable Judges.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models JudgeLM: Fine-tuned Large Language Models are Scalable Judges

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.430750Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.430750Z digest=sha256:f755c08b1352f03ee1b50795232dee829b3051c291932cf0ab3d0977bfd415f7

Observation d502c796-fd84-42f1-8049-02881aedbc6c · outbound

This paper cites Calibrating llm-based evaluator,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Calibrating llm-based evaluator,

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.677109Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-15T22:25:37.436046Z digest=sha256:d7dd7740cf950f0ecb353f32485ec91c5c55c24e1db27e89dd7f91896f926649

Observation 5085b9eb-2aab-4a30-b7ae-9e5a56eea2ac · outbound

This paper cites Exploring LLM prompting strategies for joint essay scoring and feedback generation,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Exploring LLM prompting strategies for joint essay scoring and feedback generation,

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.657994Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-15T22:25:37.441453Z digest=sha256:f5ef7ea81db09ba1f440fc26ccc8f90abb8abc58a19d902bee4222be3fab7db5

Observation a11fa56b-b699-4441-93d1-0dd229a46bfd · outbound

This paper cites Knowledge distillation of llms for automatic scoring of science assessments,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Knowledge distillation of llms for automatic scoring of science assessments,

Reference 32

Resolution
verified exact
doi, observed 2026-08-15T22:25:38.639092Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-15T22:25:37.446603Z digest=sha256:b2d030518b19ea92889a5717751eca0639626a0e860678f2d4c9a0a7348b3b30

Observation 78ac1071-4924-43a4-9fff-f65ff5ffe322 · outbound

This paper cites Efficient LLM comparative assessment: A product of experts framework for pairwise comparisons,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Efficient LLM comparative assessment: A product of experts framework for pairwise comparisons,

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.621608Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-15T22:25:37.451542Z digest=sha256:dcdf954ccdf8440633cfdc80e1eaf30e3de2b4d3fd43bc9fda915634edb06f18

Observation c269c917-9381-49f4-8d96-57aa088222ea · outbound

This paper cites Evaluating the Performance of Large Language Models on GAOKAO Benchmark.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Evaluating the Performance of Large Language Models on GAOKAO Benchmark

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.456671Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.456671Z digest=sha256:96f8346bc91c93045fa2c48805e3c8f65c7df40c1c59c47e396679d346567c99

Observation 54ae2945-2617-47e4-a733-106cf548c468 · outbound

This paper cites Asag2024: A combined benchmark for short answer grading,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Asag2024: A combined benchmark for short answer grading,

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.602647Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-15T22:25:37.461937Z digest=sha256:32e703269cabc6a2015138712288597ce4889ebf17f68fdb0c680e476d6d863a

Observation 52d578ba-2876-4185-a84b-e85747418324 · outbound

This paper cites Learning to grade short answer questions using semantic similarity measures and dependency graph alignments,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Learning to grade short answer questions using semantic similarity measures and dependency graph alignments,

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.585881Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-15T22:25:37.467209Z digest=sha256:f61a733b49c3316e96cce024f51e5a036e4fda9c2e13f11afc222deb952d4aa4

Observation 925e2821-4893-4ad6-a445-fead623247ff · outbound

This paper cites Short Answer Grading Using One-shot Prompting and Text Similarity Scoring Model.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Short Answer Grading Using One-shot Prompting and Text Similarity Scoring Model

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.472178Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.472178Z digest=sha256:fe403430d60be2dcb03f9dff53d90ec91d3c6a24ad4b972032640ff7d678fdad

Observation acd4b2d9-23c4-411b-b0d9-922849d098f3 · outbound

This paper cites Improving the performance of automatic short answer grading using transfer learning and augmentation,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Improving the performance of automatic short answer grading using transfer learning and augmentation,

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.568533Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-15T22:25:37.477724Z digest=sha256:7f8edc1e6f38375d9ddaceed61fd51c6efd7bb4d9614c2b49a02ccc391249d7a

Observation 8d7f6a0e-8165-41d1-8b43-f30162a0c3ec · outbound

This paper cites Rankcse: Unsupervised sentence representations learning via learning to rank,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Rankcse: Unsupervised sentence representations learning via learning to rank,

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.488466Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.488466Z digest=sha256:a7a5ca2e7d4cef0f1cdaece1fd8f7fa7ae9a2d037bb36cc13970c353dd63bde9

Observation 686aa5dd-108c-432b-a090-a893239baf40 · outbound

This paper cites Diffcse: Difference-based contrastive learning for sentence embeddings,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Diffcse: Difference-based contrastive learning for sentence embeddings,

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.494149Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.494149Z digest=sha256:6ad0a96d840943d2d93519486d9314b58e7760f92e6e4d5798ea26649c759235

Observation a7b0f1aa-06c5-4b17-a5de-eac4c2bdf49f · outbound

This paper cites The Llama 3 Herd of Models.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models The Llama 3 Herd of Models

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.500317Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.500317Z digest=sha256:511169d7afdc826a0bb86adb1b9319718e6825a835e32034d604e86a3176bbab

Observation ae56ddeb-cae5-4be3-b1f8-96a9f14e3088 · outbound

This paper cites Qwen2 Technical Report.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Qwen2 Technical Report

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.506787Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.506787Z digest=sha256:c3475eaf0d469725aee9ea6ae849ac93237bcacfdbad0079c8a949afd16e9a33

Observation 58b4a6ac-9710-4122-b4ce-d3c865d5e18d · outbound

This paper cites Qwen2.5 Technical Report.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Qwen2.5 Technical Report

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.512994Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.512994Z digest=sha256:f5b9cc2a50ad99cdcf5cbfe1610a2f14e460019e2a0e2edabeb6d6de7b8d51ca

Observation 84584afa-9c5a-4e59-b8ff-b16473278719 · outbound

This paper cites Chatglm: A family of large language models from glm-130b to glm-4 all tools,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Chatglm: A family of large language models from glm-130b to glm-4 all tools,

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.518394Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.518394Z digest=sha256:0026ec5cafac3e9204ab6a1bfe8fd1d3c6568d4af47c8b4240e9f686a976b25c

Observation 71a9af5a-d4c3-4296-bc87-56f3fc752410 · outbound

This paper cites Mixtral of Experts.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Mixtral of Experts

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.523662Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.523662Z digest=sha256:8ecd1e65d02803c980163c83ff047e68fe4efd4ef71accd9fa69fa5cec9bf237

Observation a7453a82-4f67-4c99-8a73-591823a94ac1 · outbound

This paper cites DeepSeek-Prover-V2: Advancing Formal Mathematical Reasoning via Reinforcement Learning for Subgoal Decomposition.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models DeepSeek-Prover-V2: Advancing Formal Mathematical Reasoning via Reinforcement Learning for Subgoal Decomposition

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.529198Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.529198Z digest=sha256:7aaa432310c1be08cc72f0c2a877386a213ef3479537b7e9754a973a9d6805b1

Observation d58c5dac-f04f-45c5-b45d-bbe6b83dd563 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.534647Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.534647Z digest=sha256:bb5872bab5e18b69d7ac3b4a7844f01a4614a8f7e12b1c71767adc0488c15df8

Observation 5b056d15-8807-4cf6-8812-62df98e22eea · outbound

This paper cites Qwq-32b: Embracing the power of reinforcement learning,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Qwq-32b: Embracing the power of reinforcement learning,

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.539755Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.539755Z digest=sha256:fb716f1063771294decb33bb539f6134b76651f3b65b8ec611e2e725f9d006a4

Observation 5f567276-c64d-448b-8881-337321c075f2 · outbound

This paper cites [Online].

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models [Online]

Reference 49

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.518609Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-15T22:25:37.544686Z digest=sha256:ddb0526f617a62095214d70accbe180d5ea5f40aa466db0001e8308f0d0a32ed

Observation 01067c15-d59f-4f01-a3af-d0f553581b28 · outbound

This paper cites Team, “Superdistillation achieves near-r1 performance with just 5.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Team, “Superdistillation achieves near-r1 performance with just 5

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.501567Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-15T22:25:37.549465Z digest=sha256:abc75eb151d6381cd7521468d06c97c689d9c7ada466b7c2a56e540dbd55946e

Observation 5dd7b017-bf1f-4171-b263-f0f7211e982a · outbound

This paper cites Mimo: Unlocking the reasoning potential of language model – from pretraining to posttraining,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Mimo: Unlocking the reasoning potential of language model – from pretraining to posttraining,

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.474371Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-15T22:25:37.554685Z digest=sha256:0a76a7c366446afeed1662abbdab93718a746d9a7fd836d35982296521b46f18

Observation 14436c82-d65d-4ab5-bc33-000dfcc84204 · outbound

This paper cites Metamath: Bootstrap your own mathematical questions for large language models,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Metamath: Bootstrap your own mathematical questions for large language models,

Reference 52

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.448544Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-15T22:25:37.559542Z digest=sha256:0057a1ed9879a1b170244628df7fde29264c11d50b369e823742d9a158e4a252

Observation 16cc9b54-bef9-49e7-81fb-d12e7e169f9e · outbound

This paper cites - Independently evaluate each step: * Determine correctness ('label').

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models - Independently evaluate each step: * Determine correctness ('label')

Reference 54

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.430755Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-15T22:25:37.565249Z digest=sha256:7a46fa6f172d691cf1663b7f091d763e7192f6f398fe01824d174b201f6cab7e

Observation 5d1ca454-5bb4-4f89-a8d1-d7e9a87204ba · outbound

This paper cites - Provide an overall evaluation ('label’).

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models - Provide an overall evaluation ('label’)

Reference 55

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.412132Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-15T22:25:37.570304Z digest=sha256:597d2850dfb9efa90e814fe9f8c1a114b095011c2aa93af3cd19e9f67f7df508

Observation 445126fd-d2be-47a6-82fd-0627bea49cd0 · outbound

This paper cites id": "Math_ShortAns_3.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models id": "Math_ShortAns_3

Reference 56

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.394516Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-15T22:25:37.576015Z digest=sha256:aca56f38909b0b8403aa65d7a77043eeb672124ef5de1bf099fbd94b0e6598d1

Observation 1580b7cf-c95d-4dc3-9c56-74a12d5a4853 · outbound

This paper cites Available: https://doi.org/10.1016/j.engappai.2023.106292.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Available: https://doi.org/10.1016/j.engappai.2023.106292

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.483240Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.483240Z digest=sha256:237132cb3cdfd095ea4f5645e96ba7e23322f80a0398ca9de0e4085e6b9d8778

Pith citing papers

Observation abf010d1-098e-4099-99b2-b8a950e31a72 · inbound

EDIT: Evidence-Diagnosed Intervention Training for Rule-Faithful LLM Grading cites this paper.

EDIT: Evidence-Diagnosed Intervention Training for Rule-Faithful LLM Grading SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models

Reference 28

Resolution
verified exact
arxiv_id, observed 2026-07-02T13:06:59.575912Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-06-28T01:31:59.207857Z digest=sha256:ec7f2e71f35b89164c1c3070595191afeafcefe264dfa7e9e151029ae961ac41