Pith. sign in

Paper Citation Record · LEDGER

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models

As of 18 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 1 inbound Pith citation observation for arXiv:2505.07247.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.07247 v2

Coverage vector

measured 55 of 55 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-15T22:25:37.576015Z

measured 56 of 56 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-18T06:34:40.430872+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-06-28T01:31:59.207857Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-02T13:06:59.574503Z

Reference resolution

55 of 55 outbound references displayed

  • verified exact2
  • verified fuzzy26
  • unresolved27
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 67fbe111-a202-46c8-b410-e574b45b5b86 · outbound

This paper cites Automated essay scoring using discourse external knowledge,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Automated essay scoring using discourse external knowledge,

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.912982Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T22:25:37.274255Z digest=sha256:77d2f541425bdee27c33309f91579e1255e31c10c0266b837eaabfc96c652c7f

Observation a261be39-31ca-4da5-83e0-f1df5bb8d924 · outbound

This paper cites Improve LLM-based Automatic Essay Scoring with Linguistic Features.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Improve LLM-based Automatic Essay Scoring with Linguistic Features

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.280015Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.280015Z digest=sha256:26f26c107a39804f23451e8852f8450294d3b5c97781d2b0de32905171743c63

Observation 252dac85-dd2e-406a-9f94-fff6f6a7e2ae · outbound

This paper cites An automated essay scoring systems: a systematic literature review,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models An automated essay scoring systems: a systematic literature review,

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.285968Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.285968Z digest=sha256:b1f3d616e25dce54c82d2b8b449b9ee0f788e1bc7521b1cc9b9252997f863584

Observation e2ed5a10-882d-4a1f-9aba-33ab95e0a017 · outbound

This paper cites Prompt Agnostic Essay Scorer: A Domain Generalization Approach to Cross-prompt Automated Essay Scoring.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Prompt Agnostic Essay Scorer: A Domain Generalization Approach to Cross-prompt Automated Essay Scoring

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.292005Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.292005Z digest=sha256:5badb72f492a826b2895a89ad3f36d4376bb80f861873d81907f237979ca03bc

Observation d9c6e080-0e50-47f4-bb20-8d2efc0137c3 · outbound

This paper cites Automated cross-prompt scoring of essay traits,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Automated cross-prompt scoring of essay traits,

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.894874Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T22:25:37.298617Z digest=sha256:11bdd5ff9046ff3ddbbce8962789d99a76f52991352e879c2e810eee73f786f3

Observation 912ca936-70d2-4507-9245-d4e4244cc659 · outbound

This paper cites A short answer grading system in chinese by cnn,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models A short answer grading system in chinese by cnn,

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.878163Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T22:25:37.303916Z digest=sha256:ceb7e1dabeef7f7d663571364f7b704c1a9c66d64b0e98b1e592fdb25a435a93

Observation 829ae285-d36a-4c41-8a0c-60318537ab5e · outbound

This paper cites A short answer grading system in chinese by support vector approach,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models A short answer grading system in chinese by support vector approach,

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.860512Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T22:25:37.310513Z digest=sha256:de6cd88dc0d4c4e6f1ba7211dd6f1717780689e05450aa5d5f54e62d2029401a

Observation 386e1beb-863f-44e7-a6c0-d34bcc21ea38 · outbound

This paper cites GPT-4 Technical Report.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models GPT-4 Technical Report

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.320977Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.320977Z digest=sha256:fc1d47ae7232dcd726c1c327f2c1a8250ead0d8f1ef375ce300aac67dc8c9c99

Observation 55358dc4-2826-4d13-98f9-4e1707ff31c0 · outbound

This paper cites DeepSeek-V3 Technical Report.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models DeepSeek-V3 Technical Report

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.327052Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.327052Z digest=sha256:8dbefb18f30f660968e57c3fa6e9fec7391289e8574009047231b1d181807c2b

Observation b4c81324-9f60-445b-aaa2-7dcd8871c39c · outbound

This paper cites Is llm-as-a-judge robust? investigating universal adversarial attacks on zero-shot LLM assessment,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Is llm-as-a-judge robust? investigating universal adversarial attacks on zero-shot LLM assessment,

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.826092Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T22:25:37.333237Z digest=sha256:69341bf69576fb5d5539572a2a21ed053bdcc140efa1d3ed8c300bc2c3f106c1

Observation 5c11d8d6-24ed-4e6f-9441-1b18a3f151d8 · outbound

This paper cites Beyond yes and no: Improving zero-shot LLM rankers via scoring fine-grained relevance labels,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Beyond yes and no: Improving zero-shot LLM rankers via scoring fine-grained relevance labels,

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.339086Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.339086Z digest=sha256:b1f2b5180d8d1dcd4e7825879a1c706bf4a5fdf316dad1fea0a27ffee7b34e31

Observation 99d57d2b-b45f-4f1e-849e-bbd86b60f8e9 · outbound

This paper cites GLIDER: Grading LLM Interactions and Decisions using Explainable Ranking.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models GLIDER: Grading LLM Interactions and Decisions using Explainable Ranking

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.344350Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.344350Z digest=sha256:4422be7c392d3951e479ceced6e17013af4d49c1dfa4fe9c1d8204432aebf07c

Observation 511f91b4-d53e-4cea-a979-f4fc8b288f8c · outbound

This paper cites The hewlett foundation: Automated essay scoring,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models The hewlett foundation: Automated essay scoring,

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.794015Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T22:25:37.349667Z digest=sha256:e8d321fc459d3a712febb81ac32492e05d504d39a259492be8b390e2bbbe81ce

Observation a965f117-da47-41b9-acdc-5bd224f349e7 · outbound

This paper cites Scaa: A dataset for automated short answer grading of children’s free-text answers in hindi and marathi,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Scaa: A dataset for automated short answer grading of children’s free-text answers in hindi and marathi,

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.776588Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T22:25:37.354817Z digest=sha256:3f9d1955d46d2015dde39cc63fef120a98cf710a4da67718b2358c56e0f40e2d

Observation 088ada9b-177a-4113-96e2-2227693bf7dc · outbound

This paper cites Semeval-2013 task 7: The joint student response analysis and 8th recognizing textual entailment challenge,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Semeval-2013 task 7: The joint student response analysis and 8th recognizing textual entailment challenge,

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.759778Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T22:25:37.362594Z digest=sha256:3233142ccfb9fd4f55b9877e14dfb78806484b6f6987bccc23f86973bde9e612

Observation bf3115d5-c7e7-4a57-bbf6-9bd2d745b62a · outbound

This paper cites Automated long answer grading with ricechem dataset,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Automated long answer grading with ricechem dataset,

Reference 17

Resolution
verified exact
doi, observed 2026-08-15T22:25:37.729426Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T22:25:37.367944Z digest=sha256:849d43a59e941662e1d75ac5c2366201bd26f382ce83d747c09782d9bbeca02d

Observation 0e1ba55a-c0ad-4ab8-b42f-bfd1716b1701 · outbound

This paper cites A new benchmark for automatic essay scoring in Portuguese,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models A new benchmark for automatic essay scoring in Portuguese,

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.743082Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T22:25:37.372891Z digest=sha256:0f309202191e98ffe3cb5161a90b42c43f9aca12519ce2263d893e12421391ab

Observation cbc2963d-3deb-4e7b-8d79-9807ff684553 · outbound

This paper cites The hewlett foundation: Short answer scoring,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models The hewlett foundation: Short answer scoring,

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.725844Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T22:25:37.377921Z digest=sha256:773c1c6452c29afc9f1c21e2d57bb16209058f35d430a99452a62a3c22c9b381

Observation acbf8cb8-182e-4175-8775-11c8fd53b5a6 · outbound

This paper cites Automated short answer grading: A simple solution for a difficult task,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Automated short answer grading: A simple solution for a difficult task,

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.843962Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T22:25:37.383844Z digest=sha256:4d154dc75d0dfbd4e193e64593ab0c28d2372c86bcd0d417fd7932a0a2c8f454

Observation 6afe4656-bf16-43bf-99da-d58bd0d25ca4 · outbound

This paper cites Text-to-text semantic similarity for automatic short answer grading,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Text-to-text semantic similarity for automatic short answer grading,

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.709426Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T22:25:37.389358Z digest=sha256:192ab80b46b87eafc52b5b2d340ee1ea37af9ce4b3194f798305421dae23d804

Observation bad24b5e-2541-4b04-a955-c8261d244d3e · outbound

This paper cites M-sim: Multi-level semantic inference model for chinese short answer scoring in low-resource scenarios,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models M-sim: Multi-level semantic inference model for chinese short answer scoring in low-resource scenarios,

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.394258Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.394258Z digest=sha256:41739489714daadc5ba72fba026ddc1ac16895a950977400568a3a28b92cdf96

Observation 9a5fcc17-45e1-4d69-a623-daaa37582af8 · outbound

This paper cites L-eval: Instituting standardized evaluation for long context language models,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models L-eval: Instituting standardized evaluation for long context language models,

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.398920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.398920Z digest=sha256:7911662bc10c9185eb13d29ce4c5e20af1f7d2e40e00c0ec38e51230e37ff7b4

Observation 2349f097-da85-4721-9716-150d5a970d50 · outbound

This paper cites Is ChatGPT a Good NLG Evaluator? A Preliminary Study.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Is ChatGPT a Good NLG Evaluator? A Preliminary Study

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.403992Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.403992Z digest=sha256:10ad07188ba32f3c027479d8c009a882e8bb8de8f6bd1aa1b0e07129933d5dce

Observation 07c991bb-86cc-4b08-be06-421a1ecda4dd · outbound

This paper cites Large language models can accurately predict searcher preferences,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Large language models can accurately predict searcher preferences,

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.409653Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.409653Z digest=sha256:dd1b4bab217451a5c724977dea7fc41339816744404e8c8a449e5231cc0ff66b

Observation 96646ba5-160a-4a0e-b933-c3bb4f3c1727 · outbound

This paper cites Perspectives on large language models for relevance judgment,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Perspectives on large language models for relevance judgment,

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.414616Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.414616Z digest=sha256:f0311371bb1bf959aa9cca2e72ea2b23856b490f5e18980f8248edc719364b17

Observation dae34f46-775f-4dab-a7ee-37d877c99256 · outbound

This paper cites Enhancing transfer learning of llms through fine- tuning on task - related corpora for automated short-answer grading,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Enhancing transfer learning of llms through fine- tuning on task - related corpora for automated short-answer grading,

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.419985Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.419985Z digest=sha256:78f6c524452deab490e37d406a9421e3a063f1c0943206f305e127914f777e0f

Observation d73afecf-e8c8-4978-b5e1-c7acc727f5b6 · outbound

This paper cites Judging llm-as-a-judge with mt-bench and chatbot arena,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Judging llm-as-a-judge with mt-bench and chatbot arena,

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.692860Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T22:25:37.425721Z digest=sha256:1f141dbe46f06b97713542001f54e2c5dddeebf2209a31a5c614176a8310c6d0

Observation 6582a659-2704-4c6c-b725-52ab8b99af63 · outbound

This paper cites JudgeLM: Fine-tuned Large Language Models are Scalable Judges.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models JudgeLM: Fine-tuned Large Language Models are Scalable Judges

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.430750Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.430750Z digest=sha256:8d13d74f7b729e042741f17314b024d0fd275db90a48a0db1be14224ba2f16e1

Observation d502c796-fd84-42f1-8049-02881aedbc6c · outbound

This paper cites Calibrating llm-based evaluator,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Calibrating llm-based evaluator,

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.677109Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T22:25:37.436046Z digest=sha256:e9cbec4eed67bacab6ab2ec9e0b5f9b9b38994ca506ea6cc72bb58a56191e6e0

Observation 5085b9eb-2aab-4a30-b7ae-9e5a56eea2ac · outbound

This paper cites Exploring LLM prompting strategies for joint essay scoring and feedback generation,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Exploring LLM prompting strategies for joint essay scoring and feedback generation,

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.657994Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T22:25:37.441453Z digest=sha256:6663710ebc1a0c359620cbdb46d00172a7f0f4484b715d1091bf63e5b460c735

Observation a11fa56b-b699-4441-93d1-0dd229a46bfd · outbound

This paper cites Knowledge distillation of llms for automatic scoring of science assessments,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Knowledge distillation of llms for automatic scoring of science assessments,

Reference 32

Resolution
verified exact
doi, observed 2026-08-15T22:25:38.639092Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T22:25:37.446603Z digest=sha256:e86708fe7939cc4998d257bff83d386cd5ffc166df2ab256edc18f61a72d4cf9

Observation 78ac1071-4924-43a4-9fff-f65ff5ffe322 · outbound

This paper cites Efficient LLM comparative assessment: A product of experts framework for pairwise comparisons,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Efficient LLM comparative assessment: A product of experts framework for pairwise comparisons,

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.621608Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T22:25:37.451542Z digest=sha256:fe74d8c62789883bde164f4471828fcfa208607b0d7e13da2cf6e380bba85dd1

Observation c269c917-9381-49f4-8d96-57aa088222ea · outbound

This paper cites Evaluating the Performance of Large Language Models on GAOKAO Benchmark.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Evaluating the Performance of Large Language Models on GAOKAO Benchmark

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.456671Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.456671Z digest=sha256:de3dd6f9285b715a38aebb2b56d0e3eeea0304975b8d892b35f6d39c024ce502

Observation 54ae2945-2617-47e4-a733-106cf548c468 · outbound

This paper cites Asag2024: A combined benchmark for short answer grading,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Asag2024: A combined benchmark for short answer grading,

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.602647Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T22:25:37.461937Z digest=sha256:75c74915597e326be3d53fbedd11fd7e0b109a483983d1c6841a1c50bd558de6

Observation 52d578ba-2876-4185-a84b-e85747418324 · outbound

This paper cites Learning to grade short answer questions using semantic similarity measures and dependency graph alignments,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Learning to grade short answer questions using semantic similarity measures and dependency graph alignments,

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.585881Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T22:25:37.467209Z digest=sha256:2cad65a52a8d4b1a4dd7a7a46e9cca5d7a24f9738056a1915ba9608c78a1d2bd

Observation 925e2821-4893-4ad6-a445-fead623247ff · outbound

This paper cites Short Answer Grading Using One-shot Prompting and Text Similarity Scoring Model.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Short Answer Grading Using One-shot Prompting and Text Similarity Scoring Model

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.472178Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.472178Z digest=sha256:9e16e2926373b244cdc80c8a18e9951fe24b3b172d1ac3bc65fce95ad5e43299

Observation acd4b2d9-23c4-411b-b0d9-922849d098f3 · outbound

This paper cites Improving the performance of automatic short answer grading using transfer learning and augmentation,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Improving the performance of automatic short answer grading using transfer learning and augmentation,

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.568533Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T22:25:37.477724Z digest=sha256:c5e7c51cc9d8f498994cc8d99e24ab866a56651a2ba280fc233ed0c290b84051

Observation 8d7f6a0e-8165-41d1-8b43-f30162a0c3ec · outbound

This paper cites Rankcse: Unsupervised sentence representations learning via learning to rank,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Rankcse: Unsupervised sentence representations learning via learning to rank,

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.488466Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.488466Z digest=sha256:c17179b33ec0767540550d01beeefb535fc0228b60e54e4adf8837ee1cf48c38

Observation 686aa5dd-108c-432b-a090-a893239baf40 · outbound

This paper cites Diffcse: Difference-based contrastive learning for sentence embeddings,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Diffcse: Difference-based contrastive learning for sentence embeddings,

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.494149Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.494149Z digest=sha256:03355e7e0d6689c0400e3cf826e0c49dba371f518b5d2c9ede11d7dc81529702

Observation a7b0f1aa-06c5-4b17-a5de-eac4c2bdf49f · outbound

This paper cites The Llama 3 Herd of Models.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models The Llama 3 Herd of Models

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.500317Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.500317Z digest=sha256:0335f08d95b8ed6b850535f0705dcd4593853fc2daf91514247b2f4d45ea9455

Observation ae56ddeb-cae5-4be3-b1f8-96a9f14e3088 · outbound

This paper cites Qwen2 Technical Report.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Qwen2 Technical Report

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.506787Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.506787Z digest=sha256:25bc4baa394301420b45b7ce2ef739127cdd7f73e528234f1887e1d690484cb6

Observation 58b4a6ac-9710-4122-b4ce-d3c865d5e18d · outbound

This paper cites Qwen2.5 Technical Report.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Qwen2.5 Technical Report

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.512994Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.512994Z digest=sha256:2e44bae44298725878ba80d859fd90f74aa4557ccc54154cbfbb242334c7f4e4

Observation 84584afa-9c5a-4e59-b8ff-b16473278719 · outbound

This paper cites Chatglm: A family of large language models from glm-130b to glm-4 all tools,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Chatglm: A family of large language models from glm-130b to glm-4 all tools,

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.518394Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.518394Z digest=sha256:d1385b7b33444fd1cc35dbf45c16ba05207908414b26d1a09b97235fa07befce

Observation 71a9af5a-d4c3-4296-bc87-56f3fc752410 · outbound

This paper cites Mixtral of Experts.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Mixtral of Experts

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.523662Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.523662Z digest=sha256:a5043645f952b4105d19d7af32add23dd9976c7dd3402d8266a950819e1b6341

Observation a7453a82-4f67-4c99-8a73-591823a94ac1 · outbound

This paper cites DeepSeek-Prover-V2: Advancing Formal Mathematical Reasoning via Reinforcement Learning for Subgoal Decomposition.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models DeepSeek-Prover-V2: Advancing Formal Mathematical Reasoning via Reinforcement Learning for Subgoal Decomposition

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.529198Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.529198Z digest=sha256:decda9a597f7874cfd2e330ee73995733396122687abd138156323572dbef6d7

Observation d58c5dac-f04f-45c5-b45d-bbe6b83dd563 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.534647Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.534647Z digest=sha256:3d151d276be89bec8a83d444b504945b57a047750631696ee80a782f641f0330

Observation 5b056d15-8807-4cf6-8812-62df98e22eea · outbound

This paper cites Qwq-32b: Embracing the power of reinforcement learning,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Qwq-32b: Embracing the power of reinforcement learning,

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.539755Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.539755Z digest=sha256:cbf5bc11aff8fe2461038e690d9caef1d8dcda9323a2b3d32f5b94b7034b1fb7

Observation 5f567276-c64d-448b-8881-337321c075f2 · outbound

This paper cites [Online].

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models [Online]

Reference 49

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.518609Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T22:25:37.544686Z digest=sha256:f05f012312c6332a1ba04e22c8607b707ec0991dacaceb183b36037afac25f1e

Observation 01067c15-d59f-4f01-a3af-d0f553581b28 · outbound

This paper cites Team, “Superdistillation achieves near-r1 performance with just 5.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Team, “Superdistillation achieves near-r1 performance with just 5

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.501567Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T22:25:37.549465Z digest=sha256:8093d8a308deba84689de296f118b3660ba830f44126f71c609a08f8bd6d13a4

Observation 5dd7b017-bf1f-4171-b263-f0f7211e982a · outbound

This paper cites Mimo: Unlocking the reasoning potential of language model – from pretraining to posttraining,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Mimo: Unlocking the reasoning potential of language model – from pretraining to posttraining,

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.474371Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T22:25:37.554685Z digest=sha256:74ab792e2eb1195ea61689a14dbe4c617a7109679b6571891a24b389c9525fde

Observation 14436c82-d65d-4ab5-bc33-000dfcc84204 · outbound

This paper cites Metamath: Bootstrap your own mathematical questions for large language models,.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Metamath: Bootstrap your own mathematical questions for large language models,

Reference 52

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.448544Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T22:25:37.559542Z digest=sha256:2065dab2e74bc5c4e8d049f0d6d143df4799283bdad2694bb9f74776cf011b90

Observation 16cc9b54-bef9-49e7-81fb-d12e7e169f9e · outbound

This paper cites - Independently evaluate each step: * Determine correctness ('label').

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models - Independently evaluate each step: * Determine correctness ('label')

Reference 54

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.430755Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T22:25:37.565249Z digest=sha256:889edfbd579d02925c4cd989722ca969ec06b81d2eff3ec46109980a66a55210

Observation 5d1ca454-5bb4-4f89-a8d1-d7e9a87204ba · outbound

This paper cites - Provide an overall evaluation ('label’).

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models - Provide an overall evaluation ('label’)

Reference 55

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.412132Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T22:25:37.570304Z digest=sha256:6ec3f8649923c3ccce0434e5d06563071fa10a511882c45b894af03d34d839d1

Observation 445126fd-d2be-47a6-82fd-0627bea49cd0 · outbound

This paper cites id": "Math_ShortAns_3.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models id": "Math_ShortAns_3

Reference 56

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:25:38.394516Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T22:25:37.576015Z digest=sha256:7182dddce680dd942f8e480f7a506e7cc7107ad6d174e08c112938b5714fc7a5

Observation 1580b7cf-c95d-4dc3-9c56-74a12d5a4853 · outbound

This paper cites Available: https://doi.org/10.1016/j.engappai.2023.106292.

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Available: https://doi.org/10.1016/j.engappai.2023.106292

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-15T22:25:37.483240Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:25:37.483240Z digest=sha256:ed5686dba9c9994fbea32e453e7fd696ab54196292433d3a5b385e814edcc52e

Pith citing papers

Observation abf010d1-098e-4099-99b2-b8a950e31a72 · inbound

EDIT: Evidence-Diagnosed Intervention Training for Rule-Faithful LLM Grading cites this paper.

EDIT: Evidence-Diagnosed Intervention Training for Rule-Faithful LLM Grading SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models

Reference 28

Resolution
verified exact
arxiv_id, observed 2026-07-02T13:06:59.575912Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-06-28T01:31:59.207857Z digest=sha256:82de9c523e5da4eb1d04844a6bf779dbb0496502b8fcd3ef9ebdf287aa0e7d0c