Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-15T22:25:37.576015Z
Paper Citation Record · LEDGER
As of 18 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 1 inbound Pith citation observation for arXiv:2505.07247.
A citation records a reference. It does not transfer a finding from one paper to another.
Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-15T22:25:37.576015Z
One-hop event checks from named stored sources.
Source: scholarly_work_events, retraction_status_cache, observed 2026-08-18T06:34:40.430872+00:00
Pith citing papers itemized under the disclosed page cap.
Source: paper_references, paper_reference_links, observed 2026-06-28T01:31:59.207857Z
A source-named dated measurement, never combined with another source.
Source: arxiv_reference, observed 2026-07-02T13:06:59.574503Z
55 of 55 outbound references displayed
External citation measurements
No source-named external measurement is stored.
Observation 67fbe111-a202-46c8-b410-e574b45b5b86 · outbound
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Automated essay scoring using discourse external knowledge,
Reference 1
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation a261be39-31ca-4da5-83e0-f1df5bb8d924 · outbound
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Improve LLM-based Automatic Essay Scoring with Linguistic Features
Reference 2
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 252dac85-dd2e-406a-9f94-fff6f6a7e2ae · outbound
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models An automated essay scoring systems: a systematic literature review,
Reference 3
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation e2ed5a10-882d-4a1f-9aba-33ab95e0a017 · outbound
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Prompt Agnostic Essay Scorer: A Domain Generalization Approach to Cross-prompt Automated Essay Scoring
Reference 4
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d9c6e080-0e50-47f4-bb20-8d2efc0137c3 · outbound
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Automated cross-prompt scoring of essay traits,
Reference 5
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 912ca936-70d2-4507-9245-d4e4244cc659 · outbound
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models A short answer grading system in chinese by cnn,
Reference 6
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 829ae285-d36a-4c41-8a0c-60318537ab5e · outbound
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models A short answer grading system in chinese by support vector approach,
Reference 7
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 386e1beb-863f-44e7-a6c0-d34bcc21ea38 · outbound
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models GPT-4 Technical Report
Reference 9
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 55358dc4-2826-4d13-98f9-4e1707ff31c0 · outbound
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models DeepSeek-V3 Technical Report
Reference 10
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b4c81324-9f60-445b-aaa2-7dcd8871c39c · outbound
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Is llm-as-a-judge robust? investigating universal adversarial attacks on zero-shot LLM assessment,
Reference 11
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 5c11d8d6-24ed-4e6f-9441-1b18a3f151d8 · outbound
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Beyond yes and no: Improving zero-shot LLM rankers via scoring fine-grained relevance labels,
Reference 12
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 99d57d2b-b45f-4f1e-849e-bbd86b60f8e9 · outbound
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models GLIDER: Grading LLM Interactions and Decisions using Explainable Ranking
Reference 13
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 511f91b4-d53e-4cea-a979-f4fc8b288f8c · outbound
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models The hewlett foundation: Automated essay scoring,
Reference 14
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation a965f117-da47-41b9-acdc-5bd224f349e7 · outbound
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Scaa: A dataset for automated short answer grading of children’s free-text answers in hindi and marathi,
Reference 15
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 088ada9b-177a-4113-96e2-2227693bf7dc · outbound
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Semeval-2013 task 7: The joint student response analysis and 8th recognizing textual entailment challenge,
Reference 16
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation bf3115d5-c7e7-4a57-bbf6-9bd2d745b62a · outbound
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Automated long answer grading with ricechem dataset,
Reference 17
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 0e1ba55a-c0ad-4ab8-b42f-bfd1716b1701 · outbound
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models A new benchmark for automatic essay scoring in Portuguese,
Reference 18
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation cbc2963d-3deb-4e7b-8d79-9807ff684553 · outbound
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models The hewlett foundation: Short answer scoring,
Reference 19
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation acbf8cb8-182e-4175-8775-11c8fd53b5a6 · outbound
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Automated short answer grading: A simple solution for a difficult task,
Reference 20
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 6afe4656-bf16-43bf-99da-d58bd0d25ca4 · outbound
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Text-to-text semantic similarity for automatic short answer grading,
Reference 21
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation bad24b5e-2541-4b04-a955-c8261d244d3e · outbound
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models M-sim: Multi-level semantic inference model for chinese short answer scoring in low-resource scenarios,
Reference 22
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 9a5fcc17-45e1-4d69-a623-daaa37582af8 · outbound
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models L-eval: Instituting standardized evaluation for long context language models,
Reference 23
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 2349f097-da85-4721-9716-150d5a970d50 · outbound
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Is ChatGPT a Good NLG Evaluator? A Preliminary Study
Reference 24
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 07c991bb-86cc-4b08-be06-421a1ecda4dd · outbound
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Large language models can accurately predict searcher preferences,
Reference 25
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 96646ba5-160a-4a0e-b933-c3bb4f3c1727 · outbound
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Perspectives on large language models for relevance judgment,
Reference 26
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation dae34f46-775f-4dab-a7ee-37d877c99256 · outbound
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Enhancing transfer learning of llms through fine- tuning on task - related corpora for automated short-answer grading,
Reference 27
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d73afecf-e8c8-4978-b5e1-c7acc727f5b6 · outbound
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Judging llm-as-a-judge with mt-bench and chatbot arena,
Reference 28
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 6582a659-2704-4c6c-b725-52ab8b99af63 · outbound
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models JudgeLM: Fine-tuned Large Language Models are Scalable Judges
Reference 29
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d502c796-fd84-42f1-8049-02881aedbc6c · outbound
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Calibrating llm-based evaluator,
Reference 30
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 5085b9eb-2aab-4a30-b7ae-9e5a56eea2ac · outbound
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Exploring LLM prompting strategies for joint essay scoring and feedback generation,
Reference 31
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation a11fa56b-b699-4441-93d1-0dd229a46bfd · outbound
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Knowledge distillation of llms for automatic scoring of science assessments,
Reference 32
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 78ac1071-4924-43a4-9fff-f65ff5ffe322 · outbound
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Efficient LLM comparative assessment: A product of experts framework for pairwise comparisons,
Reference 33
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation c269c917-9381-49f4-8d96-57aa088222ea · outbound
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Evaluating the Performance of Large Language Models on GAOKAO Benchmark
Reference 34
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 54ae2945-2617-47e4-a733-106cf548c468 · outbound
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Asag2024: A combined benchmark for short answer grading,
Reference 35
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 52d578ba-2876-4185-a84b-e85747418324 · outbound
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Learning to grade short answer questions using semantic similarity measures and dependency graph alignments,
Reference 36
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 925e2821-4893-4ad6-a445-fead623247ff · outbound
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Short Answer Grading Using One-shot Prompting and Text Similarity Scoring Model
Reference 37
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation acd4b2d9-23c4-411b-b0d9-922849d098f3 · outbound
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Improving the performance of automatic short answer grading using transfer learning and augmentation,
Reference 38
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 8d7f6a0e-8165-41d1-8b43-f30162a0c3ec · outbound
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Rankcse: Unsupervised sentence representations learning via learning to rank,
Reference 39
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 686aa5dd-108c-432b-a090-a893239baf40 · outbound
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Diffcse: Difference-based contrastive learning for sentence embeddings,
Reference 40
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation a7b0f1aa-06c5-4b17-a5de-eac4c2bdf49f · outbound
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models The Llama 3 Herd of Models
Reference 41
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation ae56ddeb-cae5-4be3-b1f8-96a9f14e3088 · outbound
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Qwen2 Technical Report
Reference 42
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 58b4a6ac-9710-4122-b4ce-d3c865d5e18d · outbound
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Qwen2.5 Technical Report
Reference 43
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 84584afa-9c5a-4e59-b8ff-b16473278719 · outbound
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Chatglm: A family of large language models from glm-130b to glm-4 all tools,
Reference 44
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 71a9af5a-d4c3-4296-bc87-56f3fc752410 · outbound
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Mixtral of Experts
Reference 45
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation a7453a82-4f67-4c99-8a73-591823a94ac1 · outbound
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models DeepSeek-Prover-V2: Advancing Formal Mathematical Reasoning via Reinforcement Learning for Subgoal Decomposition
Reference 46
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d58c5dac-f04f-45c5-b45d-bbe6b83dd563 · outbound
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
Reference 47
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 5b056d15-8807-4cf6-8812-62df98e22eea · outbound
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Qwq-32b: Embracing the power of reinforcement learning,
Reference 48
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 5f567276-c64d-448b-8881-337321c075f2 · outbound
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models [Online]
Reference 49
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 01067c15-d59f-4f01-a3af-d0f553581b28 · outbound
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Team, “Superdistillation achieves near-r1 performance with just 5
Reference 50
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 5dd7b017-bf1f-4171-b263-f0f7211e982a · outbound
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Mimo: Unlocking the reasoning potential of language model – from pretraining to posttraining,
Reference 51
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 14436c82-d65d-4ab5-bc33-000dfcc84204 · outbound
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Metamath: Bootstrap your own mathematical questions for large language models,
Reference 52
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 16cc9b54-bef9-49e7-81fb-d12e7e169f9e · outbound
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models - Independently evaluate each step: * Determine correctness ('label')
Reference 54
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 5d1ca454-5bb4-4f89-a8d1-d7e9a87204ba · outbound
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models - Provide an overall evaluation ('label’)
Reference 55
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 445126fd-d2be-47a6-82fd-0627bea49cd0 · outbound
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models id": "Math_ShortAns_3
Reference 56
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 1580b7cf-c95d-4dc3-9c56-74a12d5a4853 · outbound
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models Available: https://doi.org/10.1016/j.engappai.2023.106292
Reference 2023
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation abf010d1-098e-4099-99b2-b8a950e31a72 · inbound
EDIT: Evidence-Diagnosed Intervention Training for Rule-Faithful LLM Grading SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models
Reference 28
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.