{"as_of":"2026-08-18T23:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b9d2e49f4cf4bc4186c1e3ea4985572d3c093d5b03aaeb6732dbdd322a3e586f","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T22:25:37.576015Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T01:31:59.207857Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T13:06:59.574503Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.07247","last_updated":"2025-05-15T11:01:45Z","snapshot_observed_at":"2026-08-18T21:20:50.978958Z","submitted_at":"2025-05-12T05:43:21Z","title":"SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models","version":2},"cited_work":{"arxiv_id":"2505.07247","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.07247","snapshot_observed_at":"2026-07-02T13:06:59.574503Z","title":"arXiv preprint arXiv:2505.07247 , year =","venue":null,"work_id":"f2107abf-f757-41ad-9ada-97d3267ca1d1","year":null},"citing_paper":{"arxiv_id":"2606.06350","last_updated":"2026-06-04T16:20:17Z","snapshot_observed_at":"2026-08-08T06:36:53.979200Z","submitted_at":"2026-06-04T16:20:17Z","title":"EDIT: Evidence-Diagnosed Intervention Training for Rule-Faithful LLM Grading","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-28T01:31:59.207857Z"},"links":{"cited_paper":"/paper/2505.07247","citing_paper":"/paper/2606.06350"},"observation_digest":"sha256:82de9c523e5da4eb1d04844a6bf779dbb0496502b8fcd3ef9ebdf287aa0e7d0c","observation_id":"abf010d1-098e-4099-99b2-b8a950e31a72","resolution":{"observed_at":"2026-07-02T13:06:59.575912Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.07247/citation-record","integrity":"/paper/2505.07247/integrity","json":"/paper/2505.07247/citation-record.json","paper":"/paper/2505.07247"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:38.906890Z","title":"Automated essay scoring using discourse external knowledge,","venue":null,"work_id":"7244b448-b50f-4971-9c71-000f0973f938","year":2024},"citing_paper":{"arxiv_id":"2505.07247","last_updated":"2025-05-15T11:01:45Z","snapshot_observed_at":"2026-08-18T21:20:50.978958Z","submitted_at":"2025-05-12T05:43:21Z","title":"SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:37.274255Z"},"links":{"citing_paper":"/paper/2505.07247"},"observation_digest":"sha256:77d2f541425bdee27c33309f91579e1255e31c10c0266b837eaabfc96c652c7f","observation_id":"67fbe111-a202-46c8-b410-e574b45b5b86","resolution":{"observed_at":"2026-08-15T22:25:38.912982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09497","last_updated":"2025-02-13T17:09:52Z","snapshot_observed_at":"2026-08-14T08:53:20.876898Z","submitted_at":"2025-02-13T17:09:52Z","title":"Improve LLM-based Automatic Essay Scoring with Linguistic Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09497","snapshot_observed_at":"2026-08-15T22:25:37.280015Z","title":"Improve llm-based automatic essay scoring with linguistic features,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07247","last_updated":"2025-05-15T11:01:45Z","snapshot_observed_at":"2026-08-18T21:20:50.978958Z","submitted_at":"2025-05-12T05:43:21Z","title":"SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:37.280015Z"},"links":{"cited_paper":"/paper/2502.09497","citing_paper":"/paper/2505.07247"},"observation_digest":"sha256:26f26c107a39804f23451e8852f8450294d3b5c97781d2b0de32905171743c63","observation_id":"a261be39-31ca-4da5-83e0-f1df5bb8d924","resolution":{"observed_at":"2026-08-15T22:25:37.280015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:37.285968Z","title":"An automated essay scoring systems: a systematic literature review,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.07247","last_updated":"2025-05-15T11:01:45Z","snapshot_observed_at":"2026-08-18T21:20:50.978958Z","submitted_at":"2025-05-12T05:43:21Z","title":"SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:37.285968Z"},"links":{"citing_paper":"/paper/2505.07247"},"observation_digest":"sha256:b1f3d616e25dce54c82d2b8b449b9ee0f788e1bc7521b1cc9b9252997f863584","observation_id":"252dac85-dd2e-406a-9f94-fff6f6a7e2ae","resolution":{"observed_at":"2026-08-15T22:25:37.285968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2008.01441","last_updated":"2020-08-04T10:17:38Z","snapshot_observed_at":"2026-08-14T03:14:26.852841Z","submitted_at":"2020-08-04T10:17:38Z","title":"Prompt Agnostic Essay Scorer: A Domain Generalization Approach to Cross-prompt Automated Essay Scoring","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.01441","snapshot_observed_at":"2026-08-15T22:25:37.292005Z","title":"Prompt agnostic essay scorer: A domain generalization approach to cross-prompt automated essay scoring,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2505.07247","last_updated":"2025-05-15T11:01:45Z","snapshot_observed_at":"2026-08-18T21:20:50.978958Z","submitted_at":"2025-05-12T05:43:21Z","title":"SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:37.292005Z"},"links":{"cited_paper":"/paper/2008.01441","citing_paper":"/paper/2505.07247"},"observation_digest":"sha256:5badb72f492a826b2895a89ad3f36d4376bb80f861873d81907f237979ca03bc","observation_id":"e2ed5a10-882d-4a1f-9aba-33ab95e0a017","resolution":{"observed_at":"2026-08-15T22:25:37.292005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:38.889697Z","title":"Automated cross-prompt scoring of essay traits,","venue":null,"work_id":"cc541622-4e2d-4251-944c-3bafaca211a4","year":2021},"citing_paper":{"arxiv_id":"2505.07247","last_updated":"2025-05-15T11:01:45Z","snapshot_observed_at":"2026-08-18T21:20:50.978958Z","submitted_at":"2025-05-12T05:43:21Z","title":"SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:37.298617Z"},"links":{"citing_paper":"/paper/2505.07247"},"observation_digest":"sha256:11bdd5ff9046ff3ddbbce8962789d99a76f52991352e879c2e810eee73f786f3","observation_id":"d9c6e080-0e50-47f4-bb20-8d2efc0137c3","resolution":{"observed_at":"2026-08-15T22:25:38.894874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:38.872875Z","title":"A short answer grading system in chinese by cnn,","venue":null,"work_id":"30163b2b-dd91-4498-8efe-50164b244a79","year":2019},"citing_paper":{"arxiv_id":"2505.07247","last_updated":"2025-05-15T11:01:45Z","snapshot_observed_at":"2026-08-18T21:20:50.978958Z","submitted_at":"2025-05-12T05:43:21Z","title":"SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:37.303916Z"},"links":{"citing_paper":"/paper/2505.07247"},"observation_digest":"sha256:ceb7e1dabeef7f7d663571364f7b704c1a9c66d64b0e98b1e592fdb25a435a93","observation_id":"912ca936-70d2-4507-9245-d4e4244cc659","resolution":{"observed_at":"2026-08-15T22:25:38.878163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:38.854932Z","title":"A short answer grading system in chinese by support vector approach,","venue":null,"work_id":"96145c1b-3113-4cae-be29-3cdb3c5cfc77","year":2018},"citing_paper":{"arxiv_id":"2505.07247","last_updated":"2025-05-15T11:01:45Z","snapshot_observed_at":"2026-08-18T21:20:50.978958Z","submitted_at":"2025-05-12T05:43:21Z","title":"SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:37.310513Z"},"links":{"citing_paper":"/paper/2505.07247"},"observation_digest":"sha256:de6cd88dc0d4c4e6f1ba7211dd6f1717780689e05450aa5d5f54e62d2029401a","observation_id":"829ae285-d36a-4c41-8a0c-60318537ab5e","resolution":{"observed_at":"2026-08-15T22:25:38.860512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T22:25:37.320977Z","title":"GPT-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07247","last_updated":"2025-05-15T11:01:45Z","snapshot_observed_at":"2026-08-18T21:20:50.978958Z","submitted_at":"2025-05-12T05:43:21Z","title":"SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:37.320977Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.07247"},"observation_digest":"sha256:fc1d47ae7232dcd726c1c327f2c1a8250ead0d8f1ef375ce300aac67dc8c9c99","observation_id":"386e1beb-863f-44e7-a6c0-d34bcc21ea38","resolution":{"observed_at":"2026-08-15T22:25:37.320977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-18T18:18:37.449517Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-15T22:25:37.327052Z","title":"Deepseek-v3 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07247","last_updated":"2025-05-15T11:01:45Z","snapshot_observed_at":"2026-08-18T21:20:50.978958Z","submitted_at":"2025-05-12T05:43:21Z","title":"SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:37.327052Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.07247"},"observation_digest":"sha256:8dbefb18f30f660968e57c3fa6e9fec7391289e8574009047231b1d181807c2b","observation_id":"55358dc4-2826-4d13-98f9-4e1707ff31c0","resolution":{"observed_at":"2026-08-15T22:25:37.327052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:38.820149Z","title":"Is llm-as-a-judge robust? investigating universal adversarial attacks on zero-shot LLM assessment,","venue":null,"work_id":"a65dee03-6473-4f18-8fa8-f11e96138983","year":2024},"citing_paper":{"arxiv_id":"2505.07247","last_updated":"2025-05-15T11:01:45Z","snapshot_observed_at":"2026-08-18T21:20:50.978958Z","submitted_at":"2025-05-12T05:43:21Z","title":"SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:37.333237Z"},"links":{"citing_paper":"/paper/2505.07247"},"observation_digest":"sha256:69341bf69576fb5d5539572a2a21ed053bdcc140efa1d3ed8c300bc2c3f106c1","observation_id":"b4c81324-9f60-445b-aaa2-7dcd8871c39c","resolution":{"observed_at":"2026-08-15T22:25:38.826092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:37.339086Z","title":"Beyond yes and no: Improving zero-shot LLM rankers via scoring fine-grained relevance labels,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07247","last_updated":"2025-05-15T11:01:45Z","snapshot_observed_at":"2026-08-18T21:20:50.978958Z","submitted_at":"2025-05-12T05:43:21Z","title":"SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:37.339086Z"},"links":{"citing_paper":"/paper/2505.07247"},"observation_digest":"sha256:b1f2b5180d8d1dcd4e7825879a1c706bf4a5fdf316dad1fea0a27ffee7b34e31","observation_id":"5c11d8d6-24ed-4e6f-9441-1b18a3f151d8","resolution":{"observed_at":"2026-08-15T22:25:37.339086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14140","last_updated":"2024-12-20T21:59:56Z","snapshot_observed_at":"2026-08-15T16:14:36.378413Z","submitted_at":"2024-12-18T18:41:12Z","title":"GLIDER: Grading LLM Interactions and Decisions using Explainable Ranking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14140","snapshot_observed_at":"2026-08-15T22:25:37.344350Z","title":"GLIDER: grading LLM interactions and decisions using explainable ranking,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07247","last_updated":"2025-05-15T11:01:45Z","snapshot_observed_at":"2026-08-18T21:20:50.978958Z","submitted_at":"2025-05-12T05:43:21Z","title":"SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:37.344350Z"},"links":{"cited_paper":"/paper/2412.14140","citing_paper":"/paper/2505.07247"},"observation_digest":"sha256:4422be7c392d3951e479ceced6e17013af4d49c1dfa4fe9c1d8204432aebf07c","observation_id":"99d57d2b-b45f-4f1e-849e-bbd86b60f8e9","resolution":{"observed_at":"2026-08-15T22:25:37.344350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:38.788764Z","title":"The hewlett foundation: Automated essay scoring,","venue":null,"work_id":"52f9eb14-ca49-4fa3-9ff0-71f766249bb3","year":2012},"citing_paper":{"arxiv_id":"2505.07247","last_updated":"2025-05-15T11:01:45Z","snapshot_observed_at":"2026-08-18T21:20:50.978958Z","submitted_at":"2025-05-12T05:43:21Z","title":"SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:37.349667Z"},"links":{"citing_paper":"/paper/2505.07247"},"observation_digest":"sha256:e8d321fc459d3a712febb81ac32492e05d504d39a259492be8b390e2bbbe81ce","observation_id":"511f91b4-d53e-4cea-a979-f4fc8b288f8c","resolution":{"observed_at":"2026-08-15T22:25:38.794015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:38.770738Z","title":"Scaa: A dataset for automated short answer grading of children’s free-text answers in hindi and marathi,","venue":null,"work_id":"91ea839b-09f3-4357-9a85-6ada0af05f13","year":2020},"citing_paper":{"arxiv_id":"2505.07247","last_updated":"2025-05-15T11:01:45Z","snapshot_observed_at":"2026-08-18T21:20:50.978958Z","submitted_at":"2025-05-12T05:43:21Z","title":"SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:37.354817Z"},"links":{"citing_paper":"/paper/2505.07247"},"observation_digest":"sha256:3f9d1955d46d2015dde39cc63fef120a98cf710a4da67718b2358c56e0f40e2d","observation_id":"a965f117-da47-41b9-acdc-5bd224f349e7","resolution":{"observed_at":"2026-08-15T22:25:38.776588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:38.754667Z","title":"Semeval-2013 task 7: The joint student response analysis and 8th recognizing textual entailment challenge,","venue":null,"work_id":"34151692-e58f-41c8-a4d1-478f274bb4e5","year":2013},"citing_paper":{"arxiv_id":"2505.07247","last_updated":"2025-05-15T11:01:45Z","snapshot_observed_at":"2026-08-18T21:20:50.978958Z","submitted_at":"2025-05-12T05:43:21Z","title":"SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:37.362594Z"},"links":{"citing_paper":"/paper/2505.07247"},"observation_digest":"sha256:3233142ccfb9fd4f55b9877e14dfb78806484b6f6987bccc23f86973bde9e612","observation_id":"088ada9b-177a-4113-96e2-2227693bf7dc","resolution":{"observed_at":"2026-08-15T22:25:38.759778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-031-64302-6_12","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-17T11:03:46.409680Z","title":"Automated long answer grading with ricechem dataset,","venue":"Lecture notes in computer science","work_id":"95de8837-97e8-488b-9250-426640c55167","year":2024},"citing_paper":{"arxiv_id":"2505.07247","last_updated":"2025-05-15T11:01:45Z","snapshot_observed_at":"2026-08-18T21:20:50.978958Z","submitted_at":"2025-05-12T05:43:21Z","title":"SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:37.367944Z"},"links":{"citing_paper":"/paper/2505.07247"},"observation_digest":"sha256:849d43a59e941662e1d75ac5c2366201bd26f382ce83d747c09782d9bbeca02d","observation_id":"bf3115d5-c7e7-4a57-bbf6-9bd2d745b62a","resolution":{"observed_at":"2026-08-15T22:25:37.729426Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:38.738033Z","title":"A new benchmark for automatic essay scoring in Portuguese,","venue":null,"work_id":"86ad4dc5-5297-4a40-b4da-3a46346bf364","year":2024},"citing_paper":{"arxiv_id":"2505.07247","last_updated":"2025-05-15T11:01:45Z","snapshot_observed_at":"2026-08-18T21:20:50.978958Z","submitted_at":"2025-05-12T05:43:21Z","title":"SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:37.372891Z"},"links":{"citing_paper":"/paper/2505.07247"},"observation_digest":"sha256:0f309202191e98ffe3cb5161a90b42c43f9aca12519ce2263d893e12421391ab","observation_id":"0e1ba55a-c0ad-4ab8-b42f-bfd1716b1701","resolution":{"observed_at":"2026-08-15T22:25:38.743082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:38.720683Z","title":"The hewlett foundation: Short answer scoring,","venue":null,"work_id":"9f104bb4-d858-459d-a3b6-e08a1331f8de","year":2012},"citing_paper":{"arxiv_id":"2505.07247","last_updated":"2025-05-15T11:01:45Z","snapshot_observed_at":"2026-08-18T21:20:50.978958Z","submitted_at":"2025-05-12T05:43:21Z","title":"SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:37.377921Z"},"links":{"citing_paper":"/paper/2505.07247"},"observation_digest":"sha256:773c1c6452c29afc9f1c21e2d57bb16209058f35d430a99452a62a3c22c9b381","observation_id":"cbc2963d-3deb-4e7b-8d79-9807ff684553","resolution":{"observed_at":"2026-08-15T22:25:38.725844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:38.837867Z","title":"Automated short answer grading: A simple solution for a difficult task,","venue":null,"work_id":"7bd0a8cf-794b-45de-bba4-01b6bc98fdda","year":2019},"citing_paper":{"arxiv_id":"2505.07247","last_updated":"2025-05-15T11:01:45Z","snapshot_observed_at":"2026-08-18T21:20:50.978958Z","submitted_at":"2025-05-12T05:43:21Z","title":"SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:37.383844Z"},"links":{"citing_paper":"/paper/2505.07247"},"observation_digest":"sha256:4d154dc75d0dfbd4e193e64593ab0c28d2372c86bcd0d417fd7932a0a2c8f454","observation_id":"acbf8cb8-182e-4175-8775-11c8fd53b5a6","resolution":{"observed_at":"2026-08-15T22:25:38.843962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:38.704134Z","title":"Text-to-text semantic similarity for automatic short answer grading,","venue":null,"work_id":"bbf9c9c5-cf04-46a1-935f-bc272316e58b","year":2009},"citing_paper":{"arxiv_id":"2505.07247","last_updated":"2025-05-15T11:01:45Z","snapshot_observed_at":"2026-08-18T21:20:50.978958Z","submitted_at":"2025-05-12T05:43:21Z","title":"SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:37.389358Z"},"links":{"citing_paper":"/paper/2505.07247"},"observation_digest":"sha256:192ab80b46b87eafc52b5b2d340ee1ea37af9ce4b3194f798305421dae23d804","observation_id":"6afe4656-bf16-43bf-99da-d58bd0d25ca4","resolution":{"observed_at":"2026-08-15T22:25:38.709426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:37.394258Z","title":"M-sim: Multi-level semantic inference model for chinese short answer scoring in low-resource scenarios,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07247","last_updated":"2025-05-15T11:01:45Z","snapshot_observed_at":"2026-08-18T21:20:50.978958Z","submitted_at":"2025-05-12T05:43:21Z","title":"SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:37.394258Z"},"links":{"citing_paper":"/paper/2505.07247"},"observation_digest":"sha256:41739489714daadc5ba72fba026ddc1ac16895a950977400568a3a28b92cdf96","observation_id":"bad24b5e-2541-4b04-a955-c8261d244d3e","resolution":{"observed_at":"2026-08-15T22:25:37.394258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:37.398920Z","title":"L-eval: Instituting standardized evaluation for long context language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07247","last_updated":"2025-05-15T11:01:45Z","snapshot_observed_at":"2026-08-18T21:20:50.978958Z","submitted_at":"2025-05-12T05:43:21Z","title":"SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:37.398920Z"},"links":{"citing_paper":"/paper/2505.07247"},"observation_digest":"sha256:7911662bc10c9185eb13d29ce4c5e20af1f7d2e40e00c0ec38e51230e37ff7b4","observation_id":"9a5fcc17-45e1-4d69-a623-daaa37582af8","resolution":{"observed_at":"2026-08-15T22:25:37.398920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04048","last_updated":"2023-10-24T14:56:51Z","snapshot_observed_at":"2026-08-16T15:50:04.573553Z","submitted_at":"2023-03-07T16:57:20Z","title":"Is ChatGPT a Good NLG Evaluator? A Preliminary Study","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04048","snapshot_observed_at":"2026-08-15T22:25:37.403992Z","title":"Is chatgpt a good NLG evaluator? A preliminary study,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07247","last_updated":"2025-05-15T11:01:45Z","snapshot_observed_at":"2026-08-18T21:20:50.978958Z","submitted_at":"2025-05-12T05:43:21Z","title":"SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:37.403992Z"},"links":{"cited_paper":"/paper/2303.04048","citing_paper":"/paper/2505.07247"},"observation_digest":"sha256:10ad07188ba32f3c027479d8c009a882e8bb8de8f6bd1aa1b0e07129933d5dce","observation_id":"2349f097-da85-4721-9716-150d5a970d50","resolution":{"observed_at":"2026-08-15T22:25:37.403992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:37.409653Z","title":"Large language models can accurately predict searcher preferences,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07247","last_updated":"2025-05-15T11:01:45Z","snapshot_observed_at":"2026-08-18T21:20:50.978958Z","submitted_at":"2025-05-12T05:43:21Z","title":"SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:37.409653Z"},"links":{"citing_paper":"/paper/2505.07247"},"observation_digest":"sha256:dd1b4bab217451a5c724977dea7fc41339816744404e8c8a449e5231cc0ff66b","observation_id":"07c991bb-86cc-4b08-be06-421a1ecda4dd","resolution":{"observed_at":"2026-08-15T22:25:37.409653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:37.414616Z","title":"Perspectives on large language models for relevance judgment,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07247","last_updated":"2025-05-15T11:01:45Z","snapshot_observed_at":"2026-08-18T21:20:50.978958Z","submitted_at":"2025-05-12T05:43:21Z","title":"SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:37.414616Z"},"links":{"citing_paper":"/paper/2505.07247"},"observation_digest":"sha256:f0311371bb1bf959aa9cca2e72ea2b23856b490f5e18980f8248edc719364b17","observation_id":"96646ba5-160a-4a0e-b933-c3bb4f3c1727","resolution":{"observed_at":"2026-08-15T22:25:37.414616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:37.419985Z","title":"Enhancing transfer learning of llms through fine- tuning on task - related corpora for automated short-answer grading,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07247","last_updated":"2025-05-15T11:01:45Z","snapshot_observed_at":"2026-08-18T21:20:50.978958Z","submitted_at":"2025-05-12T05:43:21Z","title":"SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:37.419985Z"},"links":{"citing_paper":"/paper/2505.07247"},"observation_digest":"sha256:78f6c524452deab490e37d406a9421e3a063f1c0943206f305e127914f777e0f","observation_id":"dae34f46-775f-4dab-a7ee-37d877c99256","resolution":{"observed_at":"2026-08-15T22:25:37.419985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:38.687860Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena,","venue":null,"work_id":"0a8f9d60-c346-43cd-a247-89cc52881966","year":2023},"citing_paper":{"arxiv_id":"2505.07247","last_updated":"2025-05-15T11:01:45Z","snapshot_observed_at":"2026-08-18T21:20:50.978958Z","submitted_at":"2025-05-12T05:43:21Z","title":"SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:37.425721Z"},"links":{"citing_paper":"/paper/2505.07247"},"observation_digest":"sha256:1f141dbe46f06b97713542001f54e2c5dddeebf2209a31a5c614176a8310c6d0","observation_id":"d73afecf-e8c8-4978-b5e1-c7acc727f5b6","resolution":{"observed_at":"2026-08-15T22:25:38.692860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17631","last_updated":"2025-03-01T17:06:43Z","snapshot_observed_at":"2026-08-18T04:53:42.954410Z","submitted_at":"2023-10-26T17:48:58Z","title":"JudgeLM: Fine-tuned Large Language Models are Scalable Judges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17631","snapshot_observed_at":"2026-08-15T22:25:37.430750Z","title":"Judgelm: Fine-tuned large language models are scalable judges,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07247","last_updated":"2025-05-15T11:01:45Z","snapshot_observed_at":"2026-08-18T21:20:50.978958Z","submitted_at":"2025-05-12T05:43:21Z","title":"SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:37.430750Z"},"links":{"cited_paper":"/paper/2310.17631","citing_paper":"/paper/2505.07247"},"observation_digest":"sha256:8d13d74f7b729e042741f17314b024d0fd275db90a48a0db1be14224ba2f16e1","observation_id":"6582a659-2704-4c6c-b725-52ab8b99af63","resolution":{"observed_at":"2026-08-15T22:25:37.430750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:38.670977Z","title":"Calibrating llm-based evaluator,","venue":null,"work_id":"4e0efdfd-808c-476a-941a-758b35605e4a","year":2024},"citing_paper":{"arxiv_id":"2505.07247","last_updated":"2025-05-15T11:01:45Z","snapshot_observed_at":"2026-08-18T21:20:50.978958Z","submitted_at":"2025-05-12T05:43:21Z","title":"SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:37.436046Z"},"links":{"citing_paper":"/paper/2505.07247"},"observation_digest":"sha256:e9cbec4eed67bacab6ab2ec9e0b5f9b9b38994ca506ea6cc72bb58a56191e6e0","observation_id":"d502c796-fd84-42f1-8049-02881aedbc6c","resolution":{"observed_at":"2026-08-15T22:25:38.677109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:38.652518Z","title":"Exploring LLM prompting strategies for joint essay scoring and feedback generation,","venue":null,"work_id":"9bf71c6a-c086-426d-a50c-5a11102f077e","year":2024},"citing_paper":{"arxiv_id":"2505.07247","last_updated":"2025-05-15T11:01:45Z","snapshot_observed_at":"2026-08-18T21:20:50.978958Z","submitted_at":"2025-05-12T05:43:21Z","title":"SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:37.441453Z"},"links":{"citing_paper":"/paper/2505.07247"},"observation_digest":"sha256:6663710ebc1a0c359620cbdb46d00172a7f0f4484b715d1091bf63e5b460c735","observation_id":"5085b9eb-2aab-4a30-b7ae-9e5a56eea2ac","resolution":{"observed_at":"2026-08-15T22:25:38.657994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-031-64312-5_20","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-17T11:03:46.409680Z","title":"Knowledge distillation of llms for automatic scoring of science assessments,","venue":"Communications in computer and information science","work_id":"b5a85b86-1270-4196-a8a3-3097a1520400","year":2024},"citing_paper":{"arxiv_id":"2505.07247","last_updated":"2025-05-15T11:01:45Z","snapshot_observed_at":"2026-08-18T21:20:50.978958Z","submitted_at":"2025-05-12T05:43:21Z","title":"SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:37.446603Z"},"links":{"citing_paper":"/paper/2505.07247"},"observation_digest":"sha256:e86708fe7939cc4998d257bff83d386cd5ffc166df2ab256edc18f61a72d4cf9","observation_id":"a11fa56b-b699-4441-93d1-0dd229a46bfd","resolution":{"observed_at":"2026-08-15T22:25:38.639092Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:38.615012Z","title":"Efficient LLM comparative assessment: A product of experts framework for pairwise comparisons,","venue":null,"work_id":"79035eea-0498-4ee9-928f-96230763abc5","year":2024},"citing_paper":{"arxiv_id":"2505.07247","last_updated":"2025-05-15T11:01:45Z","snapshot_observed_at":"2026-08-18T21:20:50.978958Z","submitted_at":"2025-05-12T05:43:21Z","title":"SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:37.451542Z"},"links":{"citing_paper":"/paper/2505.07247"},"observation_digest":"sha256:fe74d8c62789883bde164f4471828fcfa208607b0d7e13da2cf6e380bba85dd1","observation_id":"78ac1071-4924-43a4-9fff-f65ff5ffe322","resolution":{"observed_at":"2026-08-15T22:25:38.621608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.12474","last_updated":"2024-02-24T15:44:21Z","snapshot_observed_at":"2026-08-08T08:58:54.609425Z","submitted_at":"2023-05-21T14:39:28Z","title":"Evaluating the Performance of Large Language Models on GAOKAO Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.12474","snapshot_observed_at":"2026-08-15T22:25:37.456671Z","title":"Evaluating the performance of large language models on GAOKAO benchmark,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07247","last_updated":"2025-05-15T11:01:45Z","snapshot_observed_at":"2026-08-18T21:20:50.978958Z","submitted_at":"2025-05-12T05:43:21Z","title":"SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:37.456671Z"},"links":{"cited_paper":"/paper/2305.12474","citing_paper":"/paper/2505.07247"},"observation_digest":"sha256:de3dd6f9285b715a38aebb2b56d0e3eeea0304975b8d892b35f6d39c024ce502","observation_id":"c269c917-9381-49f4-8d96-57aa088222ea","resolution":{"observed_at":"2026-08-15T22:25:37.456671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:38.597366Z","title":"Asag2024: A combined benchmark for short answer grading,","venue":null,"work_id":"7f482bf3-c2f1-436e-bec1-9cf43739613f","year":2024},"citing_paper":{"arxiv_id":"2505.07247","last_updated":"2025-05-15T11:01:45Z","snapshot_observed_at":"2026-08-18T21:20:50.978958Z","submitted_at":"2025-05-12T05:43:21Z","title":"SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:37.461937Z"},"links":{"citing_paper":"/paper/2505.07247"},"observation_digest":"sha256:75c74915597e326be3d53fbedd11fd7e0b109a483983d1c6841a1c50bd558de6","observation_id":"54ae2945-2617-47e4-a733-106cf548c468","resolution":{"observed_at":"2026-08-15T22:25:38.602647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:38.579782Z","title":"Learning to grade short answer questions using semantic similarity measures and dependency graph alignments,","venue":null,"work_id":"39f1a256-c25f-4bb1-ae43-881a11305698","year":2011},"citing_paper":{"arxiv_id":"2505.07247","last_updated":"2025-05-15T11:01:45Z","snapshot_observed_at":"2026-08-18T21:20:50.978958Z","submitted_at":"2025-05-12T05:43:21Z","title":"SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:37.467209Z"},"links":{"citing_paper":"/paper/2505.07247"},"observation_digest":"sha256:2cad65a52a8d4b1a4dd7a7a46e9cca5d7a24f9738056a1915ba9608c78a1d2bd","observation_id":"52d578ba-2876-4185-a84b-e85747418324","resolution":{"observed_at":"2026-08-15T22:25:38.585881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18638","last_updated":"2023-05-29T22:05:29Z","snapshot_observed_at":"2026-08-18T16:19:45.623780Z","submitted_at":"2023-05-29T22:05:29Z","title":"Short Answer Grading Using One-shot Prompting and Text Similarity Scoring Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18638","snapshot_observed_at":"2026-08-15T22:25:37.472178Z","title":"Short answer grading using one-shot prompting and text similarity scoring model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07247","last_updated":"2025-05-15T11:01:45Z","snapshot_observed_at":"2026-08-18T21:20:50.978958Z","submitted_at":"2025-05-12T05:43:21Z","title":"SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:37.472178Z"},"links":{"cited_paper":"/paper/2305.18638","citing_paper":"/paper/2505.07247"},"observation_digest":"sha256:9e16e2926373b244cdc80c8a18e9951fe24b3b172d1ac3bc65fce95ad5e43299","observation_id":"925e2821-4893-4ad6-a445-fead623247ff","resolution":{"observed_at":"2026-08-15T22:25:37.472178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:38.563026Z","title":"Improving the performance of automatic short answer grading using transfer learning and augmentation,","venue":null,"work_id":"07c0ffdb-86b3-4103-88f5-c3aff0fb5ee2","year":null},"citing_paper":{"arxiv_id":"2505.07247","last_updated":"2025-05-15T11:01:45Z","snapshot_observed_at":"2026-08-18T21:20:50.978958Z","submitted_at":"2025-05-12T05:43:21Z","title":"SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:37.477724Z"},"links":{"citing_paper":"/paper/2505.07247"},"observation_digest":"sha256:c5e7c51cc9d8f498994cc8d99e24ab866a56651a2ba280fc233ed0c290b84051","observation_id":"acd4b2d9-23c4-411b-b0d9-922849d098f3","resolution":{"observed_at":"2026-08-15T22:25:38.568533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:37.488466Z","title":"Rankcse: Unsupervised sentence representations learning via learning to rank,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07247","last_updated":"2025-05-15T11:01:45Z","snapshot_observed_at":"2026-08-18T21:20:50.978958Z","submitted_at":"2025-05-12T05:43:21Z","title":"SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:37.488466Z"},"links":{"citing_paper":"/paper/2505.07247"},"observation_digest":"sha256:c17179b33ec0767540550d01beeefb535fc0228b60e54e4adf8837ee1cf48c38","observation_id":"8d7f6a0e-8165-41d1-8b43-f30162a0c3ec","resolution":{"observed_at":"2026-08-15T22:25:37.488466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:37.494149Z","title":"Diffcse: Difference-based contrastive learning for sentence embeddings,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.07247","last_updated":"2025-05-15T11:01:45Z","snapshot_observed_at":"2026-08-18T21:20:50.978958Z","submitted_at":"2025-05-12T05:43:21Z","title":"SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:37.494149Z"},"links":{"citing_paper":"/paper/2505.07247"},"observation_digest":"sha256:03355e7e0d6689c0400e3cf826e0c49dba371f518b5d2c9ede11d7dc81529702","observation_id":"686aa5dd-108c-432b-a090-a893239baf40","resolution":{"observed_at":"2026-08-15T22:25:37.494149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-15T22:25:37.500317Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07247","last_updated":"2025-05-15T11:01:45Z","snapshot_observed_at":"2026-08-18T21:20:50.978958Z","submitted_at":"2025-05-12T05:43:21Z","title":"SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:37.500317Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.07247"},"observation_digest":"sha256:0335f08d95b8ed6b850535f0705dcd4593853fc2daf91514247b2f4d45ea9455","observation_id":"a7b0f1aa-06c5-4b17-a5de-eac4c2bdf49f","resolution":{"observed_at":"2026-08-15T22:25:37.500317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-08-17T11:08:48.802438Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-15T22:25:37.506787Z","title":"Qwen2 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07247","last_updated":"2025-05-15T11:01:45Z","snapshot_observed_at":"2026-08-18T21:20:50.978958Z","submitted_at":"2025-05-12T05:43:21Z","title":"SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:37.506787Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2505.07247"},"observation_digest":"sha256:25bc4baa394301420b45b7ce2ef739127cdd7f73e528234f1887e1d690484cb6","observation_id":"ae56ddeb-cae5-4be3-b1f8-96a9f14e3088","resolution":{"observed_at":"2026-08-15T22:25:37.506787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-15T22:25:37.512994Z","title":"Qwen2.5 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07247","last_updated":"2025-05-15T11:01:45Z","snapshot_observed_at":"2026-08-18T21:20:50.978958Z","submitted_at":"2025-05-12T05:43:21Z","title":"SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:37.512994Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.07247"},"observation_digest":"sha256:2e44bae44298725878ba80d859fd90f74aa4557ccc54154cbfbb242334c7f4e4","observation_id":"58b4a6ac-9710-4122-b4ce-d3c865d5e18d","resolution":{"observed_at":"2026-08-15T22:25:37.512994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:37.518394Z","title":"Chatglm: A family of large language models from glm-130b to glm-4 all tools,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07247","last_updated":"2025-05-15T11:01:45Z","snapshot_observed_at":"2026-08-18T21:20:50.978958Z","submitted_at":"2025-05-12T05:43:21Z","title":"SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:37.518394Z"},"links":{"citing_paper":"/paper/2505.07247"},"observation_digest":"sha256:d1385b7b33444fd1cc35dbf45c16ba05207908414b26d1a09b97235fa07befce","observation_id":"84584afa-9c5a-4e59-b8ff-b16473278719","resolution":{"observed_at":"2026-08-15T22:25:37.518394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-13T19:43:49.936776Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-15T22:25:37.523662Z","title":"Mixtral of experts,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07247","last_updated":"2025-05-15T11:01:45Z","snapshot_observed_at":"2026-08-18T21:20:50.978958Z","submitted_at":"2025-05-12T05:43:21Z","title":"SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:37.523662Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2505.07247"},"observation_digest":"sha256:a5043645f952b4105d19d7af32add23dd9976c7dd3402d8266a950819e1b6341","observation_id":"71a9af5a-d4c3-4296-bc87-56f3fc752410","resolution":{"observed_at":"2026-08-15T22:25:37.523662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.21801","last_updated":"2025-07-18T08:20:23Z","snapshot_observed_at":"2026-08-02T11:46:58.603316Z","submitted_at":"2025-04-30T16:57:48Z","title":"DeepSeek-Prover-V2: Advancing Formal Mathematical Reasoning via Reinforcement Learning for Subgoal Decomposition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.21801","snapshot_observed_at":"2026-08-15T22:25:37.529198Z","title":"Deepseek-prover-v2: Advancing formal mathematical reasoning via reinforcement learning for subgoal decomposition,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07247","last_updated":"2025-05-15T11:01:45Z","snapshot_observed_at":"2026-08-18T21:20:50.978958Z","submitted_at":"2025-05-12T05:43:21Z","title":"SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:37.529198Z"},"links":{"cited_paper":"/paper/2504.21801","citing_paper":"/paper/2505.07247"},"observation_digest":"sha256:decda9a597f7874cfd2e330ee73995733396122687abd138156323572dbef6d7","observation_id":"a7453a82-4f67-4c99-8a73-591823a94ac1","resolution":{"observed_at":"2026-08-15T22:25:37.529198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T22:25:37.534647Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07247","last_updated":"2025-05-15T11:01:45Z","snapshot_observed_at":"2026-08-18T21:20:50.978958Z","submitted_at":"2025-05-12T05:43:21Z","title":"SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:37.534647Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.07247"},"observation_digest":"sha256:3d151d276be89bec8a83d444b504945b57a047750631696ee80a782f641f0330","observation_id":"d58c5dac-f04f-45c5-b45d-bbe6b83dd563","resolution":{"observed_at":"2026-08-15T22:25:37.534647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:37.539755Z","title":"Qwq-32b: Embracing the power of reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07247","last_updated":"2025-05-15T11:01:45Z","snapshot_observed_at":"2026-08-18T21:20:50.978958Z","submitted_at":"2025-05-12T05:43:21Z","title":"SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:37.539755Z"},"links":{"citing_paper":"/paper/2505.07247"},"observation_digest":"sha256:cbf5bc11aff8fe2461038e690d9caef1d8dcda9323a2b3d32f5b94b7034b1fb7","observation_id":"5b056d15-8807-4cf6-8812-62df98e22eea","resolution":{"observed_at":"2026-08-15T22:25:37.539755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:38.513406Z","title":"[Online]","venue":null,"work_id":"9cd94270-2e55-49bc-b49e-d6ba6f3a3552","year":2025},"citing_paper":{"arxiv_id":"2505.07247","last_updated":"2025-05-15T11:01:45Z","snapshot_observed_at":"2026-08-18T21:20:50.978958Z","submitted_at":"2025-05-12T05:43:21Z","title":"SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:37.544686Z"},"links":{"citing_paper":"/paper/2505.07247"},"observation_digest":"sha256:f05f012312c6332a1ba04e22c8607b707ec0991dacaceb183b36037afac25f1e","observation_id":"5f567276-c64d-448b-8881-337321c075f2","resolution":{"observed_at":"2026-08-15T22:25:38.518609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:38.496182Z","title":"Team, “Superdistillation achieves near-r1 performance with just 5","venue":null,"work_id":"e1f12e1b-2862-4d05-b5cc-44602e9a5fb2","year":null},"citing_paper":{"arxiv_id":"2505.07247","last_updated":"2025-05-15T11:01:45Z","snapshot_observed_at":"2026-08-18T21:20:50.978958Z","submitted_at":"2025-05-12T05:43:21Z","title":"SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:37.549465Z"},"links":{"citing_paper":"/paper/2505.07247"},"observation_digest":"sha256:8093d8a308deba84689de296f118b3660ba830f44126f71c609a08f8bd6d13a4","observation_id":"01067c15-d59f-4f01-a3af-d0f553581b28","resolution":{"observed_at":"2026-08-15T22:25:38.501567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:38.465656Z","title":"Mimo: Unlocking the reasoning potential of language model – from pretraining to posttraining,","venue":null,"work_id":"a1d8531b-d987-4808-8501-a0a6da3f1e5b","year":2025},"citing_paper":{"arxiv_id":"2505.07247","last_updated":"2025-05-15T11:01:45Z","snapshot_observed_at":"2026-08-18T21:20:50.978958Z","submitted_at":"2025-05-12T05:43:21Z","title":"SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:37.554685Z"},"links":{"citing_paper":"/paper/2505.07247"},"observation_digest":"sha256:74ab792e2eb1195ea61689a14dbe4c617a7109679b6571891a24b389c9525fde","observation_id":"5dd7b017-bf1f-4171-b263-f0f7211e982a","resolution":{"observed_at":"2026-08-15T22:25:38.474371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:38.443009Z","title":"Metamath: Bootstrap your own mathematical questions for large language models,","venue":null,"work_id":"c56a6564-019d-428a-8632-d808e7f993dc","year":2024},"citing_paper":{"arxiv_id":"2505.07247","last_updated":"2025-05-15T11:01:45Z","snapshot_observed_at":"2026-08-18T21:20:50.978958Z","submitted_at":"2025-05-12T05:43:21Z","title":"SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:37.559542Z"},"links":{"citing_paper":"/paper/2505.07247"},"observation_digest":"sha256:2065dab2e74bc5c4e8d049f0d6d143df4799283bdad2694bb9f74776cf011b90","observation_id":"14436c82-d65d-4ab5-bc33-000dfcc84204","resolution":{"observed_at":"2026-08-15T22:25:38.448544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:38.423717Z","title":"- Independently evaluate each step: * Determine correctness ('label')","venue":null,"work_id":"1c855b3e-ed02-466d-aeed-67e783a840dd","year":null},"citing_paper":{"arxiv_id":"2505.07247","last_updated":"2025-05-15T11:01:45Z","snapshot_observed_at":"2026-08-18T21:20:50.978958Z","submitted_at":"2025-05-12T05:43:21Z","title":"SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:37.565249Z"},"links":{"citing_paper":"/paper/2505.07247"},"observation_digest":"sha256:889edfbd579d02925c4cd989722ca969ec06b81d2eff3ec46109980a66a55210","observation_id":"16cc9b54-bef9-49e7-81fb-d12e7e169f9e","resolution":{"observed_at":"2026-08-15T22:25:38.430755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:38.406180Z","title":"- Provide an overall evaluation ('label’)","venue":null,"work_id":"03836e31-4245-4f3b-9fe0-037b15993620","year":null},"citing_paper":{"arxiv_id":"2505.07247","last_updated":"2025-05-15T11:01:45Z","snapshot_observed_at":"2026-08-18T21:20:50.978958Z","submitted_at":"2025-05-12T05:43:21Z","title":"SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:37.570304Z"},"links":{"citing_paper":"/paper/2505.07247"},"observation_digest":"sha256:6ec3f8649923c3ccce0434e5d06563071fa10a511882c45b894af03d34d839d1","observation_id":"5d1ca454-5bb4-4f89-a8d1-d7e9a87204ba","resolution":{"observed_at":"2026-08-15T22:25:38.412132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:38.389034Z","title":"id\": \"Math_ShortAns_3","venue":null,"work_id":"c206d83a-30e2-4989-9337-5bcfd2067b63","year":null},"citing_paper":{"arxiv_id":"2505.07247","last_updated":"2025-05-15T11:01:45Z","snapshot_observed_at":"2026-08-18T21:20:50.978958Z","submitted_at":"2025-05-12T05:43:21Z","title":"SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:37.576015Z"},"links":{"citing_paper":"/paper/2505.07247"},"observation_digest":"sha256:7182dddce680dd942f8e480f7a506e7cc7107ad6d174e08c112938b5714fc7a5","observation_id":"445126fd-d2be-47a6-82fd-0627bea49cd0","resolution":{"observed_at":"2026-08-15T22:25:38.394516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:37.483240Z","title":"Available: https://doi.org/10.1016/j.engappai.2023.106292","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07247","last_updated":"2025-05-15T11:01:45Z","snapshot_observed_at":"2026-08-18T21:20:50.978958Z","submitted_at":"2025-05-12T05:43:21Z","title":"SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:37.483240Z"},"links":{"citing_paper":"/paper/2505.07247"},"observation_digest":"sha256:ed5686dba9c9994fbea32e453e7fd696ab54196292433d3a5b385e814edcc52e","observation_id":"1580b7cf-c95d-4dc3-9c56-74a12d5a4853","resolution":{"observed_at":"2026-08-15T22:25:37.483240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.07247","last_updated":"2025-05-15T11:01:45Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-18T21:20:50.978958Z","submitted_at":"2025-05-12T05:43:21Z","title":"SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":2,"verified_fuzzy":26},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 1 inbound Pith citation observation for arXiv:2505.07247."}